{"as_of":"2026-08-04T22:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:824ba0e1d65d4ea11d374f13fc86adbf0910ec91a9ac0091b5739792fdf188b3","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T06:08:05.386345Z","state":"measured"},{"denominator":136,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":136,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":72,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T11:28:36.924563Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T06:15:00.866473Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2310.03684","last_updated":"2024-06-11T19:02:52Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:01:53Z","title":"SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-14T17:11:00.639293Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2310.03684"},"observation_digest":"sha256:ce42ff9d2dff2d414e7b2c8f8e90dd1030fee9e1d3d9509dbfc6d190cdc9efc2","observation_id":"736b4907-b5e0-4fca-90de-b86831e13603","resolution":{"observed_at":"2026-05-15T06:08:05.732086Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T09:48:31.721745Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2310.08419"},"observation_digest":"sha256:21066dcc9d903505457a9270c6d487c36a2ce040ea31462fbdfd05064fc9ee30","observation_id":"ef279a91-5b56-4443-9ddd-2b03cf6f69ec","resolution":{"observed_at":"2026-05-15T06:08:05.732086Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2405.13068","last_updated":"2026-04-18T08:25:50Z","snapshot_observed_at":"2026-08-04T20:18:53.393132Z","submitted_at":"2024-05-20T17:17:55Z","title":"Uncovering Logit Suppression Vulnerabilities in LLM Safety Alignment","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-24T00:38:36.992597Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2405.13068"},"observation_digest":"sha256:897ed8a94d77284e7bed1161b3c658e29a9076b269d2157e60492231b09b8c90","observation_id":"a7615531-d699-43a3-87eb-d6eb25649be6","resolution":{"observed_at":"2026-05-24T00:38:39.944388Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2406.11717","last_updated":"2024-10-30T18:57:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T16:36:12Z","title":"Refusal in Language Models Is Mediated by a Single Direction","version":3},"reference_index":125,"source":"arxiv_source","source_observed_at":"2026-05-13T10:47:55.934081Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2406.11717"},"observation_digest":"sha256:b71b5b076d0f73b014f38081134d31656d58a92b4077447f7c6af423013b351d","observation_id":"15889308-8cd3-42ee-945f-63187997ca26","resolution":{"observed_at":"2026-05-15T06:08:05.732086Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2406.13352","last_updated":"2024-11-24T22:04:23Z","snapshot_observed_at":"2026-07-06T18:33:32.806635Z","submitted_at":"2024-06-19T08:55:56Z","title":"AgentDojo: A Dynamic Environment to Evaluate Prompt Injection Attacks and Defenses for LLM Agents","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T06:35:13.331872Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2406.13352"},"observation_digest":"sha256:d94de44422765d1a984abb137659e9a5e5ad73f88f91a112524e09612c0ea430","observation_id":"c452888b-062f-401a-a538-ab96428606af","resolution":{"observed_at":"2026-05-15T06:08:05.732086Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2407.04295","last_updated":"2024-08-30T11:57:47Z","snapshot_observed_at":"2026-08-03T06:32:58.433190Z","submitted_at":"2024-07-05T06:57:30Z","title":"Jailbreak Attacks and Defenses Against Large Language Models: A Survey","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T02:20:44.368219Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2407.04295"},"observation_digest":"sha256:cbbfc1e738e70eb9c6586b0c7bfcd1e3837ce896d4e919b0499543cbd910ca30","observation_id":"5ab867da-47a7-42ec-9042-3f5602e63487","resolution":{"observed_at":"2026-05-15T06:08:05.732086Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2502.18864","last_updated":"2025-02-26T06:17:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T06:17:13Z","title":"Towards an AI co-scientist","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-11T13:02:43.571234Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2502.18864"},"observation_digest":"sha256:f28516edeba25ef30f14f22a44a213f910a0821686ebc47bf7ce8c143fad353e","observation_id":"fff050ba-7da0-4e09-aaea-b532e5d65909","resolution":{"observed_at":"2026-05-15T06:08:05.732086Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2503.02574","last_updated":"2026-05-18T17:54:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-04T12:55:07Z","title":"LLM-Safety Evaluations Lack Robustness","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-23T01:26:45.402983Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2503.02574"},"observation_digest":"sha256:7e46f88e62f88663034c149edb897f79f28b0ce342c33f43522ccf476602fa28","observation_id":"b2b82c4a-c28c-47cb-8cf8-5072e7649a91","resolution":{"observed_at":"2026-05-23T01:27:21.410326Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2506.01770","last_updated":"2026-04-18T05:40:12Z","snapshot_observed_at":"2026-08-04T01:20:56.393646Z","submitted_at":"2025-06-02T15:17:38Z","title":"ReGA: Model-Based Safeguard for LLMs via Representation-Guided Abstraction","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-19T11:34:09.428653Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2506.01770"},"observation_digest":"sha256:d0781ce35d1a21265070d1a4efa1a2f69a5ddb894425e0be2a1bfc4f8b7ef60e","observation_id":"21ba870e-7a51-4253-8388-64336df98c6b","resolution":{"observed_at":"2026-05-19T11:37:15.968494Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2506.06414","last_updated":"2026-04-20T20:58:30Z","snapshot_observed_at":"2026-08-03T02:03:44.971897Z","submitted_at":"2025-06-06T17:33:33Z","title":"Benchmarking Misuse Mitigation Against Covert Adversaries","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-19T10:29:05.104520Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2506.06414"},"observation_digest":"sha256:6556974d1b4d2a5bf3ea27ccc27d9665210466a434e6d81424a54467e41fad14","observation_id":"ec31f092-06d9-452c-85e0-cb5a72982d5b","resolution":{"observed_at":"2026-05-19T10:32:14.772620Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2506.12382","last_updated":"2026-04-27T08:32:16Z","snapshot_observed_at":"2026-08-02T04:53:57.144183Z","submitted_at":"2025-06-14T07:31:52Z","title":"Exploring the Secondary Risks of Large Language Models","version":5},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-19T09:40:58.067398Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2506.12382"},"observation_digest":"sha256:8cb2b7b149c677144d79553bfced838127b5cf2d6a080e7b035731f38f2f3420","observation_id":"188b5b7c-8df4-4b34-afa0-46230752edd1","resolution":{"observed_at":"2026-05-19T09:42:14.017160Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2506.13510","last_updated":"2026-05-22T19:49:58Z","snapshot_observed_at":"2026-08-02T06:05:08.367465Z","submitted_at":"2025-06-16T14:04:54Z","title":"Safe-Child-LLM: A Developmental Benchmark for Evaluating LLM Safety in Child-LLM Interactions","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-19T09:31:14.739478Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2506.13510"},"observation_digest":"sha256:037d5f1d019e75290da3873030e2cc92774efae28964e05ba2c533b398b6f20f","observation_id":"b18139b3-ea4d-47f2-b41a-9af74acd4a7f","resolution":{"observed_at":"2026-05-19T09:32:16.265856Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2507.21540","last_updated":"2026-04-08T13:05:48Z","snapshot_observed_at":"2026-07-06T22:04:26.078628Z","submitted_at":"2025-07-29T07:13:56Z","title":"PRISM: Programmatic Reasoning with Image Sequence Manipulation for LVLM Jailbreaking","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-19T03:36:24.013477Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2507.21540"},"observation_digest":"sha256:82b1f0b2d0e786fbc8f4ed7a76489b7d30c36fd5b71f7be5f90e15d21eac9389","observation_id":"0c0e9a8e-ef58-4775-971c-215f29c4fbe4","resolution":{"observed_at":"2026-05-19T03:37:01.127676Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2508.20325","last_updated":"2026-05-11T14:12:43Z","snapshot_observed_at":"2026-07-06T22:19:48.389341Z","submitted_at":"2025-08-28T00:07:10Z","title":"GUARD: Guideline Upholding Test through Adaptive Role-play and Jailbreak Diagnostics for LLMs","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-18T21:34:51.665401Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2508.20325"},"observation_digest":"sha256:75f8c7fa18d10e8be6623c5158a9d2ed2576f3d92dd3c535f812d766144f204e","observation_id":"b543987c-e8c9-430d-aa1e-8975058769ab","resolution":{"observed_at":"2026-05-18T21:36:52.424978Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2511.12710","last_updated":"2026-05-18T06:50:41Z","snapshot_observed_at":"2026-07-06T22:35:55.936840Z","submitted_at":"2025-11-16T17:52:07Z","title":"Evolve the Method, Not the Prompts: Evolutionary Synthesis of Jailbreak Attacks on LLMs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T18:58:53.183734Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2511.12710"},"observation_digest":"sha256:af46aa14db23f9656dd510cca2059b1ab2127174553816552b6792e976d195b0","observation_id":"c20169ec-ee12-4d83-bc0f-bf6649120d5b","resolution":{"observed_at":"2026-05-21T19:00:30.437810Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2602.02280","last_updated":"2026-05-12T03:47:11Z","snapshot_observed_at":"2026-07-06T22:44:09.804048Z","submitted_at":"2026-02-02T16:20:51Z","title":"RACC: Representation-Aware Coverage Criteria for LLM Safety Testing","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T08:12:55.296932Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2602.02280"},"observation_digest":"sha256:2393bf905298be2aa4dbac7058f09ade81f18867ba9efcbdc42af9dea1e6b72f","observation_id":"6a74452a-f481-454b-817a-f45949213cb0","resolution":{"observed_at":"2026-05-16T08:17:36.584855Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2603.04459","last_updated":"2026-05-14T18:30:07Z","snapshot_observed_at":"2026-07-06T22:47:50.848191Z","submitted_at":"2026-03-03T09:10:45Z","title":"Benchmark of Benchmarks: Unpacking Influence and Code Repository Quality in LLM Safety Benchmarks","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T12:09:55.500940Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2603.04459"},"observation_digest":"sha256:a949ddc88f5803e1df06047de0940b444ece3036066dbb90bb5532a5f62eb8d8","observation_id":"95a0c614-b100-4c64-9f6d-785081bb9788","resolution":{"observed_at":"2026-05-21T12:10:06.517424Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2603.14987","last_updated":"2026-05-21T06:24:06Z","snapshot_observed_at":"2026-08-03T21:30:30.993382Z","submitted_at":"2026-03-16T08:51:33Z","title":"Beyond Benchmark Islands: Toward Representative Trustworthiness Evaluation for Agentic AI","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T10:19:56.003219Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2603.14987"},"observation_digest":"sha256:0c99e2cc9f84901d331c7b7b668396938e1e9005a7742a5ab2a183a23fed5930","observation_id":"640ab874-88a9-4497-84cc-02a1e7f29afc","resolution":{"observed_at":"2026-05-22T10:21:23.284052Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2604.12384","last_updated":"2026-04-14T07:17:55Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T07:17:55Z","title":"Preventing Safety Drift in Large Language Models via Coupled Weight and Activation Constraints","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-10T16:04:25.851592Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2604.12384"},"observation_digest":"sha256:dd06c1ac4ecaffc9ff621df221a7e92a1325767738a90cd0a1ab98030235b5eb","observation_id":"9656a927-5e86-4fc7-ae79-c0f9df2fe9cb","resolution":{"observed_at":"2026-05-15T06:08:05.732086Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2604.15415","last_updated":"2026-04-16T17:31:52Z","snapshot_observed_at":"2026-07-06T23:02:58.361418Z","submitted_at":"2026-04-16T17:31:52Z","title":"HarmfulSkillBench: How Do Harmful Skills Weaponize Your Agents?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T10:32:37.967401Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2604.15415"},"observation_digest":"sha256:ef5e59a60820691fdf7adb1bcda754a17ba60eced4eb55de476cc151fb972b5e","observation_id":"5913a7a5-0bfd-4539-8240-ae5dd5d2e9c3","resolution":{"observed_at":"2026-05-15T06:08:05.732086Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2604.15780","last_updated":"2026-04-17T07:37:41Z","snapshot_observed_at":"2026-07-06T23:03:16.345488Z","submitted_at":"2026-04-17T07:37:41Z","title":"Pruning Unsafe Tickets: A Resource-Efficient Framework for Safer and More Robust LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T09:10:55.001543Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2604.15780"},"observation_digest":"sha256:a62998cc312bd1110816ef2772e2f463d764b00dfa814d31dfa403f0f119341e","observation_id":"45c4931a-d2f8-416b-9494-1290ce298a57","resolution":{"observed_at":"2026-05-15T06:08:05.732086Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2604.20704","last_updated":"2026-04-22T15:46:11Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:11Z","title":"Auto-ART: Structured Literature Synthesis and Automated Adversarial Robustness Testing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T00:39:43.196010Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2604.20704"},"observation_digest":"sha256:6a65f52a68c77cdfdcc83be9e1173314e1bac982839728b18afdf4363a052e43","observation_id":"3de037b8-8ca6-4efe-97c7-c810f9f109f6","resolution":{"observed_at":"2026-05-15T06:08:05.732086Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2604.25716","last_updated":"2026-04-28T14:43:40Z","snapshot_observed_at":"2026-07-31T17:39:47.294991Z","submitted_at":"2026-04-28T14:43:40Z","title":"Cross-Lingual Jailbreak Detection via Semantic Codebooks","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-07T16:22:33.567085Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2604.25716"},"observation_digest":"sha256:8fad28315126342a438c42bab49a532af723811029b4289a3b7b148046af9114","observation_id":"7aaa065d-ac00-4aef-93f9-4a67a2a32e69","resolution":{"observed_at":"2026-05-15T06:08:05.732086Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2605.01449","last_updated":"2026-05-02T13:56:50Z","snapshot_observed_at":"2026-08-03T12:34:05.607551Z","submitted_at":"2026-05-02T13:56:50Z","title":"VisInject: Disruption != Injection -- A Dual-Dimension Evaluation of Universal Adversarial Attacks on Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-09T14:24:48.999632Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2605.01449"},"observation_digest":"sha256:7fff01066085f3375a410eda866ec24c865a34cdf229d1f1137b1afa116048c7","observation_id":"1a40f51c-ca41-46c5-94ae-218c4664c54a","resolution":{"observed_at":"2026-05-15T06:08:05.732086Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2605.02647","last_updated":"2026-05-04T14:32:40Z","snapshot_observed_at":"2026-07-06T23:15:41.793878Z","submitted_at":"2026-05-04T14:32:40Z","title":"ContextualJailbreak: Evolutionary Red-Teaming via Simulated Conversational Priming","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T19:16:21.173184Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2605.02647"},"observation_digest":"sha256:979555da1cd4951a583b38fa14882dedb3e2ee3a4d666d50e3bc0ea7e2fd9b7c","observation_id":"12749912-0b75-439d-bd32-c1892a2bfcbc","resolution":{"observed_at":"2026-05-15T06:08:05.732086Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2605.03179","last_updated":"2026-05-04T21:42:10Z","snapshot_observed_at":"2026-08-03T23:09:27.517424Z","submitted_at":"2026-05-04T21:42:10Z","title":"A Validated Prompt Bank for Malicious Code Generation: Separating Executable Weapons from Security Knowledge in 1,554 Consensus-Labeled Prompts","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T18:11:29.066362Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2605.03179"},"observation_digest":"sha256:625f1d35a699cd3557f9deff2f262e8bc1b6a55e8d79a2daa78f6c5a5866b9e1","observation_id":"2802f773-6c62-483d-a66e-9b88b83f1333","resolution":{"observed_at":"2026-05-15T06:08:05.732086Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2605.09225","last_updated":"2026-05-09T23:51:18Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-09T23:51:18Z","title":"The Art of the Jailbreak: Formulating Jailbreak Attacks for LLM Security Beyond Binary Scoring","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T02:42:08.565972Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2605.09225"},"observation_digest":"sha256:32f44374a6bf35369418269f44f3cba46f6259b9fce89eca8d4675c4c741b6e1","observation_id":"783c5c1d-617b-4136-89f5-e38ddec24337","resolution":{"observed_at":"2026-05-15T06:08:05.732086Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2605.10611","last_updated":"2026-05-11T14:09:31Z","snapshot_observed_at":"2026-08-02T15:29:13.025199Z","submitted_at":"2026-05-11T14:09:31Z","title":"Re-Triggering Safeguards within LLMs for Jailbreak Detection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T04:37:29.075413Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2605.10611"},"observation_digest":"sha256:3f564bd8821fe457fa69d528f7681008b92f1ae09d77ce236e17fc242275c08f","observation_id":"49bd45b7-5000-41f2-bcc6-aa51cf3ce9bb","resolution":{"observed_at":"2026-05-15T06:08:05.732086Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2605.10639","last_updated":"2026-05-11T14:27:39Z","snapshot_observed_at":"2026-08-02T13:54:55.570407Z","submitted_at":"2026-05-11T14:27:39Z","title":"Navigating the Sea of LLM Evaluation: Investigating Bias in Toxicity Benchmarks","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T05:28:45.453455Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2605.10639"},"observation_digest":"sha256:cd6e32e5b1794a417fb111b71ee77f0295c9df6b41e0c43df21ce3263c027646","observation_id":"7f3563fe-3be0-4759-952c-daa96002b875","resolution":{"observed_at":"2026-05-15T06:08:05.732086Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2605.11712","last_updated":"2026-05-12T08:02:34Z","snapshot_observed_at":"2026-07-06T23:23:30.499023Z","submitted_at":"2026-05-12T08:02:34Z","title":"Toward Stable Value Alignment: Introducing Independent Modules for Consistent Value Guidance","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-13T07:03:14.415745Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2605.11712"},"observation_digest":"sha256:053117190d3bdb78e0e029c54bef7920dc6b7a387d284df166db5380caea98e2","observation_id":"5ed8836b-364b-4656-8bbe-c6e3b5b5a408","resolution":{"observed_at":"2026-05-15T06:08:05.732086Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2605.14087","last_updated":"2026-05-15T01:03:24Z","snapshot_observed_at":"2026-08-02T22:51:58.548845Z","submitted_at":"2026-05-13T20:12:30Z","title":"Measuring and Mitigating Toxicity in Large Language Models: A Comprehensive Replication Study","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T05:11:47.070579Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2605.14087"},"observation_digest":"sha256:6d88f7c5e4b51376bf4d7390f78df8b9dcb67bf2fcf377a6a59dfcfe0586c1a1","observation_id":"7cb2d2f7-bc78-45f5-a7ae-87f5114946f0","resolution":{"observed_at":"2026-05-15T06:08:05.732086Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2605.14087","last_updated":"2026-05-15T01:03:24Z","snapshot_observed_at":"2026-08-02T22:51:58.548845Z","submitted_at":"2026-05-13T20:12:30Z","title":"Measuring and Mitigating Toxicity in Large Language Models: A Comprehensive Replication Study","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-19T13:41:37.102367Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2605.14087"},"observation_digest":"sha256:656a7d6475fa62b839358581aaf38a06a0b8b3718b0fdfcd151b7c76c80915a6","observation_id":"fb77849f-cbaa-45f3-9453-36e4b42bb3ec","resolution":{"observed_at":"2026-05-19T13:42:19.205489Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2605.14418","last_updated":"2026-05-14T06:05:37Z","snapshot_observed_at":"2026-07-06T23:25:49.545418Z","submitted_at":"2026-05-14T06:05:37Z","title":"The Great Pretender: A Stochasticity Problem in LLM Jailbreak","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T02:09:42.090550Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2605.14418"},"observation_digest":"sha256:b9e67d1c5939dfb87afd6e62a03b3dfa7b79aa2d0ac0f07b2ca31c74bc91606e","observation_id":"6c2311cd-0ea6-4e5a-a17e-6df56a8eb3e1","resolution":{"observed_at":"2026-05-15T06:08:05.732086Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:928a5be51195b8df3eae0f2e8e48e55cf3275c5ea5c64900c8aa367519a464fe","observation_id":"5612550d-065c-4012-b7c3-24a25892b71b","resolution":{"observed_at":"2026-05-19T23:32:52.506793Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2605.21602","last_updated":"2026-05-24T21:06:51Z","snapshot_observed_at":"2026-07-31T05:05:49.494448Z","submitted_at":"2026-05-20T18:08:21Z","title":"Benchmarking and Improving Monitors for Out-Of-Distribution Alignment Failure in LLMs","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-22T09:38:04.387777Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2605.21602"},"observation_digest":"sha256:039042150a3cc6c99942d787f2cd5ec564142bd824f386b4797ac6e4945e39be","observation_id":"6cf384c0-cb63-46c8-9c44-198fee815f5b","resolution":{"observed_at":"2026-05-22T09:41:22.319627Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2605.21602","last_updated":"2026-05-24T21:06:51Z","snapshot_observed_at":"2026-07-31T05:05:49.494448Z","submitted_at":"2026-05-20T18:08:21Z","title":"Benchmarking and Improving Monitors for Out-Of-Distribution Alignment Failure in LLMs","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-05-22T09:38:04.387777Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2605.21602"},"observation_digest":"sha256:9618e45891a00f110618d05384a98c8f4b04f86cd079979dacc67b6ac3039444","observation_id":"324585d1-1310-4d6c-9531-4ff33678dd68","resolution":{"observed_at":"2026-05-22T09:41:21.339259Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2605.21602","last_updated":"2026-05-24T21:06:51Z","snapshot_observed_at":"2026-07-31T05:05:49.494448Z","submitted_at":"2026-05-20T18:08:21Z","title":"Benchmarking and Improving Monitors for Out-Of-Distribution Alignment Failure in LLMs","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-30T17:17:39.899234Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2605.21602"},"observation_digest":"sha256:04f266c4f4a3d6812bafb827e14b3736bcfa02e7eac5732f731c4d3ed29407fe","observation_id":"40d4c4cf-b8b7-47ea-9721-90088215b7c9","resolution":{"observed_at":"2026-06-30T17:34:58.051793Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2605.22643","last_updated":"2026-05-22T14:53:30Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T15:50:18Z","title":"Boiling the Frog: A Multi-Turn Benchmark for Agentic Safety","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-22T05:50:28.114140Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2605.22643"},"observation_digest":"sha256:107b8304d8bf3072e411844f6559f9910c4ad6a05d3c136f44216701705b0d17","observation_id":"e3fbea9c-17fd-4419-b0a4-15ad4358f958","resolution":{"observed_at":"2026-05-22T05:51:07.923143Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2605.22643","last_updated":"2026-05-22T14:53:30Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T15:50:18Z","title":"Boiling the Frog: A Multi-Turn Benchmark for Agentic Safety","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-25T06:05:27.736494Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2605.22643"},"observation_digest":"sha256:c4f0dfced3bcdd61d3a61315da399b3378d8a6f5bca084e639b499d0009eada3","observation_id":"6ef608f6-771d-4bfd-a158-0b6d5f2e75ec","resolution":{"observed_at":"2026-05-25T06:06:42.840186Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2605.24834","last_updated":"2026-05-24T02:58:21Z","snapshot_observed_at":"2026-07-06T23:34:52.129354Z","submitted_at":"2026-05-24T02:58:21Z","title":"Reflect-Guard: Enhancing LLM Safeguards against Adversarial Prompts via Logical Self-Reflection","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T00:29:50.433221Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2605.24834"},"observation_digest":"sha256:f58451f9e6c9971c23364b932b24319e658657ff425653982fd3f4cdd13dbe7f","observation_id":"c110e024-d0e0-4f0c-8d21-631bd3cb7966","resolution":{"observed_at":"2026-07-01T16:35:50.615443Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2605.26947","last_updated":"2026-05-26T12:36:15Z","snapshot_observed_at":"2026-08-03T09:46:34.318596Z","submitted_at":"2026-05-26T12:36:15Z","title":"KZ-SafetyPrompts: A Kazakh Safety Evaluation Prompt Dataset for Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T17:57:17.196238Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2605.26947"},"observation_digest":"sha256:e4d9c5257f99c71fe547d64afac4852605dc37bbcfa5534dd1293e7fb7fba973","observation_id":"7d61bd6e-857a-4946-8f94-16e1b8b53144","resolution":{"observed_at":"2026-06-29T18:03:48.070188Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2605.27763","last_updated":"2026-05-26T23:22:55Z","snapshot_observed_at":"2026-07-31T18:23:26.053584Z","submitted_at":"2026-05-26T23:22:55Z","title":"A Paired Testing Protocol for Batch-Conditioned Refusal Robustness in LLM Serving","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-29T18:03:19.798168Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2605.27763"},"observation_digest":"sha256:cb42658996ff14e285a6b5affa36a45543a2c1c4fa7b58dd33e1c19afa2f7a34","observation_id":"ab32cb81-8744-43b7-a190-90f5a0523053","resolution":{"observed_at":"2026-06-29T18:03:47.837889Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2605.29659","last_updated":"2026-05-28T09:21:42Z","snapshot_observed_at":"2026-07-06T23:39:05.858969Z","submitted_at":"2026-05-28T09:21:42Z","title":"Opir: Efficient Multi-Task Safety Classification for Toxicity, Jailbreaks, Hate Speech, and Harmful Content","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T09:11:58.843585Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2605.29659"},"observation_digest":"sha256:b0faf0009140afc5e5c0fda15b557387dd74b7982e1984634c602ccdff0617a1","observation_id":"29bc340b-f5b5-44fe-8ab8-a844ececf74d","resolution":{"observed_at":"2026-06-29T09:13:15.969429Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2606.02822","last_updated":"2026-06-01T19:39:25Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:39:25Z","title":"Which Defense Closes Which Threat? Attributing OWASP-LLM-Top-10 Coverage and Its Brittleness Under Paraphrasing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T13:49:47.542697Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2606.02822"},"observation_digest":"sha256:0b362eb8b482b89c1b395777ae935a9cdd2c117660b8d6343572a7bde1ad0ab0","observation_id":"c316a4e2-ddb7-4865-a679-617e309600c7","resolution":{"observed_at":"2026-07-01T23:56:23.247991Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2606.03647","last_updated":"2026-06-02T13:39:15Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T13:39:15Z","title":"Black-box, Adaptive, Efficient, Transferable, Harmful, Applicable... Attacks Are All You Need to Break LLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T09:21:57.373862Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2606.03647"},"observation_digest":"sha256:ddacf99a202a46953e2cd5cc80a1b99a44c747a6506dac97f5d2862782d5fad7","observation_id":"ee365955-ebf4-4515-8c1c-e285444838a4","resolution":{"observed_at":"2026-07-02T04:16:34.640693Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2606.05523","last_updated":"2026-06-04T00:06:13Z","snapshot_observed_at":"2026-07-06T23:45:33.157370Z","submitted_at":"2026-06-04T00:06:13Z","title":"CHASE: Adversarial Red-Blue Teaming for Improving LLM Safety using Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-28T02:34:26.334078Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2606.05523"},"observation_digest":"sha256:5e2855dcbb9369a2108aef1337e5c74d284d85677d856a799846221526cf6fe2","observation_id":"b284dd0d-abb8-44fd-adc5-57946ee1f585","resolution":{"observed_at":"2026-07-02T12:06:55.607640Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2606.08044","last_updated":"2026-06-06T08:10:56Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T08:10:56Z","title":"When Behavioral Safety Evaluation Fails: A Representation-Level Perspective","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-27T20:04:17.744876Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2606.08044"},"observation_digest":"sha256:0a0ec264fec820c3be5d402f30c9c0604a162081857665432d2f30a100cbf9dd","observation_id":"7430cfc7-f41d-4e28-aaf8-40807958bf57","resolution":{"observed_at":"2026-07-02T20:57:23.064073Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2606.09165","last_updated":"2026-06-08T08:02:57Z","snapshot_observed_at":"2026-08-01T19:14:56.235029Z","submitted_at":"2026-06-08T08:02:57Z","title":"Reliable to Expressive: A Curriculum for Rubric-Following Safety Judges","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T17:01:03.040933Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2606.09165"},"observation_digest":"sha256:5ef8e619c65d7bc50f7b5c302ffdded3d2d049ff4ee296e81361ffe58394858f","observation_id":"c8d847ec-ba2b-4617-b94d-5dd9a67b491d","resolution":{"observed_at":"2026-07-03T00:47:30.706422Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2606.09388","last_updated":"2026-06-08T12:03:51Z","snapshot_observed_at":"2026-07-06T23:48:44.159537Z","submitted_at":"2026-06-08T12:03:51Z","title":"Distilling Safe LLM Systems via Soft Prompts for On Device Settings","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-06-27T17:15:51.375580Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2606.09388"},"observation_digest":"sha256:10f38d01487918162a490794e9edc65250b50c58cdcd3984a2f8bc2b67a4e5da","observation_id":"7c61749f-eda5-4a08-b1d0-e7e61b64a4be","resolution":{"observed_at":"2026-07-03T00:27:29.245408Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2606.11270","last_updated":"2026-06-26T21:36:00Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-06-09T06:52:49Z","title":"Quantifying Subliminal Behavioral Transfer Ratios in Language Model Distillation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T13:45:13.320426Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2606.11270"},"observation_digest":"sha256:c4f43948d42501019ebd976a0a1035b3dc87cdffab7fa8aa8c8e6cafc50b9f1e","observation_id":"a0955196-fff3-4f3c-a973-95563ff3016b","resolution":{"observed_at":"2026-07-03T04:37:37.325544Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2606.11270","last_updated":"2026-06-26T21:36:00Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-06-09T06:52:49Z","title":"Quantifying Subliminal Behavioral Transfer Ratios in Language Model Distillation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T11:15:21.946819Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2606.11270"},"observation_digest":"sha256:64b2012bc5c7cc9fa262e1c5b2d08e95c59510b7a5477ec4981c5e79d737d6ed","observation_id":"76dbe284-4cdd-4ae6-a7fd-abc69ec21a1f","resolution":{"observed_at":"2026-06-30T11:24:38.481668Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2606.20626","last_updated":"2026-05-26T17:35:31Z","snapshot_observed_at":"2026-07-06T23:55:43.830896Z","submitted_at":"2026-05-26T17:35:31Z","title":"Efficient Safety Benchmarking via Item Response Theory","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-01T15:51:00.484343Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2606.20626"},"observation_digest":"sha256:db5f1251deac286a7828225845037e01e27c7b73f1b79385f89357c6ced55b8e","observation_id":"d5787c4c-f09a-4619-9675-1039ec350766","resolution":{"observed_at":"2026-07-01T15:55:48.966799Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2606.22686","last_updated":"2026-06-30T05:48:55Z","snapshot_observed_at":"2026-07-06T23:57:32.788548Z","submitted_at":"2026-06-21T22:04:48Z","title":"The Geometry of Refusal: Linear Instability in Safety-Aligned LLMs","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-26T09:52:52.603708Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2606.22686"},"observation_digest":"sha256:388a97dee8aca0bb4216d950c6310193b1dba7267747123dbf5a8f052565734e","observation_id":"916a4ef1-cd9d-4d22-aec3-6f0c09160399","resolution":{"observed_at":"2026-07-04T09:29:44.263208Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2606.22686","last_updated":"2026-06-30T05:48:55Z","snapshot_observed_at":"2026-07-06T23:57:32.788548Z","submitted_at":"2026-06-21T22:04:48Z","title":"The Geometry of Refusal: Linear Instability in Safety-Aligned LLMs","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-01T07:07:45.177242Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2606.22686"},"observation_digest":"sha256:5c83dab48b1c0a0524f42989613490e79ee9946e4a1d090038c9957f8a863f09","observation_id":"8f5ed0c7-8161-412a-b29a-7f02a07eb5d0","resolution":{"observed_at":"2026-07-01T08:45:35.634487Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2606.23583","last_updated":"2026-06-22T16:48:43Z","snapshot_observed_at":"2026-07-06T23:58:16.163783Z","submitted_at":"2026-06-22T16:48:43Z","title":"Evaluation Awareness Is Not One Capability: Evidence from Open Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-26T08:23:20.122338Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2606.23583"},"observation_digest":"sha256:ac70079d32769098d1c6e908a1b6e344c219fe7b55d049ede2d3df0f64023534","observation_id":"7986c6ef-7d42-4ceb-899b-7ba5270bce65","resolution":{"observed_at":"2026-07-04T10:49:46.876444Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2606.24589","last_updated":"2026-06-23T13:50:51Z","snapshot_observed_at":"2026-07-06T23:59:08.580746Z","submitted_at":"2026-06-23T13:50:51Z","title":"AdversaBench: Automated LLM Red-Teaming with Multi-Judge Confirmation and Cross-Model Transferability","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-25T23:49:17.752279Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2606.24589"},"observation_digest":"sha256:df5a11da5162adfbeab75fab2b7e41b3d166b496d159fc73e95bbfe15469e00c","observation_id":"31453625-cfef-4665-abb4-a595ae2d112f","resolution":{"observed_at":"2026-07-04T17:20:00.203412Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2606.25097","last_updated":"2026-06-23T19:06:42Z","snapshot_observed_at":"2026-08-02T20:00:46.182561Z","submitted_at":"2026-06-23T19:06:42Z","title":"Speculative Decoding at Temperature Zero: A Scoped Safety-Invariance Screen with a 48,072-Sample Expansion","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T00:05:06.647295Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2606.25097"},"observation_digest":"sha256:d54b73c0c6ca2c89a69e49741c5ec95443d6737463bd1ad8c2dbd63688b7d48f","observation_id":"1dbe164c-dcb3-4dc0-a19b-d6b2b08ee59b","resolution":{"observed_at":"2026-07-04T16:59:58.329124Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2606.25182","last_updated":"2026-06-23T21:14:53Z","snapshot_observed_at":"2026-08-03T10:10:55.051524Z","submitted_at":"2026-06-23T21:14:53Z","title":"What Intermediate Layers Know: Detecting Jailbreaks from Entropy Dynamics","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-25T23:28:39.739645Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2606.25182"},"observation_digest":"sha256:ab4042eab92006a881f688492a137a91e2f2da96acc76661cebf9958c030d5c0","observation_id":"eefec10a-7cff-4449-8acb-d748a88d039a","resolution":{"observed_at":"2026-07-04T17:40:01.027199Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2606.25476","last_updated":"2026-07-21T11:09:35Z","snapshot_observed_at":"2026-08-02T10:16:34.720247Z","submitted_at":"2026-06-24T07:00:53Z","title":"A Red Teaming Framework for Large Language Models: A Case Study on Faithfulness Evaluation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-25T20:58:53.119386Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2606.25476"},"observation_digest":"sha256:5ae8e606b0ddac9c6b80dd66566f98c6bb61e8d6650e8a8dccf8889a56b212fc","observation_id":"956da625-3d1b-46f8-9889-c106bc14a44a","resolution":{"observed_at":"2026-07-04T19:50:11.036006Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-08-02T10:16:44.151383Z","title":"arXiv preprint arXiv:2404.01318 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.25476","last_updated":"2026-07-21T11:09:35Z","snapshot_observed_at":"2026-08-02T10:16:34.720247Z","submitted_at":"2026-06-24T07:00:53Z","title":"A Red Teaming Framework for Large Language Models: A Case Study on Faithfulness Evaluation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-02T10:16:44.151383Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2606.25476"},"observation_digest":"sha256:866e960c6c525745f8acc5683ea3cf00322341c1139288e47a9642e51df30f0a","observation_id":"de45d835-dd4d-4ddf-b57b-0a372331892f","resolution":{"observed_at":"2026-08-02T10:16:44.151383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2606.25782","last_updated":"2026-06-24T13:00:25Z","snapshot_observed_at":"2026-08-02T05:56:42.277319Z","submitted_at":"2026-06-24T13:00:25Z","title":"Do Encoders Suffice? A Systematic Comparison of Encoder and Decoder Safety Judges for LLM Adversarial Evaluation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-25T20:55:44.549142Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2606.25782"},"observation_digest":"sha256:9f0d58a9c921c50e400dd5730cc8df9b1193c54e1a1e8a9d24a47a4bd513f323","observation_id":"8859bbc8-cb8e-45f9-8901-ba12c9ba546c","resolution":{"observed_at":"2026-07-04T20:00:07.954777Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2606.26566","last_updated":"2026-06-25T03:32:12Z","snapshot_observed_at":"2026-08-03T17:22:40.185111Z","submitted_at":"2026-06-25T03:32:12Z","title":"Adversarial Diffusion Across Modalities: A Fusion Survey of Attacks, Defenses, and Evaluation for Text, Vision, and Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T04:35:51.583460Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2606.26566"},"observation_digest":"sha256:f80d5bed530ceed183b085b04ca2592ef182244897d639c7060cebf1d7bad02e","observation_id":"c297ccef-4712-429e-af2c-4a61e2323bfa","resolution":{"observed_at":"2026-06-26T04:38:59.217822Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2606.28153","last_updated":"2026-06-29T15:00:34Z","snapshot_observed_at":"2026-07-07T00:02:18.989389Z","submitted_at":"2026-06-26T14:51:16Z","title":"Robust Harmful Features Under Jailbreak Attacks: Mechanistic Evidence from Attention Head Specialization in Large Language Models","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-06-29T03:35:34.594617Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2606.28153"},"observation_digest":"sha256:015223217a1d643da5e1004e4b2e7a0b36ac32c86d8a887359cb4778afc933ea","observation_id":"e3cdde68-2d24-4748-bf6c-afa1be02e180","resolution":{"observed_at":"2026-07-01T17:35:51.343340Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2606.28153","last_updated":"2026-06-29T15:00:34Z","snapshot_observed_at":"2026-07-07T00:02:18.989389Z","submitted_at":"2026-06-26T14:51:16Z","title":"Robust Harmful Features Under Jailbreak Attacks: Mechanistic Evidence from Attention Head Specialization in Large Language Models","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-30T09:32:59.824110Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2606.28153"},"observation_digest":"sha256:57c1cb3c044c30ff48ae2bfa3d7533be1207cc3d39da5e484b505ff9e9672eb9","observation_id":"4c1cb776-4ad5-4eea-8540-b9b8a9aff192","resolution":{"observed_at":"2026-06-30T09:34:34.456037Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2606.29623","last_updated":"2026-06-28T21:59:31Z","snapshot_observed_at":"2026-07-07T00:03:36.327050Z","submitted_at":"2026-06-28T21:59:31Z","title":"SCARCE: Scalable Cascade Analysis for Rare-event Characterisation via Embeddings","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T07:03:36.414202Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2606.29623"},"observation_digest":"sha256:9c3d9a2328b7cfc7e0a0ee05dba203ca515252eb06ef41f997feb394c2797a82","observation_id":"93086946-f4f6-4ea4-a56d-ff4cfe48017b","resolution":{"observed_at":"2026-06-30T07:04:20.785937Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2607.01859","last_updated":"2026-07-02T08:17:57Z","snapshot_observed_at":"2026-08-03T00:18:15.853781Z","submitted_at":"2026-07-02T08:17:57Z","title":"Safety Targeted Embedding Exploit via Refinement","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-03T13:23:31.038332Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2607.01859"},"observation_digest":"sha256:86360a2727744e31ef4f236aabbb189c4a06e453ebdfe33ec904dd6b7b40517d","observation_id":"37b44ee2-1e89-4772-acbe-f46a9fbab962","resolution":{"observed_at":"2026-07-03T13:28:18.218798Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-14T14:13:53.489886Z","title":"arXiv preprint arXiv:2404.01318 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10112","last_updated":"2026-07-11T04:13:42Z","snapshot_observed_at":"2026-08-02T00:04:25.637534Z","submitted_at":"2026-07-11T04:13:42Z","title":"Minionese: Comprehensive Benchmark and Mechanistic Study of Multilingual LLM Safety","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-14T14:13:53.489886Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2607.10112"},"observation_digest":"sha256:fd1ee0cb8f5f844d253ae777a2255f0b2a327d9557a1e62c01b4a57ab4d43cb7","observation_id":"a28375f0-62c5-4792-bed7-befb999eca03","resolution":{"observed_at":"2026-07-14T14:13:53.489886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-08-02T07:09:30.130477Z","title":"Justin Cui, Wei-Lin Chiang, Ion Stoica, and Cho-Jui Hsieh","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13075","last_updated":"2026-07-12T20:37:19Z","snapshot_observed_at":"2026-08-03T00:34:20.307363Z","submitted_at":"2026-07-12T20:37:19Z","title":"The Entanglement Wall: Activation-Space Probes as Risk Detectors, Not Context Adjudicators","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T07:09:30.130477Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2607.13075"},"observation_digest":"sha256:31642dfd2eca1fd575cca3bf8cea8f2cc6ad00ea6bdc1eed9e93936f4d5f2fbe","observation_id":"30d638b7-d589-47c4-8a9a-59d739ce9aec","resolution":{"observed_at":"2026-08-02T07:09:30.130477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-08-01T18:54:56.575779Z","title":"arXiv preprint arXiv:2404.01318 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-01T18:54:50.722684Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:56.575779Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:a6109b65b6ba025f5a6556e10d6e448caf5d4c2ab6c581ffd98a998c23103860","observation_id":"b430ccb1-6a13-4671-825e-1544dd768caa","resolution":{"observed_at":"2026-08-01T18:54:56.575779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-08-01T11:29:54.038302Z","title":"Pappas, Florian Tramer, Hamed Hassani, and Eric Wong","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19894","last_updated":"2026-07-22T08:29:06Z","snapshot_observed_at":"2026-08-01T11:29:50.523964Z","submitted_at":"2026-07-22T08:29:06Z","title":"Defense Against LLM Backdoors using Critical Neuron Isolation Pruning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T11:29:54.038302Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2607.19894"},"observation_digest":"sha256:b3878637798ae54896a442f48b2b96635639aba6e73381a80281cd76772334bf","observation_id":"01c18020-6f22-44a6-b176-6967213a4c85","resolution":{"observed_at":"2026-08-01T11:29:54.038302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-08-02T11:28:36.924563Z","title":"Pappas, Florian Tram` er, Hamed Hassani, and Eric Wong","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20494","last_updated":"2026-06-12T18:54:24Z","snapshot_observed_at":"2026-08-02T11:28:35.990416Z","submitted_at":"2026-06-12T18:54:24Z","title":"Isolating LLM Alignment from Regex: Zero Coverage and Metric-Dependent Divergence Under Adversarial Mutation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T11:28:36.924563Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2607.20494"},"observation_digest":"sha256:d887834eae5accc8833800245eeecd23b35076b918c578cfa4a780197baaf1d5","observation_id":"a01821a1-0262-4369-bc19-79bd1d0728e6","resolution":{"observed_at":"2026-08-02T11:28:36.924563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-07-31T23:24:19.507389Z","title":"Pappas, and Eric Wong","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23999","last_updated":"2026-07-28T07:27:46Z","snapshot_observed_at":"2026-08-03T08:43:31.893929Z","submitted_at":"2026-07-27T04:51:20Z","title":"ContainmentBench: Trace-Based Evaluation of Post-Injection Containment in Tool-Using LLM Agents","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-31T23:24:19.507389Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2607.23999"},"observation_digest":"sha256:30501ab7b282a5f39e37ec39cb6111371775e6c5af8027f7b86f07ddf124bfd5","observation_id":"c08ec257-4107-4c63-bc5b-6e3e968135b9","resolution":{"observed_at":"2026-07-31T23:24:19.507389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2404.01318/citation-record","integrity":"/paper/2404.01318/integrity","json":"/paper/2404.01318/citation-record.json","paper":"/paper/2404.01318"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.00799","last_updated":"2025-03-06T17:43:10Z","snapshot_observed_at":"2026-08-03T23:30:33.347508Z","submitted_at":"2024-06-02T16:53:21Z","title":"Get my drift? Catching LLM Task Drift with Activation Deltas","version":6},"cited_work":{"arxiv_id":"2406.00799","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.00799","snapshot_observed_at":"2026-07-10T20:57:34.835399Z","title":"Are you still on track!? catching LLM task drift with activations","venue":"cs.CR","work_id":"f913aa64-dddb-4ce5-9f2c-5e314589aa1a","year":2024},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"cited_paper":"/paper/2406.00799","citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:6b16c133d2b4c8e77c6c920653d46aa7203ee1d4979eb6edc12c93b7104d23ed","observation_id":"f52f41d0-e120-43c0-9c46-915c932a32de","resolution":{"observed_at":"2026-05-15T06:08:05.444361Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T09:43:36.338801Z","title":"Llama 3 model card","venue":null,"work_id":"f46e0736-9f8c-49ee-8a86-552ab9905bf6","year":2024},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:b1e7070df4ebbb6b02787d398619eedf62039cebaf98ad9ea879c063cbf99f0e","observation_id":"cb1a5952-78e4-43b9-9b13-f69f8f2895d1","resolution":{"observed_at":"2026-05-15T06:08:05.685711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0203.366332","doi":"10.1145/3650203.3663326","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Croissant: A metadata format for ml-ready datasets","venue":null,"work_id":"b13e2013-4762-4e9a-97b5-74aa550ddbde","year":2024},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:5e9a0582a1bda514dbbdde50ffd0ec02bf3d0dffb8d6d0ca02721dc58c294619","observation_id":"ee1558a9-17a5-4cf4-b065-2372b912e852","resolution":{"observed_at":"2026-05-15T06:08:05.438566Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Jailbreak chat","venue":null,"work_id":"5d243cb8-eac6-42fe-9c14-a649fb943b5e","year":2023},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:681199739aa6ac55531eaf93dae29137ca543e1bb994425f97d1d21c1f95e220","observation_id":"94d4132a-2e54-4831-b5a4-1a3ff306350c","resolution":{"observed_at":"2026-05-15T06:08:05.726947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14132","last_updated":"2023-11-07T03:30:15Z","snapshot_observed_at":"2026-07-06T16:10:54.723336Z","submitted_at":"2023-08-27T15:20:06Z","title":"Detecting Language Model Attacks with Perplexity","version":3},"cited_work":{"arxiv_id":"2308.14132","doi":"10.48550/arxiv.2308.14132","metadata_source":"pith","pith_arxiv_id":"2308.14132","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Detecting Language Model Attacks with Perplexity","venue":"cs.CL","work_id":"8fac4469-dd8b-4784-9ff6-13d2e74e57fb","year":2023},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"cited_paper":"/paper/2308.14132","citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:f7ac291c7f0c1c6da34fd7a1491f31b5e9760e0bd2093cb77603e3e3d07a196c","observation_id":"d81435c3-e78d-408d-8c71-d1a8023331eb","resolution":{"observed_at":"2026-05-15T14:02:27.073914Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-12T03:19:28.65242+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T03:19:28.65242+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02151","last_updated":"2025-04-17T18:55:45Z","snapshot_observed_at":"2026-07-06T17:54:43.685212Z","submitted_at":"2024-04-02T17:58:27Z","title":"Jailbreaking Leading Safety-Aligned LLMs with Simple Adaptive Attacks","version":4},"cited_work":{"arxiv_id":"2404.02151","doi":"10.48550/arxiv.2404.02151","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02151","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"arXiv preprint arXiv:2404.02151 (2024)","venue":null,"work_id":"81e706c8-459e-40a1-a79d-bda6a104cd22","year":2025},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"cited_paper":"/paper/2404.02151","citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:ece2a4c208d3b94f55bc5580890d39bacaf0712dbd9034f9bdad34f15c51acff","observation_id":"9b4695f0-3376-423e-ae6d-b5f91e084b40","resolution":{"observed_at":"2026-05-15T06:08:05.456157Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Refusal in llms is mediated by a single direction","venue":null,"work_id":"94a4f0e8-49b9-44dc-b2a7-00e94c7f3557","year":2024},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:4dd392cda056aafae7aaebdd620925b8dcd17158fa3a9fca951841c1bc8e5ca2","observation_id":"9bf1517d-d7fa-42a2-885c-0c52dff62180","resolution":{"observed_at":"2026-05-15T06:08:05.663847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Are aligned neural networks adversarially aligned? Advances in Neural Information Processing Systems, 36","venue":null,"work_id":"83eec076-8094-42c6-a4e0-ff80c1826961","year":2024},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:55e5e8d7876ba6143e5e93222a2db4c2bb323dc7b5898b96ae46d0f6476699a1","observation_id":"d1a78591-99a7-4ff0-b1ad-6a855965ff3b","resolution":{"observed_at":"2026-05-15T06:08:05.667623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Non-determinism in gpt-4 is caused by sparse moe","venue":null,"work_id":"127f72c8-f4fd-44ac-adea-68b0e8b4d5ca","year":2023},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:b2e3ec37b570f91e51a292bac4a6a2c2d98be1c70243e5551e80ec6a6466754a","observation_id":"417ae944-6027-4753-b94c-3d629d48b954","resolution":{"observed_at":"2026-05-15T06:08:05.671523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"cited_work":{"arxiv_id":"2310.08419","doi":"10.48550/arxiv.2310.08419","metadata_source":"pith","pith_arxiv_id":"2310.08419","snapshot_observed_at":"2026-07-10T15:27:20.121842Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","venue":"cs.LG","work_id":"38678cda-6595-4ca3-916b-066c00cce063","year":2023},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"cited_paper":"/paper/2310.08419","citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:5e3705facd72c7fe0a4e136ca8a582206742a6794008486e1c7626039f4c114a","observation_id":"da0555d9-a6eb-406c-a06b-f113cc3ac3ff","resolution":{"observed_at":"2026-05-15T06:08:05.570098Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:06.618013+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:06.618013+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robustbench: a standardized adversarial robustness benchmark","venue":null,"work_id":"04ea92e1-af6b-45c5-9126-25522bd24806","year":2021},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:ea542e63c5cfcf3dfffd65fc4f02f45dc6fd4ccd8ca2f86d76e0865ad6332a9c","observation_id":"7beb1d43-7e0f-4423-9e8f-cbfbe07a1595","resolution":{"observed_at":"2026-05-15T06:08:05.679134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06474","last_updated":"2024-03-04T04:03:54Z","snapshot_observed_at":"2026-07-06T16:30:25.358715Z","submitted_at":"2023-10-10T09:44:06Z","title":"Multilingual Jailbreak Challenges in Large Language Models","version":3},"cited_work":{"arxiv_id":"2310.06474","doi":"10.48550/arxiv.2310.06474","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.06474","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Multilingual jailbreak challenges in large language models","venue":null,"work_id":"97d238ad-7e44-4a09-90f1-ca400f5296e3","year":2023},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"cited_paper":"/paper/2310.06474","citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:adc29502c4c621eeaf99a3499dd37641a8e8fa22fdc07333ae7f28ba6f9f2a51","observation_id":"9bde5b79-fc98-4f7d-bd61-96df390e823c","resolution":{"observed_at":"2026-05-15T06:08:05.575886Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:27:30.347033+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:27:30.347033+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09154","last_updated":"2025-03-03T09:37:27Z","snapshot_observed_at":"2026-08-03T17:59:18.731227Z","submitted_at":"2024-02-14T13:13:26Z","title":"Attacking Large Language Models with Projected Gradient Descent","version":2},"cited_work":{"arxiv_id":"2402.09154","doi":"10.48550/arxiv.2402.09154","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09154","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Attacking large language mod- els with projected gradient descent","venue":null,"work_id":"f8aa89f0-9d68-4ed9-b8fd-c3656e3a9de3","year":2024},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"cited_paper":"/paper/2402.09154","citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:32e6b9de85e9233a0d575178badf6d3bd7461c2646d711dd4cc9f5297acbc4e0","observation_id":"dcd6d2d5-77a7-4685-a090-86134a0fa128","resolution":{"observed_at":"2026-05-15T06:08:05.581194Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gemini v1.5 report","venue":null,"work_id":"88479416-908a-4fcc-85fe-7d5d8235b77d","year":2024},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:605d6970c45fb344df0740efb7b651ab9c8c56f561601a7e3a167698e85695bb","observation_id":"40a44745-888d-4f5e-8e58-53bfc3307b1c","resolution":{"observed_at":"2026-05-15T06:08:05.688548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12329","last_updated":"2024-12-07T23:09:49Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:01:36Z","title":"Query-Based Adversarial Prompt Generation","version":2},"cited_work":{"arxiv_id":"2402.12329","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.12329","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2402.12329 (2024)","venue":null,"work_id":"8f36413f-b5f1-4691-bc32-5a2b817e5b7a","year":2024},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"cited_paper":"/paper/2402.12329","citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:799a4e2d6f5910556f4743f5b97e5b9adfa9d0e09b3fdf05d47969b19196cbb0","observation_id":"3d40c8bc-92e7-45af-9a9b-13b4450f0166","resolution":{"observed_at":"2026-05-15T06:08:05.586412Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":"30e23d70-074a-45b3-9225-e3b733839027","year":2021},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:df53c76fe72d36b5d516a6a75face7ab688babc25ebb8c2f035757d43dab9393","observation_id":"c80d48f4-6846-45c8-be08-ffe06c6a00fc","resolution":{"observed_at":"2026-05-15T06:08:05.694129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06987","last_updated":"2023-10-10T20:15:54Z","snapshot_observed_at":"2026-07-06T16:30:46.321160Z","submitted_at":"2023-10-10T20:15:54Z","title":"Catastrophic Jailbreak of Open-source LLMs via Exploiting Generation","version":1},"cited_work":{"arxiv_id":"2310.06987","doi":"10.48550/arxiv.2310.06987","metadata_source":"pith","pith_arxiv_id":"2310.06987","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Catastrophic Jailbreak of Open-source LLMs via Exploiting Generation","venue":"cs.CL","work_id":"9fb26453-add9-48f5-8330-713e9b8726ed","year":2023},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"cited_paper":"/paper/2310.06987","citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:d2db26abbbe58fb22f4cdad2a4ee5e132a3dfc33b192c1d80c399cdb43304b3e","observation_id":"451e27d6-fd76-4838-a4d0-ac044ccecea1","resolution":{"observed_at":"2026-05-16T22:00:51.596826Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:27:25.810147+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:27:25.810147+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05566","last_updated":"2024-01-17T20:26:01Z","snapshot_observed_at":"2026-07-06T17:14:03.152949Z","submitted_at":"2024-01-10T22:14:35Z","title":"Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training","version":3},"cited_work":{"arxiv_id":"2401.05566","doi":"10.48550/arxiv.2401.05566","metadata_source":"pith","pith_arxiv_id":"2401.05566","snapshot_observed_at":"2026-07-11T03:17:50.191883Z","title":"Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training","venue":"cs.CR","work_id":"b95e7447-320c-4c85-b5d0-3708cc2cc72e","year":2024},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"cited_paper":"/paper/2401.05566","citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:881a99b011a4f2d6f444498d1fae9a0d720c2e4ab68922c01aa5bd7bac6ab35a","observation_id":"14eda907-262d-4a5e-9978-ccab91d7815c","resolution":{"observed_at":"2026-05-15T06:08:05.597327Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.966538+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.966538+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06674","last_updated":"2023-12-07T19:40:50Z","snapshot_observed_at":"2026-07-06T17:00:00.321552Z","submitted_at":"2023-12-07T19:40:50Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":"2312.06674","doi":"10.3390/info16050365","metadata_source":"pith","pith_arxiv_id":"2312.06674","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","venue":"cs.CL","work_id":"93844332-869b-448c-a1be-35466150b1b2","year":2023},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"cited_paper":"/paper/2312.06674","citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:56de424b4871f573fe710f8605058640e89249d17cb1e15cc9552e99333aa0fd","observation_id":"b032a506-52d4-41cf-8c2f-027640a9e8d0","resolution":{"observed_at":"2026-05-15T06:08:05.602244Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00614","last_updated":"2023-09-04T17:47:36Z","snapshot_observed_at":"2026-07-06T16:13:23.343694Z","submitted_at":"2023-09-01T17:59:44Z","title":"Baseline Defenses for Adversarial Attacks Against Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2309.00614","doi":"10.48550/arxiv.2309.00614","metadata_source":"pith","pith_arxiv_id":"2309.00614","snapshot_observed_at":"2026-07-10T15:47:23.193067Z","title":"Baseline Defenses for Adversarial Attacks Against Aligned Language Models","venue":"cs.LG","work_id":"db5870ca-177b-4d1d-a08d-ee5ceab17fe3","year":2023},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"cited_paper":"/paper/2309.00614","citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:2488adf7435de251dfc505e99f8edec08c1b35826e63615e5e7a19cf87b18cc4","observation_id":"7788ce21-f353-4643-aa33-3dfeb7d0fc56","resolution":{"observed_at":"2026-05-15T06:08:05.607273Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-12T03:19:31.483658+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T03:19:31.483658+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16192","last_updated":"2024-02-28T23:11:33Z","snapshot_observed_at":"2026-07-06T17:35:14.603648Z","submitted_at":"2024-02-25T20:36:03Z","title":"Defending Large Language Models against Jailbreak Attacks via Semantic Smoothing","version":2},"cited_work":{"arxiv_id":"2402.16192","doi":"10.48550/arxiv.2402.16192","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.16192","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Defending large language models against jailbreak attacks via semantic smoothing","venue":null,"work_id":"6f0458ba-95b0-479f-8704-1317c465f4a7","year":2024},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"cited_paper":"/paper/2402.16192","citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:d5d2bb8e029018449e8ee5c0da28bcc2ff0e63a47faab001a4bfc8a31a8903bb","observation_id":"658d527c-31f9-449c-a5a1-f82f5704d7a6","resolution":{"observed_at":"2026-05-15T06:08:05.612858Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":"2401.04088","doi":"10.48550/arxiv.2401.04088","metadata_source":"pith","pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-07-11T03:27:47.028679Z","title":"Mixtral of Experts","venue":"cs.LG","work_id":"0de8c352-9daa-4e1e-8c7b-3d0dec69f369","year":2024},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:05111bcd0b85cf91caa9785db46c6e36478c934a15e56b139244000854bf1942","observation_id":"31ddbe07-947e-412c-b49b-1f4779586d60","resolution":{"observed_at":"2026-05-15T06:08:05.617244Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:39.110013+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:39.110013+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2402.03299","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T12:45:44.888794Z","title":"Guard: Role-playing to gener- ate natural-language jailbreakings to test guide- line adherence of large language models","venue":null,"work_id":"b3144468-9149-4233-b22b-2cec98219fb8","year":2024},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:6355089b4485a3c67ae13fc3b80d54b5187f0d312c5b116940739b9bd45e232d","observation_id":"a44d343e-a3e5-4c9b-ab65-b7f13694d76f","resolution":{"observed_at":"2026-05-15T06:08:05.622523Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20413","last_updated":"2024-05-30T18:38:36Z","snapshot_observed_at":"2026-07-06T18:22:57.400982Z","submitted_at":"2024-05-30T18:38:36Z","title":"Jailbreaking Large Language Models Against Moderation Guardrails via Cipher Characters","version":1},"cited_work":{"arxiv_id":"2405.20413","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20413","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2405.20413 (2024)","venue":null,"work_id":"2d755a09-da02-4879-8951-c9d7d948a885","year":2024},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"cited_paper":"/paper/2405.20413","citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:9eef79fe57217abc6beb129d67acdee8d8c1922c4a842f03d6e9ac199bdb5c10","observation_id":"33ea019e-6694-4774-9866-fa52758af9d8","resolution":{"observed_at":"2026-05-15T06:08:05.627014Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02705","last_updated":"2025-02-04T19:47:09Z","snapshot_observed_at":"2026-07-06T16:15:00.517258Z","submitted_at":"2023-09-06T04:37:20Z","title":"Certifying LLM Safety against Adversarial Prompting","version":4},"cited_work":{"arxiv_id":"2309.02705","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.02705","snapshot_observed_at":"2026-07-09T10:26:11.131634Z","title":"Certifying llm safety against adversar- ial prompting","venue":"cs.CL","work_id":"d19a91a9-d209-412c-b9b6-c7600e55ccf9","year":2023},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"cited_paper":"/paper/2309.02705","citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:746c7e74ad99c8b837a1c7a4d0ca9526cb6d5b4c6c03cf6377837cbda9da0679","observation_id":"16e16c7d-57e5-4dd9-933b-72ca8b2c757f","resolution":{"observed_at":"2026-05-15T06:08:05.632731Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01446","last_updated":"2024-08-05T11:34:10Z","snapshot_observed_at":"2026-08-04T21:02:05.722226Z","submitted_at":"2023-09-04T08:54:20Z","title":"Open Sesame! Universal Black Box Jailbreaking of Large Language Models","version":4},"cited_work":{"arxiv_id":"2309.01446","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.01446","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Open sesame! universal black box jailbreaking of large language models","venue":null,"work_id":"153226da-2665-4072-9525-a1b0e29db394","year":2023},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"cited_paper":"/paper/2309.01446","citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:f9f4a94ef7f37351cf318e820c38831458a73451916113b141b4fa388b692701","observation_id":"fb3e3ded-af34-448d-8780-349c26f73a04","resolution":{"observed_at":"2026-05-15T06:08:05.637785Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16229","last_updated":"2024-05-25T13:38:40Z","snapshot_observed_at":"2026-07-06T18:19:52.121906Z","submitted_at":"2024-05-25T13:38:40Z","title":"No Two Devils Alike: Unveiling Distinct Mechanisms of Fine-tuning Attacks","version":1},"cited_work":{"arxiv_id":"2405.16229","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.16229","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"T., Cheng, Y ., Xu, K., Wang, J., Wang, H., and Li, W","venue":null,"work_id":"443dba79-b8e6-4bb6-b5bd-60f9f9429dbf","year":2024},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"cited_paper":"/paper/2405.16229","citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:4f2ec87229bf23c2faf6c1b12d8c0232e9e43558636f95730b43dd1cc974d95d","observation_id":"31495855-5314-410c-8106-de760bbcf6a0","resolution":{"observed_at":"2026-05-15T06:08:05.642615Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13068","last_updated":"2026-04-18T08:25:50Z","snapshot_observed_at":"2026-08-04T20:18:53.393132Z","submitted_at":"2024-05-20T17:17:55Z","title":"Uncovering Logit Suppression Vulnerabilities in LLM Safety Alignment","version":4},"cited_work":{"arxiv_id":"2405.13068","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.13068","snapshot_observed_at":"2026-07-03T11:58:06.187543Z","title":"Uncovering Logit Suppression Vulnerabilities in LLM Safety Alignment","venue":"cs.CR","work_id":"6a91df1e-a757-48f8-8a05-1583522ece9d","year":2024},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"cited_paper":"/paper/2405.13068","citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:79de8d5b46b9d5a525a6aff36f4e17c371a34d749d2b9db730851d97dea806b0","observation_id":"a0d6b3d9-7464-4d49-b2f3-9795af098f09","resolution":{"observed_at":"2026-05-15T06:08:05.648088Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04451","last_updated":"2024-03-20T21:34:56Z","snapshot_observed_at":"2026-07-06T16:28:55.209047Z","submitted_at":"2023-10-03T19:44:37Z","title":"AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":"2310.04451","doi":"10.48550/arxiv.2310.04451","metadata_source":"pith","pith_arxiv_id":"2310.04451","snapshot_observed_at":"2026-07-10T15:27:20.054506Z","title":"AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models","venue":"cs.CL","work_id":"3b676de6-edef-4976-a8b5-082d4ff50867","year":2023},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"cited_paper":"/paper/2310.04451","citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:7f89ea23a5923bf8fa8a316141907c44f1b4a8ab2d6edd23000880275d6458bd","observation_id":"b118c386-e631-48ca-8459-6e07acba552c","resolution":{"observed_at":"2026-05-15T06:08:05.653882Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T04:52:41.614605+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T04:52:41.614605+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Meta llama guard 2","venue":null,"work_id":"db5e426e-7018-4d54-9c36-ea8b061fdc2e","year":2024},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:3a5493e53c45869f4948915985dc5ef9aad90b38b1811e6e59ce6aaf1003ff34","observation_id":"8a6c4c2c-2e2e-4cb7-b988-2080a4f31622","resolution":{"observed_at":"2026-05-15T06:08:05.691379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04893","last_updated":"2024-03-07T20:55:08Z","snapshot_observed_at":"2026-07-06T17:41:19.171822Z","submitted_at":"2024-03-07T20:55:08Z","title":"A Safe Harbor for AI Evaluation and Red Teaming","version":1},"cited_work":{"arxiv_id":"2403.04893","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04893","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A Safe Harbor for AI Evaluation and Red Teaming","venue":null,"work_id":"0397e079-991e-496b-9bed-3c000c6fba1b","year":2024},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"cited_paper":"/paper/2403.04893","citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:68895d7dd44b808840805ef5a09f7e479a73a81dbd25f565ffe57bdbb5e287e4","observation_id":"45f7aa29-0ab2-4c31-9a8d-31433899d91b","resolution":{"observed_at":"2026-05-15T06:08:05.659825Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tdc 2023 (llm edition): The trojan detection challenge","venue":null,"work_id":"3e8b7962-e3f9-4f0e-92d7-f4bb6ef8d74a","year":2023},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:d9d74eccc066afcb7ac424b906447b9468c76feb19106559e8913d16848db156","observation_id":"9bfff335-1225-4dce-97eb-3a26d5ea0ddf","resolution":{"observed_at":"2026-05-15T06:08:05.701347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Harmbench: A standardized evaluation framework for automated red teaming and robust refusal","venue":null,"work_id":"7fe06d5c-cba1-4b73-abf3-b28f199b82da","year":2024},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:ff9b090ed59a3985bd39ea855c47a26358ab255ccf627597ab2f8bd1d100363b","observation_id":"3c79fc6c-f265-4f5d-b91e-c3e8048bca3a","resolution":{"observed_at":"2026-05-15T06:08:05.705246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02119","last_updated":"2024-10-31T15:57:42Z","snapshot_observed_at":"2026-07-06T16:56:46.051958Z","submitted_at":"2023-12-04T18:49:23Z","title":"Tree of Attacks: Jailbreaking Black-Box LLMs Automatically","version":3},"cited_work":{"arxiv_id":"2312.02119","doi":"10.48550/arxiv.2312.02119","metadata_source":"pith","pith_arxiv_id":"2312.02119","snapshot_observed_at":"2026-07-10T15:27:20.047022Z","title":"Tree of attacks: Jailbreaking black-box llms automatically","venue":"cs.LG","work_id":"21743458-a817-448a-b77b-559e707b5030","year":2023},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"cited_paper":"/paper/2312.02119","citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:caae9b3e2dabf8e75e719e903aba217fd20b0561d3341e9e340b9cb584a44e84","observation_id":"bffd8101-d2d5-4ae8-9420-54b5c1f107ca","resolution":{"observed_at":"2026-05-15T06:08:05.461377Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:06.257775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:06.257775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Jailbreaking chatgpt on release day","venue":null,"work_id":"258ca0a3-ef30-45ee-8c67-d79c5e07518f","year":2022},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:91a8a90f64f7ba6f174edf230b4fa70eb248464220f28bdb4cdcc096ec5aa415","observation_id":"a2126e21-474d-4b40-8e67-9f28780539d3","resolution":{"observed_at":"2026-05-15T06:08:05.712531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:26:54.787661Z","title":"Gpt-4 technical report","venue":null,"work_id":"388f534c-855a-4366-b933-f07bf3e2db5f","year":2023},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:260d246e88bfd614f0d0b2a33735404206f39ff201635c222da709d9a5856180","observation_id":"5d217870-48bb-43e3-87be-b43a47a455b0","resolution":{"observed_at":"2026-05-15T06:08:05.715713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"419d5fd7-fcec-439f-b29a-d31dcb6533dc","year":2022},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:027363a92be97a4a8526178ad50843aad2637dfcbb7908b4e9a3d96fdb600aaa","observation_id":"c58914f9-d266-4329-95f3-1ef7b40de8a6","resolution":{"observed_at":"2026-05-15T06:08:05.719739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17374","last_updated":"2024-10-30T22:35:59Z","snapshot_observed_at":"2026-07-06T18:20:44.070255Z","submitted_at":"2024-05-27T17:31:56Z","title":"Navigating the Safety Landscape: Measuring Risks in Finetuning Large Language Models","version":3},"cited_work":{"arxiv_id":"2405.17374","doi":"10.48550/arxiv.2405.17374","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.17374","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Navigating the safety landscape: Measuring risks in finetuning large language models","venue":null,"work_id":"0690d04d-031a-405d-8d00-e6ae62f2ea69","year":2024},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"cited_paper":"/paper/2405.17374","citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:3e5a3105e1b48afd024e5ae30c8d5592403a476b887a18bb1a266cfd276a56e5","observation_id":"3fc94b89-7722-488c-879c-72aaac5fb5a5","resolution":{"observed_at":"2026-05-15T06:08:05.466259Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1146.353323","doi":"10.1145/3531146.3533231","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Data cards: Purposeful and transparent dataset documentation for responsible AI","venue":null,"work_id":"ab4748cc-c07c-48e2-b916-34095b03c0d9","year":2022},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:61e6e100f1618463088207e3a8b9445b4785bbba784f17d4f2e224fe35fd6b34","observation_id":"3929f72f-23df-4171-9470-f4b591b75320","resolution":{"observed_at":"2026-05-15T06:08:05.427622Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"340b11d3-fed9-43e1-813f-40be7e10070b","year":2024},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:9f2b73c3e1c0f96b32fb7f84855f92147f6fd4091984bbd81fba62dc73fd5fb6","observation_id":"b34c67f1-8831-4f45-8438-78bf9ed89230","resolution":{"observed_at":"2026-05-15T06:08:05.730468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Find the trojan: Universal backdoor detection in aligned llms","venue":null,"work_id":"325dc856-ccde-4b24-8582-b1f2dab1913e","year":2024},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:7a493b16a7c2fed4810c7c72da0519e33999739dfc5777ad1ca69db58fe87223","observation_id":"ff2b8742-5521-43d0-98b1-c4b11784e2a7","resolution":{"observed_at":"2026-05-15T06:08:05.675608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03684","last_updated":"2024-06-11T19:02:52Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:01:53Z","title":"SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks","version":4},"cited_work":{"arxiv_id":"2310.03684","doi":"10.48550/arxiv.2310.03684","metadata_source":"pith","pith_arxiv_id":"2310.03684","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks","venue":"cs.LG","work_id":"f670dc77-bf11-46fc-af9d-b77215abd084","year":2023},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"cited_paper":"/paper/2310.03684","citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:09b6003a20edf2c7bef5f5ae9b3a35bdde089c140a8486c8cca00cf1a9fef440","observation_id":"b36fc692-d441-4a74-9449-ac3b1f0142f5","resolution":{"observed_at":"2026-05-15T06:08:05.470017Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01263","last_updated":"2024-04-01T11:50:35Z","snapshot_observed_at":"2026-08-03T00:58:55.865010Z","submitted_at":"2023-08-02T16:30:40Z","title":"XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models","version":3},"cited_work":{"arxiv_id":"2308.01263","doi":"10.48550/arxiv.2308.01263","metadata_source":"pith","pith_arxiv_id":"2308.01263","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models","venue":"cs.CL","work_id":"bd953600-1547-4c1e-ade7-219a9f7cfe7a","year":2023},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"cited_paper":"/paper/2308.01263","citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:6b3ca2a3c8cf82d0a7e07e9cd465b0154d1e173a57429f25ecfd5eff56d3012a","observation_id":"7237c79c-3056-4b6e-b8e6-30e9f9d775f7","resolution":{"observed_at":"2026-05-15T06:51:50.894684Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-07-06T16:43:46.708045Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":"2311.03348","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-07-04T19:50:11.090116Z","title":"arXiv preprint arXiv:2311.03348 (2023)","venue":null,"work_id":"ae0f14e0-eb2e-4516-b895-79c9b5a2cc0d","year":2023},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:4d7bfd47ea9df671db17aa7cc98daaf717f6cb3dc11d555c4d115553764b464e","observation_id":"dc4002bc-dea2-4b34-b549-7dd66ece4c54","resolution":{"observed_at":"2026-05-15T06:08:05.480000Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03825","last_updated":"2024-05-15T12:06:31Z","snapshot_observed_at":"2026-07-06T16:03:34.432602Z","submitted_at":"2023-08-07T16:55:20Z","title":"\"Do Anything Now\": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models","version":2},"cited_work":{"arxiv_id":"2308.03825","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.03825","snapshot_observed_at":"2026-07-10T17:17:25.614333Z","title":"\"Do Anything Now\": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models","venue":"cs.CR","work_id":"73c8e776-cd59-4029-b3fe-4579d64d9014","year":2023},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"cited_paper":"/paper/2308.03825","citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:091c73000d1939ffc980e23ca73b218ddbec441595dbdef5b7a4aa966321af0b","observation_id":"833ebf27-235d-4fa6-bc7f-aaa37c8388df","resolution":{"observed_at":"2026-05-17T08:39:28.464962Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09674","last_updated":"2024-02-15T02:54:49Z","snapshot_observed_at":"2026-07-06T17:30:25.359458Z","submitted_at":"2024-02-15T02:54:49Z","title":"PAL: Proxy-Guided Black-Box Attack on Large Language Models","version":1},"cited_work":{"arxiv_id":"2402.09674","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.09674","snapshot_observed_at":"2026-07-10T11:57:03.488334Z","title":"Pal: Proxy-guided black-box attack on large language models.arXiv preprint arXiv:2402.09674","venue":"cs.CL","work_id":"62c0dec6-b176-45bd-ba3b-30f2b0507e35","year":2024},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"cited_paper":"/paper/2402.09674","citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:36e76b490f51d9d14dd439771139f678c7e0f673e9bb6e6569392f15a8942fd4","observation_id":"efeb32c0-20bc-4c05-ad0c-89ff25a44a81","resolution":{"observed_at":"2026-05-15T06:08:05.491124Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10260","last_updated":"2024-08-27T03:32:47Z","snapshot_observed_at":"2026-08-04T21:32:35.483431Z","submitted_at":"2024-02-15T18:58:09Z","title":"A StrongREJECT for Empty Jailbreaks","version":2},"cited_work":{"arxiv_id":"2402.10260","doi":"10.48550/arxiv.2402.10260","metadata_source":"pith","pith_arxiv_id":"2402.10260","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"A StrongREJECT for Empty Jailbreaks","venue":"cs.LG","work_id":"27281d18-31bd-4124-9fa7-4e61945ff9d1","year":2024},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"cited_paper":"/paper/2402.10260","citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:0c3b254bed05791f855af3a8b3fa242d14a881a0319e2e0c4849033731814023","observation_id":"284f8814-55c9-49f3-9e3c-8d83492214e7","resolution":{"observed_at":"2026-05-16T21:28:03.016512Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:22.243424+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:22.243424+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5281/zenodo.7199437","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T01:02:55.040795Z","title":"rspeer/wordfreq: v3.0, September 2022","venue":null,"work_id":"a1c6185f-c273-4717-bbeb-586dac5e47ab","year":2022},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:68c089e588c2182bb0b9b767646865bbb995b271427a094eac2ce3c411b4b447","observation_id":"c84f9851-26ab-48ce-b16e-6f4d66ed3a5c","resolution":{"observed_at":"2026-05-15T06:08:05.432681Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-12T17:49:52.227449+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T17:49:52.227449+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05561","last_updated":"2024-09-30T10:17:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-10T22:07:21Z","title":"TrustLLM: Trustworthiness in Large Language Models","version":6},"cited_work":{"arxiv_id":"2401.05561","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.05561","snapshot_observed_at":"2026-07-04T19:50:11.226678Z","title":"TrustLLM: Trustworthiness in Large Language Models","venue":"cs.CL","work_id":"d16f7fcd-8a69-4cc5-b63f-6bb2fe440d76","year":2024},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"cited_paper":"/paper/2401.05561","citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:ef9edcd7b423dbc1e64a166898ee51c6d45975aecb6bcb7e2dbda35f8dc6e38f","observation_id":"8853d8da-4b81-4463-9835-b3e09969d32c","resolution":{"observed_at":"2026-05-18T11:17:09.209714Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09798","last_updated":"2024-02-12T02:29:28Z","snapshot_observed_at":"2026-07-06T17:17:15.712197Z","submitted_at":"2024-01-18T08:36:54Z","title":"All in How You Ask for It: Simple Black-Box Method for Jailbreak Attacks","version":3},"cited_work":{"arxiv_id":"2401.09798","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.09798","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"All in how you ask for it: Simple black-box method for jailbreak attacks","venue":null,"work_id":"54271347-2396-44c7-9298-ca6584e45391","year":2024},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"cited_paper":"/paper/2401.09798","citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:b9ac471228b945b6e411256a45481d30e84cfba44b8d0ff84402fef1470132cb","observation_id":"2fd99d61-5f03-4179-af26-52f2835ae67c","resolution":{"observed_at":"2026-05-15T06:08:05.506841Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-02T11:57:18.735747Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:0d7ca837ad363e651c30b7d5c9e3746e301fac86e4d13b086e39233c863b771c","observation_id":"a7055a67-eeeb-42a5-9f83-6ec12526dfe2","resolution":{"observed_at":"2026-05-15T06:08:05.512899Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On adaptive attacks to adversarial example defenses","venue":null,"work_id":"63b09374-f95e-4dbd-95f7-3c1e6b85ae1f","year":2020},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:05b4fc09e25dba1c40663b9b7294a4b294efc752172b3d16018d2bcfedda4430","observation_id":"a6b6c1ac-60f7-46fa-ac89-64db8add18bb","resolution":{"observed_at":"2026-05-15T06:08:05.682254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Decodingtrust: A comprehensive assessment of trustworthiness in gpt models","venue":null,"work_id":"fbe09aeb-f739-41b6-b83c-331dff510492","year":2023},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:3096df73a5c6854573808b924ed5614668593bdacc9a61016e51186a19b61266","observation_id":"c0a376a6-5313-4c1c-af69-d16230f11a23","resolution":{"observed_at":"2026-05-15T06:08:05.697673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02483","last_updated":"2023-07-05T17:58:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-05T17:58:10Z","title":"Jailbroken: How Does LLM Safety Training Fail?","version":1},"cited_work":{"arxiv_id":"2307.02483","doi":"10.48550/arxiv.2307.02483","metadata_source":"pith","pith_arxiv_id":"2307.02483","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Jailbroken: How Does LLM Safety Training Fail?","venue":"cs.LG","work_id":"a0b5df13-7a81-4b15-afb4-c715e6b400bc","year":2023},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"cited_paper":"/paper/2307.02483","citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:95f0361bb0415577b35553eb3f5c073cc3955751a616085de425a266570f897b","observation_id":"d156a89d-0465-4b93-ae09-3e03a56b44f5","resolution":{"observed_at":"2026-05-15T06:08:05.518550Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:25.377799+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:25.377799+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20099","last_updated":"2025-06-04T02:59:37Z","snapshot_observed_at":"2026-07-06T18:22:44.129954Z","submitted_at":"2024-05-30T14:40:35Z","title":"Defensive Prompt Patch: A Robust and Interpretable Defense of LLMs against Jailbreak Attacks","version":2},"cited_work":{"arxiv_id":"2405.20099","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20099","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Defensive prompt patch: A robust and interpretable defense of llms against jailbreak attacks","venue":null,"work_id":"750d63e8-dcc0-45e6-995c-6f1d3082dad9","year":2024},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"cited_paper":"/paper/2405.20099","citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:79fa55b04c4fcb08d32f927ff75b954dca237901136267332e46a808069ee344","observation_id":"0f73f005-c433-44cb-baeb-4072e24ebefd","resolution":{"observed_at":"2026-05-15T06:08:05.524282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02446","last_updated":"2024-01-27T22:54:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T21:30:56Z","title":"Low-Resource Languages Jailbreak GPT-4","version":2},"cited_work":{"arxiv_id":"2310.02446","doi":"10.48550/arxiv.2310.02446","metadata_source":"pith","pith_arxiv_id":"2310.02446","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Low-Resource Languages Jailbreak GPT-4","venue":"cs.CL","work_id":"e88f3256-3186-452b-ba46-58885055c4ec","year":2023},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"cited_paper":"/paper/2310.02446","citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:e1323be9cdfb095e2dde0690cf40c6004560c5b39bec9f9e868d6c08365c639c","observation_id":"a0946d21-1906-4376-9f24-de60bb06111f","resolution":{"observed_at":"2026-05-17T09:24:14.203470Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10253","last_updated":"2024-06-27T16:01:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-19T02:19:48Z","title":"GPTFUZZER: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts","version":4},"cited_work":{"arxiv_id":"2309.10253","doi":"10.48550/arxiv.2309.10253","metadata_source":"pith","pith_arxiv_id":"2309.10253","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"GPTFUZZER: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts","venue":"cs.AI","work_id":"230d395f-9220-4e6f-a52f-e593552b049b","year":2023},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"cited_paper":"/paper/2309.10253","citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:cd5e0c229484a7c80bb79246d2d19339acd008bb8c30514d1bc1709a1219bfc9","observation_id":"96bcb434-7eec-4492-baa4-e5f9794dc5b8","resolution":{"observed_at":"2026-05-15T06:25:21.318009Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:10.090181+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:10.090181+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06373","last_updated":"2024-01-23T22:46:12Z","snapshot_observed_at":"2026-07-06T17:14:36.670116Z","submitted_at":"2024-01-12T16:13:24Z","title":"How Johnny Can Persuade LLMs to Jailbreak Them: Rethinking Persuasion to Challenge AI Safety by Humanizing LLMs","version":2},"cited_work":{"arxiv_id":"2401.06373","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06373","snapshot_observed_at":"2026-07-03T21:58:59.338870Z","title":"InProceedings of the Inter- national Conference on Learning Representations (ICLR)","venue":null,"work_id":"4dfcea58-c69c-4ded-916c-1fb984476d6d","year":2024},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"cited_paper":"/paper/2401.06373","citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:17ea48c50756015dfd779e218241026f1cd5246ad21da1b413ede4f9248f5eca","observation_id":"68191e5e-ce2a-46cf-8c6a-d91f943006b8","resolution":{"observed_at":"2026-05-15T06:08:05.541412Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":"2306.05685","doi":"10.1109/4235.797969","metadata_source":"pith","pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","venue":"cs.CL","work_id":"d0c30cd7-81e1-4159-a87f-f6adca77ff08","year":2023},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:41306c0b87a369b50b70addf79e9b52b8732cf8f66116519a25dfdc665ca84c8","observation_id":"cd42278d-1978-49f0-81df-f7c053c8745c","resolution":{"observed_at":"2026-05-15T06:08:05.546872Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01288","last_updated":"2024-10-30T12:08:42Z","snapshot_observed_at":"2026-07-06T18:24:26.225262Z","submitted_at":"2024-06-03T12:59:17Z","title":"Improved Few-Shot Jailbreaking Can Circumvent Aligned Language Models and Their Defenses","version":2},"cited_work":{"arxiv_id":"2406.01288","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.01288","snapshot_observed_at":"2026-07-04T19:50:11.193751Z","title":"Improved few- shot jailbreaking can circumvent aligned language models and their defenses","venue":null,"work_id":"dcf8173d-4f97-4a8c-8809-e49e50087e05","year":2024},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"cited_paper":"/paper/2406.01288","citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:1ee826a45dbf4abf2cdef89f5a70e15e2218801155e42d25059246eee6a9c2b8","observation_id":"173496f5-42e2-412e-8760-c37a1c4e3b2a","resolution":{"observed_at":"2026-05-15T06:08:05.552383Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Easyjailbreak: A unified framework for jailbreaking large language models","venue":null,"work_id":"13044b16-50d3-4186-a327-f52395f0b0d1","year":2024},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:865cb4ecc0701535cb336345c3e611fc9270fe7128954b4eade4e12597db33c1","observation_id":"4d2f9c08-7a01-4d35-8d50-72dde00b0070","resolution":{"observed_at":"2026-05-15T06:08:05.723038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07910","last_updated":"2024-08-20T00:28:45Z","snapshot_observed_at":"2026-08-03T14:21:36.296572Z","submitted_at":"2023-12-13T05:58:34Z","title":"PromptBench: A Unified Library for Evaluation of Large Language Models","version":3},"cited_work":{"arxiv_id":"2312.07910","doi":"10.48550/arxiv.2312.07910","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.07910","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Available: https://arxiv.org/pdf/2312.07910","venue":null,"work_id":"011d2381-27dd-46a9-b560-d308963bc72b","year":2023},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"cited_paper":"/paper/2312.07910","citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:7d74fae69fdbc62a2dc020cbb492abfbb14795fe01b999589f7f14d5c57b0a7e","observation_id":"acac4324-7306-4d43-9b7a-3ea2b6ec88c4","resolution":{"observed_at":"2026-05-15T06:08:05.558387Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Randomness in neural network training: Characterizing the impact of tooling","venue":null,"work_id":"227a64d9-f446-48a8-a010-51b8d32d956a","year":2022},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:f16f06da2f63d9bb395b08aa3b22fadcb6894bff582ddc884ce2f5aaa619a2ad","observation_id":"3e62f120-2cb0-422e-8411-1b95f80c2164","resolution":{"observed_at":"2026-05-15T06:08:05.708945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-07-11T02:47:49.837877Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:ba8aa8164979dff62e211c85271662252b8cc2aef7fabe49714d3480c03eec0c","observation_id":"7149086c-43aa-441f-a801-7da49abfc2b1","resolution":{"observed_at":"2026-05-15T06:08:05.564496Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","latest_version":5,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":9,"parse_uncertain":0,"unresolved":0,"verified_exact":35,"verified_fuzzy":20},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 72 inbound Pith citation observations for arXiv:2404.01318."}