{"as_of":"2026-08-07T09:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0ea8342442335c0cdb8765e85e089eb775fb85fd5dc89c712187e1a96e44884d","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:20:59.199192Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.18543/citation-record","integrity":"/paper/2506.18543/integrity","json":"/paper/2506.18543/citation-record.json","paper":"/paper/2506.18543"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:04.757665Z","title":"Improving language understanding by generative pre-training2018","venue":null,"work_id":"08fc1cf1-1c04-4354-956b-bc8de6e91a1e","year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:51.740664Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:20e44c4c7d0fb43e2b86155ce99ab55b016135d2680010a0232df4498d01094e","observation_id":"aed38e89-35de-4a6d-921c-1a46b2b99efa","resolution":{"observed_at":"2026-08-06T23:21:04.904571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T23:20:51.894501Z","title":"GPT-4 Technical Report, 2023, [arXiv:cs.CL/2303.08774]","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:51.894501Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:cfce60f2b3780a292d3dc72118dda07c79be7ceee4daea62ec74e00ecac14728","observation_id":"1ef3f846-4409-4170-a3c4-4c062658fd0d","resolution":{"observed_at":"2026-08-06T23:20:51.894501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-02T13:11:16.882565Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-06T23:20:51.997871Z","title":"Deepseek llm: Scaling open-source language models with longtermism.arXiv preprint arXiv:2401.029542024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:51.997871Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:cf5897a707cde318d3b273657dca3172c740272842540b5b5e6a90d93f1f0320","observation_id":"d3dd119b-d654-4d6b-b168-1bdb893da6c2","resolution":{"observed_at":"2026-08-06T23:20:51.997871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T23:20:52.145353Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.129482025","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:52.145353Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:09a052904965faf955b83402ad571765dbe155ed8f281331e17ddba0ac53bd17","observation_id":"475ed272-df6e-433f-8369-58ebefe17c1a","resolution":{"observed_at":"2026-08-06T23:20:52.145353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09674","last_updated":"2024-02-15T02:54:49Z","snapshot_observed_at":"2026-08-06T13:07:53.842371Z","submitted_at":"2024-02-15T02:54:49Z","title":"PAL: Proxy-Guided Black-Box Attack on Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09674","snapshot_observed_at":"2026-08-06T23:20:52.222527Z","title":"Pal: Proxy-guided black-box attack on large language models.arXiv preprint arXiv:2402.096742024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:52.222527Z"},"links":{"cited_paper":"/paper/2402.09674","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:c79dec345d81347b3137058621190ba299441af0eca47a835303be4761bb0ef9","observation_id":"2f51017b-8333-451b-9117-773d2e2a4d40","resolution":{"observed_at":"2026-08-06T23:20:52.222527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T23:20:52.358358Z","title":"Universal and transferable adversarial attacks on aligned language models.arXiv preprint arXiv:2307.150432023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:52.358358Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:28acee7683a61969c708813288530ed94ef45e07b2a7e415199d5dd9558424b9","observation_id":"397bd4f2-0c8f-40b2-bb8e-1e50f9542ab5","resolution":{"observed_at":"2026-08-06T23:20:52.358358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.06607","last_updated":"2024-08-26T06:57:51Z","snapshot_observed_at":"2026-08-05T16:46:37.436149Z","submitted_at":"2023-11-11T16:37:41Z","title":"Monkey: Image Resolution and Text Label Are Important Things for Large Multi-modal Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.06607","snapshot_observed_at":"2026-08-06T23:20:52.542586Z","title":"Jailbroken: How Does LLM Safety Training Fail?arXiv preprint arXiv:2311.066072023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:52.542586Z"},"links":{"cited_paper":"/paper/2311.06607","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:1d0363bfcdd3636c08b494f9dac7a402c50453eb4bb4393d65b9deb9e483e0b4","observation_id":"cc1567fc-3ba2-4fc9-9c42-1ccde88ab3d8","resolution":{"observed_at":"2026-08-06T23:20:52.542586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:04.440843Z","title":"A survey of backdoor attacks and defenses on large language models: Implications for security measures.Authorea Preprints2024","venue":null,"work_id":"7a7bd345-5524-4923-be63-4e55486649ba","year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:52.790543Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:9ebcf83d97f07a6c5e887252971066d7cf0659d5c3b8d74024c429a88d273aa6","observation_id":"3cf6324c-550c-4d8a-8cbb-105e3cb79ade","resolution":{"observed_at":"2026-08-06T23:21:04.636289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:04.198505Z","title":"Training language models to follow instructions with human feedback.NeurIPS2022,35, 27730–27744","venue":null,"work_id":"f8562ed1-acd2-4391-9b04-649426978243","year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:52.876347Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:95536a853d1282c6817fadc5323dc967ccc471242cabc862fe6fcda8b95e0212","observation_id":"b8189ea6-8014-43c2-9a13-f58b06787a87","resolution":{"observed_at":"2026-08-06T23:21:04.274233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:04.034341Z","title":"Defending Large Language Models Against Jailbreak Attacks Through Chain of Thought Prompting","venue":null,"work_id":"46131251-63dd-480b-ab8d-8d2f081f5e14","year":2024},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:53.014644Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:374da15e527b7f2acdabd2c034398873d7ecf2441700b0c904c8a9be376469dd","observation_id":"c6aa9a52-c618-443e-b245-10472b891979","resolution":{"observed_at":"2026-08-06T23:21:04.119138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:03.855160Z","title":"Many-shot jailbreaking.NeurIPS2024,37, 129696–129742","venue":null,"work_id":"f62005d0-4d45-481b-b5c2-4a518c2a8e6d","year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:53.104384Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:690c048da068c571711987146b6fc6e6b7fc7f6d7a4afc4f73fe7c8c4b2f54ce","observation_id":"ad0c9440-6356-4961-8102-c23bd7bf22f1","resolution":{"observed_at":"2026-08-06T23:21:03.956256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08416","last_updated":"2024-02-13T12:40:39Z","snapshot_observed_at":"2026-07-06T17:29:25.794341Z","submitted_at":"2024-02-13T12:40:39Z","title":"Pandora: Jailbreak GPTs by Retrieval Augmented Generation Poisoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08416","snapshot_observed_at":"2026-08-06T23:20:53.234749Z","title":"Pandora: Jailbreak GPTs by Retrieval Augmented Generation Poisoning.CoRR abs/2402.084162024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:53.234749Z"},"links":{"cited_paper":"/paper/2402.08416","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:915b22b44f647b20695a3ebfd30d45daca2d54086ce4868429389907188aac74","observation_id":"1107255d-f51b-401a-841e-7976b9a6d564","resolution":{"observed_at":"2026-08-06T23:20:53.234749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05197","last_updated":"2023-11-01T05:14:01Z","snapshot_observed_at":"2026-07-06T15:14:24.794122Z","submitted_at":"2023-04-11T13:05:04Z","title":"Multi-step Jailbreaking Privacy Attacks on ChatGPT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05197","snapshot_observed_at":"2026-08-06T23:20:53.545039Z","title":"Multi-step jailbreaking privacy attacks on chatgpt.arXiv preprint arXiv:2304.051972023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:53.545039Z"},"links":{"cited_paper":"/paper/2304.05197","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:eafab8df3703ef20087863937bcb6a70e40ce7edd0aecb05c4b7d27bcf122d8b","observation_id":"2ec64b4f-08f6-42c6-a595-c514a2f21e81","resolution":{"observed_at":"2026-08-06T23:20:53.545039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14950","last_updated":"2023-10-14T05:03:53Z","snapshot_observed_at":"2026-07-06T15:32:22.277926Z","submitted_at":"2023-05-24T09:40:56Z","title":"Adversarial Demonstration Attacks on Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14950","snapshot_observed_at":"2026-08-06T23:20:53.674318Z","title":"Adversarial demonstration attacks on large language models.arXiv preprint arXiv:2305.149502023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:53.674318Z"},"links":{"cited_paper":"/paper/2305.14950","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:d71a71d43c5c2980d50cb27fe0f5be40a7bfb300ee5ab4ca1c2a238928ac66af","observation_id":"5b09016f-1598-49f5-8296-9045b92df4b2","resolution":{"observed_at":"2026-08-06T23:20:53.674318Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-06T23:20:53.797609Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations.arXiv preprint arXiv:2310.063872023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:53.797609Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:d9b258bf789a2b998cbc55d2f974d3b5637f544a24add15d058bf709fe238fc9","observation_id":"acd11a48-ed3f-4c4d-be94-32473105ddd4","resolution":{"observed_at":"2026-08-06T23:20:53.797609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:03.644414Z","title":"Improved few-shot jailbreaking can circumvent aligned language models and their defenses.NeurIPS2024,37, 32856–32887","venue":null,"work_id":"5007861e-b349-47a3-8694-d79db9837b12","year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:53.856016Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:ed42212e557bb74806065a2a9c9c53ba235fb976e1a660f6162e1d3c833da2e4","observation_id":"8c70371a-3c8c-4c98-8d98-02c6c726e70b","resolution":{"observed_at":"2026-08-06T23:21:03.744360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09091","last_updated":"2024-02-16T10:24:04Z","snapshot_observed_at":"2026-07-06T17:29:56.393307Z","submitted_at":"2024-02-14T11:11:51Z","title":"Play Guessing Game with LLM: Indirect Jailbreak Attack with Implicit Clues","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09091","snapshot_observed_at":"2026-08-06T23:20:53.974751Z","title":"Play guessing game with llm: Indirect jailbreak attack with implicit clues.arXiv preprint arXiv:2402.090912024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:53.974751Z"},"links":{"cited_paper":"/paper/2402.09091","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:d1b59ec04f54be792ed5844d9627f0fcf4dd8a26df6cd2bb222ab3a3a54f06f5","observation_id":"c19d5bb5-90b4-41b0-a6fe-a093ffc61213","resolution":{"observed_at":"2026-08-06T23:20:53.974751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:03.465569Z","title":"Artprompt: Ascii art-based jailbreak attacks against aligned llms","venue":null,"work_id":"de4dbc75-c883-46f0-bdcb-0e9798996b72","year":2024},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:54.051307Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:7e679197fd6588fcfdd15343d0ab8bfb0220befd76beb1073385d303a698fa2f","observation_id":"abd74381-d8d7-4181-8228-b93e0156df97","resolution":{"observed_at":"2026-08-06T23:21:03.585017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14872","last_updated":"2024-02-27T13:49:22Z","snapshot_observed_at":"2026-08-06T14:36:18.172649Z","submitted_at":"2024-02-21T15:13:50Z","title":"Semantic Mirror Jailbreak: Genetic Algorithm Based Jailbreak Prompts Against Open-source LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14872","snapshot_observed_at":"2026-08-06T23:20:54.194806Z","title":"Semantic mirror jailbreak: Genetic algorithm based jailbreak prompts against open-source llms.arXiv preprint arXiv:2402.148722024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:54.194806Z"},"links":{"cited_paper":"/paper/2402.14872","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:8c347f4738fc32422f838f9b6f9f152ccae1dbbeab653340ccef7e3c02111f01","observation_id":"7934abf5-bb74-4271-a43f-dfa0858bc75c","resolution":{"observed_at":"2026-08-06T23:20:54.194806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03052","last_updated":"2025-05-17T10:47:24Z","snapshot_observed_at":"2026-08-07T00:28:45.366441Z","submitted_at":"2025-02-05T10:29:54Z","title":"Understanding and Enhancing the Transferability of Jailbreaking Attacks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03052","snapshot_observed_at":"2026-08-06T23:20:54.264785Z","title":"Understanding and enhancing the transferability of jailbreaking attacks.arXiv preprint arXiv:2502.030522025","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:54.264785Z"},"links":{"cited_paper":"/paper/2502.03052","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:61b9ac0820a83c16e8cedf4180a7e68089593688d85346a0083fecdb55afcfde","observation_id":"62c6b020-c4b5-4cfb-ba2b-4431d76ecd1d","resolution":{"observed_at":"2026-08-06T23:20:54.264785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04451","last_updated":"2024-03-20T21:34:56Z","snapshot_observed_at":"2026-08-06T02:57:30.438059Z","submitted_at":"2023-10-03T19:44:37Z","title":"AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04451","snapshot_observed_at":"2026-08-06T23:20:54.385546Z","title":"Autodan: Generating stealthy jailbreak prompts on aligned large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:54.385546Z"},"links":{"cited_paper":"/paper/2310.04451","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:63ff9b9df7849a3c293e2fca1c542d66d07f6d749540b2a9ced7b0714cc683fd","observation_id":"04bf703d-e726-4859-8139-7bd43ff41a54","resolution":{"observed_at":"2026-08-06T23:20:54.385546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:03.265620Z","title":"Flipattack: Jailbreak llms via flipping","venue":null,"work_id":"a60b4910-644c-49d7-a55d-c8739c933c5a","year":2025},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:54.467206Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:fe991e0544790f5dba26a9720e572d5c7fd52a5c92dbafbc3b351629c6be9bfa","observation_id":"f737caa1-dd19-4063-b49f-336cf5337eaf","resolution":{"observed_at":"2026-08-06T23:21:03.365496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:03.021547Z","title":"All in how you ask for it: Simple black-box method for jailbreak attacks.Applied Sciences2024,14, 3558","venue":null,"work_id":"a62de087-2033-485a-8fc7-c75e0f7a8ad0","year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:54.614751Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:941348a8cb45c39ccb487cea860b9f8058908c38eb41508ef0d2139eb797a08e","observation_id":"b80279ff-90d9-451b-bac6-6d4c9d7bfbff","resolution":{"observed_at":"2026-08-06T23:21:03.130334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:02.839256Z","title":"Emoji Attack: Enhancing Jailbreak Attacks Against Judge LLM Detection","venue":null,"work_id":"42984010-dd90-402a-9f77-293713d736d3","year":2025},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:54.718877Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:65597f261d664dc65d5a28893bb47ea9a9bfc2c3995cb9254829c3b7a768b1a8","observation_id":"66031097-22d5-4869-95db-3bd8274d5547","resolution":{"observed_at":"2026-08-06T23:21:02.924635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-04T04:36:49.174974Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11407","snapshot_observed_at":"2026-08-06T23:20:54.845285Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models.arXiv preprint arXiv:2411.114072024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:54.845285Z"},"links":{"cited_paper":"/paper/2411.11407","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:60de2b746d930428ef075076ceedcc0d85ae7920bdc719963bcece6c0b2ff0bf","observation_id":"572595dc-71e9-4f77-ab83-eafeb7994cbd","resolution":{"observed_at":"2026-08-06T23:20:54.845285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10253","last_updated":"2024-06-27T16:01:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-19T02:19:48Z","title":"GPTFUZZER: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10253","snapshot_observed_at":"2026-08-06T23:20:54.935278Z","title":"Gptfuzzer: Red teaming large language models with auto-generated jailbreak prompts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:54.935278Z"},"links":{"cited_paper":"/paper/2309.10253","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:7f71abd0f28abc9c5ca1287accae46bd6f50acf0b53db088103a42bdc6a21f43","observation_id":"80a5b13b-f9b0-4d0d-8bd2-195e885fbab4","resolution":{"observed_at":"2026-08-06T23:20:54.935278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:02.593321Z","title":"Gpt-4 is too smart to be safe: Stealthy chat with llms via cipher2024","venue":null,"work_id":"73bd0356-0ab3-40db-8c39-c9ec210aeeef","year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:55.064753Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:3244010dccf4e56b1bccac318b18173378124c823c167e1358cd4bbd80b4df63","observation_id":"fe8b4cf5-c9ed-4ddc-9b02-460cffe25f72","resolution":{"observed_at":"2026-08-06T23:21:02.700975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-07-06T15:43:11.799806Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-06T23:20:55.144189Z","title":"Explore, establish, exploit: Red teaming language models from scratch.arXiv preprint arXiv:2306.094422023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:55.144189Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:9512aaa4ce0ada8a577d269ffcd3cc4388a1ac8977ccccc3ab6e1ad288b2139a","observation_id":"54a66195-b915-43e4-9959-84fd95786d5c","resolution":{"observed_at":"2026-08-06T23:20:55.144189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:02.437412Z","title":"Jailbreaking black box large language models in twenty queries","venue":null,"work_id":"951396b6-ad94-4a72-8019-6d570880e973","year":2025},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:55.255225Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:fef04a56b9fe4324f774fe8d7ac91657cf6f7f1e1754d0db5916d2c7b4e661ce","observation_id":"c04a6230-7c1e-48d7-a277-2891647b17b5","resolution":{"observed_at":"2026-08-06T23:21:02.554468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08715","last_updated":"2023-10-25T07:30:51Z","snapshot_observed_at":"2026-07-06T15:54:58.589775Z","submitted_at":"2023-07-16T01:07:15Z","title":"MasterKey: Automated Jailbreak Across Multiple Large Language Model Chatbots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08715","snapshot_observed_at":"2026-08-06T23:20:55.350714Z","title":"Masterkey: Automated jailbreak across multiple large language model chatbots.arXiv preprint arXiv:2307.087152023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:55.350714Z"},"links":{"cited_paper":"/paper/2307.08715","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:2077997ac9aca77dcb036164558871f2c029e808e481da29f6655702c65bb675","observation_id":"4e48964a-e6cf-40b9-95be-f7f0537b1c4b","resolution":{"observed_at":"2026-08-06T23:20:55.350714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:02.316876Z","title":"MART: Improving LLM Safety with Multi-round Automatic Red-Teaming","venue":null,"work_id":"b977fdc4-ffe4-481b-a7cb-c6a3d71f32c6","year":2024},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:55.425537Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:10a3df456135575488cf31940e63ab81f835da77ed0fde295766e6e32b95a221","observation_id":"55094c79-bba4-4d98-b270-58aefc9fa2a9","resolution":{"observed_at":"2026-08-06T23:21:02.386229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:55.484326Z","title":"Guard: Role-playing to generate natural-language jailbreakings to test guideline adherence of large language models.arXiv preprint arXiv:2402.032992024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:55.484326Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:51df4c261eb18e4083948e6e31ef19667391196f0e34f8a51d8e190a37860b31","observation_id":"4c262b5e-e8cb-4176-8743-7c89d623960d","resolution":{"observed_at":"2026-08-06T23:20:55.484326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11830","last_updated":"2023-12-08T02:57:26Z","snapshot_observed_at":"2026-08-04T13:05:30.729916Z","submitted_at":"2023-09-21T07:07:49Z","title":"Goal-Oriented Prompt Attack and Safety Evaluation for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11830","snapshot_observed_at":"2026-08-06T23:20:55.602649Z","title":"Goal-oriented prompt attack and safety evaluation for llms.arXiv preprint arXiv:2309.118302023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:55.602649Z"},"links":{"cited_paper":"/paper/2309.11830","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:0132b306becb33bc80e0465c48b556e14611bc886eac18c724b6ef2d195200a8","observation_id":"1fc88740-52ae-418d-8b91-0abd30c85890","resolution":{"observed_at":"2026-08-06T23:20:55.602649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:02.134762Z","title":"Tree of attacks: Jailbreaking black-box llms automatically.NeurIPS2024,37, 61065–61105","venue":null,"work_id":"d9667784-0bcb-43c2-bc2f-51c211693639","year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:55.752634Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:904d0f934430a97dbd8fdd71f634c0c987d54822a223bbf6eadc72672bb5869e","observation_id":"4ed0e8b6-e09e-46ab-8341-c7523c28610e","resolution":{"observed_at":"2026-08-06T23:21:02.212017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-08-06T23:20:55.859123Z","title":"Scalable and transferable black-box jailbreaks for language models via persona modulation.arXiv preprint arXiv:2311.033482023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:55.859123Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:f3faf8219b9021723244dad8d9d252e87cc5c314e7ca38a8761d265d3598e9b2","observation_id":"6d906230-1a4e-4b3f-b9a8-854bff233fbf","resolution":{"observed_at":"2026-08-06T23:20:55.859123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11855","last_updated":"2024-02-02T08:28:01Z","snapshot_observed_at":"2026-08-07T01:32:12.754339Z","submitted_at":"2023-11-20T15:50:09Z","title":"Evil Geniuses: Delving into the Safety of LLM-based Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11855","snapshot_observed_at":"2026-08-06T23:20:55.953808Z","title":"Evil geniuses: Delving into the safety of llm-based agents.arXiv preprint arXiv:2311.118552023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:55.953808Z"},"links":{"cited_paper":"/paper/2311.11855","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:73b93e771749cfc29f61c12936c44d557fde365a981cfef315368b20e1d99702","observation_id":"207ab80e-bb35-4fe7-b1ba-5e6a8bd3c6af","resolution":{"observed_at":"2026-08-06T23:20:55.953808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:01.919332Z","title":"How johnny can persuade llms to jailbreak them: Rethinking persuasion to challenge ai safety by humanizing llms","venue":null,"work_id":"afe1773f-c4aa-45b7-85e2-7390fb0be189","year":2024},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:56.055295Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:dfed07e5446931adc2822687f9bc496ef1dad76aaa25fbc17af66b38bd7ce21e","observation_id":"898e97be-5c05-4f88-9ce5-c472c57af4b6","resolution":{"observed_at":"2026-08-06T23:21:02.015166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09154","last_updated":"2025-03-03T09:37:27Z","snapshot_observed_at":"2026-08-03T17:59:18.731227Z","submitted_at":"2024-02-14T13:13:26Z","title":"Attacking Large Language Models with Projected Gradient Descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09154","snapshot_observed_at":"2026-08-06T23:20:56.204745Z","title":"Attacking large language models with projected gradient descent.arXiv preprint arXiv:2402.091542024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:56.204745Z"},"links":{"cited_paper":"/paper/2402.09154","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:99a787ef3510444ec883dd42b09bbe68968b03fe111f32fe7c99f35807a2570c","observation_id":"09cebd2c-7789-45e8-89f2-5eb8bf3a0b10","resolution":{"observed_at":"2026-08-06T23:20:56.204745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:01.828490Z","title":"Query-based adversarial prompt generation.NeurIPS2024, 37, 128260–128279","venue":null,"work_id":"8861d17d-43cf-4946-b389-39dbf168404a","year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:56.319414Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:70225455faba004856ea114769b4702f3aee587d0d4327c6d2629cc5ed3a8df8","observation_id":"a469243d-98ab-448f-a553-d9a672b4148f","resolution":{"observed_at":"2026-08-06T23:21:01.842246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21018","last_updated":"2024-06-05T16:35:49Z","snapshot_observed_at":"2026-07-06T18:23:23.565502Z","submitted_at":"2024-05-31T17:07:15Z","title":"Improved Techniques for Optimization-Based Jailbreaking on Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21018","snapshot_observed_at":"2026-08-06T23:20:56.482120Z","title":"Improved techniques for optimization-based jailbreaking on large language models.arXiv preprint arXiv:2405.210182024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:56.482120Z"},"links":{"cited_paper":"/paper/2405.21018","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:685e42c2efa810e830c99aa264f6dcbed9f3644ddfccbbbbeb639e1377261039","observation_id":"d2bfecdd-1356-4824-8494-fac5065e7174","resolution":{"observed_at":"2026-08-06T23:20:56.482120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:56.584927Z","title":"Iterative self-tuning llms for enhanced jailbreaking capabilities.arXiv preprint arXiv:2410.184692024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:56.584927Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:9cb15c8cc35cc3aa890a38a79198a0337623fa12b7d28ba56dda6d463826db62","observation_id":"2309b2d9-7282-4885-9774-dc260c466e86","resolution":{"observed_at":"2026-08-06T23:20:56.584927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:01.691354Z","title":"From noise to clarity: Unraveling the adversarial suffix of large language model attacks via translation of text embeddings.CoRR2024","venue":null,"work_id":"2007cb2e-41a0-4fe5-9005-4ee3a8636397","year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:56.742083Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:b6412eefbdfa10c4bb399d0a7ae5110b7973c57a931801f4c90c7c93f4600c64","observation_id":"980df864-1235-45f1-a729-c8df39e53787","resolution":{"observed_at":"2026-08-06T23:21:01.748411Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01865","last_updated":"2025-02-25T07:47:41Z","snapshot_observed_at":"2026-07-06T20:45:55.263034Z","submitted_at":"2025-02-25T07:47:41Z","title":"Guiding not Forcing: Enhancing the Transferability of Jailbreaking Attacks on LLMs via Removing Superfluous Constraints","version":1},"cited_work":{"arxiv_id":"2503.01865","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.01865","snapshot_observed_at":"2026-08-06T23:20:59.866363Z","title":"Guiding not Forcing: Enhancing the Transferability of Jailbreaking Attacks on LLMs via Removing Superfluous Constraints","venue":"cs.LG","work_id":"f42921ff-25c1-4023-be35-9b327a922b39","year":2025},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:56.844753Z"},"links":{"cited_paper":"/paper/2503.01865","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:2ce11e3e8c45562057aa9a77e3dff60fa28b10cd7b2b1ca4ee036cd990c63a9d","observation_id":"0f629e3d-fe27-4fae-93c7-e2ab5756f978","resolution":{"observed_at":"2026-08-06T23:21:00.004770Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15140","last_updated":"2023-12-14T06:22:51Z","snapshot_observed_at":"2026-08-03T19:47:58.067345Z","submitted_at":"2023-10-23T17:46:07Z","title":"AutoDAN: Interpretable Gradient-Based Adversarial Attacks on Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15140","snapshot_observed_at":"2026-08-06T23:20:56.924751Z","title":"AutoDAN: interpretable gradient-based adversarial attacks on large language models.arXiv preprint arXiv:2310.151402023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:56.924751Z"},"links":{"cited_paper":"/paper/2310.15140","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:8f6d88ad5ae5c677079b4a0b86794facd93058618327b554d67d8e9f1dc9c64b","observation_id":"73d991a7-641e-443f-9e8e-375b9bf881d5","resolution":{"observed_at":"2026-08-06T23:20:56.924751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04127","last_updated":"2024-02-23T07:32:27Z","snapshot_observed_at":"2026-07-06T16:58:11.501328Z","submitted_at":"2023-12-07T08:29:58Z","title":"Analyzing the Inherent Response Tendency of LLMs: Real-World Instructions-Driven Jailbreak","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04127","snapshot_observed_at":"2026-08-06T23:20:57.014753Z","title":"Analyzing the inherent response tendency of llms: Real-world instructions- driven jailbreak.arXiv preprint arXiv:2312.041272023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:57.014753Z"},"links":{"cited_paper":"/paper/2312.04127","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:a0618ba093079529477633ec6c3fd1bd9964370a0438a5f90bca1563f678ee3a","observation_id":"f2de84f1-870e-469e-b6f7-00b81abe62f6","resolution":{"observed_at":"2026-08-06T23:20:57.014753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:01.498026Z","title":"COLD-Attack: Jailbreaking LLMs with Stealthiness and Controllability","venue":null,"work_id":"906fd147-a952-42db-84c2-1fe73dea832f","year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:57.106875Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:e44c15b40129ff826fbef795d4e452bfb33ad0043eef0a5e1032d8fb09b59869","observation_id":"d6c92b03-eb4c-412c-a676-26de960e4f10","resolution":{"observed_at":"2026-08-06T23:21:01.592880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09125","last_updated":"2024-11-14T01:48:08Z","snapshot_observed_at":"2026-07-06T19:50:05.918060Z","submitted_at":"2024-11-14T01:48:08Z","title":"DROJ: A Prompt-Driven Attack against Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09125","snapshot_observed_at":"2026-08-06T23:20:57.184523Z","title":"Droj: A prompt-driven attack against large language models.arXiv preprint arXiv:2411.091252024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:57.184523Z"},"links":{"cited_paper":"/paper/2411.09125","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:0e79c584b37c3a4bf71b1c5217c9a22457f4655f4cc70d1cee5a99196cccd338","observation_id":"4340b1d7-49c0-436b-84dc-94c912fa73fd","resolution":{"observed_at":"2026-08-06T23:20:57.184523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:01.313401Z","title":"Catastrophic jailbreak of open-source llms via exploiting generation","venue":null,"work_id":"b0b1dc52-c735-4ce0-8940-c4177be199d6","year":2024},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:57.318459Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:1ebc1daf8f40a22f6eb551fea90e45c98fa2cff966ea38340722d870ab30143c","observation_id":"31f963ff-fdbe-4b35-b7e8-2b9f30b76df0","resolution":{"observed_at":"2026-08-06T23:21:01.378863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04782","last_updated":"2023-12-08T01:41:36Z","snapshot_observed_at":"2026-08-06T10:01:22.159507Z","submitted_at":"2023-12-08T01:41:36Z","title":"Make Them Spill the Beans! Coercive Knowledge Extraction from (Production) LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04782","snapshot_observed_at":"2026-08-06T23:20:57.420571Z","title":"Make them spill the beans! coercive knowledge extraction from (production) llms.arXiv preprint arXiv:2312.047822023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:57.420571Z"},"links":{"cited_paper":"/paper/2312.04782","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:dbce4af3cfd4c0992219e756d40c40c102ab06796a2c92157f9e9a33299786a8","observation_id":"dbf5d646-15db-44cb-995c-4f51ac048dd8","resolution":{"observed_at":"2026-08-06T23:20:57.420571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17256","last_updated":"2025-07-23T18:43:18Z","snapshot_observed_at":"2026-07-06T17:22:41.286422Z","submitted_at":"2024-01-30T18:48:37Z","title":"Weak-to-Strong Jailbreaking on Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17256","snapshot_observed_at":"2026-08-06T23:20:57.504508Z","title":"Weak-to-strong jailbreaking on large language models.arXiv preprint arXiv:2401.172562024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:57.504508Z"},"links":{"cited_paper":"/paper/2401.17256","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:7e2cc30afa6e76df8d9e4d25cb27a9c3b9b51871519fb6c731e5b13c86f4f46c","observation_id":"31368c05-277e-4bbf-b0e3-6e2c92dff6f8","resolution":{"observed_at":"2026-08-06T23:20:57.504508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16369","last_updated":"2025-07-02T07:27:32Z","snapshot_observed_at":"2026-07-06T18:05:20.955471Z","submitted_at":"2024-04-25T07:15:23Z","title":"Don't Say No: Jailbreaking LLM by Suppressing Refusal","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16369","snapshot_observed_at":"2026-08-06T23:20:57.656839Z","title":"Don’t say no: Jailbreaking llm by suppressing refusal.arXiv preprint arXiv:2404.163692024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:57.656839Z"},"links":{"cited_paper":"/paper/2404.16369","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:4ea71d89bf2e642918bc95907e35822354534ca54695c955256570a3aadb8ea4","observation_id":"42a48662-4628-4735-83ee-9602c01ffcd3","resolution":{"observed_at":"2026-08-06T23:20:57.656839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-06T23:20:57.744842Z","title":"Fine-tuning aligned language models compromises safety, even when users do not intend to!arXiv preprint arXiv:2310.036932023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:57.744842Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:25882458f8969fe1df1190e7dc24e3af37035d74da55ba8fff3531e19c71c7cb","observation_id":"42f69fb9-0057-4e6d-88e6-42a3df17cf2d","resolution":{"observed_at":"2026-08-06T23:20:57.744842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02949","last_updated":"2023-10-04T16:39:31Z","snapshot_observed_at":"2026-07-06T16:27:47.445841Z","submitted_at":"2023-10-04T16:39:31Z","title":"Shadow Alignment: The Ease of Subverting Safely-Aligned Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02949","snapshot_observed_at":"2026-08-06T23:20:57.826882Z","title":"Shadow alignment: The ease of subverting safely-aligned language models.arXiv preprint arXiv:2310.029492023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:57.826882Z"},"links":{"cited_paper":"/paper/2310.02949","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:a38f0b02bd30cbe859abbef2c4ba66884dc2f682d56ed66b7e1f3d9cb9becd81","observation_id":"8423a4ca-4720-4e34-9c9a-ca8ba783decd","resolution":{"observed_at":"2026-08-06T23:20:57.826882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-07-06T16:45:20.005195Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-08-06T23:20:57.988075Z","title":"Removing rlhf protections in gpt-4 via fine-tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:57.988075Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:a17f80359c8a33b9c9319143c3462d2301349f360469d0e1a6327ba20b913140","observation_id":"ab1d7d35-a32d-4fb2-9219-90097f0a8d86","resolution":{"observed_at":"2026-08-06T23:20:57.988075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04249","last_updated":"2024-02-27T04:43:08Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:08Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04249","snapshot_observed_at":"2026-08-06T23:20:58.119677Z","title":"Harmbench: A standardized evaluation framework for automated red teaming and robust refusal.arXiv preprint arXiv:2402.042492024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:58.119677Z"},"links":{"cited_paper":"/paper/2402.04249","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:26bbfdb28443addabdeae9a7a14aaf1a69aebef8c6a2b61c25d3cd6e29a58205","observation_id":"685c4854-50a5-45aa-9108-651a18eea961","resolution":{"observed_at":"2026-08-06T23:20:58.119677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12171","last_updated":"2024-03-18T18:39:53Z","snapshot_observed_at":"2026-08-06T21:46:54.063328Z","submitted_at":"2024-03-18T18:39:53Z","title":"EasyJailbreak: A Unified Framework for Jailbreaking Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12171","snapshot_observed_at":"2026-08-06T23:20:58.217814Z","title":"Easyjailbreak: A unified framework for jailbreaking large language models.arXiv preprint arXiv:2403.121712024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:58.217814Z"},"links":{"cited_paper":"/paper/2403.12171","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:297c388ce726b2959c2d2e8468b0d2f9971506905324640ef429f86af08ae6e0","observation_id":"8ace8b2b-0596-49af-b719-c484030b59f7","resolution":{"observed_at":"2026-08-06T23:20:58.217814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12762","last_updated":"2024-11-27T07:41:35Z","snapshot_observed_at":"2026-07-06T19:52:46.580689Z","submitted_at":"2024-11-16T13:07:13Z","title":"Playing Language Game with LLMs Leads to Jailbreaking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12762","snapshot_observed_at":"2026-08-06T23:20:58.265798Z","title":"Playing language game with llms leads to jailbreaking.arXiv preprint arXiv:2411.127622024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:58.265798Z"},"links":{"cited_paper":"/paper/2411.12762","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:2e2bca29180d3d6201ef44d9982691ea01facb297cc7d1fad961affeda7c9af1","observation_id":"d8e38e2c-5701-411c-be1a-3df3c7fb0434","resolution":{"observed_at":"2026-08-06T23:20:58.265798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:01.151395Z","title":"do anything now","venue":null,"work_id":"c99e4f08-1b7f-4687-b9d5-45cbada268cf","year":2024},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:58.301037Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:5ce8000924181c91a5a14cab550281224b563baeb478e903b61c1825266568d6","observation_id":"8453da1f-f303-4dfc-a528-6b3a81731ada","resolution":{"observed_at":"2026-08-06T23:21:01.234729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:58.396202Z","title":"Chain-of-Lure: A Synthetic Narrative-Driven Approach to Compromise Large Language Models.arXiv preprint arXiv:2505.175192025","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:58.396202Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:9d1b9da549e365b1e8fa4c8f02fa64f0858d3ee50e25ead168ab8264dcfe69fc","observation_id":"9d70e8b5-b0ee-4355-816b-25171df3f631","resolution":{"observed_at":"2026-08-06T23:20:58.396202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11054","last_updated":"2025-03-11T03:06:17Z","snapshot_observed_at":"2026-07-06T20:37:18.647879Z","submitted_at":"2025-02-16T09:27:44Z","title":"Reasoning-Augmented Conversation for Multi-Turn Jailbreak Attacks on Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11054","snapshot_observed_at":"2026-08-06T23:20:58.435774Z","title":"Reasoning-augmented conversation for multi-turn jailbreak attacks on large language models.arXiv preprint arXiv:2502.110542025","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:58.435774Z"},"links":{"cited_paper":"/paper/2502.11054","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:3fe0209ca83cde05872c7ea88ee55d82115dfe9526efaecb54e55a591018b33e","observation_id":"9cfac2d0-946a-46f1-b1ce-98acfb8deaf1","resolution":{"observed_at":"2026-08-06T23:20:58.435774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16489","last_updated":"2025-04-23T08:01:50Z","snapshot_observed_at":"2026-08-06T23:49:47.537087Z","submitted_at":"2025-04-23T08:01:50Z","title":"Amplified Vulnerabilities: Structured Jailbreak Attacks on LLM-based Multi-Agent Debate","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16489","snapshot_observed_at":"2026-08-06T23:20:58.553566Z","title":"Amplified Vulnerabilities: Structured Jailbreak Attacks on LLM-based Multi-Agent Debate.arXiv preprint arXiv:2504.164892025","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:58.553566Z"},"links":{"cited_paper":"/paper/2504.16489","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:570c76f1099a095a44af2e4baed45f55025b56e0c8f62baea46c097e510f37a5","observation_id":"12e3a4ea-66ab-4847-8f75-b609b11b7db2","resolution":{"observed_at":"2026-08-06T23:20:58.553566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12893","last_updated":"2025-02-27T01:32:58Z","snapshot_observed_at":"2026-08-05T21:26:59.220214Z","submitted_at":"2025-02-18T14:29:12Z","title":"H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12893","snapshot_observed_at":"2026-08-06T23:20:58.633864Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:58.633864Z"},"links":{"cited_paper":"/paper/2502.12893","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:04e9dabe05f531c3d97115b98192e11633b15a4c7085f80b02753a9509f8544b","observation_id":"a5edf243-33c2-4ba1-a47c-b019af836f53","resolution":{"observed_at":"2026-08-06T23:20:58.633864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21972","last_updated":"2025-06-27T07:26:33Z","snapshot_observed_at":"2026-08-06T22:12:05.610333Z","submitted_at":"2025-06-27T07:26:33Z","title":"Advancing Jailbreak Strategies: A Hybrid Approach to Exploiting LLM Vulnerabilities and Bypassing Modern Defenses","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21972","snapshot_observed_at":"2026-08-06T23:20:58.767251Z","title":"Advancing Jailbreak Strategies: A Hybrid Approach to Exploiting LLM Vulnerabilities and Bypassing Modern Defenses.arXiv preprint arXiv:2506.219722025","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:58.767251Z"},"links":{"cited_paper":"/paper/2506.21972","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:0baaf9772f09d555d17707ffe114ff1f3deec56c71b65763257406e988c07677","observation_id":"5da767d8-d948-43cd-ae62-0c59201e73a0","resolution":{"observed_at":"2026-08-06T23:20:58.767251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:01.009432Z","title":"Gradient cuff: Detecting jailbreak attacks on large language models by exploring refusal loss landscapes.NeurIPS2024,37, 126265–126296","venue":null,"work_id":"d72f9a5f-f7e3-407f-bae6-ac4048bccfbd","year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:58.874995Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:ece1755af354f690f844fed7187e364ee4255f52b7312ebb9a7045263f9ad901","observation_id":"780df3e5-5c8b-4e64-9949-794827c298c4","resolution":{"observed_at":"2026-08-06T23:21:01.066495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:00.715881Z","title":"JBShield: Defending Large Language Models from Jailbreak Attacks through Activated Concept Analysis and Manipulation","venue":null,"work_id":"af9925d3-7004-4c60-89af-2d43f8112930","year":2025},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:58.957828Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:c3e80e1273093e1cc4049f676257ff5865c3905d6c39542434b43a5345fdd74d","observation_id":"4b26e0de-d342-4c23-b32a-554f30637313","resolution":{"observed_at":"2026-08-06T23:21:00.942413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:59.040436Z","title":"The hidden risks of large reasoning models: A safety assessment of r1.arXiv preprint arXiv:2502.126592025","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:59.040436Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:956c45581580031eec4241969a7a8d83af51d550fe70184226c649de0b2f93ae","observation_id":"acc9b9a0-018d-4138-8dfa-666ea874745b","resolution":{"observed_at":"2026-08-06T23:20:59.040436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:00.538597Z","title":"Scaling Trends in Language Model Robustness","venue":null,"work_id":"5fda4e3f-579b-4b55-9a00-42a01c3cc7e8","year":2025},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:59.108858Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:6bf1989b94efdd5b627346167d0223d55106a92d04075caf251e953da367cfb4","observation_id":"8625a784-0c3b-4c2e-903f-810fca884fe2","resolution":{"observed_at":"2026-08-06T23:21:00.662149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09832","last_updated":"2024-03-14T19:39:10Z","snapshot_observed_at":"2026-08-04T13:21:37.312302Z","submitted_at":"2024-03-14T19:39:10Z","title":"Scaling Behavior of Machine Translation with Large Language Models under Prompt Injection Attacks","version":1},"cited_work":{"arxiv_id":"2403.09832","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.09832","snapshot_observed_at":"2026-08-06T23:20:59.312542Z","title":"Scaling Behavior of Machine Translation with Large Language Models under Prompt Injection Attacks","venue":"cs.CL","work_id":"5d68993e-844c-4be1-a4ee-92dabe954e4b","year":2024},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:59.199192Z"},"links":{"cited_paper":"/paper/2403.09832","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:09deb3d4b6693dfa30e7f4c230a158fa70b2811deb8dff56196c6073977940b3","observation_id":"9d2998c7-079e-4b37-8077-327cbdf5afaf","resolution":{"observed_at":"2026-08-06T23:20:59.349100Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","latest_version":2,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-06T23:13:30.961405Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":3,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":1,"verified_fuzzy":22},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 0 inbound Pith citation observations for arXiv:2506.18543."}