{"as_of":"2026-08-10T00:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2938b74b6361e12683f3e620347f2c8a01ffd8f40ff6576c62ea68f43a4c6a37","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T04:22:00.629797Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T08:17:10.481202Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"cited_work":{"arxiv_id":"2502.05223","doi":"10.48550/arxiv.2502.05223","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05223","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kda: A knowledge-distilled attacker for generating diverse prompts to jailbreak llms","venue":"ArXiv.org","work_id":"0d29aadb-c6de-4d0b-b7f0-a0969a7354f0","year":2025},"citing_paper":{"arxiv_id":"2602.11157","last_updated":"2025-12-08T06:48:17Z","snapshot_observed_at":"2026-08-04T23:09:56.365393Z","submitted_at":"2025-12-08T06:48:17Z","title":"Response-Based Knowledge Distillation for Multilingual Jailbreak Prevention Unwittingly Compromises Safety","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-17T01:27:16.967080Z"},"links":{"cited_paper":"/paper/2502.05223","citing_paper":"/paper/2602.11157"},"observation_digest":"sha256:52aefdc6b7c7c694b2f6757c5b22348eab8f0e92c3514ad814d81bfc1ef68be4","observation_id":"aee82b5c-2cb2-4aca-8879-ad5fd2588850","resolution":{"observed_at":"2026-05-17T01:28:48.757064Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"cited_work":{"arxiv_id":"2502.05223","doi":"10.48550/arxiv.2502.05223","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05223","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kda: A knowledge-distilled attacker for generating diverse prompts to jailbreak llms","venue":"ArXiv.org","work_id":"0d29aadb-c6de-4d0b-b7f0-a0969a7354f0","year":2025},"citing_paper":{"arxiv_id":"2605.12813","last_updated":"2026-05-31T17:51:51Z","snapshot_observed_at":"2026-07-06T23:24:27.821980Z","submitted_at":"2026-05-12T23:13:50Z","title":"REALISTA: Realistic Latent Adversarial Attacks that Elicit LLM Hallucinations","version":1},"reference_index":143,"source":"arxiv_source","source_observed_at":"2026-05-14T20:13:10.814899Z"},"links":{"cited_paper":"/paper/2502.05223","citing_paper":"/paper/2605.12813"},"observation_digest":"sha256:7c8ff56687eea6e83e8e7f766773ea8b562d823d077f232e9108051158b785d8","observation_id":"aea6f80c-12a2-4d8b-a998-5451fc2c2e92","resolution":{"observed_at":"2026-05-14T20:17:56.857636Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"cited_work":{"arxiv_id":"2502.05223","doi":"10.48550/arxiv.2502.05223","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05223","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kda: A knowledge-distilled attacker for generating diverse prompts to jailbreak llms","venue":"ArXiv.org","work_id":"0d29aadb-c6de-4d0b-b7f0-a0969a7354f0","year":2025},"citing_paper":{"arxiv_id":"2606.07539","last_updated":"2026-04-29T17:39:36Z","snapshot_observed_at":"2026-08-02T12:30:34.186010Z","submitted_at":"2026-04-29T17:39:36Z","title":"Prompt Governance? On Governing Technologies Governed by Natural Language","version":1},"reference_index":200,"source":"pdf_text","source_observed_at":"2026-07-01T08:17:10.481202Z"},"links":{"cited_paper":"/paper/2502.05223","citing_paper":"/paper/2606.07539"},"observation_digest":"sha256:5d948dafbb2a6f65d5daa43f7dc3e38d4bea85cd8ba9d46815f2d1b8d33ac553","observation_id":"069a6103-2a68-4c7d-8e54-236b5a44bc91","resolution":{"observed_at":"2026-07-01T08:25:32.845932Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.05223/citation-record","integrity":"/paper/2502.05223/integrity","json":"/paper/2502.05223/citation-record.json","paper":"/paper/2502.05223"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:22:00.402335Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.402335Z"},"links":{"citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:e5e025697790daa50cdc873f3341d7f9ce6780e9715600862920c697259ff7ed","observation_id":"459f049e-e32d-4f03-bf86-078caf999575","resolution":{"observed_at":"2026-08-09T04:22:00.402335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14132","last_updated":"2023-11-07T03:30:15Z","snapshot_observed_at":"2026-07-06T16:10:54.723336Z","submitted_at":"2023-08-27T15:20:06Z","title":"Detecting Language Model Attacks with Perplexity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14132","snapshot_observed_at":"2026-08-09T04:22:00.409603Z","title":"and Kamfonas, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.409603Z"},"links":{"cited_paper":"/paper/2308.14132","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:9df3026d5a6e651964cb58f798109d93eb6109a84ca349977d5535e5ec2a3257","observation_id":"6e7713c9-9c8c-4d40-a39c-56ef3f94ee16","resolution":{"observed_at":"2026-08-09T04:22:00.409603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02151","last_updated":"2025-04-17T18:55:45Z","snapshot_observed_at":"2026-08-08T01:18:53.200448Z","submitted_at":"2024-04-02T17:58:27Z","title":"Jailbreaking Leading Safety-Aligned LLMs with Simple Adaptive Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02151","snapshot_observed_at":"2026-08-09T04:22:00.415583Z","title":"Jailbreaking Leading Safety - Aligned LLMs with Simple Adaptive Attacks , June 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.415583Z"},"links":{"cited_paper":"/paper/2404.02151","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:f6d475b8eab61792cf2cda39359709e897e4ac71817a5b64ef150e85540ee670","observation_id":"191688ba-f10c-44cf-82ca-eb966100d94a","resolution":{"observed_at":"2026-08-09T04:22:00.415583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09091","last_updated":"2024-02-16T10:24:04Z","snapshot_observed_at":"2026-08-09T23:21:17.837388Z","submitted_at":"2024-02-14T11:11:51Z","title":"Play Guessing Game with LLM: Indirect Jailbreak Attack with Implicit Clues","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09091","snapshot_observed_at":"2026-08-09T04:22:00.421184Z","title":"Play Guessing Game with LLM : Indirect Jailbreak Attack with Implicit Clues , February 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.421184Z"},"links":{"cited_paper":"/paper/2402.09091","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:225c560384687748a4ff7172d940699a3ba0603b07c67f4d67b33e2cb9278e8a","observation_id":"5088ebba-7f09-473d-87a0-af1d184e04fd","resolution":{"observed_at":"2026-08-09T04:22:00.421184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08419","snapshot_observed_at":"2026-08-09T04:22:00.426038Z","title":"J., and Wong, E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.426038Z"},"links":{"cited_paper":"/paper/2310.08419","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:d1ab60c7e3a1bf2abb49e100603e6b659b407570a2aa1af752f1edd09d89035f","observation_id":"80cdee47-7175-435b-8cd9-458f16846005","resolution":{"observed_at":"2026-08-09T04:22:00.426038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08268","last_updated":"2024-04-07T03:04:10Z","snapshot_observed_at":"2026-07-06T16:47:24.765597Z","submitted_at":"2023-11-14T16:02:16Z","title":"A Wolf in Sheep's Clothing: Generalized Nested Jailbreak Prompts can Fool Large Language Models Easily","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08268","snapshot_observed_at":"2026-08-09T04:22:00.430779Z","title":"A Wolf in Sheep 's Clothing : Generalized Nested Jailbreak Prompts can Fool Large Language Models Easily , April 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.430779Z"},"links":{"cited_paper":"/paper/2311.08268","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:9347bdedc65a2f472eaeea2348fe06ed52bc1180da994599b0cbed75bbe918c2","observation_id":"64be1b15-dd59-433c-845e-99f6590d888e","resolution":{"observed_at":"2026-08-09T04:22:00.430779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-09T04:22:00.435398Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.435398Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:bf912605fe74e7a97d1f44cf3097a99a7888226f12a93cb0e80613ba24d5f2e8","observation_id":"61743f0c-2d37-4243-8c85-ec7bf8150e34","resolution":{"observed_at":"2026-08-09T04:22:00.435398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.05794","last_updated":"2022-03-11T08:35:15Z","snapshot_observed_at":"2026-07-06T12:46:41.057346Z","submitted_at":"2022-03-11T08:35:15Z","title":"BERTopic: Neural topic modeling with a class-based TF-IDF procedure","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.05794","snapshot_observed_at":"2026-08-09T04:22:00.440887Z","title":"BERTopic : Neural topic modeling with a class-based TF - IDF procedure, March 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.440887Z"},"links":{"cited_paper":"/paper/2203.05794","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:aa34fdbfd44a6a3576fcf53214b29abaaad7415ef3151b44ba74f020f2fc6c35","observation_id":"278ecdb3-bffe-4857-8bc4-04b004ce9f9c","resolution":{"observed_at":"2026-08-09T04:22:00.440887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08679","last_updated":"2024-06-07T00:13:08Z","snapshot_observed_at":"2026-07-06T17:29:39.117068Z","submitted_at":"2024-02-13T18:58:48Z","title":"COLD-Attack: Jailbreaking LLMs with Stealthiness and Controllability","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08679","snapshot_observed_at":"2026-08-09T04:22:00.445532Z","title":"COLD - Attack : Jailbreaking LLMs with Stealthiness and Controllability , June 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.445532Z"},"links":{"cited_paper":"/paper/2402.08679","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:daae345056b13007fcef67a07c8f980fbe45e545155c3a03d151ed5918b86bf6","observation_id":"e68ec673-131f-4676-807a-597eee54ec68","resolution":{"observed_at":"2026-08-09T04:22:00.445532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-09T04:22:00.450515Z","title":"J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., and Chen, W","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.450515Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:308be5ee1177f1453255d69c554ee51e4c737c5548de4cee11ba88831442ec03","observation_id":"bea59369-e07a-43b2-8280-ba77c93b01e9","resolution":{"observed_at":"2026-08-09T04:22:00.450515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11753","last_updated":"2024-06-07T17:35:17Z","snapshot_observed_at":"2026-07-06T17:31:58.268105Z","submitted_at":"2024-02-19T00:43:31Z","title":"ArtPrompt: ASCII Art-based Jailbreak Attacks against Aligned LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11753","snapshot_observed_at":"2026-08-09T04:22:00.455592Z","title":"ArtPrompt : ASCII Art -based Jailbreak Attacks against Aligned LLMs , June 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.455592Z"},"links":{"cited_paper":"/paper/2402.11753","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:650cc3ea55e6da04ebad85d1d758303a0702e47fdb22b4b1df1b39d85d09e295","observation_id":"89ba909c-73d6-423b-9a4f-9a419dcf7c97","resolution":{"observed_at":"2026-08-09T04:22:00.455592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:22:00.460678Z","title":"ChatGPT for good? On opportunities and challenges of large language models for education","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.460678Z"},"links":{"citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:2e53a982d4563a1ff59248e9b3ae6753dfb71193614a627ae8311f59f0b9bc5e","observation_id":"c3e539d8-921e-48b6-944e-6adec3c70b88","resolution":{"observed_at":"2026-08-09T04:22:00.460678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01446","last_updated":"2024-08-05T11:34:10Z","snapshot_observed_at":"2026-08-04T21:02:05.722226Z","submitted_at":"2023-09-04T08:54:20Z","title":"Open Sesame! Universal Black Box Jailbreaking of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.01446","snapshot_observed_at":"2026-08-09T04:22:00.465363Z","title":"Open Sesame ! Universal Black Box Jailbreaking of Large Language Models , November 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.465363Z"},"links":{"cited_paper":"/paper/2309.01446","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:7d8eda04f71043123dbdb7ce5071d8b704e97404837eba2df01802b125fd2809","observation_id":"d9172f6b-7dbe-4588-9038-23b5edfb9671","resolution":{"observed_at":"2026-08-09T04:22:00.465363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05197","last_updated":"2023-11-01T05:14:01Z","snapshot_observed_at":"2026-07-06T15:14:24.794122Z","submitted_at":"2023-04-11T13:05:04Z","title":"Multi-step Jailbreaking Privacy Attacks on ChatGPT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05197","snapshot_observed_at":"2026-08-09T04:22:00.471038Z","title":"Multi-step Jailbreaking Privacy Attacks on ChatGPT , November 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.471038Z"},"links":{"cited_paper":"/paper/2304.05197","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:d08120413eac8e2127d84d8b9d19a84657bd8ea89cba48c5fb31f21525d1c2fa","observation_id":"69c29d1a-8897-4304-9e63-78f6bb46e2ba","resolution":{"observed_at":"2026-08-09T04:22:00.471038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14872","last_updated":"2024-02-27T13:49:22Z","snapshot_observed_at":"2026-08-06T14:36:18.172649Z","submitted_at":"2024-02-21T15:13:50Z","title":"Semantic Mirror Jailbreak: Genetic Algorithm Based Jailbreak Prompts Against Open-source LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14872","snapshot_observed_at":"2026-08-09T04:22:00.476145Z","title":"Semantic Mirror Jailbreak : Genetic Algorithm Based Jailbreak Prompts Against Open -source LLMs , February 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.476145Z"},"links":{"cited_paper":"/paper/2402.14872","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:266f2a2fef3311cb617d7d47c4257124b4b1f2ecb3745caf93699c66704c8264","observation_id":"da506306-78e8-410a-8b25-a5fda1296988","resolution":{"observed_at":"2026-08-09T04:22:00.476145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16914","last_updated":"2024-11-11T23:08:20Z","snapshot_observed_at":"2026-08-08T10:16:33.808623Z","submitted_at":"2024-02-25T17:43:29Z","title":"DrAttack: Prompt Decomposition and Reconstruction Makes Powerful LLM Jailbreakers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16914","snapshot_observed_at":"2026-08-09T04:22:00.481354Z","title":"DrAttack : Prompt Decomposition and Reconstruction Makes Powerful LLM Jailbreakers , March 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.481354Z"},"links":{"cited_paper":"/paper/2402.16914","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:8a467abc2d8f92e1bc7d06623ad755a259db4463c97d89a692e02246fc514287","observation_id":"0c83e0ae-e84b-4d66-aa77-d32bf75a8b52","resolution":{"observed_at":"2026-08-09T04:22:00.481354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03191","last_updated":"2024-11-28T13:43:50Z","snapshot_observed_at":"2026-08-04T19:12:56.970085Z","submitted_at":"2023-11-06T15:29:30Z","title":"DeepInception: Hypnotize Large Language Model to Be Jailbreaker","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03191","snapshot_observed_at":"2026-08-09T04:22:00.486463Z","title":"DeepInception : Hypnotize Large Language Model to Be Jailbreaker , May 2024 c","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.486463Z"},"links":{"cited_paper":"/paper/2311.03191","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:1cf6202ab628c534865f5efdb3009b17e64e098c2d1ed8d92dca0d80a005b61d","observation_id":"ad97aa6d-bf26-4bda-b5a3-3bb411b7fb77","resolution":{"observed_at":"2026-08-09T04:22:00.486463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13401","last_updated":"2023-03-23T16:22:59Z","snapshot_observed_at":"2026-07-06T15:07:11.623462Z","submitted_at":"2023-03-23T16:22:59Z","title":"Optimization and Optimizers for Adversarial Robustness","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.13401","snapshot_observed_at":"2026-08-09T04:22:00.491594Z","title":"Optimization and Optimizers for Adversarial Robustness , March 2023 a","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.491594Z"},"links":{"cited_paper":"/paper/2303.13401","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:3807e07e19e7661a73be6582533b9aa954fdb77314047bfcc1a05c7e499746cd","observation_id":"8499386b-27f7-4af3-91a4-39fc6e9bf8ff","resolution":{"observed_at":"2026-08-09T04:22:00.491594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:22:00.496465Z","title":"Implications of Solution Patterns on Adversarial Robustness","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.496465Z"},"links":{"citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:4c811368b6c7d6069db6dcac305745cec7a6a8d9c8c24f4ff042ee6d37b5e54c","observation_id":"2e445c13-8ceb-4f88-a004-b19a9c5dedd1","resolution":{"observed_at":"2026-08-09T04:22:00.496465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07921","last_updated":"2024-11-24T18:03:43Z","snapshot_observed_at":"2026-08-08T01:20:41.374144Z","submitted_at":"2024-04-11T17:05:50Z","title":"AmpleGCG: Learning a Universal and Transferable Generative Model of Adversarial Suffixes for Jailbreaking Both Open and Closed LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07921","snapshot_observed_at":"2026-08-09T04:22:00.501027Z","title":"and Sun, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.501027Z"},"links":{"cited_paper":"/paper/2404.07921","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:7909fefd8ebac16c32c58b10880427c2159c357aaa4bd734e5943aec6ab63ce6","observation_id":"d30824fb-2002-4268-a59c-558d8e1eb226","resolution":{"observed_at":"2026-08-09T04:22:00.501027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18104","last_updated":"2024-06-10T11:20:43Z","snapshot_observed_at":"2026-08-06T17:49:19.668000Z","submitted_at":"2024-02-28T06:50:14Z","title":"Making Them Ask and Answer: Jailbreaking Large Language Models in Few Queries via Disguise and Reconstruction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18104","snapshot_observed_at":"2026-08-09T04:22:00.505854Z","title":"Making Them Ask and Answer : Jailbreaking Large Language Models in Few Queries via Disguise and Reconstruction , June 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.505854Z"},"links":{"cited_paper":"/paper/2402.18104","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:86efa338c2ddda4a2af805929767518969f7107acfbc2018110973f41c511633","observation_id":"0b1b1209-5caa-4588-a0ba-a542ca732beb","resolution":{"observed_at":"2026-08-09T04:22:00.505854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05295","last_updated":"2025-04-22T05:20:39Z","snapshot_observed_at":"2026-07-06T19:29:14.335016Z","submitted_at":"2024-10-03T17:59:01Z","title":"AutoDAN-Turbo: A Lifelong Agent for Strategy Self-Exploration to Jailbreak LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05295","snapshot_observed_at":"2026-08-09T04:22:00.510546Z","title":"AutoDAN - Turbo : A Lifelong Agent for Strategy Self - Exploration to Jailbreak LLMs , November 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.510546Z"},"links":{"cited_paper":"/paper/2410.05295","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:f30b36394b189eea227a1f8262e99101b515209b54dddc86335d660742f65394","observation_id":"7a6bcbc2-39d1-4672-879c-75f27e4eba40","resolution":{"observed_at":"2026-08-09T04:22:00.510546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04451","last_updated":"2024-03-20T21:34:56Z","snapshot_observed_at":"2026-08-06T02:57:30.438059Z","submitted_at":"2023-10-03T19:44:37Z","title":"AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04451","snapshot_observed_at":"2026-08-09T04:22:00.515272Z","title":"AutoDAN : Generating Stealthy Jailbreak Prompts on Aligned Large Language Models , March 2024 c","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.515272Z"},"links":{"cited_paper":"/paper/2310.04451","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:746f1e14864583de006f71cd75dd8052dd709d66ee3d8fb85892c94ac459383f","observation_id":"8c63baa5-456a-4ad6-93e7-871219d91a5d","resolution":{"observed_at":"2026-08-09T04:22:00.515272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04331","last_updated":"2024-11-05T15:43:18Z","snapshot_observed_at":"2026-07-06T18:26:42.010940Z","submitted_at":"2024-06-06T17:59:10Z","title":"PaCE: Parsimonious Concept Engineering for Large Language Models","version":2},"cited_work":{"arxiv_id":"2406.04331","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.04331","snapshot_observed_at":"2026-08-09T04:22:01.124740Z","title":"PaCE: Parsimonious Concept Engineering for Large Language Models","venue":"cs.CL","work_id":"e2c78cc0-1533-4dd1-a9fd-4f2401eec627","year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.520024Z"},"links":{"cited_paper":"/paper/2406.04331","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:9115ae5f6ead68de0263d240489c8004dd86497728ce7c6c502919e0103b344d","observation_id":"b43f2b73-5929-4512-a73f-49059039e97a","resolution":{"observed_at":"2026-08-09T04:22:01.131533Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16717","last_updated":"2024-02-26T16:35:59Z","snapshot_observed_at":"2026-07-06T17:35:36.900600Z","submitted_at":"2024-02-26T16:35:59Z","title":"CodeChameleon: Personalized Encryption Framework for Jailbreaking Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16717","snapshot_observed_at":"2026-08-09T04:22:00.524554Z","title":"CodeChameleon : Personalized Encryption Framework for Jailbreaking Large Language Models , February 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.524554Z"},"links":{"cited_paper":"/paper/2402.16717","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:5a887ac50c7fdb5939367d2c6db28b09af76c60a7ebb2ba18aabcee56c74b5d9","observation_id":"0471f4b8-458c-4256-81a0-ff339a0b1d2e","resolution":{"observed_at":"2026-08-09T04:22:00.524554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04249","last_updated":"2024-02-27T04:43:08Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:08Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04249","snapshot_observed_at":"2026-08-09T04:22:00.529225Z","title":"HarmBench : A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal , February 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.529225Z"},"links":{"cited_paper":"/paper/2402.04249","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:aefdef41390d6f4f5271cb6d821841f1836ca10a38f8ecfe5089647858651e7b","observation_id":"fac10459-bf1d-4c13-b110-7e175e3c6f89","resolution":{"observed_at":"2026-08-09T04:22:00.529225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02119","last_updated":"2024-10-31T15:57:42Z","snapshot_observed_at":"2026-07-06T16:56:46.051958Z","submitted_at":"2023-12-04T18:49:23Z","title":"Tree of Attacks: Jailbreaking Black-Box LLMs Automatically","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02119","snapshot_observed_at":"2026-08-09T04:22:00.533797Z","title":"Tree of Attacks : Jailbreaking Black - Box LLMs Automatically , February 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.533797Z"},"links":{"cited_paper":"/paper/2312.02119","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:bfca76d229729e622bbf64ee5497bdd628c0adba3a02a081ebbb9897fbb16102","observation_id":"9651c7b5-3875-4322-ac62-594d9e7c45e9","resolution":{"observed_at":"2026-08-09T04:22:00.533797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-09T04:22:00.538369Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.538369Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:aba172669dad237340c84186d6bfff0f53b09327568941cf142933fad6868c44","observation_id":"8fcf32ac-8614-446d-8a65-abb1eb2646e6","resolution":{"observed_at":"2026-08-09T04:22:00.538369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-05T10:26:02.067012Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-09T04:22:00.543215Z","title":"AdvPrompter : Fast Adaptive Adversarial Prompting for LLMs , April 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.543215Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:54782a57d7f345d1aff6ba85f4ccb6af8e82f21e44bef34c53fe595d4edf2e33","observation_id":"33f586e0-896b-443f-bb8a-6ccef5b4c4ea","resolution":{"observed_at":"2026-08-09T04:22:00.543215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:22:01.608863Z","title":"Language Models are Unsupervised Multitask Learners","venue":null,"work_id":"5d3d3449-a789-4849-af79-fbc6e278111d","year":null},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.548025Z"},"links":{"citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:1ab3126385b4edb51a5a3dcb6faf16763f3a28e3125e038a9ef4fd709285f004","observation_id":"3271049b-af78-410a-bcea-5b81b63e4ee6","resolution":{"observed_at":"2026-08-09T04:22:01.613807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03684","last_updated":"2024-06-11T19:02:52Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:01:53Z","title":"SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03684","snapshot_observed_at":"2026-08-09T04:22:00.552452Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.552452Z"},"links":{"cited_paper":"/paper/2310.03684","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:0f3caea9fe165c4ce04e1ce61bb5e6876e2d1743cbd4a265e483e385bb091d3c","observation_id":"f0f9d0b6-7cde-43f0-b938-de0eabe047be","resolution":{"observed_at":"2026-08-09T04:22:00.552452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-07-06T16:10:07.931347Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-09T04:22:00.557214Z","title":"E., Adi, Y., Liu, J., Sauvestre, R., Remez, T., Rapin, J., Kozhevnikov, A., Evtimov, I., Bitton, J., Bhatt, M., Ferrer, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.557214Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:a5a135cef5b1e1161f9aeaeb47cc92a059891ae27c6ef57eafa5ac80ac2c7ef8","observation_id":"aa4e9fcd-d4da-4313-baff-dddabc045772","resolution":{"observed_at":"2026-08-09T04:22:00.557214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16822","last_updated":"2024-12-11T18:07:25Z","snapshot_observed_at":"2026-08-08T15:50:09.401813Z","submitted_at":"2024-02-26T18:47:27Z","title":"Rainbow Teaming: Open-Ended Generation of Diverse Adversarial Prompts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16822","snapshot_observed_at":"2026-08-09T04:22:00.561961Z","title":"C., Lupu, A., Hambro, E., Markosyan, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.561961Z"},"links":{"cited_paper":"/paper/2402.16822","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:0c287bbf91800798835fbe2c526911d66657e97b45601a48b312b417c272a7c9","observation_id":"8b8c48c7-1360-46d9-8230-a3935d895ddc","resolution":{"observed_at":"2026-08-09T04:22:00.561961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03825","last_updated":"2024-05-15T12:06:31Z","snapshot_observed_at":"2026-07-06T16:03:34.432602Z","submitted_at":"2023-08-07T16:55:20Z","title":"\"Do Anything Now\": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03825","snapshot_observed_at":"2026-08-09T04:22:00.566995Z","title":"Do Anything Now","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.566995Z"},"links":{"cited_paper":"/paper/2308.03825","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:3e81117d87bc263fe0785c7471e3556c9efd68369785a4370020e9d8f39b6372","observation_id":"8654f3bc-4971-45fd-a9a5-6f8bbe711918","resolution":{"observed_at":"2026-08-09T04:22:00.566995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09674","last_updated":"2024-02-15T02:54:49Z","snapshot_observed_at":"2026-08-08T08:35:43.230201Z","submitted_at":"2024-02-15T02:54:49Z","title":"PAL: Proxy-Guided Black-Box Attack on Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09674","snapshot_observed_at":"2026-08-09T04:22:00.571836Z","title":"PAL : Proxy - Guided Black - Box Attack on Large Language Models , February 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.571836Z"},"links":{"cited_paper":"/paper/2402.09674","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:bbb5b9e022a4e811c6d0c25be76c6fd400052b7368ab3097f730a32624c6702b","observation_id":"7f5b80dd-b813-4747-acfb-b42906214420","resolution":{"observed_at":"2026-08-09T04:22:00.571836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:22:00.576698Z","title":"Fine-tuning large neural language models for biomedical natural language processing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.576698Z"},"links":{"citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:e2c2c80015769ed7f57c26d2a9880e17ea23dd4316bc31495f81f5da12a3da1f","observation_id":"1314c283-1c55-4387-9791-ae36b421ab10","resolution":{"observed_at":"2026-08-09T04:22:00.576698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:22:01.594046Z","title":"DAN is my new friend, 2022","venue":null,"work_id":"20ea7c37-43da-4609-8854-b1c18eaa7bd6","year":2022},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.581386Z"},"links":{"citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:977a47152aef1dc6ae8ad99c52f6711fb491820260037c20e516581132b0185c","observation_id":"25260112-4486-4903-ae24-22b8dc441103","resolution":{"observed_at":"2026-08-09T04:22:01.598827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16006","last_updated":"2024-06-04T02:59:58Z","snapshot_observed_at":"2026-08-08T21:45:59.508842Z","submitted_at":"2024-02-25T06:46:27Z","title":"ASETF: A Novel Method for Jailbreak Attack on LLMs through Translate Suffix Embeddings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16006","snapshot_observed_at":"2026-08-09T04:22:00.586129Z","title":"ASETF : A Novel Method for Jailbreak Attack on LLMs through Translate Suffix Embeddings , June 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.586129Z"},"links":{"cited_paper":"/paper/2402.16006","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:2ecc52dcf672a71de6bf8df9f9e80d852c27a4193dad8b5f213bd0148beccdb5","observation_id":"ca68ceff-f619-4d82-9cd6-59b7506b6773","resolution":{"observed_at":"2026-08-09T04:22:00.586129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14472","last_updated":"2024-05-28T09:11:25Z","snapshot_observed_at":"2026-07-06T17:48:24.076444Z","submitted_at":"2024-03-21T15:18:30Z","title":"Detoxifying Large Language Models via Knowledge Editing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14472","snapshot_observed_at":"2026-08-09T04:22:00.590879Z","title":"Detoxifying Large Language Models via Knowledge Editing , May 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.590879Z"},"links":{"cited_paper":"/paper/2403.14472","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:d9678d2ec2fb16320bf06c2579a2c688fbee2a67446a454879bb10585fca55ea","observation_id":"1ad1b49f-6085-4866-85ba-4e0be4fb408b","resolution":{"observed_at":"2026-08-09T04:22:00.590879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02483","last_updated":"2023-07-05T17:58:10Z","snapshot_observed_at":"2026-08-08T18:11:45.725753Z","submitted_at":"2023-07-05T17:58:10Z","title":"Jailbroken: How Does LLM Safety Training Fail?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02483","snapshot_observed_at":"2026-08-09T04:22:00.595645Z","title":"Jailbroken: How Does LLM Safety Training Fail ?, July 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.595645Z"},"links":{"cited_paper":"/paper/2307.02483","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:bbc489b0ea922b715824793da5ab4490c1e3db8350b3e5e9a23d355d89d5f99a","observation_id":"13bd01fd-1ea4-4ffc-9c38-f7a871a497ed","resolution":{"observed_at":"2026-08-09T04:22:00.595645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17564","last_updated":"2023-12-21T06:21:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-30T17:30:36Z","title":"BloombergGPT: A Large Language Model for Finance","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17564","snapshot_observed_at":"2026-08-09T04:22:00.600486Z","title":"BloombergGPT : A Large Language Model for Finance , December 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.600486Z"},"links":{"cited_paper":"/paper/2303.17564","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:48ef121ee3330a8e37c3bfb4b162702621f51d6691df8f7d0d7f86805bbf1c68","observation_id":"03d864db-e3d3-4784-b34c-74591dfc4cfd","resolution":{"observed_at":"2026-08-09T04:22:00.600486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02446","last_updated":"2024-01-27T22:54:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T21:30:56Z","title":"Low-Resource Languages Jailbreak GPT-4","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02446","snapshot_observed_at":"2026-08-09T04:22:00.605573Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.605573Z"},"links":{"cited_paper":"/paper/2310.02446","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:543616f4cafb049cb6ae2656c8777642a399623791a6bf185b3660cb6907f802","observation_id":"c6ca5c90-bcec-4041-8a42-ba1e7e58f2ab","resolution":{"observed_at":"2026-08-09T04:22:00.605573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10253","last_updated":"2024-06-27T16:01:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-19T02:19:48Z","title":"GPTFUZZER: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10253","snapshot_observed_at":"2026-08-09T04:22:00.610406Z","title":"GPTFUZZER : Red Teaming Large Language Models with Auto - Generated Jailbreak Prompts , June 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.610406Z"},"links":{"cited_paper":"/paper/2309.10253","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:ace0cd3a5752033f98fd2ce855cc306af1bba894f3d8731a9485b85a32090fdb","observation_id":"f7c3d5e1-2813-4608-9a57-e73e14d2ca90","resolution":{"observed_at":"2026-08-09T04:22:00.610406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06373","last_updated":"2024-01-23T22:46:12Z","snapshot_observed_at":"2026-07-06T17:14:36.670116Z","submitted_at":"2024-01-12T16:13:24Z","title":"How Johnny Can Persuade LLMs to Jailbreak Them: Rethinking Persuasion to Challenge AI Safety by Humanizing LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06373","snapshot_observed_at":"2026-08-09T04:22:00.615220Z","title":"How Johnny Can Persuade LLMs to Jailbreak Them : Rethinking Persuasion to Challenge AI Safety by Humanizing LLMs , January 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.615220Z"},"links":{"cited_paper":"/paper/2401.06373","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:8df087f2be881667e72469e1796b0ad4e8b088a3ce103e4cfcc2adf468818e0a","observation_id":"8d14b25a-76ed-4e01-97ce-a13af257036e","resolution":{"observed_at":"2026-08-09T04:22:00.615220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-09T04:22:00.620241Z","title":"P., Zhang, H., Gonzalez, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.620241Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:e4cb1ec420f13aff8c97eb1ce8419db319e99972744434acd1ce8095ba99c2d1","observation_id":"bee0ddb6-61b0-492d-8ef8-40e55289de2d","resolution":{"observed_at":"2026-08-09T04:22:00.620241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15140","last_updated":"2023-12-14T06:22:51Z","snapshot_observed_at":"2026-08-03T19:47:58.067345Z","submitted_at":"2023-10-23T17:46:07Z","title":"AutoDAN: Interpretable Gradient-Based Adversarial Attacks on Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15140","snapshot_observed_at":"2026-08-09T04:22:00.624850Z","title":"AutoDAN : Interpretable Gradient - Based Adversarial Attacks on Large Language Models , December 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.624850Z"},"links":{"cited_paper":"/paper/2310.15140","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:162d899ba9e8b02923b97c9b16ab2fdff046ad1c447ad891ddc72fb4c49456d4","observation_id":"10abcab6-f732-4f54-aa9c-412cd4b2c790","resolution":{"observed_at":"2026-08-09T04:22:00.624850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-09T04:22:00.629797Z","title":"Z., and Fredrikson, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.629797Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:23e455569c776ca859ce8b303ab3c19d6607150d7df2480ebeac750deb5f0816","observation_id":"be48752f-c814-4ba7-ac7a-f9fa692eedd2","resolution":{"observed_at":"2026-08-09T04:22:00.629797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","latest_version":1,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-09T05:14:54.791831Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":1,"verified_fuzzy":2},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 3 inbound Pith citation observations for arXiv:2502.05223."}