{"as_of":"2026-08-22T15:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f95017bd066835e236cdf56fcb613f22add379d8aeccfb1b1ee492526581da2f","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":51,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:29:57.437591Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":4,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":"2404.16873","doi":"10.48550/arxiv.2404.16873","metadata_source":"pith","pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2404.16873 (2024)","venue":"cs.CR","work_id":"162cd8d7-72c1-4741-804d-acd0126638ee","year":2024},"citing_paper":{"arxiv_id":"2405.13068","last_updated":"2026-04-18T08:25:50Z","snapshot_observed_at":"2026-08-16T01:57:57.079327Z","submitted_at":"2024-05-20T17:17:55Z","title":"Uncovering Logit Suppression Vulnerabilities in LLM Safety Alignment","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-24T00:38:36.992597Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2405.13068"},"observation_digest":"sha256:f0336094990e869c521d8bbce53e76a81a6c43d2673950e45e0e4045b25b3aa9","observation_id":"a22b6d2d-3bc2-48e3-91b6-2b23349315c6","resolution":{"observed_at":"2026-05-24T00:38:39.973302Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":"2404.16873","doi":"10.48550/arxiv.2404.16873","metadata_source":"pith","pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2404.16873 (2024)","venue":"cs.CR","work_id":"162cd8d7-72c1-4741-804d-acd0126638ee","year":2024},"citing_paper":{"arxiv_id":"2407.04295","last_updated":"2024-08-30T11:57:47Z","snapshot_observed_at":"2026-08-12T17:45:10.384900Z","submitted_at":"2024-07-05T06:57:30Z","title":"Jailbreak Attacks and Defenses Against Large Language Models: A Survey","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-15T02:20:44.368219Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2407.04295"},"observation_digest":"sha256:733a34ae9c975036d04ae95679399d7fe7dd6ef409cb3053c0692d0069d03d28","observation_id":"e3b901b0-c5d3-44d2-a0d8-052923bd8f38","resolution":{"observed_at":"2026-05-15T02:20:44.788398Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-12T15:00:14.139010Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14738","last_updated":"2024-11-22T05:17:18Z","snapshot_observed_at":"2026-08-19T23:08:07.822911Z","submitted_at":"2024-11-22T05:17:18Z","title":"Universal and Context-Independent Triggers for Precise Control of LLM Outputs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T15:00:14.139010Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2411.14738"},"observation_digest":"sha256:0eeef54213a788aa1054cac83538c5859f2fffe9acd3f64d9311641181e69243","observation_id":"73afde9b-95ea-439a-97dc-beba9c605eed","resolution":{"observed_at":"2026-08-12T15:00:14.139010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-11T22:41:27.708828Z","title":"Advprompter: Fast adaptive adversarial prompting for llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03235","last_updated":"2025-03-25T12:49:43Z","snapshot_observed_at":"2026-08-20T13:36:07.746784Z","submitted_at":"2024-12-04T11:36:37Z","title":"Does Safety Training of LLMs Generalize to Semantically Related Natural Prompts?","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T22:41:27.708828Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2412.03235"},"observation_digest":"sha256:0de779bba03d346bca4f791d9f45d6db80476d061692f35e65e4684196cbb36f","observation_id":"b21c3e6f-f1a4-470a-b25e-413242705ead","resolution":{"observed_at":"2026-08-11T22:41:27.708828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-11T20:53:37.772646Z","title":"Advprompter: Fast adaptive adversarial prompting for llms.arXiv preprint arXiv:2404.16873, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05232","last_updated":"2025-07-03T18:06:35Z","snapshot_observed_at":"2026-08-14T13:58:04.180134Z","submitted_at":"2024-12-06T18:02:59Z","title":"LIAR: Leveraging Inference Time Alignment (Best-of-N) to Jailbreak LLMs in Seconds","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T20:53:37.772646Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2412.05232"},"observation_digest":"sha256:63e43455fc48b0769ffdb480414b6015e5efdc716c56fed09cf458cf6e0ef604","observation_id":"2b798258-7090-4c1b-9e62-513af7694825","resolution":{"observed_at":"2026-08-11T20:53:37.772646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-11T20:30:10.279162Z","title":"Advprompter: Fast adaptive adversarial prompting for llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05734","last_updated":"2025-08-08T09:27:21Z","snapshot_observed_at":"2026-08-19T14:08:58.701649Z","submitted_at":"2024-12-07T20:09:01Z","title":"LeakAgent: RL-based Red-teaming Agent for LLM Privacy Leakage","version":2},"reference_index":2002,"source":"pdf_text","source_observed_at":"2026-08-11T20:30:10.279162Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2412.05734"},"observation_digest":"sha256:29b0fab1c4d79989ac9e23fdff4606537463c14336d3cdc140f4d4f5e2e00d43","observation_id":"48e175c0-10d4-43b7-8d8a-18670780c9f9","resolution":{"observed_at":"2026-08-11T20:30:10.279162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-11T12:48:10.933535Z","title":"do anything now","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13879","last_updated":"2025-05-26T15:19:26Z","snapshot_observed_at":"2026-08-17T19:11:39.895051Z","submitted_at":"2024-12-18T14:19:23Z","title":"Crabs: Consuming Resource via Auto-generation for LLM-DoS Attack under Black-box Settings","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T12:48:10.933535Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2412.13879"},"observation_digest":"sha256:934ae35b72094644f0fe53b18ad7f8fcb5755697106185d6ea7473afa83ca8ad","observation_id":"8663674f-4fa4-4a86-a5ba-20e2dd29d017","resolution":{"observed_at":"2026-08-11T12:48:10.933535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-11T10:44:19.758947Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16359","last_updated":"2025-05-29T05:54:54Z","snapshot_observed_at":"2026-08-18T14:54:26.193144Z","submitted_at":"2024-12-20T21:43:52Z","title":"Human-Readable Adversarial Prompts: An Investigation into LLM Vulnerabilities Using Situational Context","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T10:44:19.758947Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2412.16359"},"observation_digest":"sha256:18a971f1e46268d2b4b1b5f632d3920e8cbe5d2b27bbf7429afb9958d9a7a10e","observation_id":"21a60d1c-2d29-4f65-98de-6082cda87140","resolution":{"observed_at":"2026-08-11T10:44:19.758947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-11T05:55:13.027452Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17034","last_updated":"2025-05-21T16:47:23Z","snapshot_observed_at":"2026-08-16T03:34:57.133103Z","submitted_at":"2024-12-22T14:18:39Z","title":"Shaping the Safety Boundaries: Understanding and Defending Against Jailbreaks in Large Language Models","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T05:55:13.027452Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2412.17034"},"observation_digest":"sha256:fe120fc2458055c8ad7996a4bd469b4ca1dd4b2ecd96158445458e7b72da1c99","observation_id":"148e7d23-6573-4c27-865e-b74d39ef3034","resolution":{"observed_at":"2026-08-11T05:55:13.027452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-11T05:31:31.653316Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17522","last_updated":"2025-01-05T04:44:32Z","snapshot_observed_at":"2026-08-15T15:38:59.741982Z","submitted_at":"2024-12-23T12:44:54Z","title":"DiffusionAttacker: Diffusion-Driven Prompt Manipulation for LLM Jailbreak","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T05:31:31.653316Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2412.17522"},"observation_digest":"sha256:727303d35fb66c8a3c28e6cd313056ab37332f7badd9c01bae0702f2195414e9","observation_id":"70337389-7629-4802-b532-15ef011f6c38","resolution":{"observed_at":"2026-08-11T05:31:31.653316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-11T05:19:34.474151Z","title":"URL https://doi.org/10.18653/ v1/2022.findings-acl.165","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.17686","last_updated":"2024-12-23T16:11:27Z","snapshot_observed_at":"2026-08-13T21:57:18.514742Z","submitted_at":"2024-12-23T16:11:27Z","title":"Large Language Model Safety: A Holistic Survey","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T05:19:34.474151Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2412.17686"},"observation_digest":"sha256:60802f56711a3d29b4b3caf84742288b4996af00bd3df3877f35c1cc13493ac2","observation_id":"46aa5a11-e181-4c94-be87-8b9455fa5fd9","resolution":{"observed_at":"2026-08-11T05:19:34.474151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-11T05:19:34.479199Z","title":"URL https://doi.org/10.48550/arXiv.2404","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17686","last_updated":"2024-12-23T16:11:27Z","snapshot_observed_at":"2026-08-13T21:57:18.514742Z","submitted_at":"2024-12-23T16:11:27Z","title":"Large Language Model Safety: A Holistic Survey","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T05:19:34.479199Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2412.17686"},"observation_digest":"sha256:180d12a3357f51aeefc41ee49923dcf401400d1b4674f3bdb77bfdfae850094a","observation_id":"0b332681-d7de-4cc5-9b46-6534c2c64650","resolution":{"observed_at":"2026-08-11T05:19:34.479199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-09T14:49:08.791225Z","title":"14 Perez, E., Huang, S., Song, F., Cai, T., Ring, R., Aslanides, J., Glaese, A., McAleese, N., and Irving, G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01633","last_updated":"2025-06-25T15:31:17Z","snapshot_observed_at":"2026-08-16T09:09:35.076144Z","submitted_at":"2025-02-03T18:59:01Z","title":"Adversarial Reasoning at Jailbreaking Time","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T14:49:08.791225Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2502.01633"},"observation_digest":"sha256:df964254334bc0a983aa76258c86d930c2d0b13ef782749fbef44181e56d621c","observation_id":"3dea2062-6df5-498c-91d7-36ecbf9a8175","resolution":{"observed_at":"2026-08-09T14:49:08.791225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-09T04:22:00.543215Z","title":"AdvPrompter : Fast Adaptive Adversarial Prompting for LLMs , April 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.543215Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:e84bf61596e39b1b038bdcf82169304640596b298c04e8585703b991cdeb3c1c","observation_id":"33f586e0-896b-443f-bb8a-6ccef5b4c4ea","resolution":{"observed_at":"2026-08-09T04:22:00.543215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-16T10:29:57.437591Z","title":"Advances in neural in- formation processing systems, 35:27730–27744","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18041","last_updated":"2025-04-25T03:25:18Z","snapshot_observed_at":"2026-08-18T13:26:47.421289Z","submitted_at":"2025-04-25T03:25:18Z","title":"RAG LLMs are Not Safer: A Safety Analysis of Retrieval-Augmented Generation for Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T10:29:57.437591Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2504.18041"},"observation_digest":"sha256:f14db7be60fcd33651f53b9baca32d64f8e1e54a73aac248146935dc22bbef4a","observation_id":"b5f1baa3-fe14-4328-a96f-1bc2327d9050","resolution":{"observed_at":"2026-08-16T10:29:57.437591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-16T05:57:58.274145Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19440","last_updated":"2025-04-28T03:01:51Z","snapshot_observed_at":"2026-08-20T07:16:03.686107Z","submitted_at":"2025-04-28T03:01:51Z","title":"JailbreaksOverTime: Detecting Jailbreak Attacks Under Distribution Shift","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T05:57:58.274145Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2504.19440"},"observation_digest":"sha256:37a2494dc2687c1bcb6ae826658d3fee484b7a905a09547fcc59bc81260f6237","observation_id":"75d27f6e-6ab2-447c-a0d4-0a34178cfdc9","resolution":{"observed_at":"2026-08-16T05:57:58.274145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-16T05:32:23.012873Z","title":"Advprompter: Fast adaptive adversarial prompting for llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20437","last_updated":"2025-04-29T05:27:02Z","snapshot_observed_at":"2026-08-16T13:52:59.503788Z","submitted_at":"2025-04-29T05:27:02Z","title":"GaLore 2: Large-Scale LLM Pre-Training by Gradient Low-Rank Projection","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T05:32:23.012873Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2504.20437"},"observation_digest":"sha256:fff9cdd2836ef8b4849aeea2bf8a8f2117340ae3e075d1d23dc9a127a43c1546","observation_id":"89b1cf46-213c-4057-878b-0f6100f9cd30","resolution":{"observed_at":"2026-08-16T05:32:23.012873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-15T21:07:54.263941Z","title":"Ad- vprompter: Fast adaptive adversarial prompting for llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10838","last_updated":"2025-05-16T04:12:16Z","snapshot_observed_at":"2026-08-16T21:14:18.646624Z","submitted_at":"2025-05-16T04:12:16Z","title":"LARGO: Latent Adversarial Reflection through Gradient Optimization for Jailbreaking LLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:54.263941Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2505.10838"},"observation_digest":"sha256:2f1b147c349fdaf81d452320cd9090c5e898fd619c6f4959e1e27557de363718","observation_id":"e6972e7f-d34c-480e-8fb5-a6679c73ba4e","resolution":{"observed_at":"2026-08-15T21:07:54.263941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-07T14:32:04.624605Z","title":"do anything now","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18680","last_updated":"2025-05-24T12:54:22Z","snapshot_observed_at":"2026-08-14T19:10:41.629813Z","submitted_at":"2025-05-24T12:54:22Z","title":"$PD^3F$: A Pluggable and Dynamic DoS-Defense Framework Against Resource Consumption Attacks Targeting Large Language Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T14:32:04.624605Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2505.18680"},"observation_digest":"sha256:49abbbdd90c79c3de49c8e6c07ddee04acf533c7b826742da7fb09117579c7ca","observation_id":"41789b93-84a7-451b-87b4-1ea84d0cf2d1","resolution":{"observed_at":"2026-08-07T14:32:04.624605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-07T12:35:22.397407Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24369","last_updated":"2025-05-30T09:02:07Z","snapshot_observed_at":"2026-08-14T23:42:53.296054Z","submitted_at":"2025-05-30T09:02:07Z","title":"Adversarial Preference Learning for Robust LLM Alignment","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:22.397407Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2505.24369"},"observation_digest":"sha256:cd60b0edb0dfa59ccb2d9aa9d99fa3fae861d49406edf54793e55d0b5d3c6c64","observation_id":"e06c0b55-81fb-4a7b-89d4-9831c669f67f","resolution":{"observed_at":"2026-08-07T12:35:22.397407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-07T12:01:09.355215Z","title":"Paulus, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00782","last_updated":"2025-06-01T02:19:46Z","snapshot_observed_at":"2026-08-18T02:53:19.588193Z","submitted_at":"2025-06-01T02:19:46Z","title":"Jailbreak-R1: Exploring the Jailbreak Capabilities of LLMs via Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:09.355215Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2506.00782"},"observation_digest":"sha256:194820b4fac9137025b4f2bd8e3ff3536e3fb7c0e43f8408d5a551556a937279","observation_id":"08782bc4-4c05-447a-8f7a-e6054cf6024a","resolution":{"observed_at":"2026-08-07T12:01:09.355215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-07T05:40:20.611175Z","title":"Advprompter: Fast adaptive adversarial prompting for llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-18T01:42:49.770295Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.611175Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:e0bb65682525da06fd51f5595590c7fefb003422796b671dcc1aff007635ff72","observation_id":"81904555-64f5-41c7-a0fe-bfecc3e67c03","resolution":{"observed_at":"2026-08-07T05:40:20.611175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-07T01:02:30.091792Z","title":"Advprompter: Fast adaptive adversarial prompting for llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12274","last_updated":"2025-06-13T23:03:11Z","snapshot_observed_at":"2026-08-16T14:52:31.084261Z","submitted_at":"2025-06-13T23:03:11Z","title":"InfoFlood: Jailbreaking Large Language Models with Information Overload","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T01:02:30.091792Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2506.12274"},"observation_digest":"sha256:3dbca5a88b3c8d23e2bc83f42e8cd7d65c543fcbf8753efd3cbac5683e43107c","observation_id":"80fcbd30-de18-44ae-81ce-192f881e457b","resolution":{"observed_at":"2026-08-07T01:02:30.091792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-15T19:45:09.972913Z","title":"Advprompter: Fast adaptive adversarial prompting for llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15170","last_updated":"2025-08-01T10:42:39Z","snapshot_observed_at":"2026-08-16T15:33:53.252333Z","submitted_at":"2025-06-18T06:33:19Z","title":"From LLMs to MLLMs to Agents: A Survey of Emerging Paradigms in Jailbreak Attacks and Defenses within LLM Ecosystem","version":3},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-08-15T19:45:09.972913Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2506.15170"},"observation_digest":"sha256:14cd3dd56fb9e857ccf71c09463fa6360b2866cf495eb111a59e221ad6986f9b","observation_id":"8116f002-8796-404a-81af-50d24ab18c7c","resolution":{"observed_at":"2026-08-15T19:45:09.972913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-15T19:26:27.838579Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17353","last_updated":"2025-06-20T02:43:36Z","snapshot_observed_at":"2026-08-18T03:19:39.679529Z","submitted_at":"2025-06-20T02:43:36Z","title":"Differentiation-Based Extraction of Proprietary Data from Fine-Tuned LLMs","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T19:26:27.838579Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2506.17353"},"observation_digest":"sha256:495c0e1c3609757d3a4746478261eb900eda07940ec2dda2e7ec90075ef3ebbc","observation_id":"8125a248-c97e-4312-a735-b73ea763941a","resolution":{"observed_at":"2026-08-15T19:26:27.838579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-06T04:47:25.099818Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03054","last_updated":"2025-08-05T03:58:15Z","snapshot_observed_at":"2026-08-21T12:18:56.100349Z","submitted_at":"2025-08-05T03:58:15Z","title":"Beyond Surface-Level Detection: Towards Cognitive-Driven Defense Against Jailbreak Attacks via Meta-Operations Reasoning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T04:47:25.099818Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2508.03054"},"observation_digest":"sha256:dbb8d4e85f65c685c154821850871aa3083b658a05d2944bcfa128b483d1cd05","observation_id":"a8d067be-6877-4e4f-af8b-c8240083be68","resolution":{"observed_at":"2026-08-06T04:47:25.099818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-05T20:31:37.738668Z","title":"Advprompter: Fast adaptive adversarial prompting for llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10404","last_updated":"2025-08-14T07:12:44Z","snapshot_observed_at":"2026-08-21T08:08:18.531548Z","submitted_at":"2025-08-14T07:12:44Z","title":"Layer-Wise Perturbations via Sparse Autoencoders for Adversarial Text Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:37.738668Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2508.10404"},"observation_digest":"sha256:11387378973ec7a3f03dd2e5ac1c023e7f7805b7467e5665c2d0822b3f902bd0","observation_id":"662af245-6dca-4328-98e9-2e7229c2d120","resolution":{"observed_at":"2026-08-05T20:31:37.738668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-05T17:14:34.407082Z","title":"Advprompter: Fast adaptive adversarial prompting for llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18306","last_updated":"2025-08-23T02:50:55Z","snapshot_observed_at":"2026-08-14T20:23:35.152528Z","submitted_at":"2025-08-23T02:50:55Z","title":"SALMAN: Stability Analysis of Language Models Through the Maps Between Graph-based Manifolds","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:34.407082Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2508.18306"},"observation_digest":"sha256:1e700accb46badaf6132b0dc24ab5c1c01eb180b1bf1c07b81916aa0889259d2","observation_id":"749f7203-1005-4dad-a3bf-2736a213ed20","resolution":{"observed_at":"2026-08-05T17:14:34.407082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-05T16:00:48.801181Z","title":"Advprompter: Fast adaptive adversarial prompting for llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19445","last_updated":"2026-06-16T17:34:06Z","snapshot_observed_at":"2026-08-08T05:25:02.825611Z","submitted_at":"2025-08-26T21:36:45Z","title":"On Surjectivity of Neural Networks: Can you elicit any behavior from your model?","version":3},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-05T16:00:48.801181Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2508.19445"},"observation_digest":"sha256:d617c23301f6881fbd8de58e0825c0eaf37f212a8cddf6361dd5d12960420a3e","observation_id":"bfd81048-27ec-4452-9d30-2bacffc9b866","resolution":{"observed_at":"2026-08-05T16:00:48.801181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-04T21:33:58.913614Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07941","last_updated":"2025-09-09T17:21:20Z","snapshot_observed_at":"2026-08-19T02:00:41.741397Z","submitted_at":"2025-09-09T17:21:20Z","title":"ImportSnare: Directed \"Code Manual\" Hijacking in Retrieval-Augmented Code Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T21:33:58.913614Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2509.07941"},"observation_digest":"sha256:e64cdfe410c76e2d24542075de1e59f869a798e5af068e5ae822b496a1d882ec","observation_id":"d0bb0894-15f5-4301-846d-e1e48bcac584","resolution":{"observed_at":"2026-08-04T21:33:58.913614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":"2404.16873","doi":"10.48550/arxiv.2404.16873","metadata_source":"pith","pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2404.16873 (2024)","venue":"cs.CR","work_id":"162cd8d7-72c1-4741-804d-acd0126638ee","year":2024},"citing_paper":{"arxiv_id":"2510.07239","last_updated":"2026-05-17T13:01:38Z","snapshot_observed_at":"2026-08-18T02:11:31.281364Z","submitted_at":"2025-10-08T17:06:20Z","title":"Red-Bandit: Test-Time Adaptation for LLM Red-Teaming via Bandit-Guided LoRA Experts","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-21T20:53:58.198974Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2510.07239"},"observation_digest":"sha256:6490433f1214b643c42e497a400d31fc365f5e0ffc0599a5f32dedfd9c9368c7","observation_id":"d408accb-a2c8-470a-b6a2-1d3f59b263fa","resolution":{"observed_at":"2026-05-21T20:54:21.593472Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-04T09:25:51.124373Z","title":"Advprompter: Fast adaptive adversarial prompting for llms.CoRR, abs/2404.16873, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.15476","last_updated":"2026-07-04T04:20:15Z","snapshot_observed_at":"2026-08-14T22:20:04.981358Z","submitted_at":"2025-10-17T09:38:54Z","title":"SoK: Systematizing LLM Prompt Security: Taxonomies, Datasets, and Unified Evaluation of Attacks and Defenses","version":3},"reference_index":142,"source":"pdf_text","source_observed_at":"2026-08-04T09:25:51.124373Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2510.15476"},"observation_digest":"sha256:4bc26e582b6d98cc8c08b964b51640b10cb15208322ca7335a38a6215ae0e66d","observation_id":"a1413762-bdd6-4a5c-a5a4-ead1e65455b6","resolution":{"observed_at":"2026-08-04T09:25:51.124373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-04T09:08:57.585743Z","title":"Ad- vPrompter: Fast Adaptive Adversarial Prompting for LLMs.arXiv preprint arXiv:2404.16873, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.17256","last_updated":"2026-06-03T19:38:37Z","snapshot_observed_at":"2026-08-14T13:01:25.236229Z","submitted_at":"2025-10-20T07:43:53Z","title":"Explainability of Large Language Models: Opportunities and Challenges toward Generating Trustworthy Explanations","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-04T09:08:57.585743Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2510.17256"},"observation_digest":"sha256:e5a97e2dda794d8e20939e223f93fd239d3cb8164aac7895f4741995aeb5c21a","observation_id":"6f7df3db-5570-414d-9b57-a036437d1ffd","resolution":{"observed_at":"2026-08-04T09:08:57.585743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-07-13T21:05:49.558519Z","title":"arXiv preprint arXiv:2404.16873 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.21046","last_updated":"2026-07-07T14:15:25Z","snapshot_observed_at":"2026-08-14T17:16:27.140498Z","submitted_at":"2026-03-22T03:56:58Z","title":"SpatialFly: Implicit 3D Prior-Guided Visual Reparameterization for Continuous UAV Vision-and-Language Navigation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-13T21:05:49.558519Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2603.21046"},"observation_digest":"sha256:eb6e724df84b173930b7134c5334c1834d94aba1752c0a102bfd83279ee2d86f","observation_id":"33c9be13-54bd-4799-beb1-9662fa953a18","resolution":{"observed_at":"2026-07-13T21:05:49.558519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":"2404.16873","doi":"10.48550/arxiv.2404.16873","metadata_source":"pith","pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2404.16873 (2024)","venue":"cs.CR","work_id":"162cd8d7-72c1-4741-804d-acd0126638ee","year":2024},"citing_paper":{"arxiv_id":"2603.24935","last_updated":"2026-04-07T10:20:22Z","snapshot_observed_at":"2026-08-14T13:40:05.838508Z","submitted_at":"2026-03-26T01:56:01Z","title":"SABER: A Stealthy Agentic Black-Box Attack Framework for Vision-Language-Action Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T01:06:42.421062Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2603.24935"},"observation_digest":"sha256:9da771db8849e88af0b443a5507b41b24dff68b189029550037f818260e21253","observation_id":"bf7ef827-2cb1-4f1e-ada6-01de4fdf6e4e","resolution":{"observed_at":"2026-05-15T01:08:25.701404Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":"2404.16873","doi":"10.48550/arxiv.2404.16873","metadata_source":"pith","pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2404.16873 (2024)","venue":"cs.CR","work_id":"162cd8d7-72c1-4741-804d-acd0126638ee","year":2024},"citing_paper":{"arxiv_id":"2604.12232","last_updated":"2026-04-14T03:12:19Z","snapshot_observed_at":"2026-08-14T14:59:30.287265Z","submitted_at":"2026-04-14T03:12:19Z","title":"TEMPLATEFUZZ: Fine-Grained Chat Template Fuzzing for Jailbreaking and Red Teaming LLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T16:02:52.006859Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2604.12232"},"observation_digest":"sha256:d35a86607c4b10f6c93e39970cc13fb424e304578ab022a6d1fdc1aa72e94a0b","observation_id":"16e8444f-202e-4873-aacd-6de8d77165ba","resolution":{"observed_at":"2026-05-11T09:26:00.067226Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":"2404.16873","doi":"10.48550/arxiv.2404.16873","metadata_source":"pith","pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2404.16873 (2024)","venue":"cs.CR","work_id":"162cd8d7-72c1-4741-804d-acd0126638ee","year":2024},"citing_paper":{"arxiv_id":"2604.12548","last_updated":"2026-04-14T10:20:15Z","snapshot_observed_at":"2026-08-14T03:35:31.242884Z","submitted_at":"2026-04-14T10:20:15Z","title":"DeepSeek Robustness Against Semantic-Character Dual-Space Mutated Prompt Injection","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T15:54:24.013408Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2604.12548"},"observation_digest":"sha256:d2d7d9544789e6339e71de4aeb268e6533b19f33627dd61e25f9419095de176f","observation_id":"7311c844-7b4e-4ce5-bbe1-9ca087b68089","resolution":{"observed_at":"2026-05-11T09:41:00.474344Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":"2404.16873","doi":"10.48550/arxiv.2404.16873","metadata_source":"pith","pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2404.16873 (2024)","venue":"cs.CR","work_id":"162cd8d7-72c1-4741-804d-acd0126638ee","year":2024},"citing_paper":{"arxiv_id":"2604.18660","last_updated":"2026-04-20T11:29:22Z","snapshot_observed_at":"2026-08-12T19:53:02.599784Z","submitted_at":"2026-04-20T11:29:22Z","title":"Evaluating Answer Leakage Robustness of LLM Tutors against Adversarial Student Attacks","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-10T04:22:31.566907Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2604.18660"},"observation_digest":"sha256:d70826923241bdccfc3a47f1c4f34416db94689b1317a45eb88862f3c6e5aca8","observation_id":"80b76460-fe4c-4a9b-8d9a-d58c0649332f","resolution":{"observed_at":"2026-05-11T12:01:02.917204Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":"2404.16873","doi":"10.48550/arxiv.2404.16873","metadata_source":"pith","pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2404.16873 (2024)","venue":"cs.CR","work_id":"162cd8d7-72c1-4741-804d-acd0126638ee","year":2024},"citing_paper":{"arxiv_id":"2605.17128","last_updated":"2026-05-16T19:22:54Z","snapshot_observed_at":"2026-08-16T21:30:53.360651Z","submitted_at":"2026-05-16T19:22:54Z","title":"New Wide-Net-Casting Jailbreak Attacks Risk Large Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T14:46:52.070071Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2605.17128"},"observation_digest":"sha256:24a1b3f4d3d4578618f0f48134932ba1cb79b59c0e3d577dc92aa371d48d9808","observation_id":"6a94b55c-9a23-4d2b-9f8c-9e7b40a47573","resolution":{"observed_at":"2026-05-20T14:48:23.266760Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":"2404.16873","doi":"10.48550/arxiv.2404.16873","metadata_source":"pith","pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2404.16873 (2024)","venue":"cs.CR","work_id":"162cd8d7-72c1-4741-804d-acd0126638ee","year":2024},"citing_paper":{"arxiv_id":"2605.21362","last_updated":"2026-05-20T16:27:00Z","snapshot_observed_at":"2026-08-17T16:09:34.303359Z","submitted_at":"2026-05-20T16:27:00Z","title":"LASH: Adaptive Semantic Hybridization for Black-Box Jailbreaking of Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-21T04:48:19.926845Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2605.21362"},"observation_digest":"sha256:3a9d6f31dabd575f922952650efc7098ecb6c871624f40456cf30d516d13d63f","observation_id":"f65eadd1-ec73-4c02-a754-eeb7fb18003e","resolution":{"observed_at":"2026-05-21T04:49:35.490569Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":"2404.16873","doi":"10.48550/arxiv.2404.16873","metadata_source":"pith","pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2404.16873 (2024)","venue":"cs.CR","work_id":"162cd8d7-72c1-4741-804d-acd0126638ee","year":2024},"citing_paper":{"arxiv_id":"2606.03647","last_updated":"2026-06-02T13:39:15Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T13:39:15Z","title":"Black-box, Adaptive, Efficient, Transferable, Harmful, Applicable... Attacks Are All You Need to Break LLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T09:21:57.373862Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2606.03647"},"observation_digest":"sha256:7dee51b0ec87da014999e6446d06b8d1e085952fb5e4f7c77ac353559ffbe023","observation_id":"31add7b6-4f49-4c20-b858-89467e932cd3","resolution":{"observed_at":"2026-07-02T04:16:34.744444Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":"2404.16873","doi":"10.48550/arxiv.2404.16873","metadata_source":"pith","pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2404.16873 (2024)","venue":"cs.CR","work_id":"162cd8d7-72c1-4741-804d-acd0126638ee","year":2024},"citing_paper":{"arxiv_id":"2606.17872","last_updated":"2026-06-16T12:43:18Z","snapshot_observed_at":"2026-08-17T11:55:44.294472Z","submitted_at":"2026-06-16T12:43:18Z","title":"AnchorKV: Safety-Aware KV Cache Compression via Soft Penalty with a Refusal Anchor","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T01:23:23.488555Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2606.17872"},"observation_digest":"sha256:0c088c7edf7bad8ab98f813d6147bd7990916b5cb1092d0baf29a80fc3987c2d","observation_id":"b5655620-9d5e-40f1-9e69-d2c977d560bc","resolution":{"observed_at":"2026-07-03T20:18:57.885689Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":"2404.16873","doi":"10.48550/arxiv.2404.16873","metadata_source":"pith","pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2404.16873 (2024)","venue":"cs.CR","work_id":"162cd8d7-72c1-4741-804d-acd0126638ee","year":2024},"citing_paper":{"arxiv_id":"2606.25487","last_updated":"2026-06-25T02:04:55Z","snapshot_observed_at":"2026-08-12T18:22:40.145016Z","submitted_at":"2026-06-24T07:14:17Z","title":"How Reliable Is Your Jailbreak Judge? Calibration and Adversarial Robustness of Automated ASR Scoring","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-25T20:56:18.687903Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2606.25487"},"observation_digest":"sha256:afe8cf38027787530f8a29938a39859a63487483ce8771380c09276ea37c251f","observation_id":"52878905-b5a8-41c5-917a-15274188d8d3","resolution":{"observed_at":"2026-07-04T20:00:07.886490Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":"2404.16873","doi":"10.48550/arxiv.2404.16873","metadata_source":"pith","pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2404.16873 (2024)","venue":"cs.CR","work_id":"162cd8d7-72c1-4741-804d-acd0126638ee","year":2024},"citing_paper":{"arxiv_id":"2606.25487","last_updated":"2026-06-25T02:04:55Z","snapshot_observed_at":"2026-08-12T18:22:40.145016Z","submitted_at":"2026-06-24T07:14:17Z","title":"How Reliable Is Your Jailbreak Judge? Calibration and Adversarial Robustness of Automated ASR Scoring","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T05:27:21.279142Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2606.25487"},"observation_digest":"sha256:71245bdfa7d3d930956450edba25b26364d3d0fb3585d805513e8fe10e959836","observation_id":"52dc7840-6575-49cf-b5f9-ce529025042c","resolution":{"observed_at":"2026-07-04T13:09:51.024351Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":"2404.16873","doi":"10.48550/arxiv.2404.16873","metadata_source":"pith","pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2404.16873 (2024)","venue":"cs.CR","work_id":"162cd8d7-72c1-4741-804d-acd0126638ee","year":2024},"citing_paper":{"arxiv_id":"2606.26566","last_updated":"2026-06-25T03:32:12Z","snapshot_observed_at":"2026-08-12T21:54:41.598451Z","submitted_at":"2026-06-25T03:32:12Z","title":"Adversarial Diffusion Across Modalities: A Fusion Survey of Attacks, Defenses, and Evaluation for Text, Vision, and Vision-Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-26T04:35:51.583460Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2606.26566"},"observation_digest":"sha256:bda27b9539cc197cfbfd052ce1d216c129b20cba452323701bb85205c1c41076","observation_id":"0388491f-f722-4a09-83c9-79206e3d6bc3","resolution":{"observed_at":"2026-06-26T04:38:59.095913Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":"2404.16873","doi":"10.48550/arxiv.2404.16873","metadata_source":"pith","pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2404.16873 (2024)","venue":"cs.CR","work_id":"162cd8d7-72c1-4741-804d-acd0126638ee","year":2024},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-08-14T18:25:59Z","snapshot_observed_at":"2026-08-20T23:09:41.224583Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:4132f5376098ac3308f6d1d9baf97b056c191f84451bf1d0f3187ad3c32d1578","observation_id":"1954f2f3-4241-4142-a245-fcda157ab2f7","resolution":{"observed_at":"2026-07-10T15:27:20.109933Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":"2404.16873","doi":"10.48550/arxiv.2404.16873","metadata_source":"pith","pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2404.16873 (2024)","venue":"cs.CR","work_id":"162cd8d7-72c1-4741-804d-acd0126638ee","year":2024},"citing_paper":{"arxiv_id":"2607.08180","last_updated":"2026-07-09T07:27:48Z","snapshot_observed_at":"2026-08-19T22:50:17.123344Z","submitted_at":"2026-07-09T07:27:48Z","title":"Out of Sight: Compression-Aware Content Protection against Agentic Crawlers","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-10T11:48:08.491407Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2607.08180"},"observation_digest":"sha256:4c622dea33514c988b7dce4b3eb6690f46e4f38ad7109c6a4903253036c9bb74","observation_id":"57f5e0a4-dc5e-4d25-8007-3a25af8f14a8","resolution":{"observed_at":"2026-07-10T11:57:03.478911Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-01T18:54:55.186195Z","title":"arXiv preprint arXiv:2404.16873 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:55.186195Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:9243b46e949c1e9f816df2201a3f517553c083443e36d00c10d33ded51a91ee4","observation_id":"634f7881-0dcc-477c-b3cc-0de8ad8bb93e","resolution":{"observed_at":"2026-08-01T18:54:55.186195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-01T14:56:08.564003Z","title":"doi: 10.18653/v1/2022.findings-acl.165","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18622","last_updated":"2026-07-30T22:51:32Z","snapshot_observed_at":"2026-08-17T04:38:29.831089Z","submitted_at":"2026-07-21T01:44:59Z","title":"CPInj: Uncovering Prompt Injection Risks in Textual Collaborative Prompt Optimization","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-01T14:56:08.564003Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2607.18622"},"observation_digest":"sha256:8a30c1d6e91880d3cafa8fd3d0dfa8d258de7e2fe0f8fa1c40cc4d2a7cf62027","observation_id":"21620d4a-2567-4eff-8f13-d3f3035c2f15","resolution":{"observed_at":"2026-08-01T14:56:08.564003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-03T01:56:58.444116Z","title":"doi: 10.18653/v1/2022.findings-acl.165","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18622","last_updated":"2026-07-30T22:51:32Z","snapshot_observed_at":"2026-08-17T04:38:29.831089Z","submitted_at":"2026-07-21T01:44:59Z","title":"CPInj: Uncovering Prompt Injection Risks in Textual Collaborative Prompt Optimization","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T01:56:58.444116Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2607.18622"},"observation_digest":"sha256:e38845bbe6825a2339be2f6c94d92aa1e7052cd425f4b2f95846f1ab09a6d685","observation_id":"dd902880-98df-4544-b3eb-4b03dcac666c","resolution":{"observed_at":"2026-08-03T01:56:58.444116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-04T01:16:10.569808Z","title":"Ad- vprompter: Fast adaptive adversarial prompting for llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00134","last_updated":"2026-07-31T14:04:49Z","snapshot_observed_at":"2026-08-14T22:54:09.591958Z","submitted_at":"2026-07-31T14:04:49Z","title":"Stateful Cooperative Agents Safeguarding LLMs Against Evolving Multi-Turn Attacks","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:10.569808Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2608.00134"},"observation_digest":"sha256:328ada1d612535bd04b3b895b532a6578526ff0b3202b2ffd14b7240dba6e41b","observation_id":"a36c6875-97c0-47a9-8bd8-25e0b0f97ecd","resolution":{"observed_at":"2026-08-04T01:16:10.569808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2404.16873/citation-record","integrity":"/paper/2404.16873/integrity","json":"/paper/2404.16873/citation-record.json","paper":"/paper/2404.16873"},"outbound":[],"paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","latest_version":2,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 51 inbound Pith citation observations for arXiv:2404.16873."}