{"as_of":"2026-08-06T21:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c61e35854ca1aef20da1b71f395515d449b2e8f58dcb21d3b11c99fee1e8f09b","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-24T07:42:09.112946Z","state":"measured"},{"denominator":129,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":129,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":732,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:27:35.040995Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":187,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2308.01263","last_updated":"2024-04-01T11:50:35Z","snapshot_observed_at":"2026-08-03T00:58:55.865010Z","submitted_at":"2023-08-02T16:30:40Z","title":"XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T06:51:50.771676Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2308.01263"},"observation_digest":"sha256:8da8b0006545e8a7ed8455e9e3781ce85c5115936e0508c1be584a5986b7aa51","observation_id":"689f133a-5324-4b83-8b9e-c4eea52b2441","resolution":{"observed_at":"2026-05-15T06:51:50.807968Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2308.03825","last_updated":"2024-05-15T12:06:31Z","snapshot_observed_at":"2026-07-06T16:03:34.432602Z","submitted_at":"2023-08-07T16:55:20Z","title":"\"Do Anything Now\": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-17T08:39:28.047394Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2308.03825"},"observation_digest":"sha256:9e74566e8867748033b49a8a65d36a99a097f9a7df99ebe2ba90215cfd562b41","observation_id":"7ec25416-37d4-4a6f-826e-2f9e0880554d","resolution":{"observed_at":"2026-05-17T08:39:28.195931Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2309.00614","last_updated":"2023-09-04T17:47:36Z","snapshot_observed_at":"2026-07-06T16:13:23.343694Z","submitted_at":"2023-09-01T17:59:44Z","title":"Baseline Defenses for Adversarial Attacks Against Aligned Language Models","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-13T23:24:39.835347Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2309.00614"},"observation_digest":"sha256:0c6a0e4e7de95b8e96a918e6dfad9ab628672882e5d373cb871ad835ff85df1b","observation_id":"acaf8eee-4c15-4042-b03f-d453f71624a3","resolution":{"observed_at":"2026-05-13T23:24:39.984464Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2309.10253","last_updated":"2024-06-27T16:01:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-19T02:19:48Z","title":"GPTFUZZER: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts","version":4},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-15T06:25:20.966510Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2309.10253"},"observation_digest":"sha256:ce7b77f2ef18de34ff8296a7e929bc45b035dc709e534c3a24add1d3b8c800c7","observation_id":"cfc55ff5-8613-4f87-b8a0-da5af497d12f","resolution":{"observed_at":"2026-05-15T06:25:21.174508Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2310.02446","last_updated":"2024-01-27T22:54:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T21:30:56Z","title":"Low-Resource Languages Jailbreak GPT-4","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-17T09:24:13.911401Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2310.02446"},"observation_digest":"sha256:011c0e3d69bfd021ca9fc44ec95d68e6183dad38116397373202bfc8ca3c6e3d","observation_id":"8bc99e31-5022-4f5d-8b1b-659d0ef8fd2e","resolution":{"observed_at":"2026-05-17T09:24:14.046876Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2310.03684","last_updated":"2024-06-11T19:02:52Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:01:53Z","title":"SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-14T17:11:00.639293Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2310.03684"},"observation_digest":"sha256:be6a66939f265b53b447a2472f2ea0e44b949916624a9f5f8e8714e4551b1df2","observation_id":"9f633d5a-b017-40db-b951-b5cc550752bf","resolution":{"observed_at":"2026-05-14T17:11:00.729569Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2310.06987","last_updated":"2023-10-10T20:15:54Z","snapshot_observed_at":"2026-07-06T16:30:46.321160Z","submitted_at":"2023-10-10T20:15:54Z","title":"Catastrophic Jailbreak of Open-source LLMs via Exploiting Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T22:00:51.487120Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2310.06987"},"observation_digest":"sha256:5fd6ceaf5b22baa297b264739f92696047397e29e0e0fd7eb644add21f853174","observation_id":"cb3c49d1-813d-41b1-94d9-da2e6c6bff3e","resolution":{"observed_at":"2026-05-16T22:00:51.530893Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-04T15:07:29.209129Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:ee17c8a6d454a1c85d4c348ad493b6ab3eb9324b6c33b4bf7e0eb4da8cdb3859","observation_id":"9079ed20-f698-4c86-9b07-489d1b1d3578","resolution":{"observed_at":"2026-05-17T01:59:51.414513Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2310.19852","last_updated":"2025-04-04T11:14:49Z","snapshot_observed_at":"2026-08-05T20:02:35.087707Z","submitted_at":"2023-10-30T15:52:15Z","title":"AI Alignment: A Comprehensive Survey","version":6},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-17T14:28:48.987140Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2310.19852"},"observation_digest":"sha256:883ed65e370cbdb071dffd03eac826091f0cc31bb35d7c68b333fca215c51e20","observation_id":"19f7b153-cf69-4d84-a46e-93245620482a","resolution":{"observed_at":"2026-05-17T14:28:49.032977Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2311.17035","last_updated":"2023-11-28T18:47:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-28T18:47:03Z","title":"Scalable Extraction of Training Data from (Production) Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-15T19:00:46.708242Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2311.17035"},"observation_digest":"sha256:ea45c09b5d1787a1c97ce2a2ef17eaf476567fc26e29abc64bfa207f59ae395e","observation_id":"58a9aa42-db13-4505-a043-5befa3274470","resolution":{"observed_at":"2026-05-15T19:00:46.810082Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2401.06121","last_updated":"2024-01-11T18:57:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-11T18:57:12Z","title":"TOFU: A Task of Fictitious Unlearning for LLMs","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-16T11:07:39.215164Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2401.06121"},"observation_digest":"sha256:524a87d678fb71337f6b5f4d656a86c0c49b74c77fff800afaef9c07b3cbe6d9","observation_id":"8e84bd5f-8736-41af-9961-f9f71ab2b41a","resolution":{"observed_at":"2026-05-16T11:07:39.246388Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2402.06922","last_updated":"2026-04-21T14:06:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-10T11:07:24Z","title":"Whispers in the Machine: Confidentiality in Agentic Systems","version":5},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-24T03:59:03.972043Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2402.06922"},"observation_digest":"sha256:f8630ef9c2d34124a0c9e0751c9b88b802c4f73431f61462e8db741e64796c9c","observation_id":"072c6e2a-0719-4282-b7aa-32e4992998ac","resolution":{"observed_at":"2026-05-24T04:03:53.912178Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2402.10260","last_updated":"2024-08-27T03:32:47Z","snapshot_observed_at":"2026-08-04T21:32:35.483431Z","submitted_at":"2024-02-15T18:58:09Z","title":"A StrongREJECT for Empty Jailbreaks","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-16T21:28:02.745230Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2402.10260"},"observation_digest":"sha256:4bf441344e27df29c249c871ae05249d610f0208b7073d0173c133bae173ad4d","observation_id":"7f8da37b-d73a-46ac-acc8-04760c41a286","resolution":{"observed_at":"2026-05-16T21:28:02.900691Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2403.14720","last_updated":"2024-03-20T15:26:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-20T15:26:23Z","title":"Defending Against Indirect Prompt Injection Attacks With Spotlighting","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-14T22:28:55.370749Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2403.14720"},"observation_digest":"sha256:c85ed9aee241b7dddf511cb3070d3d418b6583b0925492cd900e37c4b01e9893","observation_id":"4df00ab4-ea88-47ed-a0bc-0df4844ba04d","resolution":{"observed_at":"2026-05-14T22:28:55.503509Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:f042f515e8aa762207f11c2665c5aab8ddb17b2c702a718ecfdf598a6ea2c4d6","observation_id":"7149086c-43aa-441f-a801-7da49abfc2b1","resolution":{"observed_at":"2026-05-15T06:08:05.564496Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2404.01833","last_updated":"2025-02-26T13:41:41Z","snapshot_observed_at":"2026-08-03T07:26:39.431128Z","submitted_at":"2024-04-02T10:45:49Z","title":"Great, Now Write an Article About That: The Crescendo Multi-Turn LLM Jailbreak Attack","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-18T02:12:41.431156Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2404.01833"},"observation_digest":"sha256:4088df0ab8010b9d18e18e80f8fd06cf8e1c1adba57ade88d33e6ab92da348e6","observation_id":"8350874e-ad20-47ca-ac27-48037e9179b5","resolution":{"observed_at":"2026-05-18T02:12:41.520873Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2404.08144","last_updated":"2024-04-17T04:34:39Z","snapshot_observed_at":"2026-08-02T04:29:28.130280Z","submitted_at":"2024-04-11T22:07:19Z","title":"LLM Agents can Autonomously Exploit One-day Vulnerabilities","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T04:18:27.597704Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2404.08144"},"observation_digest":"sha256:d6c5d40f048b513e103f6e381eb206912e43c7f519404b298044cf176a626b3f","observation_id":"6370596a-fdd9-4567-b76b-1ba428927731","resolution":{"observed_at":"2026-05-18T04:18:27.680738Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2404.13208","last_updated":"2024-04-19T22:55:23Z","snapshot_observed_at":"2026-08-02T11:48:17.206729Z","submitted_at":"2024-04-19T22:55:23Z","title":"The Instruction Hierarchy: Training LLMs to Prioritize Privileged Instructions","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T10:59:30.728091Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2404.13208"},"observation_digest":"sha256:bbaba8ad1e56c08c14a6d7e3d6dee6d7a8b951692aa50823ae980ccf0accfb24","observation_id":"1b2eada1-26ce-4905-a0c5-23380fb12b90","resolution":{"observed_at":"2026-05-12T10:59:30.811638Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2405.13068","last_updated":"2026-04-18T08:25:50Z","snapshot_observed_at":"2026-08-04T20:18:53.393132Z","submitted_at":"2024-05-20T17:17:55Z","title":"Uncovering Logit Suppression Vulnerabilities in LLM Safety Alignment","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-24T00:38:36.992597Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2405.13068"},"observation_digest":"sha256:b971efeea41ada36492c9c3350cfead57ad459cdb59cb8d321ac86d34965deb8","observation_id":"f70dc3f4-852e-49b1-8029-357de2a01387","resolution":{"observed_at":"2026-05-24T00:38:39.800763Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2406.11717","last_updated":"2024-10-30T18:57:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T16:36:12Z","title":"Refusal in Language Models Is Mediated by a Single Direction","version":3},"reference_index":208,"source":"arxiv_source","source_observed_at":"2026-05-13T10:47:55.934081Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2406.11717"},"observation_digest":"sha256:f7e155b4431441d10342c84324c400cbf03fcca079d74bee3a435232fbfe16b0","observation_id":"8990ca77-8e46-4295-973c-6fa1cb724aab","resolution":{"observed_at":"2026-05-13T10:47:56.181588Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2406.13352","last_updated":"2024-11-24T22:04:23Z","snapshot_observed_at":"2026-07-06T18:33:32.806635Z","submitted_at":"2024-06-19T08:55:56Z","title":"AgentDojo: A Dynamic Environment to Evaluate Prompt Injection Attacks and Defenses for LLM Agents","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-13T06:35:13.331872Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2406.13352"},"observation_digest":"sha256:36b70a06bfb1c53dfda87fcd2ebc1b0438bcf13ccab48ca0277b57b4557a5e7a","observation_id":"d9c4eff1-78e4-4d0c-af2c-c8aeac3843c4","resolution":{"observed_at":"2026-05-13T06:35:13.539981Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-08-06T04:32:59.039501Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:018eedb5906e89d5f989c48d6219bb53895f4e0ff46516d2268d6b7d5389e986","observation_id":"78e3adc0-7411-4d4b-96d4-4c86ceeeba18","resolution":{"observed_at":"2026-05-17T16:25:14.923012Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2407.04295","last_updated":"2024-08-30T11:57:47Z","snapshot_observed_at":"2026-08-04T23:34:13.332065Z","submitted_at":"2024-07-05T06:57:30Z","title":"Jailbreak Attacks and Defenses Against Large Language Models: A Survey","version":2},"reference_index":125,"source":"pdf_text","source_observed_at":"2026-05-15T02:20:44.368219Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2407.04295"},"observation_digest":"sha256:dbd469e93c80fed63dd90881a8ba9ec8bc09fb2fe8ea512fb8ca466660e03e55","observation_id":"9ba9306c-28a8-4616-8a2c-4fd7c64240d0","resolution":{"observed_at":"2026-05-15T02:20:44.537423Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2409.02399","last_updated":"2026-05-02T21:46:56Z","snapshot_observed_at":"2026-08-02T04:48:06.236870Z","submitted_at":"2024-09-04T02:48:52Z","title":"Guidance for twisted particle filter: a continuous-time perspective","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-23T21:06:52.470243Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2409.02399"},"observation_digest":"sha256:d0a2b61c1604e3aff11790e1d365eb951803403bf2d1021590d9f8ec2f20aa34","observation_id":"0e127a1a-06d7-4776-95b0-0087710317ac","resolution":{"observed_at":"2026-05-23T21:08:26.084514Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2409.12917","last_updated":"2024-10-04T17:28:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-19T17:16:21Z","title":"Training Language Models to Self-Correct via Reinforcement Learning","version":2},"reference_index":138,"source":"arxiv_source","source_observed_at":"2026-05-17T12:04:10.210508Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2409.12917"},"observation_digest":"sha256:810bba57a20452c9f068b504c39ec86bd8e801399fbbb19a1af3c87098aa6f4c","observation_id":"df5667e5-d446-46e4-a88d-0a5a584f919b","resolution":{"observed_at":"2026-05-17T12:04:10.681068Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2409.18169","last_updated":"2026-04-23T18:48:49Z","snapshot_observed_at":"2026-07-06T19:22:58.341345Z","submitted_at":"2024-09-26T17:55:22Z","title":"Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey","version":6},"reference_index":184,"source":"pdf_text","source_observed_at":"2026-05-23T20:58:16.237327Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2409.18169"},"observation_digest":"sha256:dbe8bada6fddd752507ada7f8b1ee09c0d992fb0afe52d9a9e35348c9a7a34da","observation_id":"979b9f49-bfce-45ca-8377-e8ad995d6700","resolution":{"observed_at":"2026-05-23T20:58:25.850959Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2410.07283","last_updated":"2024-10-09T11:01:29Z","snapshot_observed_at":"2026-08-02T17:12:52.352951Z","submitted_at":"2024-10-09T11:01:29Z","title":"Prompt Infection: LLM-to-LLM Prompt Injection within Multi-Agent Systems","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-05-15T19:32:19.405615Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2410.07283"},"observation_digest":"sha256:06a0fbedb4bc3a416082534e3eb88fcc2249c26ba7f989f6b71f3ce29b109757","observation_id":"5a53c659-fa35-4dea-8ff0-6632e7ba4b1e","resolution":{"observed_at":"2026-05-15T19:32:19.876030Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2410.09024","last_updated":"2025-04-18T14:30:31Z","snapshot_observed_at":"2026-08-02T12:38:54.249632Z","submitted_at":"2024-10-11T17:39:22Z","title":"AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-14T01:35:50.992477Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2410.09024"},"observation_digest":"sha256:1c65909942687c90f60f25da5297c26d018ddcd7ad6dc12fb2ff34c44ef7b2f9","observation_id":"6b640dcf-4154-4191-95c9-4adfb30dd792","resolution":{"observed_at":"2026-05-14T01:35:51.188032Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2410.15362","last_updated":"2026-05-19T04:19:17Z","snapshot_observed_at":"2026-07-06T19:36:36.994783Z","submitted_at":"2024-10-20T11:27:41Z","title":"Faster-GCG: Efficient Discrete Optimization Jailbreak Attacks against Aligned Large Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-23T19:01:43.922848Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2410.15362"},"observation_digest":"sha256:1dc83362d438c823ad409d26af704ea701e58eef1eb320ddb23fc7b5f2d69da9","observation_id":"61bec995-990b-4a62-b57d-70cfcaa12970","resolution":{"observed_at":"2026-05-23T19:03:21.394452Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2410.17196","last_updated":"2024-12-11T15:45:21Z","snapshot_observed_at":"2026-07-06T19:37:56.214143Z","submitted_at":"2024-10-22T17:15:20Z","title":"VoiceBench: Benchmarking LLM-Based Voice Assistants","version":3},"reference_index":111,"source":"arxiv_source","source_observed_at":"2026-05-17T00:50:13.841689Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2410.17196"},"observation_digest":"sha256:af7aa04f78edf3fc68e4646039c69532e604766c5f17e783c320eed86e308a9e","observation_id":"ce3bce45-f4b3-47b5-884f-7d52f467af29","resolution":{"observed_at":"2026-05-17T00:50:13.931900Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2412.13663","last_updated":"2024-12-19T06:32:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T09:39:44Z","title":"Smarter, Better, Faster, Longer: A Modern Bidirectional Encoder for Fast, Memory Efficient, and Long Context Finetuning and Inference","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-20T17:46:46.845424Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2412.13663"},"observation_digest":"sha256:575ab4a0c1ae31c38a706e328d50cfa01f95404b9b78128cfe8f92b77f094ca6","observation_id":"3438c2bd-479c-41be-aa06-dd13c4777f2a","resolution":{"observed_at":"2026-05-20T17:46:47.014121Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2412.14113","last_updated":"2026-05-14T17:15:02Z","snapshot_observed_at":"2026-07-06T20:09:28.763595Z","submitted_at":"2024-12-18T17:58:58Z","title":"Adversarial Hubness in Multi-Modal Retrieval","version":4},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-23T06:39:36.039613Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2412.14113"},"observation_digest":"sha256:6a6b9f9a7ff5f8e74c24971e7952836f68b2322e6d2f1c190ac168729ac2d981","observation_id":"b7cc975b-4979-4e18-82c7-854a94d69f03","resolution":{"observed_at":"2026-05-23T06:42:39.776660Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2501.19202","last_updated":"2026-04-20T06:27:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-31T15:12:20Z","title":"Improving LLM Unlearning Robustness via Random Perturbations","version":6},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-23T04:41:47.910423Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2501.19202"},"observation_digest":"sha256:c9d2a618d20c0e5429de44bd943ae84c4a995cd46efad41f49b79ecd9bbfe8f1","observation_id":"ccaf8640-23cc-4605-9a3a-18bca850bbc6","resolution":{"observed_at":"2026-05-23T04:42:33.408884Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2502.01241","last_updated":"2026-04-13T12:56:05Z","snapshot_observed_at":"2026-07-06T20:30:12.663808Z","submitted_at":"2025-02-03T11:02:30Z","title":"Peering Behind the Shield: Guardrail Identification in Large Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-23T03:45:14.234545Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2502.01241"},"observation_digest":"sha256:0abbf04ccd6f4be566f9f092b994bf09736394ed2935e1e86465122b5d2f6231","observation_id":"cbb29ad8-3885-4d94-aeda-1032d8eb6078","resolution":{"observed_at":"2026-05-23T03:45:21.382565Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:600050d7b2b562d10974f3e64875c7072bb6e292eec85d6d2e759753df19529f","observation_id":"637f526e-2929-40eb-97d3-90a660c36cc2","resolution":{"observed_at":"2026-05-23T04:42:33.773359Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2502.16691","last_updated":"2026-05-16T22:13:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-23T19:12:10Z","title":"Responsible Federated LLMs via Safety Filtering and Constitutional AI","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-23T02:20:07.800524Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2502.16691"},"observation_digest":"sha256:813a019898827f8c7fdbe217c841f01b212a00a335edfeca3f07f520a488e71a","observation_id":"894a831f-546e-4e02-93cb-64991a8715a0","resolution":{"observed_at":"2026-05-23T02:22:25.163571Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2502.18864","last_updated":"2025-02-26T06:17:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T06:17:13Z","title":"Towards an AI co-scientist","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-11T13:02:43.571234Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2502.18864"},"observation_digest":"sha256:e8fcbea7e701179bafbee7d7cbd17c367697a1f4ccf80f2cad9f79b5d54a0169","observation_id":"af241a98-56db-4f1d-94c4-6c9679ab0378","resolution":{"observed_at":"2026-05-11T13:02:44.377608Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2504.20472","last_updated":"2026-04-09T06:57:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-29T07:13:53Z","title":"Robustness via Referencing: Defending against Prompt Injection Attacks by Referencing the Executed Instruction","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-22T19:10:55.009810Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2504.20472"},"observation_digest":"sha256:78c15259ac5a4a300fd4d2c45bb4e8ed107861aa417cc1d6c778043e9f5159bd","observation_id":"bc488420-641c-4c77-88b8-04b63f9be930","resolution":{"observed_at":"2026-05-22T19:11:58.054185Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2505.14226","last_updated":"2026-04-07T12:14:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T11:35:25Z","title":"Phonetic Perturbations Reveal Tokenizer-Rooted Safety Gaps in LLMs","version":5},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-22T14:40:58.506345Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2505.14226"},"observation_digest":"sha256:4b06c1c08b2325f42a9faeefe64f57747d1201f7c228a2abc58448f15a17c439","observation_id":"24a4adc1-99d1-4f51-8574-5635935e58ac","resolution":{"observed_at":"2026-05-22T14:41:41.452731Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2505.15323","last_updated":"2026-04-03T14:23:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T09:58:38Z","title":"Improving LLM First-Token Predictions in Multiple-Choice Question Answering via Output Prefilling","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-22T14:21:18.355360Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2505.15323"},"observation_digest":"sha256:368730a4ccf92393c716a05523965c153ae5e739aafb0f918c248aef52c8bbfc","observation_id":"f02a76a8-8b5c-4f40-89c5-fab83ff4e166","resolution":{"observed_at":"2026-05-22T14:21:39.607873Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2505.16737","last_updated":"2026-04-23T08:31:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T14:52:10Z","title":"Secure LLM Fine-Tuning via Safety-Aware Probing","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-22T13:07:09.402763Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2505.16737"},"observation_digest":"sha256:290c88b3950eb8ae7600e418ae7b0a3fabd820e7b61fa3f9e9b9e716eddef8b8","observation_id":"b76efd75-d0d9-46ea-ad2a-d362a8bce8f4","resolution":{"observed_at":"2026-05-22T13:11:35.797307Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2505.16831","last_updated":"2026-05-16T02:05:58Z","snapshot_observed_at":"2026-08-06T13:03:08.046974Z","submitted_at":"2025-05-22T16:02:10Z","title":"Unlearning Isn't Deletion: Investigating Reversibility of Machine Unlearning in LLMs","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-22T13:26:47.663124Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2505.16831"},"observation_digest":"sha256:c92632d19a516a04499ba2b50b90455e10591b1727f5f85c3f72d84566154e3d","observation_id":"b7c82321-6650-484a-962c-968250b0b367","resolution":{"observed_at":"2026-05-22T13:31:36.614411Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2506.01770","last_updated":"2026-04-18T05:40:12Z","snapshot_observed_at":"2026-08-04T01:20:56.393646Z","submitted_at":"2025-06-02T15:17:38Z","title":"ReGA: Model-Based Safeguard for LLMs via Representation-Guided Abstraction","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-19T11:34:09.428653Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2506.01770"},"observation_digest":"sha256:a89dee39f3a7575638a5042d344a949e3ef04087d0114b67254f13e609f38184","observation_id":"8f9b1d36-ed45-4d04-bae2-971bb6b06b23","resolution":{"observed_at":"2026-05-19T11:37:16.011602Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2506.04390","last_updated":"2026-05-22T04:35:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-04T19:15:09Z","title":"Through the Stealth Lens: Attention-Aware Defenses Against Poisoning in RAG","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-25T08:10:31.473565Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2506.04390"},"observation_digest":"sha256:a319833a8e9cd274095299b51b7720bcdea74c603bef2fe14f854d67c554302d","observation_id":"9376c1d2-219c-4e2e-b956-503d17ea8e7d","resolution":{"observed_at":"2026-05-25T08:15:34.183042Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2506.06414","last_updated":"2026-04-20T20:58:30Z","snapshot_observed_at":"2026-08-03T02:03:44.971897Z","submitted_at":"2025-06-06T17:33:33Z","title":"Benchmarking Misuse Mitigation Against Covert Adversaries","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-19T10:29:05.104520Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2506.06414"},"observation_digest":"sha256:7e69c41be53dab921b17dad4dc050cd8ae573f043c9e99e24dce4361f1df15ed","observation_id":"511005a8-5dd7-4be7-8719-e9692af9ad39","resolution":{"observed_at":"2026-05-19T10:32:14.672975Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2506.09067","last_updated":"2026-04-09T22:50:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-08T16:26:51Z","title":"Enhancing the Safety of Medical Vision-Language Models by Synthetic Demonstrations","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-19T10:54:55.262180Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2506.09067"},"observation_digest":"sha256:e6a765ae560cefa165ded23cca9607599698978dfbd349b5747517cf66eb9556","observation_id":"a5c26d1f-29f0-4915-ae9d-f3845d336592","resolution":{"observed_at":"2026-05-19T10:57:16.516818Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2506.10060","last_updated":"2026-04-17T19:21:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T18:00:00Z","title":"Textual Bayes: Quantifying Prompt Uncertainty in LLM-Based Systems","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-19T09:20:12.827871Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2506.10060"},"observation_digest":"sha256:9e4c23a038fe88e9d1a4a321019eccc68a089bac9f5e2bf960687fc458f82ecc","observation_id":"80df81ac-fe22-4c21-b861-2c9cf89ea567","resolution":{"observed_at":"2026-05-19T09:22:15.935221Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2506.12382","last_updated":"2026-04-27T08:32:16Z","snapshot_observed_at":"2026-08-02T04:53:57.144183Z","submitted_at":"2025-06-14T07:31:52Z","title":"Exploring the Secondary Risks of Large Language Models","version":5},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-19T09:40:58.067398Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2506.12382"},"observation_digest":"sha256:640dc603997b6db5c4fd9520dbe2504aac87199ce2cb9e7851247954778f0436","observation_id":"a1907dc4-5f4e-4c17-ae41-e158b954d2f3","resolution":{"observed_at":"2026-05-19T09:42:13.917686Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2506.17299","last_updated":"2026-04-24T04:36:54Z","snapshot_observed_at":"2026-08-02T14:45:34.223522Z","submitted_at":"2025-06-17T20:37:29Z","title":"Toward Principled LLM Safety Testing: Solving the Jailbreak Oracle Problem","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-19T08:40:56.186349Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2506.17299"},"observation_digest":"sha256:e6547e6937bb71dfcd822ae54711fb5e17f31e3d7302d0b1a238db2540696bae","observation_id":"da4f7547-1716-48ad-a6b2-97c30866c39b","resolution":{"observed_at":"2026-05-19T08:42:12.809508Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T21:27:35.040995Z","title":"diverse set of fictional names","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-06T21:18:19.412178Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:35.040995Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:5add91f19f2cd6e0ee458968e91e0f4148be490659bd8bfd13c9c692f5e86f12","observation_id":"e3b2af77-ec94-45f6-9f49-31afebf2d95b","resolution":{"observed_at":"2026-08-06T21:27:35.040995Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T20:45:53.383863Z","title":"de- composition correctness,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02057","last_updated":"2025-07-02T18:00:49Z","snapshot_observed_at":"2026-08-06T20:36:51.169138Z","submitted_at":"2025-07-02T18:00:49Z","title":"MGC: A Compiler Framework Exploiting Compositional Blindness in Aligned LLMs for Malware Generation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:53.383863Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.02057"},"observation_digest":"sha256:0bebb95082fd2da0baf48ea9ae9266fd8e25be94af827c0215df849a57ee8777","observation_id":"ce291d9e-2eb9-4d40-8058-06b80d36a5ee","resolution":{"observed_at":"2026-08-06T20:45:53.383863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T19:57:44.883812Z","title":"Z., and Fredrikson, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-06T19:50:01.905374Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:44.883812Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:36093a3a3f8ff648d16894ecde1b4882bdd37618ba5219aadd7d40ab82ec4df1","observation_id":"af12dd0b-7f73-46b2-b5eb-5f4f0ab62693","resolution":{"observed_at":"2026-08-06T19:57:44.883812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T19:54:11.959670Z","title":"Attention Sharpening","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04365","last_updated":"2025-07-06T12:19:04Z","snapshot_observed_at":"2026-08-06T19:47:03.672143Z","submitted_at":"2025-07-06T12:19:04Z","title":"Attention Slipping: A Mechanistic Understanding of Jailbreak Attacks and Defenses in LLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:11.959670Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.04365"},"observation_digest":"sha256:2b5242d1bd07e070264d135e8098ec90c676ac19f9a2eed649d2055c4f355d0e","observation_id":"ba7b66aa-1fbd-4999-9ebd-7bdd9a34e7b0","resolution":{"observed_at":"2026-08-06T19:54:11.959670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T19:52:35.701983Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04455","last_updated":"2025-07-06T16:27:27Z","snapshot_observed_at":"2026-08-06T19:44:48.327849Z","submitted_at":"2025-07-06T16:27:27Z","title":"GradOT: Training-free Gradient-preserving Offsite-tuning for Large Language Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T19:52:35.701983Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.04455"},"observation_digest":"sha256:67da2c31570c2c09e20dee48a454d5cbff80b1528e76b2107229e019f61b7f95","observation_id":"12e02cd1-a3bc-41ba-9856-8a0121a07529","resolution":{"observed_at":"2026-08-06T19:52:35.701983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T19:46:25.870469Z","title":"Z., & Fredrikson, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04673","last_updated":"2026-07-11T20:48:21Z","snapshot_observed_at":"2026-08-06T19:40:14.478360Z","submitted_at":"2025-07-07T05:35:21Z","title":"Trojan Horse Prompting: Jailbreaking Conversational Multimodal Models by Forging Assistant Message","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:25.870469Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.04673"},"observation_digest":"sha256:484dbf4a0c7a82d12191f652b249e13efa9ae54e2988cb8db92096e3f381cf6f","observation_id":"3d0799c7-1f3f-4ff7-b50c-591d077226c6","resolution":{"observed_at":"2026-08-06T19:46:25.870469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T20:03:53.475523Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05288","last_updated":"2025-07-05T09:52:21Z","snapshot_observed_at":"2026-08-06T19:55:51.769745Z","submitted_at":"2025-07-05T09:52:21Z","title":"A Survey on Proactive Defense Strategies Against Misinformation in Large Language Models","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-06T20:03:53.475523Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.05288"},"observation_digest":"sha256:aac1ad835483649f79d6aedd036aaaf14c48ac1587d3f0fbd7df528a8777391f","observation_id":"044c6098-585c-406e-b827-e830f6011e8d","resolution":{"observed_at":"2026-08-06T20:03:53.475523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2507.05660","last_updated":"2026-05-21T16:31:21Z","snapshot_observed_at":"2026-07-29T18:54:03.959574Z","submitted_at":"2025-07-08T04:40:09Z","title":"Optimus: A Robust Defense Framework for Mitigating Toxicity while Fine-Tuning Conversational AI","version":3},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-22T12:17:59.458633Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.05660"},"observation_digest":"sha256:8453b269c88c819b66ef714e0f0100b8c8781e8113a69d819cb2863f468371ee","observation_id":"a8a01a32-cf18-4ac8-aa00-4f59739f1c6d","resolution":{"observed_at":"2026-05-22T12:21:31.168880Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T19:18:47.094379Z","title":"Zico Kolter, and Matt Fredrikson","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06043","last_updated":"2025-08-06T05:32:54Z","snapshot_observed_at":"2026-08-06T19:09:56.821409Z","submitted_at":"2025-07-08T14:45:21Z","title":"CAVGAN: Unifying Jailbreak and Defense of LLMs via Generative Adversarial Attacks on their Internal Representations","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T19:18:47.094379Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.06043"},"observation_digest":"sha256:ab3699b499ca8ca7e336798eea94edfddd08f87b7201fbe380ab8dcf773a1cdf","observation_id":"822a0e55-2997-4ae1-8622-df97a4992f59","resolution":{"observed_at":"2026-08-06T19:18:47.094379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2507.06056","last_updated":"2026-04-20T04:08:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T14:58:28Z","title":"Data Compressibility Quantifies LLM Memorization","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-19T06:00:12.027708Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.06056"},"observation_digest":"sha256:42a73879ee1212a14338a61b4b27b3beb1df17642489d67f76527de434957fe9","observation_id":"509b5c76-8874-43d0-a16c-ce5ef743af98","resolution":{"observed_at":"2026-05-19T06:02:07.677164Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T19:46:12.168372Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06256","last_updated":"2025-07-07T07:29:52Z","snapshot_observed_at":"2026-08-06T19:38:51.451950Z","submitted_at":"2025-07-07T07:29:52Z","title":"Attacker's Noise Can Manipulate Your Audio-based LLM in the Real World","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.168372Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.06256"},"observation_digest":"sha256:87cceded4efec1a93517d7e3e4f9b9ea0b256c35f1a9a2d023e04b48522c27c2","observation_id":"d6493212-f791-4b4d-bfc1-c8c85109138f","resolution":{"observed_at":"2026-08-06T19:46:12.168372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T19:18:40.283148Z","title":"Zico and Fredrikson, Matt.Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06282","last_updated":"2025-07-08T15:21:17Z","snapshot_observed_at":"2026-08-06T19:09:17.542317Z","submitted_at":"2025-07-08T15:21:17Z","title":"The bitter lesson of misuse detection","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:18:40.283148Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.06282"},"observation_digest":"sha256:5cb65ec297b262eb7e748d68b2c6f6adf1184830b9b70247152c2c4ac13dfbc5","observation_id":"05f8fcb2-eb3f-441e-99f1-8a526aa9d2fe","resolution":{"observed_at":"2026-08-06T19:18:40.283148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T19:12:22.950253Z","title":"Universal and transferable adversarial attacks on aligned language models, 2023,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06323","last_updated":"2025-07-08T18:24:28Z","snapshot_observed_at":"2026-08-06T19:05:12.143746Z","submitted_at":"2025-07-08T18:24:28Z","title":"Bridging AI and Software Security: A Comparative Vulnerability Assessment of LLM Agent Deployment Paradigms","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:12:22.950253Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.06323"},"observation_digest":"sha256:87f632fa40d4a952481882a6c8ebd7bb98c54a4ef6a4f3a75054c3f021ce6f2c","observation_id":"81543be5-060c-4908-a8f5-81c9cc76f904","resolution":{"observed_at":"2026-08-06T19:12:22.950253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T19:08:18.041331Z","title":"Universal and transferable adversarial attacks on aligned language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06565","last_updated":"2025-07-23T17:02:53Z","snapshot_observed_at":"2026-08-06T18:57:57.142397Z","submitted_at":"2025-07-09T05:39:56Z","title":"A Mathematical Theory of Discursive Networks","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:08:18.041331Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.06565"},"observation_digest":"sha256:fc1f4761462312b9bd93039fddd1667fd23b18672c60238470172b957eb862b2","observation_id":"f682a274-4437-454e-9094-6f3cd42927a9","resolution":{"observed_at":"2026-08-06T19:08:18.041331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2507.07871","last_updated":"2026-05-11T08:00:17Z","snapshot_observed_at":"2026-08-02T20:18:48.475092Z","submitted_at":"2025-07-10T15:52:32Z","title":"Mitigating Watermark Forgery in Generative Models via Randomized Key Selection","version":4},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-19T05:25:41.898297Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.07871"},"observation_digest":"sha256:0ffa80e705c4adf7f5f1558edfd8914a272c07f65fcf65bdd104b9136e9a3aad","observation_id":"e3038363-73c7-4391-9fea-9f2d75a9285f","resolution":{"observed_at":"2026-05-19T05:27:05.474981Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T18:32:44.285307Z","title":"Zico Kolter, and Matt Fredrikson","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07974","last_updated":"2025-08-25T16:49:10Z","snapshot_observed_at":"2026-08-06T18:25:32.971973Z","submitted_at":"2025-07-10T17:51:05Z","title":"Defending Against Prompt Injection With a Few DefensiveTokens","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:44.285307Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.07974"},"observation_digest":"sha256:cc1b9ac38f2b75529e51bd578b7b8a8212bf529a9ee581147409887e294c3070","observation_id":"aad169b6-04a0-46ca-8be5-38d353ad6935","resolution":{"observed_at":"2026-08-06T18:32:44.285307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T19:56:04.760055Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08014","last_updated":"2025-07-06T08:41:30Z","snapshot_observed_at":"2026-08-06T19:48:50.296360Z","submitted_at":"2025-07-06T08:41:30Z","title":"Mass-Scale Analysis of In-the-Wild Conversations Reveals Complexity Bounds on LLM Jailbreaking","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:56:04.760055Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.08014"},"observation_digest":"sha256:59c60e737e395f1b5d7b06bd92742b06a61f6af0d8d5e93a3abc82b09cd19a2c","observation_id":"6c1c173e-b8c0-4879-86af-82c9e8e326bb","resolution":{"observed_at":"2026-08-06T19:56:04.760055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T19:26:13.774858Z","title":"Rating: [[rating]]","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08020","last_updated":"2025-07-08T03:01:00Z","snapshot_observed_at":"2026-08-06T19:19:20.387278Z","submitted_at":"2025-07-08T03:01:00Z","title":"Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:13.774858Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.08020"},"observation_digest":"sha256:cf84b4fc7e86282e4935a9725f72ac31a3de7a454dd446ba8586b8d64dfff77b","observation_id":"a23e8d93-7f7b-4d19-8c45-61b2b66b355d","resolution":{"observed_at":"2026-08-06T19:26:13.774858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T18:28:46.576684Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08898","last_updated":"2025-07-17T08:01:44Z","snapshot_observed_at":"2026-08-06T18:20:05.427908Z","submitted_at":"2025-07-11T05:15:35Z","title":"SEALGuard: Safeguarding the Multilingual Conversations in Southeast Asian Languages for LLM Software Systems","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T18:28:46.576684Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.08898"},"observation_digest":"sha256:ea0df2eff5c0f600af2e75707a2b6904c94a4bbba73f0c1009a789aad882014e","observation_id":"55d16c82-124c-46f0-820c-40016709b7f5","resolution":{"observed_at":"2026-08-06T18:28:46.576684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T17:45:58.756338Z","title":"Universal and transferable adversarial attacks on aligned language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10054","last_updated":"2025-07-23T10:43:29Z","snapshot_observed_at":"2026-08-06T17:38:15.321285Z","submitted_at":"2025-07-14T08:36:26Z","title":"Explicit Vulnerability Generation with LLMs: An Investigation Beyond Adversarial Attacks","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:45:58.756338Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.10054"},"observation_digest":"sha256:052074e762addb3fbc5b9ab261273c034da8b94db0cbc408bcfc0447b36d4786","observation_id":"dda1b033-61d2-4105-9240-05780f8dee01","resolution":{"observed_at":"2026-08-06T17:45:58.756338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T19:08:27.669576Z","title":"Z., and Fredrikson, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T19:01:33.582052Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:27.669576Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:84b21b06b41932dfdcf95517e847c7b872624da74dda4622fccdd80f6d60f41e","observation_id":"4777db18-432d-4d4b-b08a-62bbc6266ced","resolution":{"observed_at":"2026-08-06T19:08:27.669576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T17:05:04.749036Z","title":"Z., and Fredrikson, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11771","last_updated":"2025-07-15T22:21:18Z","snapshot_observed_at":"2026-08-06T16:59:37.603117Z","submitted_at":"2025-07-15T22:21:18Z","title":"Scaling laws for activation steering with Llama 2 models and refusal mechanisms","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T17:05:04.749036Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.11771"},"observation_digest":"sha256:acae142f5b947010b91dd3c2f483bf238c92466ca577dfcff282efe47b57c6a0","observation_id":"182fc9f9-0577-4c67-9158-41413fef0fbf","resolution":{"observed_at":"2026-08-06T17:05:04.749036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T17:09:24.884191Z","title":"Universal and transferable adversarial attacks on aligned lan- guage models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","snapshot_observed_at":"2026-08-06T16:54:49.708049Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T17:09:24.884191Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.11968"},"observation_digest":"sha256:18c7e1a26c1c9ebd044b591e9b74c432b41c6aa87114724a424b5804e6068ab4","observation_id":"1612cb63-f7b3-4493-b43e-c44ffd16bb53","resolution":{"observed_at":"2026-08-06T17:09:24.884191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T16:42:30.788941Z","title":"Universal and transferable adversarial attacks on aligned language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12855","last_updated":"2025-07-17T07:26:22Z","snapshot_observed_at":"2026-08-06T16:34:29.463565Z","submitted_at":"2025-07-17T07:26:22Z","title":"DEMONSTRATE: Zero-shot Language to Robotic Control via Multi-task Demonstration Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T16:42:30.788941Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.12855"},"observation_digest":"sha256:ca5092d6a64c468c664192de62f5c908130ed9b01abe3cc0a9dc7d5c68395cec","observation_id":"c71ef73d-e629-4829-bd77-79b456a154dc","resolution":{"observed_at":"2026-08-06T16:42:30.788941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T16:28:54.067424Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13474","last_updated":"2025-07-17T18:33:50Z","snapshot_observed_at":"2026-08-06T16:21:22.177023Z","submitted_at":"2025-07-17T18:33:50Z","title":"Paper Summary Attack: Jailbreaking LLMs through LLM Safety Papers","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T16:28:54.067424Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.13474"},"observation_digest":"sha256:e73a23ad0cc3bb5324d85c1f33ce3c1ebb4d04d65637b227cd747b8a7b5b568e","observation_id":"6b688f2f-1418-4268-8b2c-054e0d455c8b","resolution":{"observed_at":"2026-08-06T16:28:54.067424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T16:24:30.380334Z","title":"Universal and transferable adversarial attacks on aligned language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13629","last_updated":"2025-07-18T03:41:18Z","snapshot_observed_at":"2026-08-06T16:17:24.952667Z","submitted_at":"2025-07-18T03:41:18Z","title":"Large Language Models in Cybersecurity: Applications, Vulnerabilities, and Defense Techniques","version":1},"reference_index":165,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:30.380334Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.13629"},"observation_digest":"sha256:9b901202c39beb182451b818b78f30f6e12c4c6d4d3aebb6bf3e123341f882bb","observation_id":"0b34dbed-1ad6-4c8e-a379-7265076398a4","resolution":{"observed_at":"2026-08-06T16:24:30.380334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T16:25:54.883404Z","title":"Universal and transferable adversarial attacks on aligned language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13761","last_updated":"2025-07-18T09:13:05Z","snapshot_observed_at":"2026-08-06T16:14:35.657196Z","submitted_at":"2025-07-18T09:13:05Z","title":"Innocence in the Crossfire: Roles of Skip Connections in Jailbreaking Visual Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T16:25:54.883404Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.13761"},"observation_digest":"sha256:83b488777cb6a40925156cb75940676964c22d565b752fe1acc9311e3f80bece","observation_id":"fa31761e-3949-45f7-ae22-ae12307ef775","resolution":{"observed_at":"2026-08-06T16:25:54.883404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T17:35:48.626472Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-06T17:26:43.433203Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.626472Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:a230168ef072816241fd5279a6bdb345f4bf778a70e09f968b39d81b2efaecd3","observation_id":"bba77999-6c87-41b9-bf16-cc2d7c3a81ad","resolution":{"observed_at":"2026-08-06T17:35:48.626472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T15:52:56.837539Z","title":"8 A Demo Website UI Interface Figure 7 illustrates the main interface of the demo website","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14799","last_updated":"2025-07-20T03:10:13Z","snapshot_observed_at":"2026-08-06T15:45:02.144047Z","submitted_at":"2025-07-20T03:10:13Z","title":"Manipulating LLM Web Agents with Indirect Prompt Injection Attack via HTML Accessibility Tree","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:52:56.837539Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.14799"},"observation_digest":"sha256:2fcd8bdbaf841629b340aea9e569edc343aad413d5297795a49bbd97db5cd9ab","observation_id":"72567c5b-b766-408c-84bc-fbb1cad14ede","resolution":{"observed_at":"2026-08-06T15:52:56.837539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T15:48:01.441397Z","title":"Zico Kolter, and Matt Fredrikson","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-06T15:41:01.200040Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.441397Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:88c3ae5b10112fbcf0488a8f07635dc68fb86139ee945072c052a6e577d21c76","observation_id":"05a11772-9b8d-4347-87ad-2ea278f2011e","resolution":{"observed_at":"2026-08-06T15:48:01.441397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T15:42:01.109613Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15219","last_updated":"2025-07-21T03:41:44Z","snapshot_observed_at":"2026-08-06T15:35:31.690602Z","submitted_at":"2025-07-21T03:41:44Z","title":"PromptArmor: Simple yet Effective Prompt Injection Defenses","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T15:42:01.109613Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.15219"},"observation_digest":"sha256:dc51efbc5ec53fcc1c281d6a7f1ba2aff5d7615993fa8911a13c2be91d94dcb1","observation_id":"e5fd10a6-b584-415e-a924-c1a1834b7ae5","resolution":{"observed_at":"2026-08-06T15:42:01.109613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T15:40:19.586657Z","title":"Z., and Fredrikson, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15349","last_updated":"2025-08-27T16:50:45Z","snapshot_observed_at":"2026-08-06T19:31:03.835404Z","submitted_at":"2025-07-21T08:01:43Z","title":"Scaling Decentralized Learning with FLock","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:19.586657Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.15349"},"observation_digest":"sha256:4e74981905417f17fc6ec2056386820a2043fb830476574eaa71dd4b98266a0b","observation_id":"46896952-598c-46e0-835f-975c032324c5","resolution":{"observed_at":"2026-08-06T15:40:19.586657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T15:32:52.962454Z","title":"Zou et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15613","last_updated":"2025-07-21T13:38:12Z","snapshot_observed_at":"2026-08-06T15:25:07.933809Z","submitted_at":"2025-07-21T13:38:12Z","title":"Multi-Stage Prompt Inference Attacks on Enterprise LLM Systems","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:52.962454Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.15613"},"observation_digest":"sha256:9c2d778199cb71f46a9cb44a83eb54c127e968d4df12a62311124704f3131a15","observation_id":"4109fe61-1555-4a87-afec-b2619bbd29d4","resolution":{"observed_at":"2026-08-06T15:32:52.962454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T15:07:29.257814Z","title":"Universal and transferable adversarial attacks on aligned language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16773","last_updated":"2025-07-22T17:21:36Z","snapshot_observed_at":"2026-08-06T14:59:38.375772Z","submitted_at":"2025-07-22T17:21:36Z","title":"When LLMs Copy to Think: Uncovering Copy-Guided Attacks in Reasoning LLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:29.257814Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.16773"},"observation_digest":"sha256:5b7f428f518aa8fc1c8093a2d322b477d206f941e0cf2f3d50ec069680fa0cec","observation_id":"2fc7540c-8fa6-4f35-9582-0abde34b4e65","resolution":{"observed_at":"2026-08-06T15:07:29.257814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T14:57:06.710356Z","title":"Universal and transferable adversarial attacks on aligned language models.arXiv preprint arXiv:2307.15043, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17257","last_updated":"2025-07-23T06:56:15Z","snapshot_observed_at":"2026-08-06T18:04:24.113657Z","submitted_at":"2025-07-23T06:56:15Z","title":"Agent Identity Evals: Measuring Agentic Identity","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T14:57:06.710356Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.17257"},"observation_digest":"sha256:60e1129b0243040b44e2881eb4d2d25569d2e877cbc1bfd18d09f8da37e18cf5","observation_id":"0d7e05da-9a35-4c94-9b5d-ee9effd20baf","resolution":{"observed_at":"2026-08-06T14:57:06.710356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T14:51:53.952177Z","title":"arXiv:2307.15043","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17477","last_updated":"2025-07-23T13:00:00Z","snapshot_observed_at":"2026-08-06T14:44:42.207359Z","submitted_at":"2025-07-23T13:00:00Z","title":"An Uncertainty-Driven Adaptive Self-Alignment Framework for Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.952177Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.17477"},"observation_digest":"sha256:1456118536720b0483e675f2d19383520abef953d751dd8b68a99206773d1f16","observation_id":"0ef33d82-3afb-4942-8a18-8c3bbd3e0cd9","resolution":{"observed_at":"2026-08-06T14:51:53.952177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T14:45:20.584079Z","title":"refusal to generate","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17922","last_updated":"2025-07-23T20:39:14Z","snapshot_observed_at":"2026-08-06T14:37:37.075855Z","submitted_at":"2025-07-23T20:39:14Z","title":"From Seed to Harvest: Augmenting Human Creativity with AI for Red-teaming Text-to-Image Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T14:45:20.584079Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.17922"},"observation_digest":"sha256:edb08020f4157bf74ce2b5a90f8cb4f30d9e2e414c9c18f3c026f869837b8049","observation_id":"67231121-8a7e-4839-b5ad-4050d547ecd5","resolution":{"observed_at":"2026-08-06T14:45:20.584079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T14:45:42.918332Z","title":"Universal and transferable adversarial attacks on aligned language models.arXiv preprint arXiv:2307.15043,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18105","last_updated":"2025-07-24T05:30:54Z","snapshot_observed_at":"2026-08-06T14:36:17.225757Z","submitted_at":"2025-07-24T05:30:54Z","title":"Understanding the Supply Chain and Risks of Large Language Model Applications","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T14:45:42.918332Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.18105"},"observation_digest":"sha256:9a9935b7406e9f71257a96f2942c5f2fb0772846d489d4389c8e3fc1e1b1ea5c","observation_id":"44dd8d47-a542-4d88-b2d7-e04cd9399c11","resolution":{"observed_at":"2026-08-06T14:45:42.918332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T14:42:08.218547Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18202","last_updated":"2025-07-24T08:58:41Z","snapshot_observed_at":"2026-08-06T14:35:57.710454Z","submitted_at":"2025-07-24T08:58:41Z","title":"Safeguarding RAG Pipelines with GMTP: A Gradient-based Masked Token Probability Method for Poisoned Document Detection","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T14:42:08.218547Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.18202"},"observation_digest":"sha256:7bd43265d09730bb7dd12c3ead5dde6cb3aa4a2ce790f6f5e01c389109b657b3","observation_id":"39d40f62-47b1-4f12-a3ce-39c1cd4c782c","resolution":{"observed_at":"2026-08-06T14:42:08.218547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T14:17:34.222274Z","title":"Zico Kolter, and Matt Fredrikson","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19598","last_updated":"2025-07-25T18:11:10Z","snapshot_observed_at":"2026-08-06T14:36:53.214750Z","submitted_at":"2025-07-25T18:11:10Z","title":"MOCHA: Are Code Language Models Robust Against Multi-Turn Malicious Coding Prompts?","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-06T14:17:34.222274Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.19598"},"observation_digest":"sha256:ab08ad57bfb407e547f224af4c737a57287fcf02ba5b2dbc5212586c1bf3aa1d","observation_id":"258945a3-61a4-4d26-ad7a-a680973cd1d1","resolution":{"observed_at":"2026-08-06T14:17:34.222274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T14:13:06.203975Z","title":"Zico Kolter, and Matt Fredrikson","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19672","last_updated":"2025-07-25T20:52:58Z","snapshot_observed_at":"2026-08-06T15:54:13.981735Z","submitted_at":"2025-07-25T20:52:58Z","title":"Alignment and Safety in Large Language Models: Safety Mechanisms, Training Paradigms, and Emerging Challenges","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-06T14:13:06.203975Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.19672"},"observation_digest":"sha256:746307ca2569e041f95a1c1cf503e81b1091496732d1418f8201b0aff56a9fd0","observation_id":"7824e3b7-baaa-4e5c-b1d7-1e519ffd28b0","resolution":{"observed_at":"2026-08-06T14:13:06.203975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T13:54:40.584133Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19894","last_updated":"2025-07-26T09:49:57Z","snapshot_observed_at":"2026-08-06T13:54:37.308959Z","submitted_at":"2025-07-26T09:49:57Z","title":"A Survey on Generative Model Unlearning: Fundamentals, Taxonomy, Evaluation, and Future Direction","version":1},"reference_index":271,"source":"pdf_text","source_observed_at":"2026-08-06T13:54:40.584133Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.19894"},"observation_digest":"sha256:8d23f428a9a42a009ffcd64cf0541e15ee9d8f950c0eb85ad805bf21bf89ded8","observation_id":"0689a87f-add5-4750-9a33-7b636a5c79eb","resolution":{"observed_at":"2026-08-06T13:54:40.584133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T15:10:29.544536Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21133","last_updated":"2025-07-22T14:13:08Z","snapshot_observed_at":"2026-08-06T15:04:03.484535Z","submitted_at":"2025-07-22T14:13:08Z","title":"Analysis of Threat-Based Manipulation in Large Language Models: A Dual Perspective on Vulnerabilities and Performance Enhancement Opportunities","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:10:29.544536Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.21133"},"observation_digest":"sha256:0c57b37ec25bf152b5a43e94f248db5f4ad3ef5c5f3b1dfd751e92b6c6ccf011","observation_id":"2c3fa86f-39a3-4e81-aef5-217f6cfced5e","resolution":{"observed_at":"2026-08-06T15:10:29.544536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T15:04:21.377383Z","title":"Universal and transferable adversarial attacks on aligned language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21134","last_updated":"2026-07-27T09:44:33Z","snapshot_observed_at":"2026-08-06T14:59:02.897315Z","submitted_at":"2025-07-22T17:52:29Z","title":"TRIDENT: Benchmarking LLM Safety in Finance, Medicine, and Law","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T15:04:21.377383Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.21134"},"observation_digest":"sha256:fc978ba19e998f51c4435dd2622a25cd403e8176f1d99a99f10da11f812eaeba","observation_id":"ee54552d-dc47-4001-9de5-3984dec23f87","resolution":{"observed_at":"2026-08-06T15:04:21.377383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2507.21540","last_updated":"2026-04-08T13:05:48Z","snapshot_observed_at":"2026-07-06T22:04:26.078628Z","submitted_at":"2025-07-29T07:13:56Z","title":"PRISM: Programmatic Reasoning with Image Sequence Manipulation for LVLM Jailbreaking","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-19T03:36:24.013477Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.21540"},"observation_digest":"sha256:da5552ace710156794300a37a25c9fcbdfa18db9e99038995507959aeff8605d","observation_id":"9b19ed04-201d-49af-ac45-199cae965ab4","resolution":{"observed_at":"2026-05-19T03:37:01.111600Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T12:18:37.932831Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21919","last_updated":"2025-07-30T10:11:59Z","snapshot_observed_at":"2026-08-06T12:18:32.619773Z","submitted_at":"2025-07-29T15:33:20Z","title":"Training language models to be warm and empathetic makes them less reliable and more sycophantic","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:37.932831Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.21919"},"observation_digest":"sha256:de5a18e94c4e0344dac741e28f1b47217510daa37de7e33f92bbfc0e9080aa8f","observation_id":"c4fdc14f-445e-4781-9f32-f9361afa7df3","resolution":{"observed_at":"2026-08-06T12:18:37.932831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T12:05:44.471626Z","title":"Universal and transferable adversarial attacks on aligned language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22160","last_updated":"2025-07-29T18:46:56Z","snapshot_observed_at":"2026-08-06T12:05:43.806101Z","submitted_at":"2025-07-29T18:46:56Z","title":"Strategic Deflection: Defending LLMs from Logit Manipulation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T12:05:44.471626Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.22160"},"observation_digest":"sha256:c4a5c9794ede313c0f8bbebe4879edbc21ad64ec4bd5b156227338cfce6a33f6","observation_id":"6ab8a4e0-999b-4b93-a1ca-820f02528e21","resolution":{"observed_at":"2026-08-06T12:05:44.471626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T10:13:24.003904Z","title":"Jailbreak chat: A benchmark for jailbreak detection in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00500","last_updated":"2026-08-03T00:31:29Z","snapshot_observed_at":"2026-08-06T21:19:27.088710Z","submitted_at":"2025-08-01T10:24:47Z","title":"ProbGuard: Proactive Runtime Monitoring for LLM Agent Safety via Probabilistic Prediction","version":4},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T10:13:24.003904Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2508.00500"},"observation_digest":"sha256:8ab6ec517435f9fe4288396194535135ac42784bc57faab546694158c8245b98","observation_id":"c7e21a6a-5c9e-4963-b3b2-45149780c19b","resolution":{"observed_at":"2026-08-06T10:13:24.003904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T05:53:58.417889Z","title":"Answer the question in English","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01198","last_updated":"2025-08-02T05:09:58Z","snapshot_observed_at":"2026-08-06T05:53:57.592883Z","submitted_at":"2025-08-02T05:09:58Z","title":"Adaptive Content Restriction for Large Language Models via Suffix Optimization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T05:53:58.417889Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2508.01198"},"observation_digest":"sha256:3899ccf1eba4a04561cca4ba26c116d72e7fa409fe6b0454b525733cd70462d8","observation_id":"63eef6ee-9127-41be-a63b-b15d1a0cda18","resolution":{"observed_at":"2026-08-06T05:53:58.417889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T05:43:40.073275Z","title":"Z.; and Fredrikson, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01306","last_updated":"2025-08-02T10:36:01Z","snapshot_observed_at":"2026-08-06T05:43:35.285627Z","submitted_at":"2025-08-02T10:36:01Z","title":"PUZZLED: Jailbreaking LLMs through Word-Based Puzzles","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T05:43:40.073275Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2508.01306"},"observation_digest":"sha256:8236ee5607b2f2dde1c9c4cdddd509daa71f95743b51dca97890cf07b1ea1ff1","observation_id":"d008524b-2600-43f7-aabf-d8db455af81e","resolution":{"observed_at":"2026-08-06T05:43:40.073275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T05:29:20.984433Z","title":"Universal and transferable adversarial attacks on aligned language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01781","last_updated":"2025-08-03T14:37:16Z","snapshot_observed_at":"2026-08-06T05:29:07.933755Z","submitted_at":"2025-08-03T14:37:16Z","title":"A comprehensive taxonomy of hallucinations in Large Language Models","version":1},"reference_index":108,"source":"pdf_text","source_observed_at":"2026-08-06T05:29:20.984433Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2508.01781"},"observation_digest":"sha256:c59be7917b8f69e9935654ee3b673cb165bf2e4e0789d3e7a20fca571d19774f","observation_id":"554aa273-f8f3-4e03-88a6-cfc38ee93423","resolution":{"observed_at":"2026-08-06T05:29:20.984433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2307.15043/citation-record","integrity":"/paper/2307.15043/integrity","json":"/paper/2307.15043/citation-record.json","paper":"/paper/2307.15043"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1804.07998","last_updated":"2018-09-24T20:29:35Z","snapshot_observed_at":"2026-07-06T06:34:41.441373Z","submitted_at":"2018-04-21T17:02:20Z","title":"Generating Natural Language Adversarial Examples","version":2},"cited_work":{"arxiv_id":"1804.07998","doi":null,"metadata_source":"pith","pith_arxiv_id":"1804.07998","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generating Natural Language Adversarial Examples","venue":"cs.CL","work_id":"f55a0f76-2c64-4349-91d9-cc64a1e0d033","year":2018},"citing_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-24T07:42:09.112946Z"},"links":{"cited_paper":"/paper/1804.07998","citing_paper":"/paper/2307.15043"},"observation_digest":"sha256:80ee8b8ccbac0647b98ee3e7135088a229a5a18981da4f01f200592558308bdf","observation_id":"ca4e928a-9d59-41b2-b973-a170c0b100b1","resolution":{"observed_at":"2026-05-24T07:44:08.458367Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":"2204.05862","doi":"10.1016/j.respol.2005.01.014","metadata_source":"pith","pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","venue":"cs.CL","work_id":"a1f2574b-a899-4713-be60-c87ba332656c","year":2022},"citing_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-24T07:42:09.112946Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2307.15043"},"observation_digest":"sha256:8cd43e3a1053cd2fa34f8a80b047d4c412d05cce7802ff8f7a4d5f447f438762","observation_id":"b2f5e9bd-290b-470c-9202-5eb960eee6c9","resolution":{"observed_at":"2026-05-24T07:44:08.438344Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evasion attacks against machine learning at test time","venue":null,"work_id":"c42e0f74-6ecb-451a-9118-1dd241d5eb86","year":2013},"citing_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-24T07:42:09.112946Z"},"links":{"citing_paper":"/paper/2307.15043"},"observation_digest":"sha256:4dda221969363ea0da692eb0256463ce3aee185c05e9c6792822a8ea67622ae5","observation_id":"6a9e9bee-8dd3-4138-a99f-f2f458f35de7","resolution":{"observed_at":"2026-05-24T07:44:08.931997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15447","last_updated":"2024-05-06T06:36:24Z","snapshot_observed_at":"2026-08-03T21:29:11.660688Z","submitted_at":"2023-06-26T17:18:44Z","title":"Are aligned neural networks adversarially aligned?","version":2},"cited_work":{"arxiv_id":"2306.15447","doi":"10.48550/arxiv.2306.15447","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.15447","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adversarial examples are not easily detected: Bypassing ten detection methods","venue":"arXiv (Cornell University)","work_id":"cbf9eae3-40c5-419a-9f5b-335eab5a2bb2","year":2023},"citing_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-24T07:42:09.112946Z"},"links":{"cited_paper":"/paper/2306.15447","citing_paper":"/paper/2307.15043"},"observation_digest":"sha256:610be1d6ad1e110fe60da4d29e9b127f988161ff1fcb7eed064b75bf428e503a","observation_id":"70b52c00-5d1e-4019-8c6b-dbede855f858","resolution":{"observed_at":"2026-05-24T07:44:08.583092Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14314","last_updated":"2023-05-23T17:50:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-23T17:50:33Z","title":"QLoRA: Efficient Finetuning of Quantized LLMs","version":1},"cited_work":{"arxiv_id":"2305.14314","doi":"10.1007/978-3-031-86644-9","metadata_source":"pith","pith_arxiv_id":"2305.14314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"QLoRA: Efficient Finetuning of Quantized LLMs","venue":"cs.LG","work_id":"d3fdf68e-3a5e-48b5-8a18-7a9137479c55","year":2023},"citing_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-24T07:42:09.112946Z"},"links":{"cited_paper":"/paper/2305.14314","citing_paper":"/paper/2307.15043"},"observation_digest":"sha256:4e0edd6889319e3d814bc6d565902f12e3d57c1b27b1b4d3909fef282fb44ed5","observation_id":"4a777885-6e35-43da-8749-bb209fb2e591","resolution":{"observed_at":"2026-05-24T07:44:08.576786Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.06751","last_updated":"2018-05-24T16:43:45Z","snapshot_observed_at":"2026-07-06T06:15:02.045009Z","submitted_at":"2017-12-19T02:15:19Z","title":"HotFlip: White-Box Adversarial Examples for Text Classification","version":2},"cited_work":{"arxiv_id":"1712.06751","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.06751","snapshot_observed_at":"2026-07-04T21:00:09.078340Z","title":"HotFlip: White-Box Adversarial Examples for Text Classification","venue":"cs.CL","work_id":"4437bc40-bf35-46a7-adb4-3051437b4028","year":2017},"citing_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-24T07:42:09.112946Z"},"links":{"cited_paper":"/paper/1712.06751","citing_paper":"/paper/2307.15043"},"observation_digest":"sha256:448515657fab6c17104870921c6f8248a5b58ca97fc802940b17886480aa1aa9","observation_id":"97d41f36-9e04-4305-898e-8d65624e5c6f","resolution":{"observed_at":"2026-05-24T07:44:08.570834Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14375","last_updated":"2022-09-28T19:04:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-28T19:04:43Z","title":"Improving alignment of dialogue agents via targeted human judgements","version":1},"cited_work":{"arxiv_id":"2209.14375","doi":"10.48550/arxiv.2209.14375","metadata_source":"pith","pith_arxiv_id":"2209.14375","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving alignment of dialogue agents via targeted human judgements","venue":"cs.LG","work_id":"6ad5970e-7550-4ae8-a158-7084dec7e3cc","year":2022},"citing_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-24T07:42:09.112946Z"},"links":{"cited_paper":"/paper/2209.14375","citing_paper":"/paper/2307.15043"},"observation_digest":"sha256:13010e4d1cfdd4cd7eb2cdc89bf39c66e5359c989f57dba53f1f40f8659399c4","observation_id":"d5dc8f3f-5cae-44a5-9567-4dfa8e5f5e6e","resolution":{"observed_at":"2026-05-24T07:44:08.427372Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6572","last_updated":"2015-03-20T20:19:16Z","snapshot_observed_at":"2026-07-06T04:04:16.777653Z","submitted_at":"2014-12-20T01:17:12Z","title":"Explaining and Harnessing Adversarial Examples","version":3},"cited_work":{"arxiv_id":"1412.6572","doi":"10.48550/arxiv.1412.6572","metadata_source":"pith","pith_arxiv_id":"1412.6572","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Explaining and Harnessing Adversarial Examples","venue":"stat.ML","work_id":"2cedf8f6-7539-4c49-8136-f42a20487146","year":2014},"citing_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-24T07:42:09.112946Z"},"links":{"cited_paper":"/paper/1412.6572","citing_paper":"/paper/2307.15043"},"observation_digest":"sha256:84b19cd0b80c212badd8da94e902f84e105673661f59a73b799475601c6fc514","observation_id":"f7530c69-8ed4-4384-bf38-f51aeeed4585","resolution":{"observed_at":"2026-05-24T07:44:08.565407Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.13733","last_updated":"2021-04-15T17:43:43Z","snapshot_observed_at":"2026-07-06T11:04:24.086263Z","submitted_at":"2021-04-15T17:43:43Z","title":"Gradient-based Adversarial Attacks against Text Transformers","version":1},"cited_work":{"arxiv_id":"2104.13733","doi":"10.48550/arxiv.2104.13733","metadata_source":"arxiv_reference","pith_arxiv_id":"2104.13733","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gradient-based adversarial attacks against text transform- ers.arXiv:2104.13733","venue":"arXiv (Cornell University)","work_id":"21585bac-bb88-4c9d-b6cb-207d33047b6b","year":2021},"citing_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-24T07:42:09.112946Z"},"links":{"cited_paper":"/paper/2104.13733","citing_paper":"/paper/2307.15043"},"observation_digest":"sha256:edf1c89c3e6b829f7a0ef19ef3b1d71bf5d06a405f3b8075ce34356d757a9862","observation_id":"d85c7d76-6cfc-4435-86f8-85b94843a510","resolution":{"observed_at":"2026-05-24T07:44:08.560184Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.07328","last_updated":"2017-07-23T18:26:29Z","snapshot_observed_at":"2026-07-06T05:52:19.613514Z","submitted_at":"2017-07-23T18:26:29Z","title":"Adversarial Examples for Evaluating Reading Comprehension Systems","version":1},"cited_work":{"arxiv_id":"1707.07328","doi":null,"metadata_source":"pith","pith_arxiv_id":"1707.07328","snapshot_observed_at":"2026-07-01T10:05:40.430723Z","title":"Adversarial Examples for Evaluating Reading Comprehension Systems","venue":"cs.CL","work_id":"053f3b94-dd53-46fe-822a-5eb03810daf8","year":2017},"citing_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-24T07:42:09.112946Z"},"links":{"cited_paper":"/paper/1707.07328","citing_paper":"/paper/2307.15043"},"observation_digest":"sha256:9313de1fd1db73b545b65705214923340645271eaf5f16db1a5b1ad11e7541f4","observation_id":"e297ad03-7c85-42a5-bc48-d7e4bd71d09e","resolution":{"observed_at":"2026-05-24T07:44:08.553572Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04381","last_updated":"2023-03-08T05:09:59Z","snapshot_observed_at":"2026-07-06T15:00:01.455874Z","submitted_at":"2023-03-08T05:09:59Z","title":"Automatically Auditing Large Language Models via Discrete Optimization","version":1},"cited_work":{"arxiv_id":"2303.04381","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.04381","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Automatically auditing large language models via discrete optimization","venue":null,"work_id":"25b6d6f0-fd83-4f8f-8056-9496fa68278e","year":2023},"citing_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-24T07:42:09.112946Z"},"links":{"cited_paper":"/paper/2303.04381","citing_paper":"/paper/2307.15043"},"observation_digest":"sha256:24102beca6d346752ebf7b93cdf97719c0cfa398688f523b0c3db99a1cf61577","observation_id":"2057dccc-700a-4cf2-9f2f-cc98e76fe724","resolution":{"observed_at":"2026-05-24T07:44:08.444210Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-07-06T07:15:51.575438Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":"1811.07871","doi":"10.48550/arxiv.1811.07871","metadata_source":"pith","pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":"cs.LG","work_id":"1e9c4f6d-b369-4bd2-8e6e-1ec00318c924","year":2018},"citing_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-24T07:42:09.112946Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2307.15043"},"observation_digest":"sha256:4cb58d6d6018a1a335b811fd5fd0bcb366d89fda1413d2ece57e15efc0666af5","observation_id":"321cb681-049f-486e-96dc-72cd871218ab","resolution":{"observed_at":"2026-05-24T07:44:08.548111Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08691","last_updated":"2021-09-02T17:34:41Z","snapshot_observed_at":"2026-08-06T15:24:34.790850Z","submitted_at":"2021-04-18T03:19:26Z","title":"The Power of Scale for Parameter-Efficient Prompt Tuning","version":2},"cited_work":{"arxiv_id":"2104.08691","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.08691","snapshot_observed_at":"2026-07-04T14:59:55.372222Z","title":"The Power of Scale for Parameter-Efficient Prompt Tuning","venue":"cs.CL","work_id":"1056ba8e-7b3f-4811-be8e-9a3ed9269acb","year":2021},"citing_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-24T07:42:09.112946Z"},"links":{"cited_paper":"/paper/2104.08691","citing_paper":"/paper/2307.15043"},"observation_digest":"sha256:8a4ed31d0317e2bec9783b209edbd51bec79a115d19bbd1aabb033afbc368ccd","observation_id":"0f77806a-b0a6-430c-a32d-59bb0a883152","resolution":{"observed_at":"2026-05-24T07:44:08.432848Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sok: Certified robustness for deep neural networks","venue":null,"work_id":"a8a4af07-5229-423d-ade0-1d5470d92abf","year":2023},"citing_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-24T07:42:09.112946Z"},"links":{"citing_paper":"/paper/2307.15043"},"observation_digest":"sha256:4e3e13943e7bb663ebd971f99a0cef925a97a13ebe3b47c67554bf6a8ccb1e9a","observation_id":"1ecd6f6f-ef44-4f02-8e17-ff3599895285","resolution":{"observed_at":"2026-05-24T07:44:08.935695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.02757","last_updated":"2021-04-06T19:39:05Z","snapshot_observed_at":"2026-07-06T10:57:01.205276Z","submitted_at":"2021-04-06T19:39:05Z","title":"Exploring Targeted Universal Adversarial Perturbations to End-to-end ASR Models","version":1},"cited_work":{"arxiv_id":"2104.02757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.02757","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring targeted universal adversarial perturbations to end-to-end asr models","venue":null,"work_id":"c5d492f3-4c1e-4d88-a301-b879c204ab3c","year":null},"citing_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-24T07:42:09.112946Z"},"links":{"cited_paper":"/paper/2104.02757","citing_paper":"/paper/2307.15043"},"observation_digest":"sha256:49bdc776898ae59309fee3e71545069e4ffb07928d0ea53fee36d45be7288b12","observation_id":"b979029f-6eec-4452-a10f-2985c4c8fd37","resolution":{"observed_at":"2026-05-24T07:44:08.543081Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04237","last_updated":"2023-05-29T17:06:45Z","snapshot_observed_at":"2026-08-04T04:47:40.318963Z","submitted_at":"2023-02-08T18:07:31Z","title":"Black Box Adversarial Prompting for Foundation Models","version":2},"cited_work":{"arxiv_id":"2302.04237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2302.04237","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Natalie Maus, Patrick Chao, Eric Wong, and Jacob Gardner","venue":null,"work_id":"f6631cc1-8180-4919-9697-a371945de572","year":2023},"citing_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-24T07:42:09.112946Z"},"links":{"cited_paper":"/paper/2302.04237","citing_paper":"/paper/2307.15043"},"observation_digest":"sha256:26e51c372657bb3b557351d6b1d24306198fe77d4356e61f8b8a203a83b638a0","observation_id":"d76ba06f-d1c6-48a0-b92b-75a91a292791","resolution":{"observed_at":"2026-05-24T07:44:08.537226Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.03828","last_updated":"2019-08-15T05:15:43Z","snapshot_observed_at":"2026-08-01T00:27:10.219357Z","submitted_at":"2019-05-09T19:35:30Z","title":"Universal Adversarial Perturbations for Speech Recognition Systems","version":2},"cited_work":{"arxiv_id":"1905.03828","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1905.03828","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Universal adversarial perturbations for speech recognition systems","venue":null,"work_id":"cf250529-ca6a-4413-974a-2fe44ba6fd9b","year":1905},"citing_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-24T07:42:09.112946Z"},"links":{"cited_paper":"/paper/1905.03828","citing_paper":"/paper/2307.15043"},"observation_digest":"sha256:4e4a8373174c4d2bb455c5772d3d5e9b61e0f0981ff838cf8bcbe4d59eddffff","observation_id":"ac6388fc-d75b-4f5b-a80b-472482296aca","resolution":{"observed_at":"2026-05-24T07:44:08.531019Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1605.07277","last_updated":"2016-05-24T03:27:48Z","snapshot_observed_at":"2026-07-06T04:57:19.691523Z","submitted_at":"2016-05-24T03:27:48Z","title":"Transferability in Machine Learning: from Phenomena to Black-Box Attacks using Adversarial Samples","version":1},"cited_work":{"arxiv_id":"1605.07277","doi":null,"metadata_source":"pith","pith_arxiv_id":"1605.07277","snapshot_observed_at":"2026-07-10T20:07:33.433424Z","title":"Transferability in Machine Learning: from Phenomena to Black-Box Attacks using Adversarial Samples","venue":"cs.CR","work_id":"99873b2b-3bd9-4521-9025-ca2d25bab2c7","year":2016},"citing_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-24T07:42:09.112946Z"},"links":{"cited_paper":"/paper/1605.07277","citing_paper":"/paper/2307.15043"},"observation_digest":"sha256:dea16647aa7ef727a0011998104c00443406add152412ec35ce5e1061374471b","observation_id":"d83fd42c-7ee9-4e4a-9ba9-b8cea034257a","resolution":{"observed_at":"2026-05-24T07:44:08.523743Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01116","last_updated":"2023-06-01T20:03:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-01T20:03:56Z","title":"The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only","version":1},"cited_work":{"arxiv_id":"2306.01116","doi":"10.48550/arxiv.2306.01116","metadata_source":"pith","pith_arxiv_id":"2306.01116","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only","venue":"cs.CL","work_id":"edfb45ee-84c2-4531-b3cd-bd8eb830f4e1","year":2023},"citing_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-24T07:42:09.112946Z"},"links":{"cited_paper":"/paper/2306.01116","citing_paper":"/paper/2307.15043"},"observation_digest":"sha256:d5d353ea61ca2fccbfa5abe5be78093f7fa917ff27c84bad0081f84786d90b83","observation_id":"c0389a04-54c2-4631-9fdd-c8aa7ef0fd9c","resolution":{"observed_at":"2026-05-24T07:44:08.464630Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.15980","last_updated":"2020-11-07T05:33:35Z","snapshot_observed_at":"2026-08-05T14:17:34.026911Z","submitted_at":"2020-10-29T22:54:00Z","title":"AutoPrompt: Eliciting Knowledge from Language Models with Automatically Generated Prompts","version":2},"cited_work":{"arxiv_id":"2010.15980","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.15980","snapshot_observed_at":"2026-07-10T15:27:20.065753Z","title":"L., Wallace, E., and Singh, S","venue":"cs.CL","work_id":"1b968c9c-9b73-409a-aa88-57e02917679c","year":2020},"citing_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-24T07:42:09.112946Z"},"links":{"cited_paper":"/paper/2010.15980","citing_paper":"/paper/2307.15043"},"observation_digest":"sha256:a80ced927f5e433a55ad6b7e3cd61fcd75c2b23a982b0d1d577153c7108a42b9","observation_id":"1045f988-1058-450c-9c07-c2c184a9cd74","resolution":{"observed_at":"2026-05-24T07:44:08.517831Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-02T11:57:18.735747Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-24T07:42:09.112946Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2307.15043"},"observation_digest":"sha256:a146a6525b6e60993c6ea20dd159431de827ee4803eabb66df5178f20047b1cb","observation_id":"3831fdf3-9c73-4317-93af-53f49c229acb","resolution":{"observed_at":"2026-05-24T07:44:08.512307Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.03453","last_updated":"2017-05-23T18:14:30Z","snapshot_observed_at":"2026-07-06T05:37:27.385512Z","submitted_at":"2017-04-11T17:59:12Z","title":"The Space of Transferable Adversarial Examples","version":2},"cited_work":{"arxiv_id":"1704.03453","doi":null,"metadata_source":"pith","pith_arxiv_id":"1704.03453","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Space of Transferable Adversarial Examples","venue":"stat.ML","work_id":"178c76d7-e76a-44a0-bc5b-5692e305cfe2","year":2017},"citing_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-24T07:42:09.112946Z"},"links":{"cited_paper":"/paper/1704.03453","citing_paper":"/paper/2307.15043"},"observation_digest":"sha256:632c83cba108d7d5edaf293c63d7d27d52690a9bd4a39ef8e38b511fa0b80084","observation_id":"023b5a70-651b-4c14-b264-82fadcd3dcd6","resolution":{"observed_at":"2026-05-24T07:44:08.506484Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.07125","last_updated":"2021-01-03T19:58:55Z","snapshot_observed_at":"2026-07-06T08:15:25.894149Z","submitted_at":"2019-08-20T01:51:40Z","title":"Universal Adversarial Triggers for Attacking and Analyzing NLP","version":3},"cited_work":{"arxiv_id":"1908.07125","doi":"10.48550/arxiv.1908.07125","metadata_source":"arxiv_reference","pith_arxiv_id":"1908.07125","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Universal adversarial triggers for attacking and analyz- ing nlp.arXiv:1908.07125","venue":null,"work_id":"1c27ffe0-d906-454c-8e9c-acb6779148d2","year":1908},"citing_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-24T07:42:09.112946Z"},"links":{"cited_paper":"/paper/1908.07125","citing_paper":"/paper/2307.15043"},"observation_digest":"sha256:b6e04a9e2c7eaa2288f146d3490b4720272f7b2b3ccecad135eada12b0e6ab51","observation_id":"51751e4c-a6b8-468f-8be4-42ff42147cec","resolution":{"observed_at":"2026-05-24T07:44:08.501178Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02840","last_updated":"2022-01-10T06:05:16Z","snapshot_observed_at":"2026-07-06T12:05:25.336577Z","submitted_at":"2021-11-04T12:59:55Z","title":"Adversarial GLUE: A Multi-Task Benchmark for Robustness Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2111.02840","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.02840","snapshot_observed_at":"2026-07-03T01:37:30.523597Z","title":"Adversarial glue: A multi-task benchmark for robustness evaluation of language models","venue":null,"work_id":"445f4304-a89d-4e75-9f0f-22daeadcf559","year":2021},"citing_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-24T07:42:09.112946Z"},"links":{"cited_paper":"/paper/2111.02840","citing_paper":"/paper/2307.15043"},"observation_digest":"sha256:d284fdf3e059a244820aaf6ecadb02e85bf7b2bb241c84b0da1caca876035c3e","observation_id":"299597fc-8011-4ba3-900f-bd62627e7964","resolution":{"observed_at":"2026-05-24T07:44:08.495253Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02483","last_updated":"2023-07-05T17:58:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-05T17:58:10Z","title":"Jailbroken: How Does LLM Safety Training Fail?","version":1},"cited_work":{"arxiv_id":"2307.02483","doi":"10.48550/arxiv.2307.02483","metadata_source":"pith","pith_arxiv_id":"2307.02483","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jailbroken: How Does LLM Safety Training Fail?","venue":"cs.LG","work_id":"a0b5df13-7a81-4b15-afb4-c715e6b400bc","year":2023},"citing_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-24T07:42:09.112946Z"},"links":{"cited_paper":"/paper/2307.02483","citing_paper":"/paper/2307.15043"},"observation_digest":"sha256:afe719c254bfbd2e3c7c60cffe33f028aeb0fa9608975b8a26c4cd3d468b6b94","observation_id":"3bd9b335-1537-4360-a4d6-67d4c015a45d","resolution":{"observed_at":"2026-05-24T07:44:08.488843Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:25.377799+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:25.377799+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03668","last_updated":"2023-06-01T12:26:45Z","snapshot_observed_at":"2026-07-06T14:49:23.099154Z","submitted_at":"2023-02-07T18:40:18Z","title":"Hard Prompts Made Easy: Gradient-Based Discrete Optimization for Prompt Tuning and Discovery","version":2},"cited_work":{"arxiv_id":"2302.03668","doi":"10.48550/arxiv.2302.03668","metadata_source":"arxiv_reference","pith_arxiv_id":"2302.03668","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hard prompts made easy: Gradient-based discrete optimization for prompt tuning and discovery","venue":"arXiv (Cornell University)","work_id":"584dc6bf-7262-4b56-a62a-fdb564b98d2d","year":2023},"citing_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-24T07:42:09.112946Z"},"links":{"cited_paper":"/paper/2302.03668","citing_paper":"/paper/2307.15043"},"observation_digest":"sha256:ebb4c473de21f0445976f4c6f498d764dcc40f0403f58a7e33b58a1c083afd9d","observation_id":"e62e4a33-f511-4137-b300-e7a0247455d2","resolution":{"observed_at":"2026-05-24T07:44:08.477006Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11082","last_updated":"2024-06-03T12:19:16Z","snapshot_observed_at":"2026-07-06T15:18:26.300068Z","submitted_at":"2023-04-19T17:50:09Z","title":"Fundamental Limitations of Alignment in Large Language Models","version":6},"cited_work":{"arxiv_id":"2304.11082","doi":"10.48550/arxiv.2304.11082","metadata_source":"arxiv_reference","pith_arxiv_id":"2304.11082","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fundamental limitations of alignment in large language models","venue":"arXiv (Cornell University)","work_id":"818b2f89-488c-4c42-beee-dc4ed4223978","year":2024},"citing_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-24T07:42:09.112946Z"},"links":{"cited_paper":"/paper/2304.11082","citing_paper":"/paper/2307.15043"},"observation_digest":"sha256:a940c7a02e0effc7e92a6969b1656f921c7a5fb1a041c8ac33750731e716b69e","observation_id":"3efae1f4-54d7-4687-aafa-7b082e8c0467","resolution":{"observed_at":"2026-05-24T07:44:08.470910Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":"2306.05685","doi":"10.1109/4235.797969","metadata_source":"pith","pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","venue":"cs.CL","work_id":"d0c30cd7-81e1-4159-a87f-f6adca77ff08","year":2023},"citing_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-24T07:42:09.112946Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2307.15043"},"observation_digest":"sha256:d2d4834f1e21139a3029a574197e4d176034fd2c53d517306a0b5d8621ac348e","observation_id":"cebe60e5-147d-4845-8fa1-b8dd4a3d0d07","resolution":{"observed_at":"2026-05-24T07:44:08.450809Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04528","last_updated":"2024-07-16T07:29:49Z","snapshot_observed_at":"2026-07-06T15:39:49.273453Z","submitted_at":"2023-06-07T15:37:00Z","title":"PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts","version":5},"cited_work":{"arxiv_id":"2306.04528","doi":"10.48550/arxiv.2306.04528","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.04528","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Promptbench: Towards evaluating the robustness of large language models on adversarial prompts","venue":"arXiv (Cornell University)","work_id":"e65e5731-8f09-44e1-94d5-1674f9e08988","year":2024},"citing_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-24T07:42:09.112946Z"},"links":{"cited_paper":"/paper/2306.04528","citing_paper":"/paper/2307.15043"},"observation_digest":"sha256:1e9e7270be216b4f53908bbfbf2005d41878f6a2045e4b251a69383b1a51664e","observation_id":"2b2e6116-13c7-4016-8e76-f738ee64014d","resolution":{"observed_at":"2026-05-24T07:44:08.483210Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":0,"verified_exact":23,"verified_fuzzy":2},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 100 inbound Pith citation observations for arXiv:2307.15043."}