{"as_of":"2026-08-17T14:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:02e85af08f685772859b9f20caff23184458f22161fdefcd4e801010c82667a7","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":33,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:28:48.859908Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":5,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.09154","last_updated":"2025-03-03T09:37:27Z","snapshot_observed_at":"2026-08-16T14:18:39.959590Z","submitted_at":"2024-02-14T13:13:26Z","title":"Attacking Large Language Models with Projected Gradient Descent","version":2},"cited_work":{"arxiv_id":"2402.09154","doi":"10.48550/arxiv.2402.09154","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09154","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Attacking large language mod- els with projected gradient descent","venue":"arXiv (Cornell University)","work_id":"f8aa89f0-9d68-4ed9-b8fd-c3656e3a9de3","year":2024},"citing_paper":{"arxiv_id":"2310.03684","last_updated":"2024-06-11T19:02:52Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:01:53Z","title":"SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-14T17:11:00.639293Z"},"links":{"cited_paper":"/paper/2402.09154","citing_paper":"/paper/2310.03684"},"observation_digest":"sha256:eae97c0062c1e592b598e2d02219adb577ccfa2f0c36edccbbd8cef770846dc3","observation_id":"cd7ed140-9c2e-4f02-bcf7-da743d17a18b","resolution":{"observed_at":"2026-05-14T17:11:00.698921Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09154","last_updated":"2025-03-03T09:37:27Z","snapshot_observed_at":"2026-08-16T14:18:39.959590Z","submitted_at":"2024-02-14T13:13:26Z","title":"Attacking Large Language Models with Projected Gradient Descent","version":2},"cited_work":{"arxiv_id":"2402.09154","doi":"10.48550/arxiv.2402.09154","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09154","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Attacking large language mod- els with projected gradient descent","venue":"arXiv (Cornell University)","work_id":"f8aa89f0-9d68-4ed9-b8fd-c3656e3a9de3","year":2024},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-11T16:28:21.917686Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"cited_paper":"/paper/2402.09154","citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:35987eeb054563a6b41af671fae73c4a0192124e8f366e68f6ec189047cbf1ec","observation_id":"dcd6d2d5-77a7-4685-a090-86134a0fa128","resolution":{"observed_at":"2026-05-15T06:08:05.581194Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09154","last_updated":"2025-03-03T09:37:27Z","snapshot_observed_at":"2026-08-16T14:18:39.959590Z","submitted_at":"2024-02-14T13:13:26Z","title":"Attacking Large Language Models with Projected Gradient Descent","version":2},"cited_work":{"arxiv_id":"2402.09154","doi":"10.48550/arxiv.2402.09154","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09154","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Attacking large language mod- els with projected gradient descent","venue":"arXiv (Cornell University)","work_id":"f8aa89f0-9d68-4ed9-b8fd-c3656e3a9de3","year":2024},"citing_paper":{"arxiv_id":"2407.04295","last_updated":"2024-08-30T11:57:47Z","snapshot_observed_at":"2026-08-12T17:45:10.384900Z","submitted_at":"2024-07-05T06:57:30Z","title":"Jailbreak Attacks and Defenses Against Large Language Models: A Survey","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T02:20:44.368219Z"},"links":{"cited_paper":"/paper/2402.09154","citing_paper":"/paper/2407.04295"},"observation_digest":"sha256:abab8482505ae9c3bd0e79d3a33a1b5bab1df65e7cfe56fa46b9ac72bc16b5e1","observation_id":"cc169369-d863-4cf4-b57c-c8a5fa95f46d","resolution":{"observed_at":"2026-05-15T02:20:44.639144Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09154","last_updated":"2025-03-03T09:37:27Z","snapshot_observed_at":"2026-08-16T14:18:39.959590Z","submitted_at":"2024-02-14T13:13:26Z","title":"Attacking Large Language Models with Projected Gradient Descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09154","snapshot_observed_at":"2026-08-12T15:57:06.132379Z","title":"Attacking large language models with projected gradient descent,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15222","last_updated":"2024-11-21T02:46:04Z","snapshot_observed_at":"2026-08-14T11:31:32.382799Z","submitted_at":"2024-11-21T02:46:04Z","title":"Rethinking the Intermediate Features in Adversarial Attacks: Misleading Robotic Models via Adversarial Distillation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:06.132379Z"},"links":{"cited_paper":"/paper/2402.09154","citing_paper":"/paper/2411.15222"},"observation_digest":"sha256:1b6c2cc3bb687ded492d9c9b917c1e38d4fb251e57a348ca18d766a2829e96fc","observation_id":"6448b82d-8a67-444c-98d4-f9be429bdc3f","resolution":{"observed_at":"2026-08-12T15:57:06.132379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09154","last_updated":"2025-03-03T09:37:27Z","snapshot_observed_at":"2026-08-16T14:18:39.959590Z","submitted_at":"2024-02-14T13:13:26Z","title":"Attacking Large Language Models with Projected Gradient Descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09154","snapshot_observed_at":"2026-08-11T20:53:36.949947Z","title":"Attacking large language models with projected gradient descent.arXiv preprint arXiv:2402.09154, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05232","last_updated":"2025-07-03T18:06:35Z","snapshot_observed_at":"2026-08-14T13:58:04.180134Z","submitted_at":"2024-12-06T18:02:59Z","title":"LIAR: Leveraging Inference Time Alignment (Best-of-N) to Jailbreak LLMs in Seconds","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T20:53:36.949947Z"},"links":{"cited_paper":"/paper/2402.09154","citing_paper":"/paper/2412.05232"},"observation_digest":"sha256:ac4be947e24359ac8f7cdafb63ffa69c2dd885de2bddcef0cdcdf7c78e138e33","observation_id":"c2f0d227-a640-4fe8-ab2f-a9062f9a3346","resolution":{"observed_at":"2026-08-11T20:53:36.949947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09154","last_updated":"2025-03-03T09:37:27Z","snapshot_observed_at":"2026-08-16T14:18:39.959590Z","submitted_at":"2024-02-14T13:13:26Z","title":"Attacking Large Language Models with Projected Gradient Descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09154","snapshot_observed_at":"2026-08-11T18:42:33.351242Z","title":"Attacking Large Language Models with Projected Gradient Descent.arXiv preprint arXiv:2402.09154","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07634","last_updated":"2024-12-10T16:13:59Z","snapshot_observed_at":"2026-08-12T05:35:35.248416Z","submitted_at":"2024-12-10T16:13:59Z","title":"Improving the Robustness of the Projected Gradient Descent Method for Nonlinear Constrained Optimization Problems in Topology Optimization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T18:42:33.351242Z"},"links":{"cited_paper":"/paper/2402.09154","citing_paper":"/paper/2412.07634"},"observation_digest":"sha256:d43373aeba40af71af44afd4910f80ef9426fd8271ad5034d3611a48afa57241","observation_id":"bfd9486a-9c6d-471f-9738-f76846e34efa","resolution":{"observed_at":"2026-08-11T18:42:33.351242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09154","last_updated":"2025-03-03T09:37:27Z","snapshot_observed_at":"2026-08-16T14:18:39.959590Z","submitted_at":"2024-02-14T13:13:26Z","title":"Attacking Large Language Models with Projected Gradient Descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09154","snapshot_observed_at":"2026-08-11T05:31:31.576750Z","title":"a ger, MHI Abdalla, Johannes Gasteiger, and Stephan G \\","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17522","last_updated":"2025-01-05T04:44:32Z","snapshot_observed_at":"2026-08-15T15:38:59.741982Z","submitted_at":"2024-12-23T12:44:54Z","title":"DiffusionAttacker: Diffusion-Driven Prompt Manipulation for LLM Jailbreak","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T05:31:31.576750Z"},"links":{"cited_paper":"/paper/2402.09154","citing_paper":"/paper/2412.17522"},"observation_digest":"sha256:da3c743fc6a66abee80943d02ffd02c2e3e3c2d56059d607edeb15a73d991e0c","observation_id":"66422da4-9284-4434-adf0-a283237a2e44","resolution":{"observed_at":"2026-08-11T05:31:31.576750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09154","last_updated":"2025-03-03T09:37:27Z","snapshot_observed_at":"2026-08-16T14:18:39.959590Z","submitted_at":"2024-02-14T13:13:26Z","title":"Attacking Large Language Models with Projected Gradient Descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09154","snapshot_observed_at":"2026-08-10T23:40:18.803840Z","title":", author Wollschläger, T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20087","last_updated":"2024-12-28T09:08:37Z","snapshot_observed_at":"2026-08-15T12:46:32.785416Z","submitted_at":"2024-12-28T09:08:37Z","title":"On the Validity of Traditional Vulnerability Scoring Systems for Adversarial Attacks against LLMs","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-10T23:40:18.803840Z"},"links":{"cited_paper":"/paper/2402.09154","citing_paper":"/paper/2412.20087"},"observation_digest":"sha256:d7fab20c9916dc6ef0f4e65195d1bf475713144394f356570bed7853467378c0","observation_id":"d32d0ce5-0404-4151-80cb-80fb5e2ceb31","resolution":{"observed_at":"2026-08-10T23:40:18.803840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09154","last_updated":"2025-03-03T09:37:27Z","snapshot_observed_at":"2026-08-16T14:18:39.959590Z","submitted_at":"2024-02-14T13:13:26Z","title":"Attacking Large Language Models with Projected Gradient Descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09154","snapshot_observed_at":"2026-08-10T18:07:46.811659Z","title":"arXiv preprint arXiv:2402.09154 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11621","last_updated":"2025-01-20T17:36:04Z","snapshot_observed_at":"2026-08-14T11:36:00.851001Z","submitted_at":"2025-01-20T17:36:04Z","title":"Trojan Detection Through Pattern Recognition for Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T18:07:46.811659Z"},"links":{"cited_paper":"/paper/2402.09154","citing_paper":"/paper/2501.11621"},"observation_digest":"sha256:c10eb4abc8c7a2d384c3c3f274fa5c03b86c87dd965b626da824708d1cbffa8e","observation_id":"a48861e3-38af-4701-99f2-bc6ad706a53b","resolution":{"observed_at":"2026-08-10T18:07:46.811659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09154","last_updated":"2025-03-03T09:37:27Z","snapshot_observed_at":"2026-08-16T14:18:39.959590Z","submitted_at":"2024-02-14T13:13:26Z","title":"Attacking Large Language Models with Projected Gradient Descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09154","snapshot_observed_at":"2026-08-09T21:39:57.801536Z","title":"Geisler, T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19026","last_updated":"2025-01-31T10:51:14Z","snapshot_observed_at":"2026-08-13T14:23:23.676113Z","submitted_at":"2025-01-31T10:51:14Z","title":"MPLinker: Multi-template Prompt-tuning with Adversarial Training for Issue-commit Link Recovery","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-09T21:39:57.801536Z"},"links":{"cited_paper":"/paper/2402.09154","citing_paper":"/paper/2501.19026"},"observation_digest":"sha256:28b87c2478ce2634be8552fe870720361540de8d940409bf96a2b11c0ec2f9ec","observation_id":"e6060557-e7b2-4978-86ba-8095c8d1971a","resolution":{"observed_at":"2026-08-09T21:39:57.801536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09154","last_updated":"2025-03-03T09:37:27Z","snapshot_observed_at":"2026-08-16T14:18:39.959590Z","submitted_at":"2024-02-14T13:13:26Z","title":"Attacking Large Language Models with Projected Gradient Descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09154","snapshot_observed_at":"2026-08-08T23:50:35.711274Z","title":"a ger, T., Abdalla, M., Gasteiger, J., and G \\","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04040","last_updated":"2025-05-30T09:43:42Z","snapshot_observed_at":"2026-08-15T09:31:20.952358Z","submitted_at":"2025-02-06T13:01:44Z","title":"Safety Reasoning with Guidelines","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T23:50:35.711274Z"},"links":{"cited_paper":"/paper/2402.09154","citing_paper":"/paper/2502.04040"},"observation_digest":"sha256:9f8de073e1e389326115201810dce907924fb1b68b18cf03f4ef63ce2c94d0ae","observation_id":"9efbfee1-fe77-4e5f-b64e-5940d1f523d5","resolution":{"observed_at":"2026-08-08T23:50:35.711274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09154","last_updated":"2025-03-03T09:37:27Z","snapshot_observed_at":"2026-08-16T14:18:39.959590Z","submitted_at":"2024-02-14T13:13:26Z","title":"Attacking Large Language Models with Projected Gradient Descent","version":2},"cited_work":{"arxiv_id":"2402.09154","doi":"10.48550/arxiv.2402.09154","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09154","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Attacking large language mod- els with projected gradient descent","venue":"arXiv (Cornell University)","work_id":"f8aa89f0-9d68-4ed9-b8fd-c3656e3a9de3","year":2024},"citing_paper":{"arxiv_id":"2503.02574","last_updated":"2026-05-18T17:54:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-04T12:55:07Z","title":"LLM-Safety Evaluations Lack Robustness","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-23T01:26:45.402983Z"},"links":{"cited_paper":"/paper/2402.09154","citing_paper":"/paper/2503.02574"},"observation_digest":"sha256:897838716bb453c33f44c7691e3bc5fe73237e5577002b9403ea36fb3639a71e","observation_id":"227aab02-0700-4ca3-9c78-dc0bc8748524","resolution":{"observed_at":"2026-05-23T01:27:21.305556Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09154","last_updated":"2025-03-03T09:37:27Z","snapshot_observed_at":"2026-08-16T14:18:39.959590Z","submitted_at":"2024-02-14T13:13:26Z","title":"Attacking Large Language Models with Projected Gradient Descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09154","snapshot_observed_at":"2026-08-16T10:28:48.859908Z","title":"arXiv preprint arXiv:2402.09154 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20077","last_updated":"2025-04-25T04:04:59Z","snapshot_observed_at":"2026-08-16T10:23:22.136208Z","submitted_at":"2025-04-25T04:04:59Z","title":"Edge-Based Learning for Improved Classification Under Adversarial Noise","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T10:28:48.859908Z"},"links":{"cited_paper":"/paper/2402.09154","citing_paper":"/paper/2504.20077"},"observation_digest":"sha256:d6ada5c9116510abea8147a2befcb7adcffab8834823a1c9e3ad7db13aa1198b","observation_id":"5661be85-fa06-42da-8390-2496b559f216","resolution":{"observed_at":"2026-08-16T10:28:48.859908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09154","last_updated":"2025-03-03T09:37:27Z","snapshot_observed_at":"2026-08-16T14:18:39.959590Z","submitted_at":"2024-02-14T13:13:26Z","title":"Attacking Large Language Models with Projected Gradient Descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09154","snapshot_observed_at":"2026-08-16T04:38:39.361751Z","title":"Attacking large language models with projected gradient descent","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00843","last_updated":"2025-05-01T20:09:48Z","snapshot_observed_at":"2026-08-16T04:31:22.111810Z","submitted_at":"2025-05-01T20:09:48Z","title":"OET: Optimization-based prompt injection Evaluation Toolkit","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T04:38:39.361751Z"},"links":{"cited_paper":"/paper/2402.09154","citing_paper":"/paper/2505.00843"},"observation_digest":"sha256:0f8dc9183686544ab477c241187d1d78612aa4beb105d85ac716087353100b0d","observation_id":"4d6006f2-0e8f-4cfe-9107-a73599998ffc","resolution":{"observed_at":"2026-08-16T04:38:39.361751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09154","last_updated":"2025-03-03T09:37:27Z","snapshot_observed_at":"2026-08-16T14:18:39.959590Z","submitted_at":"2024-02-14T13:13:26Z","title":"Attacking Large Language Models with Projected Gradient Descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09154","snapshot_observed_at":"2026-08-07T14:00:04.958799Z","title":"Attacking large language models with projected gradient descent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:04.958799Z"},"links":{"cited_paper":"/paper/2402.09154","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:5f72af0cdde37881591207fadd21fc2797b838a7cca0c929381d881dcd3624e4","observation_id":"9298d76f-bc7f-4d4a-aa27-382ceecacf83","resolution":{"observed_at":"2026-08-07T14:00:04.958799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09154","last_updated":"2025-03-03T09:37:27Z","snapshot_observed_at":"2026-08-16T14:18:39.959590Z","submitted_at":"2024-02-14T13:13:26Z","title":"Attacking Large Language Models with Projected Gradient Descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09154","snapshot_observed_at":"2026-08-07T14:01:06.516291Z","title":"Attacking large language models with projected gradient descent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21556","last_updated":"2025-05-26T17:27:32Z","snapshot_observed_at":"2026-08-15T16:19:18.443251Z","submitted_at":"2025-05-26T17:27:32Z","title":"Benign-to-Toxic Jailbreaking: Inducing Harmful Responses from Harmless Prompts","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:01:06.516291Z"},"links":{"cited_paper":"/paper/2402.09154","citing_paper":"/paper/2505.21556"},"observation_digest":"sha256:0839e5f6c5a96061a0e5489670ffcdfe35b2d4da7ef4a4eb1f586b1cefd624a1","observation_id":"d8e12a24-16cb-4e2d-abc5-24064a025fd8","resolution":{"observed_at":"2026-08-07T14:01:06.516291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09154","last_updated":"2025-03-03T09:37:27Z","snapshot_observed_at":"2026-08-16T14:18:39.959590Z","submitted_at":"2024-02-14T13:13:26Z","title":"Attacking Large Language Models with Projected Gradient Descent","version":2},"cited_work":{"arxiv_id":"2402.09154","doi":"10.48550/arxiv.2402.09154","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09154","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Attacking large language mod- els with projected gradient descent","venue":"arXiv (Cornell University)","work_id":"f8aa89f0-9d68-4ed9-b8fd-c3656e3a9de3","year":2024},"citing_paper":{"arxiv_id":"2506.09067","last_updated":"2026-04-09T22:50:08Z","snapshot_observed_at":"2026-08-12T22:05:05.795246Z","submitted_at":"2025-06-08T16:26:51Z","title":"Enhancing the Safety of Medical Vision-Language Models by Synthetic Demonstrations","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-19T10:54:55.262180Z"},"links":{"cited_paper":"/paper/2402.09154","citing_paper":"/paper/2506.09067"},"observation_digest":"sha256:1bd4db4139af815cd856c4f47c0a0106edb370215ec35921e95b44e63dd0f392","observation_id":"fdebc9ff-d61f-4f92-a347-780d0fa2a544","resolution":{"observed_at":"2026-05-19T10:57:16.512989Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09154","last_updated":"2025-03-03T09:37:27Z","snapshot_observed_at":"2026-08-16T14:18:39.959590Z","submitted_at":"2024-02-14T13:13:26Z","title":"Attacking Large Language Models with Projected Gradient Descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09154","snapshot_observed_at":"2026-08-07T00:51:13.446894Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12707","last_updated":"2025-06-15T03:39:13Z","snapshot_observed_at":"2026-08-10T10:13:26.110622Z","submitted_at":"2025-06-15T03:39:13Z","title":"SecurityLingua: Efficient Defense of LLM Jailbreak Attacks via Security-Aware Prompt Compression","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T00:51:13.446894Z"},"links":{"cited_paper":"/paper/2402.09154","citing_paper":"/paper/2506.12707"},"observation_digest":"sha256:ddadbf4f6738cdc204930bfe1849c699bf8f93ae554396ea3c7a7cfc39a372d3","observation_id":"b604ea45-9d0f-4d8b-872c-dc0f7479c980","resolution":{"observed_at":"2026-08-07T00:51:13.446894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09154","last_updated":"2025-03-03T09:37:27Z","snapshot_observed_at":"2026-08-16T14:18:39.959590Z","submitted_at":"2024-02-14T13:13:26Z","title":"Attacking Large Language Models with Projected Gradient Descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09154","snapshot_observed_at":"2026-08-07T00:15:00.545572Z","title":"Geisler, T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14922","last_updated":"2025-06-24T19:55:23Z","snapshot_observed_at":"2026-08-13T20:33:14.014427Z","submitted_at":"2025-06-17T19:08:02Z","title":"FORTRESS: Frontier Risk Evaluation for National Security and Public Safety","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:00.545572Z"},"links":{"cited_paper":"/paper/2402.09154","citing_paper":"/paper/2506.14922"},"observation_digest":"sha256:bfa93ef6a353922d7455196df2db36135c3611dadc46780ccbf1447ac7979f0a","observation_id":"6bb50952-d1d9-413d-be5e-82a3066116a6","resolution":{"observed_at":"2026-08-07T00:15:00.545572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09154","last_updated":"2025-03-03T09:37:27Z","snapshot_observed_at":"2026-08-16T14:18:39.959590Z","submitted_at":"2024-02-14T13:13:26Z","title":"Attacking Large Language Models with Projected Gradient Descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09154","snapshot_observed_at":"2026-08-15T18:56:13.268391Z","title":"Attacking large language models with projected gradient descent,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18325","last_updated":"2025-06-23T06:17:30Z","snapshot_observed_at":"2026-08-17T09:03:07.597136Z","submitted_at":"2025-06-23T06:17:30Z","title":"NSFW-Classifier Guided Prompt Sanitization for Safe Text-to-Image Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T18:56:13.268391Z"},"links":{"cited_paper":"/paper/2402.09154","citing_paper":"/paper/2506.18325"},"observation_digest":"sha256:8dacebcb1afee43f8b07639417bf2c9685cbd1c4326d0aade9c3ddf9fd4913da","observation_id":"457de37f-944c-47b4-9a23-eb3cfd5ba36c","resolution":{"observed_at":"2026-08-15T18:56:13.268391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09154","last_updated":"2025-03-03T09:37:27Z","snapshot_observed_at":"2026-08-16T14:18:39.959590Z","submitted_at":"2024-02-14T13:13:26Z","title":"Attacking Large Language Models with Projected Gradient Descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09154","snapshot_observed_at":"2026-08-06T23:20:56.204745Z","title":"Attacking large language models with projected gradient descent.arXiv preprint arXiv:2402.091542024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-13T02:33:46.917734Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:56.204745Z"},"links":{"cited_paper":"/paper/2402.09154","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:c2f7537d44cfb94693d4d2a29809edac6b46947160e3f631c66eca9322d3cb84","observation_id":"09cebd2c-7789-45e8-89f2-5eb8bf3a0b10","resolution":{"observed_at":"2026-08-06T23:20:56.204745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09154","last_updated":"2025-03-03T09:37:27Z","snapshot_observed_at":"2026-08-16T14:18:39.959590Z","submitted_at":"2024-02-14T13:13:26Z","title":"Attacking Large Language Models with Projected Gradient Descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09154","snapshot_observed_at":"2026-08-05T20:31:33.071055Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10404","last_updated":"2025-08-14T07:12:44Z","snapshot_observed_at":"2026-08-15T19:14:10.464568Z","submitted_at":"2025-08-14T07:12:44Z","title":"Layer-Wise Perturbations via Sparse Autoencoders for Adversarial Text Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:33.071055Z"},"links":{"cited_paper":"/paper/2402.09154","citing_paper":"/paper/2508.10404"},"observation_digest":"sha256:094db46b81a9b866cabb15bb74b7d06e431bbecf3288b66f674cfd85268655be","observation_id":"abd52154-d50a-4659-b063-cc2bbd32eb46","resolution":{"observed_at":"2026-08-05T20:31:33.071055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09154","last_updated":"2025-03-03T09:37:27Z","snapshot_observed_at":"2026-08-16T14:18:39.959590Z","submitted_at":"2024-02-14T13:13:26Z","title":"Attacking Large Language Models with Projected Gradient Descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09154","snapshot_observed_at":"2026-08-05T16:00:48.402754Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.19445","last_updated":"2026-06-16T17:34:06Z","snapshot_observed_at":"2026-08-08T05:25:02.825611Z","submitted_at":"2025-08-26T21:36:45Z","title":"On Surjectivity of Neural Networks: Can you elicit any behavior from your model?","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T16:00:48.402754Z"},"links":{"cited_paper":"/paper/2402.09154","citing_paper":"/paper/2508.19445"},"observation_digest":"sha256:b429f871b63b158fd0405ee3c221f38fad498729f2732a5f812fd64fba978a96","observation_id":"6b47654b-2df4-4b6f-b4e5-9da9ec7c2479","resolution":{"observed_at":"2026-08-05T16:00:48.402754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09154","last_updated":"2025-03-03T09:37:27Z","snapshot_observed_at":"2026-08-16T14:18:39.959590Z","submitted_at":"2024-02-14T13:13:26Z","title":"Attacking Large Language Models with Projected Gradient Descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09154","snapshot_observed_at":"2026-08-04T09:25:40.661962Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.15476","last_updated":"2026-07-04T04:20:15Z","snapshot_observed_at":"2026-08-14T22:20:04.981358Z","submitted_at":"2025-10-17T09:38:54Z","title":"SoK: Systematizing LLM Prompt Security: Taxonomies, Datasets, and Unified Evaluation of Attacks and Defenses","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-04T09:25:40.661962Z"},"links":{"cited_paper":"/paper/2402.09154","citing_paper":"/paper/2510.15476"},"observation_digest":"sha256:95729deecf57476c7ed4b2fbb64ec938d6155e5001fd1e1589b8fe6e63638b7d","observation_id":"dbb98816-ca6a-40f5-96a0-89c93ed6d197","resolution":{"observed_at":"2026-08-04T09:25:40.661962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09154","last_updated":"2025-03-03T09:37:27Z","snapshot_observed_at":"2026-08-16T14:18:39.959590Z","submitted_at":"2024-02-14T13:13:26Z","title":"Attacking Large Language Models with Projected Gradient Descent","version":2},"cited_work":{"arxiv_id":"2402.09154","doi":"10.48550/arxiv.2402.09154","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09154","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Attacking large language mod- els with projected gradient descent","venue":"arXiv (Cornell University)","work_id":"f8aa89f0-9d68-4ed9-b8fd-c3656e3a9de3","year":2024},"citing_paper":{"arxiv_id":"2511.02356","last_updated":"2026-04-20T12:25:45Z","snapshot_observed_at":"2026-08-15T04:39:07.087594Z","submitted_at":"2025-11-04T08:24:22Z","title":"ASTRA: An Automated Framework for Strategy Discovery, Retrieval, and Evolution for Jailbreaking LLMs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T01:54:22.995178Z"},"links":{"cited_paper":"/paper/2402.09154","citing_paper":"/paper/2511.02356"},"observation_digest":"sha256:9113292f5b21af6ba62a8f988343baeeb940e040a60042665f19e4e51050fc77","observation_id":"3431ab42-a099-4b3d-bbd3-9069a13ea693","resolution":{"observed_at":"2026-05-18T01:55:38.083052Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09154","last_updated":"2025-03-03T09:37:27Z","snapshot_observed_at":"2026-08-16T14:18:39.959590Z","submitted_at":"2024-02-14T13:13:26Z","title":"Attacking Large Language Models with Projected Gradient Descent","version":2},"cited_work":{"arxiv_id":"2402.09154","doi":"10.48550/arxiv.2402.09154","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09154","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Attacking large language mod- els with projected gradient descent","venue":"arXiv (Cornell University)","work_id":"f8aa89f0-9d68-4ed9-b8fd-c3656e3a9de3","year":2024},"citing_paper":{"arxiv_id":"2604.09222","last_updated":"2026-08-07T05:55:06Z","snapshot_observed_at":"2026-08-12T23:09:41.000056Z","submitted_at":"2026-04-10T11:27:25Z","title":"GRM: Utility-Aware Jailbreak Attacks on Audio LLMs via Gradient-Ratio Masking","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T16:40:59.993298Z"},"links":{"cited_paper":"/paper/2402.09154","citing_paper":"/paper/2604.09222"},"observation_digest":"sha256:cd49c52fe39905334232956049a8770c77f1277d01875e5bdd831b4515e77136","observation_id":"a1b178c8-724c-4bfe-b48e-4bcf2c02f008","resolution":{"observed_at":"2026-05-11T08:21:01.267141Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09154","last_updated":"2025-03-03T09:37:27Z","snapshot_observed_at":"2026-08-16T14:18:39.959590Z","submitted_at":"2024-02-14T13:13:26Z","title":"Attacking Large Language Models with Projected Gradient Descent","version":2},"cited_work":{"arxiv_id":"2402.09154","doi":"10.48550/arxiv.2402.09154","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09154","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Attacking large language mod- els with projected gradient descent","venue":"arXiv (Cornell University)","work_id":"f8aa89f0-9d68-4ed9-b8fd-c3656e3a9de3","year":2024},"citing_paper":{"arxiv_id":"2605.05116","last_updated":"2026-05-06T16:47:07Z","snapshot_observed_at":"2026-08-13T11:23:40.255170Z","submitted_at":"2026-05-06T16:47:07Z","title":"On the Hardness of Junking LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-08T17:38:32.028947Z"},"links":{"cited_paper":"/paper/2402.09154","citing_paper":"/paper/2605.05116"},"observation_digest":"sha256:77cb16153e90c2bfabc87104e71152692841d65fe4a900e3ad640be85bfda80c","observation_id":"f87d6bfa-6cb8-4a93-a63a-07c2da470cf5","resolution":{"observed_at":"2026-05-11T17:21:10.187348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09154","last_updated":"2025-03-03T09:37:27Z","snapshot_observed_at":"2026-08-16T14:18:39.959590Z","submitted_at":"2024-02-14T13:13:26Z","title":"Attacking Large Language Models with Projected Gradient Descent","version":2},"cited_work":{"arxiv_id":"2402.09154","doi":"10.48550/arxiv.2402.09154","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09154","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Attacking large language mod- els with projected gradient descent","venue":"arXiv (Cornell University)","work_id":"f8aa89f0-9d68-4ed9-b8fd-c3656e3a9de3","year":2024},"citing_paper":{"arxiv_id":"2605.08898","last_updated":"2026-05-09T11:43:47Z","snapshot_observed_at":"2026-07-06T23:21:02.177557Z","submitted_at":"2026-05-09T11:43:47Z","title":"LLM-Agnostic Semantic Representation Attack","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-12T01:14:08.629862Z"},"links":{"cited_paper":"/paper/2402.09154","citing_paper":"/paper/2605.08898"},"observation_digest":"sha256:5d8b87e28a920ebd69e17e6bd69ae85e49460b9767ed5b2ad7a53287c508cc88","observation_id":"6c7792d8-2f4a-4dc1-8be3-a90d998c2bed","resolution":{"observed_at":"2026-05-12T08:21:24.234026Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09154","last_updated":"2025-03-03T09:37:27Z","snapshot_observed_at":"2026-08-16T14:18:39.959590Z","submitted_at":"2024-02-14T13:13:26Z","title":"Attacking Large Language Models with Projected Gradient Descent","version":2},"cited_work":{"arxiv_id":"2402.09154","doi":"10.48550/arxiv.2402.09154","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09154","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Attacking large language mod- els with projected gradient descent","venue":"arXiv (Cornell University)","work_id":"f8aa89f0-9d68-4ed9-b8fd-c3656e3a9de3","year":2024},"citing_paper":{"arxiv_id":"2605.12813","last_updated":"2026-05-31T17:51:51Z","snapshot_observed_at":"2026-07-06T23:24:27.821980Z","submitted_at":"2026-05-12T23:13:50Z","title":"REALISTA: Realistic Latent Adversarial Attacks that Elicit LLM Hallucinations","version":1},"reference_index":158,"source":"arxiv_source","source_observed_at":"2026-05-14T20:13:10.814899Z"},"links":{"cited_paper":"/paper/2402.09154","citing_paper":"/paper/2605.12813"},"observation_digest":"sha256:29315f4e5ea17588d932172d35b49a1fe2f3e8e72fc192d1abe19e2c9d31b701","observation_id":"209e1f92-6b78-4cd4-9587-1b0b917b5ad8","resolution":{"observed_at":"2026-05-14T20:17:56.850770Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09154","last_updated":"2025-03-03T09:37:27Z","snapshot_observed_at":"2026-08-16T14:18:39.959590Z","submitted_at":"2024-02-14T13:13:26Z","title":"Attacking Large Language Models with Projected Gradient Descent","version":2},"cited_work":{"arxiv_id":"2402.09154","doi":"10.48550/arxiv.2402.09154","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09154","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Attacking large language mod- els with projected gradient descent","venue":"arXiv (Cornell University)","work_id":"f8aa89f0-9d68-4ed9-b8fd-c3656e3a9de3","year":2024},"citing_paper":{"arxiv_id":"2606.03647","last_updated":"2026-06-02T13:39:15Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T13:39:15Z","title":"Black-box, Adaptive, Efficient, Transferable, Harmful, Applicable... Attacks Are All You Need to Break LLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T09:21:57.373862Z"},"links":{"cited_paper":"/paper/2402.09154","citing_paper":"/paper/2606.03647"},"observation_digest":"sha256:d7b1855cc3ca77e6df182e594968cf2d1ea757600768aeb8533a6af619a61ad7","observation_id":"cbeeb290-95be-49a3-a155-f2d60800eb74","resolution":{"observed_at":"2026-07-02T04:16:34.691368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09154","last_updated":"2025-03-03T09:37:27Z","snapshot_observed_at":"2026-08-16T14:18:39.959590Z","submitted_at":"2024-02-14T13:13:26Z","title":"Attacking Large Language Models with Projected Gradient Descent","version":2},"cited_work":{"arxiv_id":"2402.09154","doi":"10.48550/arxiv.2402.09154","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09154","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Attacking large language mod- els with projected gradient descent","venue":"arXiv (Cornell University)","work_id":"f8aa89f0-9d68-4ed9-b8fd-c3656e3a9de3","year":2024},"citing_paper":{"arxiv_id":"2607.00481","last_updated":"2026-07-01T06:08:07Z","snapshot_observed_at":"2026-08-04T19:51:57.082592Z","submitted_at":"2026-07-01T06:08:07Z","title":"Beyond the Prompt: Jailbreaking Function-Calling LLMs via Simulated Moderation Traces","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-02T11:37:02.538968Z"},"links":{"cited_paper":"/paper/2402.09154","citing_paper":"/paper/2607.00481"},"observation_digest":"sha256:3732a5fd9fabf9c97a0ad014ab5c89b3afcbef97e36335f6699b9a00f7331d12","observation_id":"b9c5ddeb-a11c-435d-bbd1-7ad52573b1be","resolution":{"observed_at":"2026-07-02T11:46:54.860562Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09154","last_updated":"2025-03-03T09:37:27Z","snapshot_observed_at":"2026-08-16T14:18:39.959590Z","submitted_at":"2024-02-14T13:13:26Z","title":"Attacking Large Language Models with Projected Gradient Descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09154","snapshot_observed_at":"2026-08-04T01:16:10.330416Z","title":"Attacking large language models with projected gradient descent,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00134","last_updated":"2026-07-31T14:04:49Z","snapshot_observed_at":"2026-08-14T22:54:09.591958Z","submitted_at":"2026-07-31T14:04:49Z","title":"Stateful Cooperative Agents Safeguarding LLMs Against Evolving Multi-Turn Attacks","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:10.330416Z"},"links":{"cited_paper":"/paper/2402.09154","citing_paper":"/paper/2608.00134"},"observation_digest":"sha256:66314e7147301abd8486662958e618837b46e744caa2178970b078b1dc0228b0","observation_id":"c5232ba9-5422-459d-ba88-940486fce466","resolution":{"observed_at":"2026-08-04T01:16:10.330416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09154","last_updated":"2025-03-03T09:37:27Z","snapshot_observed_at":"2026-08-16T14:18:39.959590Z","submitted_at":"2024-02-14T13:13:26Z","title":"Attacking Large Language Models with Projected Gradient Descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09154","snapshot_observed_at":"2026-08-07T01:00:03.202299Z","title":"arXiv preprint arXiv:2402.09154 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05188","last_updated":"2026-07-31T19:16:53Z","snapshot_observed_at":"2026-08-15T03:17:44.645392Z","submitted_at":"2026-07-31T19:16:53Z","title":"Position: It's Time to Optimize LLMs for Self-Consistency","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T01:00:03.202299Z"},"links":{"cited_paper":"/paper/2402.09154","citing_paper":"/paper/2608.05188"},"observation_digest":"sha256:d4711335e0639c3921035e715b15346a9c3af7a1b02720ec23deec0307bc2b6a","observation_id":"2f6fcc8f-0817-4044-8971-ddbf7e95922a","resolution":{"observed_at":"2026-08-07T01:00:03.202299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2402.09154/citation-record","integrity":"/paper/2402.09154/integrity","json":"/paper/2402.09154/citation-record.json","paper":"/paper/2402.09154"},"outbound":[],"paper":{"arxiv_id":"2402.09154","last_updated":"2025-03-03T09:37:27Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T14:18:39.959590Z","submitted_at":"2024-02-14T13:13:26Z","title":"Attacking Large Language Models with Projected Gradient Descent"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 33 inbound Pith citation observations for arXiv:2402.09154."}