{"as_of":"2026-08-07T15:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ae6e069b0e75f8fdaebcb61e1746f7df6a1b8a3caa58e345cad7b10ad51139a6","coverage":[{"denominator":84,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":84,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:27:03.780401Z","state":"measured"},{"denominator":91,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":91,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:12:22.885999Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-17T00:31:24.539214Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18889","snapshot_observed_at":"2026-08-06T19:12:22.885999Z","title":"Security concerns for large language models: A survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06323","last_updated":"2025-07-08T18:24:28Z","snapshot_observed_at":"2026-08-06T19:05:12.143746Z","submitted_at":"2025-07-08T18:24:28Z","title":"Bridging AI and Software Security: A Comparative Vulnerability Assessment of LLM Agent Deployment Paradigms","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:12:22.885999Z"},"links":{"cited_paper":"/paper/2505.18889","citing_paper":"/paper/2507.06323"},"observation_digest":"sha256:83e0a89722c132171b67be37673c80d08df789558a3d54e3864f377e35337ffa","observation_id":"2ee4e6f2-7cd7-497b-b623-98bf6ffa8b58","resolution":{"observed_at":"2026-08-06T19:12:22.885999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":"2505.18889","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18889","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Security Concerns for Large Language Models: A Survey","venue":null,"work_id":"998c55c6-39ca-4bf1-9129-52de8b1455d4","year":2025},"citing_paper":{"arxiv_id":"2512.05929","last_updated":"2026-06-29T18:18:24Z","snapshot_observed_at":"2026-08-03T18:19:06.255338Z","submitted_at":"2025-12-05T18:12:21Z","title":"LLM Harms: A Taxonomy and Discussion","version":2},"reference_index":130,"source":"pdf_text","source_observed_at":"2026-05-17T00:29:07.951709Z"},"links":{"cited_paper":"/paper/2505.18889","citing_paper":"/paper/2512.05929"},"observation_digest":"sha256:a2b9aa7b24433227e67f9b172f6f0ed9d5c0ed9f4e9304d1d29931500144ae1b","observation_id":"b093e5c6-e241-448f-98f4-13db15d84283","resolution":{"observed_at":"2026-05-17T00:31:24.541239Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18889","snapshot_observed_at":"2026-08-03T18:19:22.067036Z","title":"Security Concerns for Large Language Models: A Survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.05929","last_updated":"2026-06-29T18:18:24Z","snapshot_observed_at":"2026-08-03T18:19:06.255338Z","submitted_at":"2025-12-05T18:12:21Z","title":"LLM Harms: A Taxonomy and Discussion","version":4},"reference_index":130,"source":"pdf_text","source_observed_at":"2026-08-03T18:19:22.067036Z"},"links":{"cited_paper":"/paper/2505.18889","citing_paper":"/paper/2512.05929"},"observation_digest":"sha256:e1ca0c5edcaecf6f3ca07e93e9be5a81a3c874babeab0e682a713f07664a6eab","observation_id":"a210001a-a16e-4ba2-9984-e67cd692f373","resolution":{"observed_at":"2026-08-03T18:19:22.067036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18889","snapshot_observed_at":"2026-08-03T09:53:25.123806Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.12359","last_updated":"2026-01-18T11:33:35Z","snapshot_observed_at":"2026-08-06T10:38:00.882004Z","submitted_at":"2026-01-18T11:33:35Z","title":"Zero-Shot Embedding Drift Detection: A Lightweight Defense Against Prompt Injections in LLMs","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:25.123806Z"},"links":{"cited_paper":"/paper/2505.18889","citing_paper":"/paper/2601.12359"},"observation_digest":"sha256:03598fa34486cf0bb821d159e883eda8d8981e0987e772abab280af834b2d89f","observation_id":"7698991f-040b-4cc0-affd-9512d14552e9","resolution":{"observed_at":"2026-08-03T09:53:25.123806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18889","snapshot_observed_at":"2026-08-02T21:46:33.293428Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19218","last_updated":"2026-06-09T15:02:00Z","snapshot_observed_at":"2026-08-05T17:29:43.215311Z","submitted_at":"2026-02-22T15:02:00Z","title":"Gecko: A Simulation Environment with Stateful Feedback for Refining Agent Tool Calls","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T21:46:33.293428Z"},"links":{"cited_paper":"/paper/2505.18889","citing_paper":"/paper/2602.19218"},"observation_digest":"sha256:08fceb5be57878a98e61f453bbe0c889434394dc866a415a92f1009e562f35e8","observation_id":"89b8a45c-01e6-42eb-8b6f-309f69ae204e","resolution":{"observed_at":"2026-08-02T21:46:33.293428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":"2505.18889","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18889","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Security Concerns for Large Language Models: A Survey","venue":null,"work_id":"998c55c6-39ca-4bf1-9129-52de8b1455d4","year":2025},"citing_paper":{"arxiv_id":"2604.18803","last_updated":"2026-04-25T21:48:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T20:21:27Z","title":"LLM-as-Judge Framework for Evaluating Tone-Induced Hallucination in Vision-Language Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T05:11:01.039309Z"},"links":{"cited_paper":"/paper/2505.18889","citing_paper":"/paper/2604.18803"},"observation_digest":"sha256:a2b9fcfec5c109d006c04747cb04c5b914d9dba70a387480295201dac6fc8fb2","observation_id":"a4ecefb4-f0f3-44a9-a41d-79f573a1a009","resolution":{"observed_at":"2026-05-10T09:38:43.149038Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18889","snapshot_observed_at":"2026-08-02T05:10:09.315243Z","title":"Li and Benjamin C","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13453","last_updated":"2026-07-15T05:26:43Z","snapshot_observed_at":"2026-08-06T13:52:49.949504Z","submitted_at":"2026-07-15T05:26:43Z","title":"Adversarial Prompting Framework for AI Safety Assessment","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T05:10:09.315243Z"},"links":{"cited_paper":"/paper/2505.18889","citing_paper":"/paper/2607.13453"},"observation_digest":"sha256:27151bc6381f5afe31e1564640f3ab523d05a5cdb73af9076f4ae897b728596a","observation_id":"f11db4e2-a816-4d47-aad9-ec665cf4ea53","resolution":{"observed_at":"2026-08-02T05:10:09.315243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.18889/citation-record","integrity":"/paper/2505.18889/integrity","json":"/paper/2505.18889/citation-record.json","paper":"/paper/2505.18889"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-07T14:27:03.364590Z","title":"Concrete problems in ai safety","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.364590Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:b8a0ba321782e39b1c24cf26c63e7f156cc5459959a7373fa924593360685fc7","observation_id":"1b66ac07-a466-4c8b-9424-707bdcc9a53e","resolution":{"observed_at":"2026-08-07T14:27:03.364590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:03.370897Z","title":"System Card: Claude Opus 4 & Claude Sonnet 4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.370897Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:1f62152193d44462af886d68628ea1a52b0db4b4373ac58909a9c9bdbe22fb02","observation_id":"40fc1189-3a08-465a-b301-751bdf4b694b","resolution":{"observed_at":"2026-08-07T14:27:03.370897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:03.376217Z","title":"Theclaude3modelfamily:Opus,sonnet,haiku","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.376217Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:bc4a447e0dd37744606abe06721add33460e082a061e100ed43524464cc6db04","observation_id":"a406cd1d-1821-4e37-b4ca-a6701e8d1913","resolution":{"observed_at":"2026-08-07T14:27:03.376217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:03.381548Z","title":"Embedding-based classifiers can detect prompt injection attacks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.381548Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:efa9a4e3c3d2e531af16900d78d3054ef18687841ca017e4a387a1600c2170d3","observation_id":"317e49e5-374c-40d5-8786-b7729eb72d50","resolution":{"observed_at":"2026-08-07T14:27:03.381548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11926","last_updated":"2025-03-14T23:50:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-14T23:50:34Z","title":"Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11926","snapshot_observed_at":"2026-08-07T14:27:03.386052Z","title":"Monitoring reasoning modelsformisbehaviorandtherisksofpromotingobfuscation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.386052Z"},"links":{"cited_paper":"/paper/2503.11926","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:c0049f572dcbea9489ce2b2f829e13dfe6b9cc52819a22008d15366c608a513a","observation_id":"97ce77fa-9edb-42ac-a154-3bd1a17c4167","resolution":{"observed_at":"2026-08-07T14:27:03.386052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16513","last_updated":"2025-01-30T08:00:14Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T21:26:37Z","title":"Deception in LLMs: Self-Preservation and Autonomous Goals in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16513","snapshot_observed_at":"2026-08-07T14:27:03.390674Z","title":"Deception in llms: Self- preservation and autonomous goals in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.390674Z"},"links":{"cited_paper":"/paper/2501.16513","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:24146329874089a699cf1ce6164b214fcddb41678d67c8a74f18cb41d0e40cd8","observation_id":"466f5ac9-9c5a-48fe-80b1-f32da3f1006f","resolution":{"observed_at":"2026-08-07T14:27:03.390674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05232","last_updated":"2025-07-03T18:06:35Z","snapshot_observed_at":"2026-08-03T05:38:55.252697Z","submitted_at":"2024-12-06T18:02:59Z","title":"LIAR: Leveraging Inference Time Alignment (Best-of-N) to Jailbreak LLMs in Seconds","version":3},"cited_work":{"arxiv_id":"2412.05232","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.05232","snapshot_observed_at":"2026-08-07T14:27:04.860102Z","title":"LIAR: Leveraging Inference Time Alignment (Best-of-N) to Jailbreak LLMs in Seconds","venue":"cs.CL","work_id":"65cdd210-a0dd-4fab-803c-d66244c4848e","year":2024},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.396465Z"},"links":{"cited_paper":"/paper/2412.05232","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:a81916bc957969dca4233c537ad794f542b4c4c622398d99c5ca515a9ae5f2ce","observation_id":"08abe4a7-9e46-4070-a905-96ca93301b08","resolution":{"observed_at":"2026-08-07T14:27:04.889778Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15657","last_updated":"2025-02-24T18:14:15Z","snapshot_observed_at":"2026-07-06T20:40:34.378362Z","submitted_at":"2025-02-21T18:28:36Z","title":"Superintelligent Agents Pose Catastrophic Risks: Can Scientist AI Offer a Safer Path?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.15657","snapshot_observed_at":"2026-08-07T14:27:03.401477Z","title":"Superintelligent agents pose catastrophic risks: Can scientist ai offer a safer path? arXiv preprint arXiv:2502.15657","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.401477Z"},"links":{"cited_paper":"/paper/2502.15657","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:0ad3149df15678b9f6b51f7d40b9535d95817fefeffbdfd831b754cd4aeef7d9","observation_id":"554e00f1-c718-43d1-882c-12be9106f299","resolution":{"observed_at":"2026-08-07T14:27:03.401477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09662","last_updated":"2023-08-30T10:21:00Z","snapshot_observed_at":"2026-08-06T17:01:00.147032Z","submitted_at":"2023-08-18T16:27:04Z","title":"Red-Teaming Large Language Models using Chain of Utterances for Safety-Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09662","snapshot_observed_at":"2026-08-07T14:27:03.407254Z","title":"Red-teaming large language mod- els using chain of utterances for safety-alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.407254Z"},"links":{"cited_paper":"/paper/2308.09662","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:8e4a1d5058e27577759134a836e2b75e0645ed34cedec6c94c98167e1e0ca7b4","observation_id":"cf7d8278-25e5-430d-8210-761a9ce1c0b0","resolution":{"observed_at":"2026-08-07T14:27:03.407254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:03.412812Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.412812Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:3df31baa138d315a1a4973ff49fa6be72f679509b5204bfdd5e5b3216291f91d","observation_id":"3852f90b-0c1a-4b47-bc46-85e3acf1666e","resolution":{"observed_at":"2026-08-07T14:27:03.412812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08419","snapshot_observed_at":"2026-08-07T14:27:03.417247Z","title":"Jailbreaking black box large language models in twenty queries","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.417247Z"},"links":{"cited_paper":"/paper/2310.08419","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:825f604e3e3cbda840a545113555ae6436b104521a943170708113e8d09d6b46","observation_id":"99ec921e-878c-44c2-9900-bfff5d05ad88","resolution":{"observed_at":"2026-08-07T14:27:03.417247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10414","last_updated":"2024-11-15T18:34:07Z","snapshot_observed_at":"2026-08-06T19:21:24.933454Z","submitted_at":"2024-11-15T18:34:07Z","title":"Llama Guard 3 Vision: Safeguarding Human-AI Image Understanding Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10414","snapshot_observed_at":"2026-08-07T14:27:03.421477Z","title":"Llama guard 3vision:Safeguardinghuman-aiimageunderstandingconversations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.421477Z"},"links":{"cited_paper":"/paper/2411.10414","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:3efcc17014e08e48f8ba2577205c4e8d2d80389f7baedfabd3df25820cd51a26","observation_id":"48eb96e2-9bbc-4668-9c72-6313023d7d9b","resolution":{"observed_at":"2026-08-07T14:27:03.421477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02817","last_updated":"2025-01-30T11:11:37Z","snapshot_observed_at":"2026-07-06T17:39:45.571775Z","submitted_at":"2024-03-05T09:37:13Z","title":"Here Comes The AI Worm: Unleashing Zero-click Worms that Target GenAI-Powered Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02817","snapshot_observed_at":"2026-08-07T14:27:03.426864Z","title":"Here comes the ai worm: Unleashing zero-click worms that target genai-powered applications","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.426864Z"},"links":{"cited_paper":"/paper/2403.02817","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:ad5f3d32debe5589c2f1e5b11a66a49d658b08c8a296e7ae84b3dbca9e110e07","observation_id":"95ad58b2-1d5a-4c5a-8193-bf587a9eb541","resolution":{"observed_at":"2026-08-07T14:27:03.426864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08535","last_updated":"2024-01-24T06:07:20Z","snapshot_observed_at":"2026-07-06T16:32:07.186600Z","submitted_at":"2023-10-12T17:24:15Z","title":"Formally Specifying the High-Level Behavior of LLM-Based Agents","version":3},"cited_work":{"arxiv_id":"2310.08535","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.08535","snapshot_observed_at":"2026-08-07T14:27:04.748972Z","title":"Formally Specifying the High-Level Behavior of LLM-Based Agents","venue":"cs.AI","work_id":"a8007a5e-be90-420b-9458-403e8bb7a885","year":2023},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.431586Z"},"links":{"cited_paper":"/paper/2310.08535","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:db977e663a581416886f717a1c4d84c0c3ebb43d0ec3ff4aa8fa447e5c7f6f9c","observation_id":"50b95a10-6167-4fa7-89c3-058e2b64e073","resolution":{"observed_at":"2026-08-07T14:27:04.757335Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:08.788194Z","title":null,"venue":null,"work_id":"8c42345f-1aad-4945-9b98-922cd4b7050d","year":null},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.436483Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:ff30fe6aba834dae1294795b3ee6f016616504fd7a99f4081d2c3c47ff4f6042","observation_id":"1762adc4-8824-456b-b369-5d8da4c9c261","resolution":{"observed_at":"2026-08-07T14:27:08.854007Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:08.618341Z","title":"Security and privacy chal- lengesoflargelanguagemodels:Asurvey","venue":null,"work_id":"d8157b49-37b2-4a9a-9529-9e8fe657e3b0","year":2025},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.445557Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:39fa7276022cd766e4516a435a09f11ec08bfa67377292a17179d14eb725b504","observation_id":"7e49c603-d220-482d-b4be-a746810aba26","resolution":{"observed_at":"2026-08-07T14:27:08.696535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17614","last_updated":"2024-12-23T14:36:37Z","snapshot_observed_at":"2026-08-05T08:30:58.054420Z","submitted_at":"2024-12-23T14:36:37Z","title":"Emerging Security Challenges of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17614","snapshot_observed_at":"2026-08-07T14:27:03.449834Z","title":"Emerging security challenges of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.449834Z"},"links":{"cited_paper":"/paper/2412.17614","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:14f209c0b996fb96b61a1c45151efa90e808cddb186e08605c3a0ebb9c6880a5","observation_id":"4b6a04d7-0ff7-43f8-9b06-3d0a76b46036","resolution":{"observed_at":"2026-08-07T14:27:03.449834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00374","last_updated":"2024-09-11T12:48:42Z","snapshot_observed_at":"2026-07-06T16:55:29.501535Z","submitted_at":"2023-12-01T06:36:17Z","title":"The Philosopher's Stone: Trojaning Plugins of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00374","snapshot_observed_at":"2026-08-07T14:27:03.455337Z","title":"The philosopher’s stone: Trojaning plugins of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.455337Z"},"links":{"cited_paper":"/paper/2312.00374","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:facc2b4d220e65df0c2d8e6f979fa0efd105fbb4bee091c69114f66e7e088ca2","observation_id":"1a31531c-5d8d-4bc5-8768-c8c5491ee37c","resolution":{"observed_at":"2026-08-07T14:27:03.455337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09841","last_updated":"2025-04-14T03:22:04Z","snapshot_observed_at":"2026-07-06T21:08:47.660019Z","submitted_at":"2025-04-14T03:22:04Z","title":"StruPhantom: Evolutionary Injection Attacks on Black-Box Tabular Agents Powered by Large Language Models","version":1},"cited_work":{"arxiv_id":"2504.09841","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.09841","snapshot_observed_at":"2026-08-07T14:27:04.666574Z","title":"StruPhantom: Evolutionary Injection Attacks on Black-Box Tabular Agents Powered by Large Language Models","venue":"cs.CR","work_id":"b818a7a4-20d5-4495-bd71-905a90fb2776","year":2025},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.459930Z"},"links":{"cited_paper":"/paper/2504.09841","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:941db6b6f4e5e2ec9cb5e91a038a7b8a11c7f6163ba0e322feaa759f7f9ef4ef","observation_id":"bb2fdb16-1cda-447a-87f1-5527d52d15b9","resolution":{"observed_at":"2026-08-07T14:27:04.677664Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02174","last_updated":"2025-06-05T21:52:43Z","snapshot_observed_at":"2026-07-06T20:46:09.097525Z","submitted_at":"2025-03-04T01:31:17Z","title":"Adversarial Tokenization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02174","snapshot_observed_at":"2026-08-07T14:27:03.464470Z","title":"Adversarial tokenization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.464470Z"},"links":{"cited_paper":"/paper/2503.02174","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:c900864593e675060fe61b0abf681d5d50ad47dfe334b30599298127a052adfe","observation_id":"d82fce64-904b-421d-9092-11a1acc7c9e9","resolution":{"observed_at":"2026-08-07T14:27:03.464470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:08.439912Z","title":null,"venue":null,"work_id":"3579a87b-4147-42b9-bd90-8f9d074a0cc0","year":2023},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.469121Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:eed88a1070d1cf6c0ecdf287354daac104f9e586196699d3cfdfca9c232ecb6c","observation_id":"20143416-9609-4ad7-9888-37115c98b2cd","resolution":{"observed_at":"2026-08-07T14:27:08.528535Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-07T14:27:03.474448Z","title":"Deliberative alignment: Reasoning enables safer language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.474448Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:90db0d78c9629d09e45ef67c8ba25dbc7002353372526644af4fddb90a874fe0","observation_id":"428190b1-bbfa-4d5d-bc45-1d9bbdbd8c59","resolution":{"observed_at":"2026-08-07T14:27:03.474448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:03.480328Z","title":"System prompt poisoning: Persistent attacks on large language models beyond user injection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.480328Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:0bac93339eaa64b0782d8b1ead43fa1adaaf12b6aa2296d07a4265e9587819c5","observation_id":"62e05885-63d8-47b6-b4a4-1f4c924b55e6","resolution":{"observed_at":"2026-08-07T14:27:03.480328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14847","last_updated":"2025-06-02T01:51:09Z","snapshot_observed_at":"2026-07-06T20:40:01.776087Z","submitted_at":"2025-02-20T18:55:39Z","title":"Red-Teaming LLM Multi-Agent Systems via Communication Attacks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14847","snapshot_observed_at":"2026-08-07T14:27:03.485673Z","title":"Red-teaming llm multi-agent systems via communication attacks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.485673Z"},"links":{"cited_paper":"/paper/2502.14847","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:3d570f61554599a9ca8b5e6cc857f364257c99de65a0592fc06345cc048d578e","observation_id":"c592c1ef-f1f2-4a3f-a571-497ca4cfcd5f","resolution":{"observed_at":"2026-08-07T14:27:03.485673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:08.251365Z","title":null,"venue":null,"work_id":"bc05b286-e621-4dfb-858f-ad152657eecf","year":null},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.490803Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:ca3ec4dae31b88b08e42f242591c5f5ef13358cb417d14025fa552ee06841dd7","observation_id":"8f70f9be-cdb5-4ff8-8fe7-82d885618a5c","resolution":{"observed_at":"2026-08-07T14:27:08.359894Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:08.063669Z","title":"Pleak: Promptleakingattacksagainstlargelanguagemodelapplications,in: Proceedings of the 2024 on ACM SIGSAC Conference on Computer and Communications Security, pp","venue":null,"work_id":"d516c85a-13d3-4dd5-91b7-77e8fcba671b","year":2024},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.501273Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:a2417773fbf6384f5f2cd435b9f8edd1497963d6d65487a78a6e2d538f9d8c54","observation_id":"5d5d53c0-54d1-46bf-a773-794ecbf44098","resolution":{"observed_at":"2026-08-07T14:27:08.140247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:07.911540Z","title":"Poisongpt:Howwehidalobotomized llmonhuggingfacetospreadfakenews","venue":null,"work_id":"e91a7651-9be4-4b48-a960-c6b51ef2c743","year":2023},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.505534Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:d5f70018fe3636a89fc8af9ce0f0601364feec13f72a808c49b971ce13d61f13","observation_id":"c19edb68-7eff-4127-a61e-c8bac5e6f212","resolution":{"observed_at":"2026-08-07T14:27:07.995449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06674","last_updated":"2023-12-07T19:40:50Z","snapshot_observed_at":"2026-07-06T17:00:00.321552Z","submitted_at":"2023-12-07T19:40:50Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06674","snapshot_observed_at":"2026-08-07T14:27:03.510563Z","title":"Llama guard: Llm-based input-output safeguard for human-ai conversations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.510563Z"},"links":{"cited_paper":"/paper/2312.06674","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:fd7f9fcf96a633fd1ecd7bb51f6fab871b5a9898f4ad84f2850ea3bd4f372702","observation_id":"a94f58ae-8610-4a7f-b05b-0dd5f644d0a1","resolution":{"observed_at":"2026-08-07T14:27:03.510563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:07.715464Z","title":"Llmsecurity101:Defendingagainstprompthacks","venue":null,"work_id":"88f89da6-51cb-40e2-8a97-6813c497f952","year":2025},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.516147Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:420d74896c9fc8fe2be877c08af942cf6f66a93c88235f918ee1091bbd496ad3","observation_id":"98d8d85c-1ef6-47f4-a1d3-809687dc6d90","resolution":{"observed_at":"2026-08-07T14:27:07.795090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00614","last_updated":"2023-09-04T17:47:36Z","snapshot_observed_at":"2026-07-06T16:13:23.343694Z","submitted_at":"2023-09-01T17:59:44Z","title":"Baseline Defenses for Adversarial Attacks Against Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00614","snapshot_observed_at":"2026-08-07T14:27:03.520629Z","title":"Baseline defenses for adversarial attacks against aligned language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.520629Z"},"links":{"cited_paper":"/paper/2309.00614","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:dcca17eb65fb19cd11881879c9714fb86e292ab39a278b838cb382a4b26f6ae5","observation_id":"f1994eb4-52c4-481a-beca-94f65dd64760","resolution":{"observed_at":"2026-08-07T14:27:03.520629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:07.507557Z","title":"A watermark for large language models, in: International Conference on Machine Learning, PMLR","venue":null,"work_id":"59f67577-2781-4622-b1f3-344901c814f7","year":2023},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.526345Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:94cde54ff8fbc049d946ff48be94aa1285bbaaa20502add6c9ff5bdda62ebf3f","observation_id":"8f5ae23f-3b17-494b-8494-438332375b7b","resolution":{"observed_at":"2026-08-07T14:27:07.598434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09798","last_updated":"2025-05-10T02:36:13Z","snapshot_observed_at":"2026-08-04T21:08:03.374081Z","submitted_at":"2025-01-16T19:01:25Z","title":"Fun-tuning: Characterizing the Vulnerability of Proprietary LLMs to Optimization-based Prompt Injection Attacks via the Fine-Tuning Interface","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09798","snapshot_observed_at":"2026-08-07T14:27:03.532090Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.532090Z"},"links":{"cited_paper":"/paper/2501.09798","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:5aa0e408133128546b03791b4f2939804e0d58342bdfca3f761b8fce733cb097","observation_id":"30fba0b6-0662-48c2-9a97-08c7f135c1c9","resolution":{"observed_at":"2026-08-07T14:27:03.532090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:07.260255Z","title":null,"venue":null,"work_id":"594dac3e-bff0-4057-b9d0-76f43e365a33","year":null},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.536591Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:12d20c66fcf3d2a63d31d45b852c2809c0b58dc787d63c9570388272c66aedf1","observation_id":"d70dfd76-74a7-481c-9dd7-3d4d073c52c1","resolution":{"observed_at":"2026-08-07T14:27:07.356304Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21038","last_updated":"2025-08-25T20:17:00Z","snapshot_observed_at":"2026-08-06T06:53:37.842976Z","submitted_at":"2025-04-28T07:38:43Z","title":"Prefill-level Jailbreak: A Black-Box Risk Analysis of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.21038","snapshot_observed_at":"2026-08-07T14:27:03.546803Z","title":"Prefill-basedjailbreak:Anovelapproach of bypassing llm safety boundary","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.546803Z"},"links":{"cited_paper":"/paper/2504.21038","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:d7bbadb6634c85d8b00d442e9d708404dc23c1151b3d9d880ceed3d0466aa8a4","observation_id":"1c6d1c47-9a87-431d-b297-a701ad27e765","resolution":{"observed_at":"2026-08-07T14:27:03.546803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:07.117379Z","title":"Backdoorllm: A comprehensive benchmark for backdoor attacks on large language models","venue":null,"work_id":"4c008346-4c21-4942-b5a9-45a77e9cdd05","year":2024},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.551855Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:56bc5211dde4690e27d8d46a47d71ee226dec86baea0eea91a1de8a8e880d986","observation_id":"72ec2fdd-26f8-470c-944b-1b448705f2fb","resolution":{"observed_at":"2026-08-07T14:27:07.201977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13702","last_updated":"2023-07-17T01:08:39Z","snapshot_observed_at":"2026-07-31T04:21:27.501709Z","submitted_at":"2023-07-17T01:08:39Z","title":"Measuring Faithfulness in Chain-of-Thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13702","snapshot_observed_at":"2026-08-07T14:27:03.541783Z","title":"arXiv preprint arXiv:2307.13702","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.541783Z"},"links":{"cited_paper":"/paper/2307.13702","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:fb8d94106ac8b92e1fb339504afd45c95ea3fcb1ba5e85a5e67b858fdf0aa12f","observation_id":"8abbee08-07ad-450d-a4eb-89465f60a515","resolution":{"observed_at":"2026-08-07T14:27:03.541783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:06.671974Z","title":"Autohijacker: Automatic indirect prompt injection against black-box llm agents, in: Submitted to ICLR 2025.https://openreview.net/forum?id=11629","venue":null,"work_id":"032ae1de-f37a-4ad5-bb85-c6508a02bda8","year":2025},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.561299Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:4d46ca5506c77af91dad96dddcfdcbc96d1a580abdeb08036ca56aceb1c848e6","observation_id":"663ca6f8-5b6e-4dd9-92f1-0f8e03ee9663","resolution":{"observed_at":"2026-08-07T14:27:06.805257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02832","last_updated":"2026-05-15T07:55:39Z","snapshot_observed_at":"2026-07-06T19:27:16.301809Z","submitted_at":"2024-10-02T08:41:23Z","title":"FlipAttack: Jailbreak LLMs via Flipping","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02832","snapshot_observed_at":"2026-08-07T14:27:03.566012Z","title":"Fli- pattack:Jailbreakllmsviaflipping","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.566012Z"},"links":{"cited_paper":"/paper/2410.02832","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:2460b2241881c08871249eb7baed25ce04b47c99eecc9dcb629df1ac3055a433","observation_id":"2224e001-e7fb-46b9-9f51-819fc26db4d9","resolution":{"observed_at":"2026-08-07T14:27:03.566012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:06.925718Z","title":"Nature Machine Intelligence , 1–14","venue":null,"work_id":"5de0975d-6750-4a67-95d1-fe244e6f9b03","year":null},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.556830Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:2cb4599eb689c10216101e086cafd582d0e40d8f09a3433d0ac88af067d30594","observation_id":"804323e0-a0cf-48dc-8476-d5e75e7d5b45","resolution":{"observed_at":"2026-08-07T14:27:07.009172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:06.267165Z","title":"Agentic misalign- ment: How llms could be an insider threat","venue":null,"work_id":"f4ecd0d6-977c-435d-abf0-c3424eaee660","year":2025},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.576065Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:4c4e64bbf9a98db17845710c052cb957c8795dc57aca390d33876f3e7f7edc44","observation_id":"61c3d0a4-f14d-4110-a060-48a4c97eaa41","resolution":{"observed_at":"2026-08-07T14:27:06.363703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:06.096128Z","title":"Tree of attacks: Jailbreaking black- box llms automatically","venue":null,"work_id":"5c80c443-f485-41b2-a05e-14ff5a8d2145","year":2024},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.581387Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:dd19f8515fda9c6e09a34acc68adc412a2e93aab586006b71b85a42a9bb9985b","observation_id":"e8d594a7-3a99-4da9-bf24-488c8974f8f0","resolution":{"observed_at":"2026-08-07T14:27:06.153119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:06.474878Z","title":"Formalizing and benchmarking prompt injection attacks and defenses, in: 33rd USENIX Security Symposium (USENIX Security 24), pp","venue":null,"work_id":"19971cfb-6081-4616-91f5-2f55b2f5827d","year":null},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.570611Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:e5a35414a4d50d2153d48a6e89d323a2124db419a83e429b16adfb17c70bda4b","observation_id":"594998f1-24d2-4b97-9986-48c367269cce","resolution":{"observed_at":"2026-08-07T14:27:06.572898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:03.591089Z","title":"Fully autonomous ai agents should not be developed","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.591089Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:72e7b573d04f00072cfc523e55327602c4d3426c105ed849627f81d1b7741ecc","observation_id":"76516eb3-79fb-4df2-8745-0a325c84f7ea","resolution":{"observed_at":"2026-08-07T14:27:03.591089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04018","last_updated":"2026-06-22T12:47:48Z","snapshot_observed_at":"2026-08-07T10:46:59.056034Z","submitted_at":"2025-06-04T14:46:47Z","title":"AgentMisalignment: Measuring the Propensity for Misaligned Behaviour in LLM-Based Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04018","snapshot_observed_at":"2026-08-07T14:27:03.596762Z","title":"Agentmisalignment: Measuring the propen- sity for misaligned behaviour in llm-based agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.596762Z"},"links":{"cited_paper":"/paper/2506.04018","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:722d94488818584db243a11efdd6d31a9516e99bd5ed81acda7fee45eaee85e1","observation_id":"944c7bf4-9622-499a-8461-ec9b37e178a4","resolution":{"observed_at":"2026-08-07T14:27:03.596762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04984","last_updated":"2025-01-14T20:16:01Z","snapshot_observed_at":"2026-07-29T23:20:20.918596Z","submitted_at":"2024-12-06T12:09:50Z","title":"Frontier Models are Capable of In-context Scheming","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04984","snapshot_observed_at":"2026-08-07T14:27:03.586403Z","title":"Frontier models are capable of in-context scheming","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.586403Z"},"links":{"cited_paper":"/paper/2412.04984","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:891f12a8f39d8d22810a637898d3dda8b1fbcb2a9da2dc4411c7b33115276f92","observation_id":"af322d9b-6b9f-42ed-b73c-75edf804a0ce","resolution":{"observed_at":"2026-08-07T14:27:03.586403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04196","last_updated":"2025-08-06T08:25:40Z","snapshot_observed_at":"2026-08-06T00:50:46.772389Z","submitted_at":"2025-08-06T08:25:40Z","title":"Eliciting and Analyzing Emergent Misalignment in State-of-the-Art Large Language Models","version":1},"cited_work":{"arxiv_id":"2508.04196","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.04196","snapshot_observed_at":"2026-08-07T14:27:04.306133Z","title":"Eliciting and Analyzing Emergent Misalignment in State-of-the-Art Large Language Models","venue":"cs.CL","work_id":"be9718a2-4ffc-4414-b34b-30ff9f2ba6c5","year":2025},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.607771Z"},"links":{"cited_paper":"/paper/2508.04196","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:c7290e12c778eb8cf3957f5462935225109407a357ffebebb4827b2b5d4f6353","observation_id":"f40d4b36-c785-4193-8798-510bb0213b15","resolution":{"observed_at":"2026-08-07T14:27:04.311908Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03792","last_updated":"2024-05-02T09:25:38Z","snapshot_observed_at":"2026-07-06T17:40:29.558340Z","submitted_at":"2024-03-06T15:40:30Z","title":"Neural Exec: Learning (and Learning from) Execution Triggers for Prompt Injection Attacks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03792","snapshot_observed_at":"2026-08-07T14:27:03.612380Z","title":"Neural exec: Learning (and learning from) execution triggers for prompt injection attacks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.612380Z"},"links":{"cited_paper":"/paper/2403.03792","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:64088920c4ae2eb760b617fc2846366a3df74e9a9e2b8dc43ba83b93ae82ecf2","observation_id":"c6fa50bd-3b22-4322-b72c-ce82f7a1333f","resolution":{"observed_at":"2026-08-07T14:27:03.612380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T14:27:03.602300Z","title":"Gpt-4 technical report.arXiv:2303.08774","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.602300Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:20eb4a400f751458f0667bfb65f29abf83cbc875bc60c30f6e19a462500b0339","observation_id":"77b8372a-7ad2-4b67-8a78-a7e57022c71f","resolution":{"observed_at":"2026-08-07T14:27:03.602300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09948","last_updated":"2025-05-29T14:49:44Z","snapshot_observed_at":"2026-07-06T16:48:37.243305Z","submitted_at":"2023-11-16T15:01:48Z","title":"Hijacking Large Language Models via Adversarial In-Context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09948","snapshot_observed_at":"2026-08-07T14:27:03.621418Z","title":"Hijackinglargelanguagemodels via adversarial in-context learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.621418Z"},"links":{"cited_paper":"/paper/2311.09948","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:e1e2dd48d7176e6af0e8438c1687861f794cad0adc96e3406c69277901d352d8","observation_id":"ce91f6c3-7ae0-4a5f-a822-9edf9615ec9e","resolution":{"observed_at":"2026-08-07T14:27:03.621418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:05.968853Z","title":"From chatbotstophishbots?:Phishingscamgenerationincommerciallarge languagemodels,in:2024IEEESymposiumonSecurityandPrivacy (SP), IEEE","venue":null,"work_id":"08e47d03-cd29-4f6b-ac01-cd6432c29e0a","year":2024},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.626005Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:d38016d1ebcf55911a33bfb32773d7ea51a1e9552422ed95be9f67dde094821f","observation_id":"26580501-d266-4a08-9291-d8ff75199f53","resolution":{"observed_at":"2026-08-07T14:27:06.004447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09527","last_updated":"2022-11-17T13:43:20Z","snapshot_observed_at":"2026-07-06T14:19:47.424778Z","submitted_at":"2022-11-17T13:43:20Z","title":"Ignore Previous Prompt: Attack Techniques For Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09527","snapshot_observed_at":"2026-08-07T14:27:03.616788Z","title":"arXiv preprint arXiv:2211.09527","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.616788Z"},"links":{"cited_paper":"/paper/2211.09527","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:9e7368ef3da776647cc65171a5115400132467b379374b605d54243f0d2cf0b7","observation_id":"a12f2e67-d3ee-4924-85bc-4a8b38807754","resolution":{"observed_at":"2026-08-07T14:27:03.616788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12298","last_updated":"2023-02-21T08:59:22Z","snapshot_observed_at":"2026-07-06T15:19:28.033750Z","submitted_at":"2023-02-21T08:59:22Z","title":"BadGPT: Exploring Security Vulnerabilities of ChatGPT via Backdoor Attacks to InstructGPT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12298","snapshot_observed_at":"2026-08-07T14:27:03.635415Z","title":"Badgpt: Exploring security vulnerabilities of chatgpt via backdoor attacks to instructgpt","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.635415Z"},"links":{"cited_paper":"/paper/2304.12298","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:6457bb4cf1535ef5a914e4d1e8097152ecddd7b4321d9dca2df0924a90221924","observation_id":"24375860-c72e-4ad5-b9c4-f90a96155f81","resolution":{"observed_at":"2026-08-07T14:27:03.635415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:05.856973Z","title":null,"venue":null,"work_id":"3d679fe4-02d7-4e87-862e-086cd232e705","year":null},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.640227Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:912c0127948cb885440073867eaa4626089221d0c9b4b8186abb0ea87b7300de","observation_id":"12b4b3aa-060e-4106-80c0-cf97e3f9d79d","resolution":{"observed_at":"2026-08-07T14:27:05.920423Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10844","last_updated":"2023-10-16T21:37:24Z","snapshot_observed_at":"2026-07-06T16:34:11.453458Z","submitted_at":"2023-10-16T21:37:24Z","title":"Survey of Vulnerabilities in Large Language Models Revealed by Adversarial Attacks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10844","snapshot_observed_at":"2026-08-07T14:27:03.630698Z","title":"Surveyofvulnerabilitiesinlargelanguagemod- els revealed by adversarial attacks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.630698Z"},"links":{"cited_paper":"/paper/2310.10844","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:9cf876372372ce3db38f9d5c7e13eaa73986bcfddeae5cd0c3087ff786e2b846","observation_id":"3a5fd50e-8463-4378-b555-0104ecddeb33","resolution":{"observed_at":"2026-08-07T14:27:03.630698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T14:27:03.655102Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.655102Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:711b45e2f3c4527aeea8054fd1f9510055fee7a1ed86a1837c50d20cfd3a347c","observation_id":"cda06f9a-a7ab-4138-8483-610e2173d028","resolution":{"observed_at":"2026-08-07T14:27:03.655102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T14:27:03.659641Z","title":"Llama2:Openfoundationandfine-tunedchatmodels","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.659641Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:2e7e1bc25b65627873d78269a66ead3b9dd417509e88f8c95c32c025f12d60b3","observation_id":"345b4c22-c783-4260-9166-3d5cb358380e","resolution":{"observed_at":"2026-08-07T14:27:03.659641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:05.769697Z","title":"AdvancesinNeural Information Processing Systems 36, 61836–61856","venue":null,"work_id":"dc0de733-f5db-459f-ae3b-5d206dbcd72a","year":null},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.645571Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:2e6b508a74c8ab0a2cad3e70d132e1ab533619a3e77c6443244413f4e289ec9b","observation_id":"3fff1a74-7046-469b-a5d8-c0b24f7ea928","resolution":{"observed_at":"2026-08-07T14:27:05.817837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:05.643142Z","title":"Wormgpt and fraudgpt – the rise of malicious llms","venue":null,"work_id":"404fea31-8961-4baa-a75a-b5bc690502f8","year":2023},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.650551Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:6f4d9f32c70a4cf5e01935adef63b3028754774acefd2e06725a1a5f2cef6868","observation_id":"2440f6fb-d53c-47cf-a777-1a03490ad880","resolution":{"observed_at":"2026-08-07T14:27:05.699816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:05.449225Z","title":null,"venue":null,"work_id":"9c0176f4-9e5d-4e49-a876-65a5c33c98c2","year":null},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.673431Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:28ca7cbbb726db0e55b7114e8b7f81708686015c767f4e49db74ef52e7d3124e","observation_id":"a4ee6f0e-964d-4f5d-8547-a982f9c59d9a","resolution":{"observed_at":"2026-08-07T14:27:05.453509Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.00944","last_updated":"2023-05-01T16:57:33Z","snapshot_observed_at":"2026-07-06T15:21:57.592347Z","submitted_at":"2023-05-01T16:57:33Z","title":"Poisoning Language Models During Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.00944","snapshot_observed_at":"2026-08-07T14:27:03.683845Z","title":"Poisoning language modelsduringinstructiontuning,in:Proc.40thInternationalConfer- ence on Machine Learning (ICML).arXiv:2305.00944","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.683845Z"},"links":{"cited_paper":"/paper/2305.00944","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:c033cd0c73bcb08861d6e280fd7adf2cd8e84a49290e61827b29a6f24320f2b5","observation_id":"c3c72e84-9a5e-479f-9a66-84669cef5015","resolution":{"observed_at":"2026-08-07T14:27:03.683845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:05.562059Z","title":"DAN is my new friend.https://old.reddit.c om/r/ChatGPT/comments/zlcyr9/dan_is_my_new_friend/","venue":null,"work_id":"8e0ee09f-4e4b-462a-bd5f-dfa1a2953fd7","year":2022},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.664204Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:00b38ad0870e4366c8724fc426149e3619240260fac2ad038440bcf4dff2103f","observation_id":"bc0ea891-fa4a-49c0-a147-d83ddf0fe92d","resolution":{"observed_at":"2026-08-07T14:27:05.592228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:05.466082Z","title":"Universal adversarial triggers for attacking and analyzing nlp, in: EMNLP","venue":null,"work_id":"e94345c3-fea3-4b52-be2c-1f25a6dc2fe7","year":2020},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.668643Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:d445a81ce4aac975d284ed51be121ea5a899d705c47feb865ad73a95d45da91c","observation_id":"f43a025c-03cf-44e5-83f9-236dd5fbf0aa","resolution":{"observed_at":"2026-08-07T14:27:05.502228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04909","last_updated":"2025-06-05T11:44:19Z","snapshot_observed_at":"2026-08-07T10:28:37.330537Z","submitted_at":"2025-06-05T11:44:19Z","title":"When Thinking LLMs Lie: Unveiling the Strategic Deception in Representations of Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04909","snapshot_observed_at":"2026-08-07T14:27:03.699530Z","title":"When thinking llms lie: Unveiling the strategic deception in representations of reasoning models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.699530Z"},"links":{"cited_paper":"/paper/2506.04909","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:955795b5c2e46b290d2051a3fbf283216e3a42bfdafa08debd99b1b40616d2e7","observation_id":"dc1e993c-71e8-4590-b811-d4843a5ebd9d","resolution":{"observed_at":"2026-08-07T14:27:03.699530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13208","last_updated":"2024-04-19T22:55:23Z","snapshot_observed_at":"2026-08-02T11:48:17.206729Z","submitted_at":"2024-04-19T22:55:23Z","title":"The Instruction Hierarchy: Training LLMs to Prioritize Privileged Instructions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13208","snapshot_observed_at":"2026-08-07T14:27:03.678249Z","title":"arXiv preprint arXiv:2404.13208","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.678249Z"},"links":{"cited_paper":"/paper/2404.13208","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:bb0aaad95a25b7a257e8f3251b942a49e726dda47dc2b45005a2ef79fb50ce77","observation_id":"7c7786f9-4dbd-4f3b-aa2b-3d99c574d136","resolution":{"observed_at":"2026-08-07T14:27:03.678249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:05.427071Z","title":"Jailbroken: How does llm safety training fail? Advances in Neural Information Processing Systems 36, 80079–80110","venue":null,"work_id":"ee3fe2dd-6862-4aa7-9162-afb0651a1ec8","year":2023},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.710344Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:3e08310b47078661f2fbbd358c3bf821fe0ed2f0f5e0c070722e47025a7af78e","observation_id":"68defda7-725f-4125-a8fd-b54e3b8798ad","resolution":{"observed_at":"2026-08-07T14:27:05.439142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18666","last_updated":"2025-07-31T04:00:48Z","snapshot_observed_at":"2026-07-06T20:57:47.748881Z","submitted_at":"2025-03-24T13:31:48Z","title":"AgentSpec: Customizable Runtime Enforcement for Safe and Reliable LLM Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18666","snapshot_observed_at":"2026-08-07T14:27:03.688700Z","title":"Agentspec: Customizable runtime enforcement for safe and reliable llm agents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.688700Z"},"links":{"cited_paper":"/paper/2503.18666","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:68200aa20284853c7b0e708d18513ab1c809ba84f018341ca634546224b96447","observation_id":"63ce99cb-7ea7-45b3-b288-d427f9a6e538","resolution":{"observed_at":"2026-08-07T14:27:03.688700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09433","last_updated":"2024-08-15T19:51:07Z","snapshot_observed_at":"2026-07-06T16:48:16.671370Z","submitted_at":"2023-11-15T23:07:40Z","title":"Trojan Activation Attack: Red-Teaming Large Language Models using Activation Steering for Safety-Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09433","snapshot_observed_at":"2026-08-07T14:27:03.694102Z","title":"Trojan activation attack: Red-teaming large language models using activation steering for safety-alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.694102Z"},"links":{"cited_paper":"/paper/2311.09433","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:15a3faa011cfaaf59b9cc2330fbb46616f6c96e0b4143f42b01b520bd8338038","observation_id":"15125eaa-6240-4c15-bf31-a7767070f8d6","resolution":{"observed_at":"2026-08-07T14:27:03.694102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11355","last_updated":"2025-03-23T06:22:28Z","snapshot_observed_at":"2026-08-05T22:18:01.917777Z","submitted_at":"2025-02-17T02:11:17Z","title":"Nuclear Deployed: Analyzing Catastrophic Risks in Decision-making of Autonomous LLM Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11355","snapshot_observed_at":"2026-08-07T14:27:03.725980Z","title":"Nuclear deployed: Analyzing catastrophic risks in decision-making of autonomous llm agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.725980Z"},"links":{"cited_paper":"/paper/2502.11355","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:1448601caf79d37d15aa031c86de4cbb0eadc5bcf472d4f40648d0cbb73a5909","observation_id":"3d99dff0-7482-4de9-a3f6-cb55c68aaff5","resolution":{"observed_at":"2026-08-07T14:27:03.725980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:03.705501Z","title":"Persona features control emergent misalignment, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.705501Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:ad4dd58bbabc35c71b12e18f5bae8c74180c6a740601b3ae55319a78204933f9","observation_id":"3d4cf9b3-0620-496e-ac16-24d848e360e7","resolution":{"observed_at":"2026-08-07T14:27:03.705501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:05.271568Z","title":"Asurvey on large language model (llm) security and privacy: The good, the bad, and the ugly","venue":null,"work_id":"f5f67374-7d55-4ad7-adc1-fc45df8309f7","year":2024},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.736286Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:b83931b1bffe201a4ac7646a8eb4ff6baec399fe81553a10977a8c58c38c7f53","observation_id":"9b8871b8-d32b-4189-af08-9dbd0804a0c4","resolution":{"observed_at":"2026-08-07T14:27:05.361858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16667","last_updated":"2024-07-23T17:34:36Z","snapshot_observed_at":"2026-07-06T18:50:48.181248Z","submitted_at":"2024-07-23T17:34:36Z","title":"RedAgent: Red Teaming Large Language Models with Context-aware Autonomous Language Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16667","snapshot_observed_at":"2026-08-07T14:27:03.715584Z","title":"Redagent: Red teaming large language models with context-aware autonomous language agent","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.715584Z"},"links":{"cited_paper":"/paper/2407.16667","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:1bd207d5e273aa6baf1795197d3a865161d31841b8b4723a989e1c3870f1dc62","observation_id":"64e5fd1a-3be0-4c55-99b3-8395982cc5e0","resolution":{"observed_at":"2026-08-07T14:27:03.715584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18349","last_updated":"2024-08-08T08:57:23Z","snapshot_observed_at":"2026-08-06T14:40:09.150498Z","submitted_at":"2024-03-27T08:39:56Z","title":"Rejection Improves Reliability: Training LLMs to Refuse Unknown Questions Using RL from Knowledge Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18349","snapshot_observed_at":"2026-08-07T14:27:03.720278Z","title":"Rejection improves reliability: Training llms to refuse un- known questions using rl from knowledge feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.720278Z"},"links":{"cited_paper":"/paper/2403.18349","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:3abaf1f3f8ab34777eeab60979ffe8e9e570597cd37ccd55fc6580e168ffbf89","observation_id":"702d2ad4-02d6-4f69-82be-ff06d645237e","resolution":{"observed_at":"2026-08-07T14:27:03.720278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:05.132912Z","title":null,"venue":null,"work_id":"bb736e89-ae49-4b01-a35f-f24f871c774c","year":2024},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.750500Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:c27c12a7ad03bb1af64679a243f99ccf334c69eb4858b3e2425165b774c054b2","observation_id":"c1a8b09f-38b2-4f95-b3b9-29b4a8fdcfa5","resolution":{"observed_at":"2026-08-07T14:27:05.197213Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16888","last_updated":"2024-04-03T05:53:20Z","snapshot_observed_at":"2026-07-06T16:00:50.467537Z","submitted_at":"2023-07-31T17:56:00Z","title":"Backdooring Instruction-Tuned Large Language Models with Virtual Prompt Injection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16888","snapshot_observed_at":"2026-08-07T14:27:03.730949Z","title":"Backdooring instruction-tuned large language models with virtual prompt injection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.730949Z"},"links":{"cited_paper":"/paper/2307.16888","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:90645f04f48f70c126376690a404bea64ada9d2334d419aae29edb01039b9a38","observation_id":"8b9d043f-428c-4a8d-adb8-edbe1f111dcf","resolution":{"observed_at":"2026-08-07T14:27:03.730949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15754","last_updated":"2025-03-20T00:13:04Z","snapshot_observed_at":"2026-07-06T20:55:47.967653Z","submitted_at":"2025-03-20T00:13:04Z","title":"AutoRedTeamer: Autonomous Red Teaming with Lifelong Attack Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15754","snapshot_observed_at":"2026-08-07T14:27:03.764785Z","title":"Autoredteamer: Autonomous red teaming with lifelong attack integration","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.764785Z"},"links":{"cited_paper":"/paper/2503.15754","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:8fe978ab2620c8f12e6f4f144095f8f1677fa8586c99a7e806565a07d476035a","observation_id":"9a515249-b67b-43be-8da3-9b87c3a00f40","resolution":{"observed_at":"2026-08-07T14:27:03.764785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00055","last_updated":"2024-12-28T07:48:57Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-28T07:48:57Z","title":"LLM-Virus: Evolutionary Jailbreak Attack on Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00055","snapshot_observed_at":"2026-08-07T14:27:03.740914Z","title":"Llm-virus: Evolutionary jailbreak attack on large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.740914Z"},"links":{"cited_paper":"/paper/2501.00055","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:2300067b84984553d08958a2935c860285b1ed8ecb42b19eb8a675e2834a4f51","observation_id":"bb96e0a4-8b38-43f2-ace2-cc8a809bae58","resolution":{"observed_at":"2026-08-07T14:27:03.740914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08109","last_updated":"2025-08-10T02:49:05Z","snapshot_observed_at":"2026-08-05T10:27:24.738852Z","submitted_at":"2024-10-10T16:56:05Z","title":"A Closer Look at Machine Unlearning for Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08109","snapshot_observed_at":"2026-08-07T14:27:03.745848Z","title":"A closer look at machine unlearning for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.745848Z"},"links":{"cited_paper":"/paper/2410.08109","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:bac0930f0e3c24f9cc7effe62e97d7a95d3cf7ca73f9b57758e79715583f646d","observation_id":"2499618d-1ed2-418d-b7ba-c5cbdc64ff78","resolution":{"observed_at":"2026-08-07T14:27:03.745848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13666","last_updated":"2025-07-25T06:20:38Z","snapshot_observed_at":"2026-07-06T20:09:05.798010Z","submitted_at":"2024-12-18T09:48:53Z","title":"Evaluation of LLM Vulnerabilities to Being Misused for Personalized Disinformation Generation","version":2},"cited_work":{"arxiv_id":"2412.13666","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.13666","snapshot_observed_at":"2026-08-07T14:27:03.818131Z","title":"Evaluation of LLM Vulnerabilities to Being Misused for Personalized Disinformation Generation","venue":"cs.CL","work_id":"b9863fd1-6737-4adb-b577-f892ec2a7ec0","year":2024},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.780401Z"},"links":{"cited_paper":"/paper/2412.13666","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:7dab572056d3d576ce989429d5cc9c4a238d92a33ca71b61b9e44e9ebbf0b509","observation_id":"57120ddb-8970-4d96-b258-a53bc8fb3204","resolution":{"observed_at":"2026-08-07T14:27:03.825519Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:04.994331Z","title":null,"venue":null,"work_id":"c429feef-ff81-4c45-b12e-012b61746e77","year":null},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.754737Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:b89b547e58eba10accae62de829285092cd6a868e4c42818d355fcec402706fe","observation_id":"82d11667-9a15-4cae-a3fd-e0a0b67e667d","resolution":{"observed_at":"2026-08-07T14:27:05.063421Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17256","last_updated":"2025-07-23T18:43:18Z","snapshot_observed_at":"2026-07-06T17:22:41.286422Z","submitted_at":"2024-01-30T18:48:37Z","title":"Weak-to-Strong Jailbreaking on Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17256","snapshot_observed_at":"2026-08-07T14:27:03.759736Z","title":"arXiv preprint arXiv:2401.17256","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.759736Z"},"links":{"cited_paper":"/paper/2401.17256","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:fac958bd6bb58b08331f3a44d79a6b21b7440dd37ac7bd017aa3fce5f9291780","observation_id":"eb482b29-547d-4846-bd6b-42e9cf4b000f","resolution":{"observed_at":"2026-08-07T14:27:03.759736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:03.770830Z","title":"Ad- vprefix: An objective for nuanced llm jailbreaks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.770830Z"},"links":{"citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:e282b7c4341429b5b5261013ba4dae39e715b29de5722b634f5a40503d8380e8","observation_id":"ab4d47a7-5cae-41a2-9f9f-014b5ea4b4b0","resolution":{"observed_at":"2026-08-07T14:27:03.770830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-07T14:27:03.775471Z","title":"Universal and transferable adversarial attacks on aligned language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.775471Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:653cd2b55b5c242a99dfe50827c83b68025f989ee58b033049a84c3b01f30b1f","observation_id":"6956a007-7c79-41f6-9f67-bbae36cce66c","resolution":{"observed_at":"2026-08-07T14:27:03.775471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12773","last_updated":"2023-10-19T14:22:03Z","snapshot_observed_at":"2026-08-02T16:56:38.535065Z","submitted_at":"2023-10-19T14:22:03Z","title":"Safe RLHF: Safe Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12773","snapshot_observed_at":"2026-08-07T14:27:03.440620Z","title":"arXiv preprint arXiv:2310.12773","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.440620Z"},"links":{"cited_paper":"/paper/2310.12773","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:d141ce77887a58534c844308e0da6aa0f7fc6803d6291e42ce60fbb45cf8eac5","observation_id":"099fde57-8128-44e5-a0b5-d7ee8ff11def","resolution":{"observed_at":"2026-08-07T14:27:03.440620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05566","last_updated":"2024-01-17T20:26:01Z","snapshot_observed_at":"2026-07-06T17:14:03.152949Z","submitted_at":"2024-01-10T22:14:35Z","title":"Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05566","snapshot_observed_at":"2026-08-07T14:27:03.495748Z","title":"arXiv preprint arXiv:2401.05566","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.495748Z"},"links":{"cited_paper":"/paper/2401.05566","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:5c15bacf56a6713b55faeb30c1f7481d4ad929a4ea8a3b6925d5574ea5230b49","observation_id":"f03154d5-a4b3-4d51-a0de-e83b582db2b2","resolution":{"observed_at":"2026-08-07T14:27:03.495748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","latest_version":5,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-07T14:21:41.034177Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey"},"reference_resolution":{"displayed":84,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":61,"verified_exact":5,"verified_fuzzy":18},"total_outbound_references":84},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 84 of 84 outbound references and 7 inbound Pith citation observations for arXiv:2505.18889."}