{"as_of":"2026-08-07T11:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:323935de4c21b1b4289e484a52ff0029427d140166dc766267dcc38d799e70b7","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T05:22:30.509147Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2510.20129/citation-record","integrity":"/paper/2510.20129/integrity","json":"/paper/2510.20129/citation-record.json","paper":"/paper/2510.20129"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:c3b3a1cfd0054e68ce28f807b051f59e1b9da75283c33de867ce6f5775f2fb35","observation_id":"60d19697-c414-403d-8613-47f1d2a45592","resolution":{"observed_at":"2026-05-18T05:25:54.588103Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14132","last_updated":"2023-11-07T03:30:15Z","snapshot_observed_at":"2026-07-06T16:10:54.723336Z","submitted_at":"2023-08-27T15:20:06Z","title":"Detecting Language Model Attacks with Perplexity","version":3},"cited_work":{"arxiv_id":"2308.14132","doi":"10.48550/arxiv.2308.14132","metadata_source":"pith","pith_arxiv_id":"2308.14132","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Detecting Language Model Attacks with Perplexity","venue":"cs.CL","work_id":"8fac4469-dd8b-4784-9ff6-13d2e74e57fb","year":2023},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"cited_paper":"/paper/2308.14132","citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:2f21f2d1628bdc67cfea084794c176f5daa2bbf08aee8244329d5ca054a657be","observation_id":"62a58878-b48d-4562-bf88-5231492a62b3","resolution":{"observed_at":"2026-05-18T05:25:54.601980Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-12T03:19:28.65242+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T03:19:28.65242+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.14255","last_updated":"2022-07-28T17:40:47Z","snapshot_observed_at":"2026-08-07T11:38:07.397956Z","submitted_at":"2022-07-28T17:40:47Z","title":"Efficient Training of Language Models to Fill in the Middle","version":1},"cited_work":{"arxiv_id":"2207.14255","doi":"10.48550/arxiv.2207.14255","metadata_source":"pith","pith_arxiv_id":"2207.14255","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Training of Language Models to Fill in the Middle","venue":"cs.CL","work_id":"54afe4f8-4d93-4829-99ae-2a27143a9641","year":2022},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"cited_paper":"/paper/2207.14255","citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:81287c57683ecd072ae7b19f3bbbd7546f77e4f5c76dfb035554fe88019315a9","observation_id":"d0fb6236-87cb-456b-af2e-ef2b9a3d95de","resolution":{"observed_at":"2026-05-18T05:25:54.581354Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the dangers of stochastic parrots: Can language models be too big? InProceedings of the 2021 ACM conference on fairness, accountability, and transparency, pp","venue":null,"work_id":"b49a66e6-cee5-4ed5-981f-74b9b323118e","year":2021},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:bb51276b895bf3be16c110337fc60559422dc672610840483919192ce22e4e07","observation_id":"b0aa928f-7f2a-492b-87c5-85c78b430438","resolution":{"observed_at":"2026-05-18T05:25:54.975897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15435","last_updated":"2025-02-21T13:04:13Z","snapshot_observed_at":"2026-08-07T06:43:04.887815Z","submitted_at":"2025-02-21T13:04:13Z","title":"Single-pass Detection of Jailbreaking Input in Large Language Models","version":1},"cited_work":{"arxiv_id":"2502.15435","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.15435","snapshot_observed_at":"2026-07-04T17:40:01.004170Z","title":"Single-pass detection of jailbreaking input in large language models.arXiv preprint arXiv:2502.15435","venue":null,"work_id":"6b145a9f-79b1-4997-93e0-53666b3f403a","year":2025},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"cited_paper":"/paper/2502.15435","citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:4f409d713b4a2741a23d972fa39faa3803be6996a33bcab47e5bb76eb0d1293e","observation_id":"80d9fd52-404a-445d-8d57-deb9b2c81485","resolution":{"observed_at":"2026-05-18T05:25:54.598504Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on evaluation of large language models.ACM transactions on intelligent systems and technology, 15(3):1–45, 2024a","venue":null,"work_id":"b9decd04-fa8d-47b0-b41d-8426fa2ece64","year":2024},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:b0f162ca5a939ee18bf0261df5dace4613bce63aac923673407319e3f1559a40","observation_id":"8ac98264-c6e6-4e9f-bfb7-50c9b0c50203","resolution":{"observed_at":"2026-05-18T05:25:54.969547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality.See https://vicuna","venue":null,"work_id":"9ae0c422-f9e3-4f20-bcc9-3ec30d9df7dd","year":2023},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:6606572edeed8af430f178fd530c2ef8ebc2516d26dbc2f57d0ad72b7774724c","observation_id":"a33a43cc-c162-4524-a220-dcbf48b5f7a0","resolution":{"observed_at":"2026-05-18T05:25:54.972940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12505","last_updated":"2023-10-19T06:15:05Z","snapshot_observed_at":"2026-07-06T16:35:27.763870Z","submitted_at":"2023-10-19T06:15:05Z","title":"Attack Prompt Generation for Red Teaming and Defending Large Language Models","version":1},"cited_work":{"arxiv_id":"2310.12505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.12505","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attack prompt generation for red teaming and defending large language models.arXiv preprint arXiv:2310.12505","venue":null,"work_id":"9c608c1b-2d5b-4cb3-af08-642484ba3083","year":2023},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"cited_paper":"/paper/2310.12505","citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:ac0e3ffe69cbdfc12ad1b8c5c8b7465931d7ec40e1f7d83caa6d4596882ec5cb","observation_id":"bdcdeac0-827d-4bbc-9058-f8fe59b29b4a","resolution":{"observed_at":"2026-05-18T05:25:54.594563Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17034","last_updated":"2025-05-21T16:47:23Z","snapshot_observed_at":"2026-07-06T20:11:46.794148Z","submitted_at":"2024-12-22T14:18:39Z","title":"Shaping the Safety Boundaries: Understanding and Defending Against Jailbreaks in Large Language Models","version":2},"cited_work":{"arxiv_id":"2412.17034","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.17034","snapshot_observed_at":"2026-07-02T17:37:14.918785Z","title":"Shaping the safety boundaries: Understanding and defending against jailbreaks in large language models.arXiv preprint arXiv:2412.17034","venue":null,"work_id":"af1b473d-82a5-4baa-b8e6-81a99f1b3e39","year":2024},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"cited_paper":"/paper/2412.17034","citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:640e950574ee3e76204f6a3e23e0bbe805722df171a667b39dd66a300c2b8481","observation_id":"46a53fd7-b283-434a-8f45-3a266a9a2acb","resolution":{"observed_at":"2026-05-18T05:25:54.605699Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00934","last_updated":"2024-04-03T17:04:06Z","snapshot_observed_at":"2026-07-06T17:53:51.988186Z","submitted_at":"2024-04-01T05:39:36Z","title":"ChatGLM-RLHF: Practices of Aligning Large Language Models with Human Feedback","version":2},"cited_work":{"arxiv_id":"2404.00934","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.00934","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chatglm- rlhf: Practices of aligning large language models with human feedback","venue":null,"work_id":"c9ced531-0d1d-4eb8-88f5-be15e8d55087","year":2024},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"cited_paper":"/paper/2404.00934","citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:2d1d4326da1365406a449a29bd6aad1c82675b1ad1eed11362716ab416615100","observation_id":"5653751b-b50d-4246-aec2-17d7a6739f09","resolution":{"observed_at":"2026-05-18T05:25:54.591261Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00614","last_updated":"2023-09-04T17:47:36Z","snapshot_observed_at":"2026-07-06T16:13:23.343694Z","submitted_at":"2023-09-01T17:59:44Z","title":"Baseline Defenses for Adversarial Attacks Against Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2309.00614","doi":"10.48550/arxiv.2309.00614","metadata_source":"pith","pith_arxiv_id":"2309.00614","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Baseline Defenses for Adversarial Attacks Against Aligned Language Models","venue":"cs.LG","work_id":"db5870ca-177b-4d1d-a08d-ee5ceab17fe3","year":2023},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"cited_paper":"/paper/2309.00614","citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:dc5f30774154b4586b549cead3c2b6023a4b26b98c59bce0e1ee5858d4ecd9a6","observation_id":"3334fb1b-1f0b-4af7-83ed-f8955a7ebb35","resolution":{"observed_at":"2026-05-18T05:25:54.584578Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-12T03:19:31.483658+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T03:19:31.483658+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":"2001.08361","doi":"10.1145/3616855.3635845","metadata_source":"pith","pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Laws for Neural Language Models","venue":"cs.LG","work_id":"b7dd8749-9c45-4977-ab9b-64478dce1ae8","year":2020},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:002282b843a0c0864f7ec945633ddd1016f9c7115b9cceb9493417d3571b926d","observation_id":"c39e4aac-3abc-478b-9ea1-51ed769a62ea","resolution":{"observed_at":"2026-05-18T05:25:54.608709Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03191","last_updated":"2024-11-28T13:43:50Z","snapshot_observed_at":"2026-08-04T19:12:56.970085Z","submitted_at":"2023-11-06T15:29:30Z","title":"DeepInception: Hypnotize Large Language Model to Be Jailbreaker","version":5},"cited_work":{"arxiv_id":"2311.03191","doi":"10.48550/arxiv.2311.03191","metadata_source":"pith","pith_arxiv_id":"2311.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepInception: Hypnotize Large Language Model to Be Jailbreaker","venue":"cs.LG","work_id":"5ab14a22-d25d-4d5f-8b1e-f2ff79daf69d","year":2023},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"cited_paper":"/paper/2311.03191","citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:00b4b0e609307aebc71ed3efdb576334796853fb3172f631e6cabfc367dcf8e6","observation_id":"692ae75b-197e-4f6e-8e29-e1d2b887ca24","resolution":{"observed_at":"2026-05-19T10:37:07.279605Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13068","last_updated":"2026-04-18T08:25:50Z","snapshot_observed_at":"2026-08-04T20:18:53.393132Z","submitted_at":"2024-05-20T17:17:55Z","title":"Uncovering Logit Suppression Vulnerabilities in LLM Safety Alignment","version":4},"cited_work":{"arxiv_id":"2405.13068","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.13068","snapshot_observed_at":"2026-07-03T11:58:06.187543Z","title":"Uncovering Logit Suppression Vulnerabilities in LLM Safety Alignment","venue":"cs.CR","work_id":"6a91df1e-a757-48f8-8a05-1583522ece9d","year":2024},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"cited_paper":"/paper/2405.13068","citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:566d2eaa67e83f8e876f813e391965d5a820cb238dc9d214f12af446c7ab0033","observation_id":"3630742f-6a01-4f88-983f-14b53afa37ef","resolution":{"observed_at":"2026-05-18T05:25:54.619328Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01552","last_updated":"2023-12-04T00:46:11Z","snapshot_observed_at":"2026-08-07T00:42:49.627314Z","submitted_at":"2023-12-04T00:46:11Z","title":"The Unlocking Spell on Base LLMs: Rethinking Alignment via In-Context Learning","version":1},"cited_work":{"arxiv_id":"2312.01552","doi":"10.48550/arxiv.2312.01552","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.01552","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2312.01552 , year=","venue":"arXiv (Cornell University)","work_id":"f9e86809-ec80-4d62-85ec-21e6c6680c43","year":2023},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"cited_paper":"/paper/2312.01552","citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:94d987d8f62dc68f5b0cda6ee7b1382f3db223992f887ead645b11cff4d245a8","observation_id":"a4f16710-d197-41d0-9f06-c86237e9b564","resolution":{"observed_at":"2026-05-18T05:25:54.623202Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04451","last_updated":"2024-03-20T21:34:56Z","snapshot_observed_at":"2026-08-06T02:57:30.438059Z","submitted_at":"2023-10-03T19:44:37Z","title":"AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":"2310.04451","doi":"10.48550/arxiv.2310.04451","metadata_source":"pith","pith_arxiv_id":"2310.04451","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models","venue":"cs.CL","work_id":"3b676de6-edef-4976-a8b5-082d4ff50867","year":2023},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"cited_paper":"/paper/2310.04451","citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:f66a416dee5b226948b60e00e05223e5f66f86737ec7fe6f4e19b59f7e5e3d0e","observation_id":"7604e27f-5245-40be-ac1c-8aba2983e0c0","resolution":{"observed_at":"2026-05-18T05:25:54.615726Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-23T04:52:41.614605+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T04:52:41.614605+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02832","last_updated":"2026-05-15T07:55:39Z","snapshot_observed_at":"2026-07-06T19:27:16.301809Z","submitted_at":"2024-10-02T08:41:23Z","title":"FlipAttack: Jailbreak LLMs via Flipping","version":2},"cited_work":{"arxiv_id":"2410.02832","doi":"10.48550/arxiv.2410.02832","metadata_source":"pith","pith_arxiv_id":"2410.02832","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FlipAttack: Jailbreak LLMs via Flipping","venue":"cs.CR","work_id":"247bb9a4-1fea-4de4-9873-697a30aae57b","year":2024},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"cited_paper":"/paper/2410.02832","citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:63bebd0e6c92cb0549ffe01036e4a331a79710ea344909413f5f040b047191e3","observation_id":"eddb566c-e329-4d43-988d-fec1b861e745","resolution":{"observed_at":"2026-05-20T00:00:16.351675Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-02T11:57:18.735747Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:ebed93a5954d7dc3565113bd6c4895fe49df41a4dfff441096b54647c05abb8e","observation_id":"f005551b-3535-4fbc-8b50-44a2164ce102","resolution":{"observed_at":"2026-05-18T05:25:54.612403Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":"2310.06387","doi":"10.48550/arxiv.2310.06387","metadata_source":"pith","pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":"cs.LG","work_id":"4fe10dc2-a8a4-46ec-bb39-b0edae135f1d","year":2023},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:7ce1416af27631fdf52f99268fe58d3a61f7d472938200cbbcf3572039d0fccd","observation_id":"8b9af65f-eef9-4e39-b148-2c7c4b2f4287","resolution":{"observed_at":"2026-05-18T05:25:54.630924Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19041","last_updated":"2025-05-28T06:36:50Z","snapshot_observed_at":"2026-07-06T20:43:00.304358Z","submitted_at":"2025-02-26T10:53:58Z","title":"Beyond Surface-Level Patterns: An Essence-Driven Defense Framework Against Jailbreak Attacks in LLMs","version":2},"cited_work":{"arxiv_id":"2502.19041","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.19041","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond surface-level pat- terns: An essence-driven defense framework against jailbreak attacks in llms.arXiv preprint arXiv:2502.19041","venue":null,"work_id":"cc5a3173-97a8-4c76-a683-cd1b42b94116","year":null},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"cited_paper":"/paper/2502.19041","citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:1aa91610b81c18ce7dc78afbd87d0ca76228b983b6443829f9cbe368581043f1","observation_id":"f4a23f62-8ce5-41e7-8783-73cd59afbd12","resolution":{"observed_at":"2026-05-18T05:25:54.651445Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02756","last_updated":"2024-06-04T20:21:45Z","snapshot_observed_at":"2026-07-06T18:25:31.706930Z","submitted_at":"2024-06-04T20:21:45Z","title":"Aligning Large Language Models via Fine-grained Supervision","version":1},"cited_work":{"arxiv_id":"2406.02756","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.02756","snapshot_observed_at":"2026-07-02T07:26:46.053194Z","title":"Aligning large language models via fine-grained supervision.arXiv preprint arXiv:2406.02756, 2024a","venue":null,"work_id":"343ea319-092b-42f2-ba3c-7a9854d00bd2","year":2024},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"cited_paper":"/paper/2406.02756","citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:83e620c9090de1864e2f01d2947331c3aa11cfd19f2bbab6ea3f9eba266834f7","observation_id":"fcdc1f0f-0310-4bd3-85ac-c878661eb97d","resolution":{"observed_at":"2026-05-18T05:25:54.634495Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01565","last_updated":"2025-05-21T16:29:45Z","snapshot_observed_at":"2026-07-30T17:30:05.335961Z","submitted_at":"2024-11-03T13:36:34Z","title":"SQL Injection Jailbreak: A Structural Disaster of Large Language Models","version":6},"cited_work":{"arxiv_id":"2411.01565","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.01565","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sql injection jailbreak: A structural disaster of large language models.arXiv preprint arXiv:2411.01565","venue":null,"work_id":"91af8c96-a6f8-4765-982f-e4da6ca91575","year":null},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"cited_paper":"/paper/2411.01565","citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:478f9ceda6eb1ed70e11d2d4520c6d143299e0f7a0ac295e96856474e412ea61","observation_id":"e1dc0f50-33f0-44c8-a642-1a38297e42ae","resolution":{"observed_at":"2026-05-18T05:25:54.641114Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":"2303.18223","doi":"10.18653/v1/d16-1080","metadata_source":"pith","pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey of Large Language Models","venue":"cs.CL","work_id":"de1b42b5-4a0a-4b1f-8c78-1f7fe21be6c9","year":2023},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:83c53255542c1d7434af17bed451e7cad8d442e56eac252e34ba1daa0e9cce82","observation_id":"47c0bf16-1594-4405-a165-94c5d2ae83f1","resolution":{"observed_at":"2026-05-18T05:25:54.637716Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:cb5d1e72a3ee02b5b6eb5b5b9269dc05c2828f4e9cd7564991f6a47a233669ee","observation_id":"bde3143e-20e0-43e6-a32c-d846de78f1bd","resolution":{"observed_at":"2026-05-18T05:25:54.644521Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"comment- ing out","venue":null,"work_id":"87ae847b-d842-4c6b-8e92-a61ea4e1604f","year":2023},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:01ff8c99e87afe01d71b1297c691c67b141eab7b62773c8a22638d45e6069620","observation_id":"26b76b3f-b214-4dfe-876f-9241edfc35ca","resolution":{"observed_at":"2026-05-18T05:25:54.981075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Can I”, significantly outperform prefixes that carry a strong personal or instructional intent, like “Can you teach me to do this to others","venue":null,"work_id":"2d66072b-a4f1-4f9f-aa0f-141c96ed598a","year":2025},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:abb5565051a278020125296221e902647ba84387c2f78d308ce998bd2ae25a5f","observation_id":"0ff281eb-4bc6-480f-8262-4ba0b439132c","resolution":{"observed_at":"2026-05-18T05:25:54.983873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"role-playing","venue":null,"work_id":"75511153-187b-41fa-877e-c37f55b4d408","year":2025},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:2e2618e81d3191bd9646abd9596dcf0d677f1787692a936366b46fdc2863bdcb","observation_id":"e22bf799-5ac6-4635-9ffa-62842cc5e0f9","resolution":{"observed_at":"2026-05-18T05:25:54.978587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","latest_version":2,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":20,"verified_fuzzy":6},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2510.20129."}