{"as_of":"2026-08-22T06:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7b1811cb180bc64faac2ca053fa8d6386a6eb1c8f0af92af17b145c262f358aa","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:29:10.244362Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-08T10:00:02.677030Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T10:04:51.400037Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"cited_work":{"arxiv_id":"2508.12072","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.12072","snapshot_observed_at":"2026-07-08T10:04:51.400037Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","venue":"cs.CR","work_id":"70c16172-7f5b-4b76-b8bb-07e332ebee0d","year":2025},"citing_paper":{"arxiv_id":"2607.06326","last_updated":"2026-07-07T14:25:05Z","snapshot_observed_at":"2026-08-20T18:39:10.480221Z","submitted_at":"2026-07-07T14:25:05Z","title":"DT-Guard: Intent-Driven Reasoning-Active Training for Reasoning-Free LLM Safety Guardrail","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-08T10:00:02.677030Z"},"links":{"cited_paper":"/paper/2508.12072","citing_paper":"/paper/2607.06326"},"observation_digest":"sha256:5e4f4071ddb27ce7895003961a861de6e3a61518036f5dbb2188ed12e8ce21db","observation_id":"89d30831-1b5d-4210-8782-5bdf095841ab","resolution":{"observed_at":"2026-07-08T10:04:51.403792Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.12072/citation-record","integrity":"/paper/2508.12072/integrity","json":"/paper/2508.12072/citation-record.json","paper":"/paper/2508.12072"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:29:11.500207Z","title":"Jailbreaking leading safety-aligned LLM s with simple adaptive attacks","venue":null,"work_id":"7bba2e98-3b29-4b63-9737-b19db92d8d20","year":2025},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:09.880216Z"},"links":{"citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:c8bd05cedcae4db162797d7ad4205f79afc349d2d2442220ea089fc050808d46","observation_id":"3c47d5bc-078a-4911-9100-e4c7d9d32834","resolution":{"observed_at":"2026-08-15T17:29:11.506187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:29:11.479811Z","title":"Activating ai safety level 3 protections","venue":null,"work_id":"0ec99dda-e4e6-4822-a702-104e4bec4416","year":2025},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:09.887473Z"},"links":{"citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:bf13530bc057f0475f8a19446e708f3f9492a0c1e1f9b0bacb8ab670e841864f","observation_id":"ff32cf5d-a269-441e-a9f2-ea87259c1f43","resolution":{"observed_at":"2026-08-15T17:29:11.485732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:29:11.458788Z","title":"Refusal in language models is mediated by a single direction","venue":null,"work_id":"0c822ad9-09ba-41e3-8139-506432974779","year":2024},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:09.894162Z"},"links":{"citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:253c3f1aa97a7d584f736689bb1a9456efabe2386d881bf00a3d3b96cb677c82","observation_id":"0b033b50-671b-46d4-81b7-46f84c169124","resolution":{"observed_at":"2026-08-15T17:29:11.466366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00861","last_updated":"2021-12-09T21:40:22Z","snapshot_observed_at":"2026-08-10T12:03:10.373653Z","submitted_at":"2021-12-01T22:24:34Z","title":"A General Language Assistant as a Laboratory for Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00861","snapshot_observed_at":"2026-08-15T17:29:09.902399Z","title":"A general language assistant as a laboratory for alignment","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:09.902399Z"},"links":{"cited_paper":"/paper/2112.00861","citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:fbb03d834f1025593629df795661cc23c4e2216031670cd5f1a97067d4aaf5b5","observation_id":"ef4bdce6-965c-4458-a52e-d6b2ddea170e","resolution":{"observed_at":"2026-08-15T17:29:09.902399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:29:11.438845Z","title":"GASP : Efficient black-box generation of adversarial suffixes for jailbreaking LLM s","venue":null,"work_id":"29e45f46-e8d5-4977-8d7a-8027686d9d62","year":2025},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:09.908203Z"},"links":{"citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:fd54920f8d132c32e72a2e50ce2ff1c0359f2ff3336ce74c4ef40a618ff2f04f","observation_id":"3ad2a0fb-09d3-4301-b1c6-f2b2ac4e7ff3","resolution":{"observed_at":"2026-08-15T17:29:11.446110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:29:09.913375Z","title":"Safety-tuned LL a MA s: Lessons from improving the safety of large language models that follow instructions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:09.913375Z"},"links":{"citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:b406e70e7e95fe8ccbe85778f7c3c2f8c5a532d682ff375386e2984a858c22ab","observation_id":"59b184fa-1d4b-4f0d-ada9-f989831c3c4f","resolution":{"observed_at":"2026-08-15T17:29:09.913375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14348","last_updated":"2024-06-12T00:27:06Z","snapshot_observed_at":"2026-08-18T09:36:32.490699Z","submitted_at":"2023-09-18T02:07:22Z","title":"Defending Against Alignment-Breaking Attacks via Robustly Aligned LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14348","snapshot_observed_at":"2026-08-15T17:29:09.919474Z","title":"Defending against alignment-breaking attacks via robustly aligned llm","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:09.919474Z"},"links":{"cited_paper":"/paper/2309.14348","citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:4fa688c30f25984610745c4b0a0124cee8fb225e20f1a2698606e617d0f1a1eb","observation_id":"7a1a998c-30b8-42e9-b002-bd04ea3bd9c6","resolution":{"observed_at":"2026-08-15T17:29:09.919474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-11T16:28:21.917686Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-08-15T17:29:09.925144Z","title":"Jailbreakbench: An open robustness benchmark for jailbreaking large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:09.925144Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:917e11d1e34dc0b39dfad901ee891305ca3afe45aa403f9014c0a587bbd9254d","observation_id":"b8bfb122-33d5-4986-b14c-174550b222c9","resolution":{"observed_at":"2026-08-15T17:29:09.925144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:29:09.930800Z","title":"Jailbreaking black box large language models in twenty queries","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:09.930800Z"},"links":{"citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:da47401d545cb549420d62b974ea0877f4e51e506e35878a5a723a7e4f4fad1f","observation_id":"6f0dd45f-00fa-4e13-a78b-cadf03b6f165","resolution":{"observed_at":"2026-08-15T17:29:09.930800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-15T17:29:09.936340Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:09.936340Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:0eba3d8dd6a8b3de86d84ef2d0b81e455197b0b1bd48939bf847053aec66b0ea","observation_id":"63de3034-a7a0-40ac-a943-b50d34b6a3f0","resolution":{"observed_at":"2026-08-15T17:29:09.936340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-15T17:29:09.943941Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:09.943941Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:651d279850d0ba8c9d02949f324c7b984ef5a3fa1f8f57d76a8207be8b8c7346","observation_id":"13d2f2a6-8ea2-4f8a-9396-3cf5042ee6f6","resolution":{"observed_at":"2026-08-15T17:29:09.943941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:29:09.952336Z","title":"A mathematical framework for transformer circuits","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:09.952336Z"},"links":{"citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:06ad629e7ee41697a4de058fc36136c39bff16809e369d8d5994e930570ddad7","observation_id":"d3be2c77-c0f2-4937-92bf-84b0262b70b6","resolution":{"observed_at":"2026-08-15T17:29:09.952336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T17:29:09.958673Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:09.958673Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:6f1a058c2964967f2da0b48aac6a086ca849c55c0debe43939b4f2621c7688cd","observation_id":"3f26b293-9976-48dd-8802-4f36cffd17f4","resolution":{"observed_at":"2026-08-15T17:29:09.958673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-15T17:29:09.965838Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:09.965838Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:aa9bea2cf0e8534531de12bb4b000db1d63400325a37658b8f2564b4156853d2","observation_id":"021d5cfe-93c4-4e14-9fa0-793148835295","resolution":{"observed_at":"2026-08-15T17:29:09.965838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:29:11.386071Z","title":"Intention awareness: Improving upon situation awareness in human-centric environments","venue":null,"work_id":"590e758c-be2f-480e-9197-03bf310c42ed","year":2013},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:09.973500Z"},"links":{"citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:0ec201e0cf1d62719ca73604109172d538b40a216bf6a1823dac5fe8e0c221cd","observation_id":"f0edbdc2-8b21-4269-b1c7-949d6e369a13","resolution":{"observed_at":"2026-08-15T17:29:11.391025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00614","last_updated":"2023-09-04T17:47:36Z","snapshot_observed_at":"2026-07-06T16:13:23.343694Z","submitted_at":"2023-09-01T17:59:44Z","title":"Baseline Defenses for Adversarial Attacks Against Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00614","snapshot_observed_at":"2026-08-15T17:29:09.980047Z","title":"Baseline defenses for adversarial attacks against aligned language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:09.980047Z"},"links":{"cited_paper":"/paper/2309.00614","citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:b66d222ffa73ab2b40c1b2bcbb015f66756783e51a505eac9d1d782b719d4801","observation_id":"853b76b3-30c6-4bd7-bd76-5bbaadc4f97c","resolution":{"observed_at":"2026-08-15T17:29:09.980047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-15T17:29:09.986599Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:09.986599Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:80696cf699e1965fedaa7019bdb429a0494419dce0c2e90cdd9e19ad82baa101","observation_id":"6234d0f2-dcd9-42b5-af94-bb3c41225c08","resolution":{"observed_at":"2026-08-15T17:29:09.986599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:29:09.992450Z","title":"Wildteaming at scale: From in-the-wild jailbreaks to (adversarially) safer language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:09.992450Z"},"links":{"citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:020bb0d03a0af3bf529afb86d9f69f26ea79e2c7fbb1ec535831616eafd92dfc","observation_id":"cc856a12-6e8b-41d8-8f0f-b6485dbe3ec4","resolution":{"observed_at":"2026-08-15T17:29:09.992450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03218","last_updated":"2024-05-15T19:16:09Z","snapshot_observed_at":"2026-08-15T06:18:34.739211Z","submitted_at":"2024-03-05T18:59:35Z","title":"The WMDP Benchmark: Measuring and Reducing Malicious Use With Unlearning","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03218","snapshot_observed_at":"2026-08-15T17:29:09.999175Z","title":"Li, Ann-Kathrin Dombrowski, Shashwat Goel, Long Phan, Gabriel Mukobi, Nathan Helm-Burger, Rassin Lababidi, Lennart Justen, Andrew B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:09.999175Z"},"links":{"cited_paper":"/paper/2403.03218","citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:ab17d351087e2cd0e182c83ce430649c13052e62e7a8a5f51e783dfbf8b7b300","observation_id":"44f10ae0-5251-4bde-885a-99f4a207a0b8","resolution":{"observed_at":"2026-08-15T17:29:09.999175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03191","last_updated":"2024-11-28T13:43:50Z","snapshot_observed_at":"2026-08-18T06:50:23.685098Z","submitted_at":"2023-11-06T15:29:30Z","title":"DeepInception: Hypnotize Large Language Model to Be Jailbreaker","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03191","snapshot_observed_at":"2026-08-15T17:29:10.005464Z","title":"Deepinception: Hypnotize large language model to be jailbreaker","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:10.005464Z"},"links":{"cited_paper":"/paper/2311.03191","citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:e37ff76cbea9b4e57546595c28d3a815a19f75d0e0ad76142480ce06da305fd5","observation_id":"22c555b8-c51d-479d-97ad-bac6f2b5d7b8","resolution":{"observed_at":"2026-08-15T17:29:10.005464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-15T17:29:10.012108Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:10.012108Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:29f083a6f950d19815e6276daa17580e95b57b0f3eaf57a815e9a87d04217a2b","observation_id":"54677ca1-7d48-4193-af87-dd22cd5eee36","resolution":{"observed_at":"2026-08-15T17:29:10.012108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04451","last_updated":"2024-03-20T21:34:56Z","snapshot_observed_at":"2026-08-16T14:36:14.029419Z","submitted_at":"2023-10-03T19:44:37Z","title":"AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04451","snapshot_observed_at":"2026-08-15T17:29:10.019491Z","title":"Autodan: Generating stealthy jailbreak prompts on aligned large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:10.019491Z"},"links":{"cited_paper":"/paper/2310.04451","citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:a92a38748578c4b5fbdfb6d06ccd39fa45e5ce6754a9dcf009215b8520eefaf1","observation_id":"5338bdcf-806b-413c-a126-cec8fac44fe9","resolution":{"observed_at":"2026-08-15T17:29:10.019491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15911","last_updated":"2024-02-24T21:27:13Z","snapshot_observed_at":"2026-08-20T15:49:43.570647Z","submitted_at":"2024-02-24T21:27:13Z","title":"PRP: Propagating Universal Perturbations to Attack Large Language Model Guard-Rails","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15911","snapshot_observed_at":"2026-08-15T17:29:10.029145Z","title":"Prp: Propagating universal perturbations to attack large language model guard-rails","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:10.029145Z"},"links":{"cited_paper":"/paper/2402.15911","citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:5e7b98b613dd811b82041700ef0bd4a5c6931b682b7bc2401f72f105aa0cbb19","observation_id":"8e860e02-3f08-4eee-8f69-55d3dc824a19","resolution":{"observed_at":"2026-08-15T17:29:10.029145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:29:11.356908Z","title":"GPTEval : A survey on assessments of ChatGPT and GPT-4","venue":null,"work_id":"191590a7-838d-4d14-b249-6a3847c3d120","year":2024},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:10.035174Z"},"links":{"citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:ea85ea8a81d4c8f6a0c7a00bd0640234a00a3089a8baea4f878e5708d15fe050","observation_id":"403c4415-1430-4150-8002-1e9843f09e9d","resolution":{"observed_at":"2026-08-15T17:29:11.362490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:29:11.337526Z","title":"Interpreting GPT : The logit lens, 2020","venue":null,"work_id":"4311db7f-8afa-46be-9f5a-bfda2d754d5b","year":2020},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:10.042023Z"},"links":{"citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:f6e3d304a9302ecdb9119a3458dd2fdad8368a8c1e87598c1c5c88adc3e178e7","observation_id":"3ae14a51-dbc4-42b3-90f1-e23a9b1669bf","resolution":{"observed_at":"2026-08-15T17:29:11.343169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:29:10.047010Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:10.047010Z"},"links":{"citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:c58b37636561f918a3aa24f66fcaa53bf06e1c52b4d159b34ba2bde2e86d0b65","observation_id":"03e33d49-f9a8-4592-8c47-fae210e467a2","resolution":{"observed_at":"2026-08-15T17:29:10.047010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06681","last_updated":"2024-07-05T15:30:45Z","snapshot_observed_at":"2026-08-15T08:04:06.283165Z","submitted_at":"2023-12-09T04:40:46Z","title":"Steering Llama 2 via Contrastive Activation Addition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06681","snapshot_observed_at":"2026-08-15T17:29:10.052229Z","title":"Steering llama 2 via contrastive activation addition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:10.052229Z"},"links":{"cited_paper":"/paper/2312.06681","citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:dc6f31d51c93a6bfdebd39dba0658f82f2b1c45f1cd651e133be94ef246e416d","observation_id":"fb54500f-058f-4482-bdc6-9d96135326db","resolution":{"observed_at":"2026-08-15T17:29:10.052229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07494","last_updated":"2024-11-12T02:44:49Z","snapshot_observed_at":"2026-08-20T15:49:34.743315Z","submitted_at":"2024-11-12T02:44:49Z","title":"Rapid Response: Mitigating LLM Jailbreaks with a Few Examples","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07494","snapshot_observed_at":"2026-08-15T17:29:10.059063Z","title":"Rapid response: Mitigating llm jailbreaks with a few examples","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:10.059063Z"},"links":{"cited_paper":"/paper/2411.07494","citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:69861fbd8dc8f47f8a497e4726c23eb16e7068862eeb03cf00beb9a86da9f0e5","observation_id":"1a225055-0953-4e84-b4e3-ed03311b145e","resolution":{"observed_at":"2026-08-15T17:29:10.059063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-15T17:29:10.065531Z","title":"Fine-tuning aligned language models compromises safety, even when users do not intend to! arXiv preprint arXiv:2310.03693, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:10.065531Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:e4c6c07016dcf557461e03979be05ccacfbdc0cc9bdc7114b5f10fa871d13006","observation_id":"1967755b-1600-452e-a007-171c105495d1","resolution":{"observed_at":"2026-08-15T17:29:10.065531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05946","last_updated":"2024-06-10T00:35:23Z","snapshot_observed_at":"2026-08-18T11:01:42.927110Z","submitted_at":"2024-06-10T00:35:23Z","title":"Safety Alignment Should Be Made More Than Just a Few Tokens Deep","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05946","snapshot_observed_at":"2026-08-15T17:29:10.071729Z","title":"Safety alignment should be made more than just a few tokens deep","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:10.071729Z"},"links":{"cited_paper":"/paper/2406.05946","citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:6dca10fdca2ff45fe9e0db730e13cf8482bd60b9d5cb87dd2ac4a8ddf0e0e45e","observation_id":"363cc3c7-c03e-409c-b430-ade50ee50753","resolution":{"observed_at":"2026-08-15T17:29:10.071729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:29:10.078388Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:10.078388Z"},"links":{"citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:bd965f3144fea03d504bc5840b51d469455956f24fd7b818544ecf70d743fbb0","observation_id":"95a18e53-130b-4ffa-9d6b-9ba0555f5520","resolution":{"observed_at":"2026-08-15T17:29:10.078388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:29:10.083742Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:10.083742Z"},"links":{"citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:8ef4fb28bdb5badcb9a68170850dc7ddc7f22d8b4ac75e13aec92277dc527e0d","observation_id":"e43708b6-0e92-475d-99dc-534bc8a2f176","resolution":{"observed_at":"2026-08-15T17:29:10.083742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03684","last_updated":"2024-06-11T19:02:52Z","snapshot_observed_at":"2026-08-17T15:25:03.596568Z","submitted_at":"2023-10-05T17:01:53Z","title":"SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03684","snapshot_observed_at":"2026-08-15T17:29:10.089503Z","title":"Smoothllm: Defending large language models against jailbreaking attacks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:10.089503Z"},"links":{"cited_paper":"/paper/2310.03684","citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:4a1d73695a804d76937ace2d3a40f3f02fe3a115ca255e64c1a6154e07a16360","observation_id":"4e191eec-8cc5-42bf-866f-9dc69522eafc","resolution":{"observed_at":"2026-08-15T17:29:10.089503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01263","last_updated":"2024-04-01T11:50:35Z","snapshot_observed_at":"2026-08-20T18:53:27.304270Z","submitted_at":"2023-08-02T16:30:40Z","title":"XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01263","snapshot_observed_at":"2026-08-15T17:29:10.096105Z","title":"Xstest: A test suite for identifying exaggerated safety behaviours in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:10.096105Z"},"links":{"cited_paper":"/paper/2308.01263","citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:e9cf130957668d0b960ca7b210b7f4a69a494e40bff03f25a5cd61e8d4734123","observation_id":"916aba2d-6834-429c-a140-da9de1f01423","resolution":{"observed_at":"2026-08-15T17:29:10.096105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:29:11.279594Z","title":"A trivial jailbreak against llama 3","venue":null,"work_id":"f0483f68-acc7-4704-beb3-7d9c76623ce3","year":2024},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:10.103374Z"},"links":{"citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:ebd5c8c0b0cd1bc75a597aa142192e2726e9832dc2ff1c918404012150f3b71d","observation_id":"75bf6229-c3f8-4972-b8ad-3cf180975230","resolution":{"observed_at":"2026-08-15T17:29:11.284859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:29:10.109488Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:10.109488Z"},"links":{"citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:21fc1b2511e189958898b4aeb675f80231afee0b703e30a315cdfdc865868c3b","observation_id":"b30ac8b4-1fdd-4b70-ae18-d0e80df57d38","resolution":{"observed_at":"2026-08-15T17:29:10.109488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10248","last_updated":"2024-10-10T13:20:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-20T12:21:05Z","title":"Steering Language Models With Activation Engineering","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10248","snapshot_observed_at":"2026-08-15T17:29:10.115243Z","title":"Steering language models with activation engineering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:10.115243Z"},"links":{"cited_paper":"/paper/2308.10248","citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:3189c39ce02e95766fe5f27fb918add51e8ac51bcd307401f65b138e67eba220","observation_id":"c8137613-46a6-4763-b7e6-b6edb5f68863","resolution":{"observed_at":"2026-08-15T17:29:10.115243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:29:10.121110Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:10.121110Z"},"links":{"citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:38735fa2c6294ad7a972e8d7f47ee2c9f51bbbd6320c7d6966417b755de8f4ae","observation_id":"0f42bf46-0ab5-442e-8e3e-686ad93b263d","resolution":{"observed_at":"2026-08-15T17:29:10.121110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:29:11.233127Z","title":"Backdooralign: Mitigating fine-tuning based jailbreak attack with backdoor enhanced safety alignment","venue":null,"work_id":"00adde4c-1ae3-41a8-9d0e-dd3768582338","year":2024},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:10.127407Z"},"links":{"citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:c38b93a3a21678265b69ef11a6b043fda59055a1efe6e3422059323a82b4199d","observation_id":"e08b5517-3148-4184-8c94-4806f4113af1","resolution":{"observed_at":"2026-08-15T17:29:11.238788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:29:10.132535Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:10.132535Z"},"links":{"citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:44fd54031733d018829d7dcbb89768a201bfec328b4dbc5288f0ba17ef2b3706","observation_id":"f1670cfe-f217-4d1b-a61c-5d69e4ad09a0","resolution":{"observed_at":"2026-08-15T17:29:10.132535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-16T14:53:33.115609Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-15T17:29:10.137872Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:10.137872Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:86296e61f573f8c386d70fd7e20c4a017aaf3a7570e46b6ec6aee3d8681fddbe","observation_id":"9443b52e-49d8-4b5e-b54b-912e938cb6bd","resolution":{"observed_at":"2026-08-15T17:29:10.137872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:29:10.143425Z","title":"Defending chatgpt against jailbreak attack via self-reminders","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:10.143425Z"},"links":{"citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:5ea5f34af106e2fb522611d55d09710504c86d79d0d1c545377ca6b705e71a03","observation_id":"c7396fc9-14c9-4ac8-bf22-f3fa6ae7041f","resolution":{"observed_at":"2026-08-15T17:29:10.143425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:29:11.191145Z","title":null,"venue":null,"work_id":"a34943a8-3b96-42ed-b146-9adc508a22e1","year":2024},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:10.149962Z"},"links":{"citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:f5f8d3b75dd26c7483c4e7c009da4797a889e7939db8f3515f68c9a3bd6f1953","observation_id":"008c067d-6be2-406a-86c9-b962e2d64528","resolution":{"observed_at":"2026-08-15T17:29:11.197462Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-15T17:29:10.155747Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:10.155747Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:0a8a0ba52b367a50105642d72e93adfa73fb908395e5cc41d6f29998baf8c95f","observation_id":"6bb7a1ac-0db6-4658-973b-29e124550a31","resolution":{"observed_at":"2026-08-15T17:29:10.155747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23556","last_updated":"2025-05-29T15:33:39Z","snapshot_observed_at":"2026-08-14T07:04:41.384971Z","submitted_at":"2025-05-29T15:33:39Z","title":"Understanding Refusal in Language Models with Sparse Autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23556","snapshot_observed_at":"2026-08-15T17:29:10.162261Z","title":"Understanding refusal in language models with sparse autoencoders","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:10.162261Z"},"links":{"cited_paper":"/paper/2505.23556","citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:c948dcbef19e99560c75a97cb834aacadb167d1a3bbe685dec73e407b06a3c51","observation_id":"21c0f68c-05f5-45de-8f2d-d8090664d7ac","resolution":{"observed_at":"2026-08-15T17:29:10.162261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06463","last_updated":"2024-03-26T04:23:12Z","snapshot_observed_at":"2026-08-19T19:09:36.928554Z","submitted_at":"2023-08-12T04:05:57Z","title":"GPT-4 Is Too Smart To Be Safe: Stealthy Chat with LLMs via Cipher","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06463","snapshot_observed_at":"2026-08-15T17:29:10.169290Z","title":"Gpt-4 is too smart to be safe: Stealthy chat with llms via cipher","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:10.169290Z"},"links":{"cited_paper":"/paper/2308.06463","citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:a793ed40e711b5ddb61b76950132aa8aafc7c0ede7c2ae78414dc87684e4f503","observation_id":"a0dae1fc-7da4-42d3-9976-ed7b99e495be","resolution":{"observed_at":"2026-08-15T17:29:10.169290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:29:11.167353Z","title":"How johnny can persuade llms to jailbreak them: Rethinking persuasion to challenge ai safety by humanizing llms","venue":null,"work_id":"2def3bcd-2374-48cb-9797-feb17c50e847","year":2024},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:10.175799Z"},"links":{"citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:52ae388c022794d4a5244a35819f0058f93ee65788423fe9d1f977ed4eb99b49","observation_id":"cdaec08b-c9ea-489f-ba3f-ef2362598c0c","resolution":{"observed_at":"2026-08-15T17:29:11.173330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06561","last_updated":"2024-12-16T08:43:24Z","snapshot_observed_at":"2026-08-20T15:49:35.318884Z","submitted_at":"2024-01-12T13:15:05Z","title":"Intention Analysis Makes LLMs A Good Jailbreak Defender","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06561","snapshot_observed_at":"2026-08-15T17:29:10.184512Z","title":"Intention analysis makes llms a good jailbreak defender","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:10.184512Z"},"links":{"cited_paper":"/paper/2401.06561","citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:c186a911571cd0fdb10cd3ca829c3b7fc7adc87b496fc041dd01d3179e0ed3e9","observation_id":"f8370a41-0248-4bd0-9d69-30bf64fb40aa","resolution":{"observed_at":"2026-08-15T17:29:10.184512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19633","last_updated":"2025-03-25T13:19:46Z","snapshot_observed_at":"2026-08-16T12:46:59.807198Z","submitted_at":"2025-03-25T13:19:46Z","title":"1.4 Million Open-Source Distilled Reasoning Dataset to Empower Large Language Model Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19633","snapshot_observed_at":"2026-08-15T17:29:10.191260Z","title":"1.4 million open-source distilled reasoning dataset to empower large language model training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:10.191260Z"},"links":{"cited_paper":"/paper/2503.19633","citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:7b3f2102d30bdb38f474fe6f8af114e5c8da7f27fc31e9643e78a47daa6d6a98","observation_id":"91f1dd1e-2f8b-4c24-9cdc-9b38a1ce7133","resolution":{"observed_at":"2026-08-15T17:29:10.191260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:29:11.141467Z","title":"Improved few-shot jailbreaking can circumvent aligned language models and their defenses","venue":null,"work_id":"ff21882c-ebbf-4e22-b984-56f2ad74ffaf","year":2024},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:10.198323Z"},"links":{"citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:7fc6b3669ea9a05b928bdbd154671f9e03d7fd93b14b54d5ada442ed26b47702","observation_id":"876c3381-9c27-4c56-a3c4-0a13060e8389","resolution":{"observed_at":"2026-08-15T17:29:11.151312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:29:10.203834Z","title":"Reasoning-to-defend: Safety-aware reasoning can defend large language models from jailbreaking","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:10.203834Z"},"links":{"citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:0bfabeca8f4b197020f8107a7a06f631c51c83eb5c589a5fd83b23717d0dd308","observation_id":"5d9f8eab-517e-4fd1-a044-4dd506347ec6","resolution":{"observed_at":"2026-08-15T17:29:10.203834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-08-12T09:06:50.363435Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-15T17:29:10.214076Z","title":"Universal and transferable adversarial attacks on aligned language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:10.214076Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:1dbcde4d21531f2b64b1d71d8b13c0cc2eaf43a61157af68996f52a04e5f9b56","observation_id":"ca6244fc-8205-4bb5-9524-e97f91c234ba","resolution":{"observed_at":"2026-08-15T17:29:10.214076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:29:10.220344Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:10.220344Z"},"links":{"citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:ff18966f26986295726607ac6988c73065424b2be6afff1b53c05d8e3a674b76","observation_id":"e39e89d7-4539-43eb-8341-579ba0114310","resolution":{"observed_at":"2026-08-15T17:29:10.220344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:29:10.228790Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:10.228790Z"},"links":{"citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:b8630ea63b7d1bb7fc9f6f1d46cac4bf5c658eb63edf9eb47381e3f4196735d0","observation_id":"42bf9968-7716-4cf6-bdbe-b604aa7e73a0","resolution":{"observed_at":"2026-08-15T17:29:10.228790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:29:10.237302Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:10.237302Z"},"links":{"citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:daf6828e7f0ed5a7b2dc5a958334a6a6cc1e3c2d0b71a9c109187c10c4e5f5c6","observation_id":"8055015f-f9de-4743-8421-f05ec6aa6590","resolution":{"observed_at":"2026-08-15T17:29:10.237302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:29:10.244362Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T17:29:10.244362Z"},"links":{"citing_paper":"/paper/2508.12072"},"observation_digest":"sha256:6a4c1ab94806401dacc57e3e500e15ae8fa3895bb3495b28fc628669ef9a95f4","observation_id":"ccfee3f8-9b7d-4227-afdb-a4b12c04e79c","resolution":{"observed_at":"2026-08-15T17:29:10.244362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.12072","last_updated":"2025-08-23T06:11:04Z","latest_version":2,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-19T06:26:14.512772Z","submitted_at":"2025-08-16T15:03:33Z","title":"Mitigating Jailbreaks with Intent-Aware LLMs"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":0,"verified_fuzzy":11},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 1 inbound Pith citation observation for arXiv:2508.12072."}