{"as_of":"2026-08-18T06:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8c7f9dc3a0ab67698149b9b291122d73f8b7d963ad4e2843983ecb1fe7ac6620","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:10:31.131754Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.13562/citation-record","integrity":"/paper/2504.13562/integrity","json":"/paper/2504.13562/citation-record.json","paper":"/paper/2504.13562"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2409.00598","last_updated":"2025-06-11T03:14:28Z","snapshot_observed_at":"2026-08-17T04:34:36.439951Z","submitted_at":"2024-09-01T03:25:59Z","title":"Automatic Pseudo-Harmful Prompt Generation for Evaluating False Refusals in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00598","snapshot_observed_at":"2026-08-16T12:10:30.898210Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:30.898210Z"},"links":{"cited_paper":"/paper/2409.00598","citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:b6ccb1a697131b0f4eb0b8999ea285e68efd56320f2b45241d5821ef41d7bebc","observation_id":"62ae4d59-dd8c-457d-8afb-1fa5b705cfbc","resolution":{"observed_at":"2026-08-16T12:10:30.898210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02151","last_updated":"2025-04-17T18:55:45Z","snapshot_observed_at":"2026-08-16T14:04:12.947538Z","submitted_at":"2024-04-02T17:58:27Z","title":"Jailbreaking Leading Safety-Aligned LLMs with Simple Adaptive Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02151","snapshot_observed_at":"2026-08-16T12:10:30.904167Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:30.904167Z"},"links":{"cited_paper":"/paper/2404.02151","citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:5bda449367edaf8641e6404f6ab8f7a454d3d89b059690e320245f7816c085f5","observation_id":"d58959d5-2197-41e6-8d01-c45298f405c0","resolution":{"observed_at":"2026-08-16T12:10:30.904167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-16T12:10:30.910396Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:30.910396Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:e4a43bbdb14779559fb3a06e53d669ebd8834eea0213a95b38ccc21b2eba02b0","observation_id":"2ede2e4a-7d9d-4021-8cc7-cc0ba662f677","resolution":{"observed_at":"2026-08-16T12:10:30.910396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:10:30.915634Z","title":"Bender, Timnit Gebru, Angelina McMillan - Major, and Shmargaret Shmitchell","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:30.915634Z"},"links":{"citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:87cff7ae90679deeb15192d5c56b95468a6a1bc978263ca35369c33a18e69622","observation_id":"245933f6-3bad-4a58-866a-850cf9a12834","resolution":{"observed_at":"2026-08-16T12:10:30.915634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:10:31.955055Z","title":null,"venue":null,"work_id":"2928b29d-bb0b-4461-91fe-42f2f6ea805a","year":2024},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:30.920517Z"},"links":{"citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:7a61a21b24e0b69b09d4a244e0ccc20e3c6cb5a9148cbbb0ee75a7c503f5914f","observation_id":"18e1e37a-e73a-4df6-92d2-fade10287c68","resolution":{"observed_at":"2026-08-16T12:10:31.959640Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:10:30.925082Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:30.925082Z"},"links":{"citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:d5d3febe6b261a94b4cfa28c6f9099be4729c1699f76d3c96f8488cec71c543a","observation_id":"b600ed47-243c-4441-adb5-d84d93d8382d","resolution":{"observed_at":"2026-08-16T12:10:30.925082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-11T16:28:21.917686Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-08-16T12:10:30.930303Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:30.930303Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:06eac5ffc67a5dba4e99555b47bc0d9728d4aee5f66bbee68b5210d08675a83b","observation_id":"fffb375a-25d3-45e4-a074-0cfa3666257f","resolution":{"observed_at":"2026-08-16T12:10:30.930303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-08-16T13:08:51.920120Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08419","snapshot_observed_at":"2026-08-16T12:10:30.935163Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:30.935163Z"},"links":{"cited_paper":"/paper/2310.08419","citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:92ff39dc70ff3b8ef218652049bd631e737f492431e062bdffe997e63479d424","observation_id":"7fd13752-c144-4f96-9926-123a15e39aa2","resolution":{"observed_at":"2026-08-16T12:10:30.935163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10438","last_updated":"2025-02-09T17:03:23Z","snapshot_observed_at":"2026-08-16T20:39:14.115556Z","submitted_at":"2025-02-09T17:03:23Z","title":"Injecting Universal Jailbreak Backdoors into LLMs in Minutes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10438","snapshot_observed_at":"2026-08-16T12:10:30.939879Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:30.939879Z"},"links":{"cited_paper":"/paper/2502.10438","citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:fbb4aeb639c2a3a3950d3b4a739b2f1b686b8917faf535e54e1411c2c1944dd4","observation_id":"5f908982-cb68-417b-9abc-8fb5f5cf95d9","resolution":{"observed_at":"2026-08-16T12:10:30.939879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:10:30.944718Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:30.944718Z"},"links":{"citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:671914578e4881d724223b398291f867fe7fabdee72ecee1b6a0a283ecd4d765","observation_id":"3ca86a27-66a4-4eb5-b4bb-a387c53d98ba","resolution":{"observed_at":"2026-08-16T12:10:30.944718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20947","last_updated":"2025-06-15T21:44:25Z","snapshot_observed_at":"2026-08-16T13:47:22.319152Z","submitted_at":"2024-05-31T15:44:33Z","title":"OR-Bench: An Over-Refusal Benchmark for Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20947","snapshot_observed_at":"2026-08-16T12:10:30.948693Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:30.948693Z"},"links":{"cited_paper":"/paper/2405.20947","citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:72519da2fc2d8d60b9445c3829d4dde62fe9b2ead0d94d0b9f451cbe23965cea","observation_id":"a90b09ef-8ac4-4e71-876e-b7d460e28410","resolution":{"observed_at":"2026-08-16T12:10:30.948693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:10:31.931224Z","title":null,"venue":null,"work_id":"c22c67a1-a523-486b-b5f8-6ef74489e59b","year":2023},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:30.952547Z"},"links":{"citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:2e4d742a508c40b0ad6cdd04848caf8535158c4751869821f1e3fcb9f2a7325c","observation_id":"b00dda28-cf7a-4a73-a981-9336b9192a41","resolution":{"observed_at":"2026-08-16T12:10:31.935707Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:10:30.956078Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:30.956078Z"},"links":{"citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:aa7f931eff1ad7caea458aa55fbca4447096d3d1f67153e37077a7e56436484b","observation_id":"f625397d-fc9d-4e2d-9788-082c094a3b0e","resolution":{"observed_at":"2026-08-16T12:10:30.956078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16192","last_updated":"2024-02-28T23:11:33Z","snapshot_observed_at":"2026-08-16T14:15:30.148136Z","submitted_at":"2024-02-25T20:36:03Z","title":"Defending Large Language Models against Jailbreak Attacks via Semantic Smoothing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16192","snapshot_observed_at":"2026-08-16T12:10:30.960158Z","title":"Pappas, Hamed Hassani, Yang Zhang, Eric Wong, and Shiyu Chang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:30.960158Z"},"links":{"cited_paper":"/paper/2402.16192","citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:caff1bd6fc39056ed6eb0d92f0f30165e3630b552556ff7da4125958a893d8ce","observation_id":"77d3d7ce-ea34-46aa-b1fb-04b9522bfce0","resolution":{"observed_at":"2026-08-16T12:10:30.960158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-16T12:10:30.964242Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:30.964242Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:683c183c229c298132ed891c6ba6d331998938d9e343b87289eeeb1c5fa129ba","observation_id":"a1389b44-281d-4d50-b791-e7350b403733","resolution":{"observed_at":"2026-08-16T12:10:30.964242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18510","last_updated":"2024-06-26T17:31:22Z","snapshot_observed_at":"2026-08-16T13:39:21.038674Z","submitted_at":"2024-06-26T17:31:22Z","title":"WildTeaming at Scale: From In-the-Wild Jailbreaks to (Adversarially) Safer Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18510","snapshot_observed_at":"2026-08-16T12:10:30.968917Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:30.968917Z"},"links":{"cited_paper":"/paper/2406.18510","citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:7bf3a7e5bd3ffa74a9c3e48d9159448a6d7ed276cf09437e0845dc0259a8ca06","observation_id":"aac9a438-846e-4cff-9e05-9a54cf1bcfb3","resolution":{"observed_at":"2026-08-16T12:10:30.968917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:10:31.917794Z","title":null,"venue":null,"work_id":"3e08a29b-15e5-4c56-9cea-b9427a369cca","year":2024},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:30.974149Z"},"links":{"citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:bdd829469a77cf3ca5ae1a279988f9be75e1dc3c0ba9e9c600f67506178bfcef","observation_id":"0fb49374-8d37-42f5-a66b-36c1df2b2d4d","resolution":{"observed_at":"2026-08-16T12:10:31.922004Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:10:30.978703Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:30.978703Z"},"links":{"citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:0d7c23fd1c395dee490949dd00d8e478f83c9d3bc724b3f69b5290a9dc53cb65","observation_id":"6b46e0dc-c6ca-4f1e-9976-5d8a59afcfcd","resolution":{"observed_at":"2026-08-16T12:10:30.978703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03191","last_updated":"2024-11-28T13:43:50Z","snapshot_observed_at":"2026-08-15T16:37:22.396444Z","submitted_at":"2023-11-06T15:29:30Z","title":"DeepInception: Hypnotize Large Language Model to Be Jailbreaker","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03191","snapshot_observed_at":"2026-08-16T12:10:30.983352Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:30.983352Z"},"links":{"cited_paper":"/paper/2311.03191","citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:33317503d76d1927bc2a8fbfbd34b3ad3e04c29d8c16d810c493e6b0c07cae38","observation_id":"3493a01b-a5f8-40d1-8da2-7247ba2ac36c","resolution":{"observed_at":"2026-08-16T12:10:30.983352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:10:31.903004Z","title":null,"venue":null,"work_id":"5a394408-068b-4d6a-b589-86a4d2fb12b9","year":2024},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:30.988165Z"},"links":{"citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:1e2f6ae6b153e1d48c7db17d2266025ade8642e155d1d0ddc61201eda21d6ba1","observation_id":"25ba5215-cad9-43cf-9589-6974ce7b167b","resolution":{"observed_at":"2026-08-16T12:10:31.907722Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06622","last_updated":"2024-06-07T15:37:15Z","snapshot_observed_at":"2026-08-16T13:45:06.275715Z","submitted_at":"2024-06-07T15:37:15Z","title":"Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06622","snapshot_observed_at":"2026-08-16T12:10:30.992805Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:30.992805Z"},"links":{"cited_paper":"/paper/2406.06622","citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:bb17d3f8eac91c381f86a3f31cad9e49dd69b569fc1f555f0c8d3842f7901b0e","observation_id":"a3965006-66f1-4af7-b424-54cc5c34482a","resolution":{"observed_at":"2026-08-16T12:10:30.992805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04451","last_updated":"2024-03-20T21:34:56Z","snapshot_observed_at":"2026-08-16T14:36:14.029419Z","submitted_at":"2023-10-03T19:44:37Z","title":"AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04451","snapshot_observed_at":"2026-08-16T12:10:30.997511Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:30.997511Z"},"links":{"cited_paper":"/paper/2310.04451","citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:1819ef8ec2426af1e62788856745c47eff6adc9b5241bb26a12a3228a5273184","observation_id":"9402466e-5bd3-43c8-ad65-98a5b4b713f9","resolution":{"observed_at":"2026-08-16T12:10:30.997511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:10:31.886941Z","title":null,"venue":null,"work_id":"e3bbc695-6d87-46f9-82c8-9eb1780ff005","year":2024},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:31.003090Z"},"links":{"citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:6da298b5001a20936693f8cfbeecef2436a0a16f9ee2bde7d5ad52e2f76f9812","observation_id":"0dba8af0-03c4-4526-a6d5-e5399af47a86","resolution":{"observed_at":"2026-08-16T12:10:31.892305Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:10:31.871192Z","title":null,"venue":null,"work_id":"39c154cd-30fa-4832-991d-065e51fb4722","year":2024},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:31.008312Z"},"links":{"citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:1d29bad9a55d124539ee6d553a748801dc036b8af59de4d9f615e8f678e3e659","observation_id":"cca35e4b-f552-4d59-99dc-e326b1bf4058","resolution":{"observed_at":"2026-08-16T12:10:31.875915Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-16T12:10:31.013275Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:31.013275Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:6716f5f61a3b1b7a38d90bc685edaedd85329300a1873c8b5d36985a28af1017","observation_id":"09df1fb0-8d16-476d-bdac-33c129394e40","resolution":{"observed_at":"2026-08-16T12:10:31.013275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:10:31.856000Z","title":null,"venue":null,"work_id":"4ce6c73a-d432-4850-b45c-45268dfa5815","year":2024},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:31.017732Z"},"links":{"citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:0862e89d3ba06d7d8ffc26c5d93d36b34c30696c6dd67059af60d65ce41e8837","observation_id":"77fca6da-6759-4b32-a6e5-4e44c4cc73df","resolution":{"observed_at":"2026-08-16T12:10:31.860430Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:10:31.022326Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:31.022326Z"},"links":{"citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:a0f2051f5144bc991ef37d7bf21ced6a0784315d85c43840bfdc77af274c9578","observation_id":"91c07911-987f-4f36-af22-692348e74303","resolution":{"observed_at":"2026-08-16T12:10:31.022326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03684","last_updated":"2024-06-11T19:02:52Z","snapshot_observed_at":"2026-08-17T15:25:03.596568Z","submitted_at":"2023-10-05T17:01:53Z","title":"SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03684","snapshot_observed_at":"2026-08-16T12:10:31.026735Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:31.026735Z"},"links":{"cited_paper":"/paper/2310.03684","citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:8346b857d054407e510339517c48b94cb0c49eddae2d8c4bf2a954c1b056a1a7","observation_id":"28163107-d7c6-4216-b8a1-b3b2d3f08e8b","resolution":{"observed_at":"2026-08-16T12:10:31.026735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:10:31.031366Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:31.031366Z"},"links":{"citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:4361955d5a90facb70429d98f7894ad1989dfd10ddb283d7308065825123dc8e","observation_id":"22002250-cb8b-45a8-88bf-b3ecec84cc53","resolution":{"observed_at":"2026-08-16T12:10:31.031366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:10:31.841132Z","title":"do anything now","venue":null,"work_id":"0da01334-f826-47e8-b991-ecf2b7549615","year":2023},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:31.036107Z"},"links":{"citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:960bad70b9c23ba0acc9bbbe9df1eab78ee465ce23a8a592b48880f1b4be5676","observation_id":"0ce3cdde-fb4f-4623-922d-eba00cc09e96","resolution":{"observed_at":"2026-08-16T12:10:31.845971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:10:31.040694Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:31.040694Z"},"links":{"citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:bea761e321d94db35735cab9c6340651d743e48b05e24a52a02a51f65c2f0cbf","observation_id":"c84cdb34-fce2-45c7-afff-22cb6dacb3af","resolution":{"observed_at":"2026-08-16T12:10:31.040694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-16T12:10:31.046231Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:31.046231Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:7c701a1ed5f8fe653a4fc576da13ece49d235255f9569a56e5abe03ed18ef41c","observation_id":"fbfe326f-9e8d-4b9f-8e54-c1bbbfbd1e94","resolution":{"observed_at":"2026-08-16T12:10:31.046231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:10:31.050526Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:31.050526Z"},"links":{"citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:ea93fc12241d11038f11d79302e512e4db8298ec4f3201cb1f3e641beec871d7","observation_id":"0c50aca7-63f7-4a47-b6ce-969c24fcdf55","resolution":{"observed_at":"2026-08-16T12:10:31.050526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:10:31.825811Z","title":null,"venue":null,"work_id":"44de83e7-cc34-48a6-b331-56b9ea50bec8","year":2024},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:31.055141Z"},"links":{"citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:d89ef1902f98c15d21aa9af38f09b8a561ba7ff31ffafa9a48466bdbbb4458ad","observation_id":"a3a3f5d5-f0c5-4208-a783-e54ec33b01d8","resolution":{"observed_at":"2026-08-16T12:10:31.830997Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:10:31.810629Z","title":null,"venue":null,"work_id":"1744dff7-3dab-4987-a103-acf1c10ef650","year":2024},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:31.059987Z"},"links":{"citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:2efcfa04046944a7fc7b40349e4a0b7f8b5110b672bdeaae3aee86b883e0108e","observation_id":"ad9db7de-fa27-496f-bae5-2d5b87b42f9c","resolution":{"observed_at":"2026-08-16T12:10:31.815248Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-16T14:53:33.115609Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-16T12:10:31.064804Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:31.064804Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:4d33f5ed09162c5a3238409aa0e3527a3ceef7e879366d90d40c7dbc7a77b408","observation_id":"c3d0bbf9-03d8-49cd-8153-bb7f999c5e68","resolution":{"observed_at":"2026-08-16T12:10:31.064804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:10:31.069229Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:31.069229Z"},"links":{"citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:1c18c0fd64353db4b303841bb10854ddfdce7702774aae5c6fa95440b3ecd491","observation_id":"b454e88e-88f5-494e-bbc2-cc822f24a2ef","resolution":{"observed_at":"2026-08-16T12:10:31.069229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:10:31.786921Z","title":null,"venue":null,"work_id":"5e88cf90-65d8-4b60-a8d6-a6d6412f7f61","year":2024},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:31.073293Z"},"links":{"citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:389e827ea26b3e0e8ff851c036786115ac96b0a786090cf5c10bcf2b564eef1c","observation_id":"f809632a-e5c1-4ace-94e5-516b24aafc35","resolution":{"observed_at":"2026-08-16T12:10:31.791377Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02003","last_updated":"2024-03-20T19:00:24Z","snapshot_observed_at":"2026-08-16T14:37:48.920279Z","submitted_at":"2023-12-04T16:25:18Z","title":"A Survey on Large Language Model (LLM) Security and Privacy: The Good, the Bad, and the Ugly","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02003","snapshot_observed_at":"2026-08-16T12:10:31.077809Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:31.077809Z"},"links":{"cited_paper":"/paper/2312.02003","citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:b2828dae927e987f45c9ede1120854440e5db39ca0aff3b2a0565d27a1ec6399","observation_id":"5a701a33-ae22-4dda-9ab4-a90d4ad77df7","resolution":{"observed_at":"2026-08-16T12:10:31.077809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10253","last_updated":"2024-06-27T16:01:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-19T02:19:48Z","title":"GPTFUZZER: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10253","snapshot_observed_at":"2026-08-16T12:10:31.083034Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:31.083034Z"},"links":{"cited_paper":"/paper/2309.10253","citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:95d8852fb4f624683b061304f01c7f9f5fe8da456988d342c91195582dc7e6ea","observation_id":"4fbc9df5-e981-4a39-b09a-557393605066","resolution":{"observed_at":"2026-08-16T12:10:31.083034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20653","last_updated":"2025-06-17T03:03:45Z","snapshot_observed_at":"2026-08-16T13:47:29.916757Z","submitted_at":"2024-05-31T07:41:03Z","title":"Mind the Inconspicuous: Revealing the Hidden Weakness in Aligned LLMs' Refusal Boundaries","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20653","snapshot_observed_at":"2026-08-16T12:10:31.088250Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:31.088250Z"},"links":{"cited_paper":"/paper/2405.20653","citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:e2a18ef665c9fda71f3725aa1ce287c2998186eb93d45b742a4eb1a6bf2c0808","observation_id":"5fa10b5e-15c8-4546-b981-9aa37f58c252","resolution":{"observed_at":"2026-08-16T12:10:31.088250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04783","last_updated":"2024-11-14T18:14:00Z","snapshot_observed_at":"2026-08-16T14:13:28.210442Z","submitted_at":"2024-03-02T16:52:22Z","title":"AutoDefense: Multi-Agent LLM Defense against Jailbreak Attacks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04783","snapshot_observed_at":"2026-08-16T12:10:31.093405Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:31.093405Z"},"links":{"cited_paper":"/paper/2403.04783","citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:76ba73fa2f7a754d54a82f95357d48f3b1b40b35dabc01600461689b2a698027","observation_id":"e0e1ef83-954b-4e3d-baf3-6fe8801ae300","resolution":{"observed_at":"2026-08-16T12:10:31.093405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02855","last_updated":"2025-05-20T05:38:08Z","snapshot_observed_at":"2026-08-16T13:37:30.490546Z","submitted_at":"2024-07-03T07:14:05Z","title":"From Theft to Bomb-Making: The Ripple Effect of Unlearning in Defending Against Jailbreak Attacks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02855","snapshot_observed_at":"2026-08-16T12:10:31.098839Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:31.098839Z"},"links":{"cited_paper":"/paper/2407.02855","citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:f809375fc85726425751b59222b916edb5a4992008169e98edf6d88f4b560593","observation_id":"7df04aee-21bb-46bd-9156-c2910edfe740","resolution":{"observed_at":"2026-08-16T12:10:31.098839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:10:31.770754Z","title":null,"venue":null,"work_id":"c2a8d188-7ba7-475b-acb0-fe890448e973","year":2024},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:31.103761Z"},"links":{"citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:2c0fe0bebd49b02774ccb59c1649b09ce47cbbde120cab81c3026852f6a6dac2","observation_id":"a167b720-56ec-45c0-b909-80cdf83c8234","resolution":{"observed_at":"2026-08-16T12:10:31.776451Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-16T12:10:31.108393Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:31.108393Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:9e9a6c6d7f85d209c941d2d270d215fc820fe456daa8b91bbd919525b57bc03f","observation_id":"f68c0b31-1ae0-4ea4-a11b-c12c54df7d38","resolution":{"observed_at":"2026-08-16T12:10:31.108393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12171","last_updated":"2024-03-18T18:39:53Z","snapshot_observed_at":"2026-08-16T14:08:39.423965Z","submitted_at":"2024-03-18T18:39:53Z","title":"EasyJailbreak: A Unified Framework for Jailbreaking Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12171","snapshot_observed_at":"2026-08-16T12:10:31.112869Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:31.112869Z"},"links":{"cited_paper":"/paper/2403.12171","citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:8ba27c192ffc78403ae65f42ec81e544d82da93e3446c885451f835609616b4c","observation_id":"6c8fdd32-ceb5-46cb-98db-96a416576729","resolution":{"observed_at":"2026-08-16T12:10:31.112869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16369","last_updated":"2025-07-02T07:27:32Z","snapshot_observed_at":"2026-08-17T14:40:44.246598Z","submitted_at":"2024-04-25T07:15:23Z","title":"Don't Say No: Jailbreaking LLM by Suppressing Refusal","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16369","snapshot_observed_at":"2026-08-16T12:10:31.116961Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:31.116961Z"},"links":{"cited_paper":"/paper/2404.16369","citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:b07ddd814a35cbfd4adfb9becd5fe40907cc2a7c32e070163e99189598cbea6c","observation_id":"0a81a26c-05cf-4e47-ab71-dfbc0f7b0720","resolution":{"observed_at":"2026-08-16T12:10:31.116961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-08-12T09:06:50.363435Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-16T12:10:31.122045Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:31.122045Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:77a9b83fca29846821abdda09351bf1209af726c3bc5a4fe92aa95b6eba22672","observation_id":"5e069761-60d8-472b-acb5-1e6bbb1abf55","resolution":{"observed_at":"2026-08-16T12:10:31.122045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:10:31.126712Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:31.126712Z"},"links":{"citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:51ae2d0b1c9b947b94de7c366b375c731b2f15212b44bb640eae0da94622f76a","observation_id":"e724aed9-0c47-4b6e-bdbe-b1b18cf33114","resolution":{"observed_at":"2026-08-16T12:10:31.126712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:10:31.131754Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-16T12:10:31.131754Z"},"links":{"citing_paper":"/paper/2504.13562"},"observation_digest":"sha256:367ebd28081246190913ba04a99d64d76706a64945b48f3df41aa29abfd964d0","observation_id":"cc4eada2-5e12-4294-ab6c-4d89b87174ba","resolution":{"observed_at":"2026-08-16T12:10:31.131754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.13562","last_updated":"2025-04-18T09:02:12Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-17T15:26:10.256287Z","submitted_at":"2025-04-18T09:02:12Z","title":"DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":49,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2504.13562."}