{"as_of":"2026-08-17T05:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:21fd88b4d0d8f9153510624065a9689cf987ffc3886b4b008a5078d08970f90b","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T15:29:05.726369Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.09542/citation-record","integrity":"/paper/2608.09542/integrity","json":"/paper/2608.09542/citation-record.json","paper":"/paper/2608.09542"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.02151","last_updated":"2025-04-17T18:55:45Z","snapshot_observed_at":"2026-08-16T14:04:12.947538Z","submitted_at":"2024-04-02T17:58:27Z","title":"Jailbreaking Leading Safety-Aligned LLMs with Simple Adaptive Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02151","snapshot_observed_at":"2026-08-11T15:29:05.507886Z","title":"Jailbreaking leading safety-aligned llms with simple adaptive attacks.arXiv preprint arXiv:2404.02151, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.507886Z"},"links":{"cited_paper":"/paper/2404.02151","citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:e7895a82041f94c82658a06ed6e3a866a32006a6098e15eded639e033239761c","observation_id":"cf6cb120-67b1-41bf-b019-e9111a4386c9","resolution":{"observed_at":"2026-08-11T15:29:05.507886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00861","last_updated":"2021-12-09T21:40:22Z","snapshot_observed_at":"2026-08-10T12:03:10.373653Z","submitted_at":"2021-12-01T22:24:34Z","title":"A General Language Assistant as a Laboratory for Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00861","snapshot_observed_at":"2026-08-11T15:29:05.512848Z","title":"A general language assistant as a laboratory for alignment.arXiv preprint arXiv:2112.00861, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.512848Z"},"links":{"cited_paper":"/paper/2112.00861","citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:92f784379924400889c7ba714ee3b83a2f7f7f976ac0bf855350377f18b9a9ac","observation_id":"ab2919dd-806c-424e-8956-62f3c213d7e9","resolution":{"observed_at":"2026-08-11T15:29:05.512848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-11T15:29:05.518062Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback.arXiv preprint arXiv:2204.05862, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.518062Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:517a8ad6c2d67027210c778cfbf1fe521c4f39536869e0752c29f6f1ff80e21b","observation_id":"8973b0c1-811c-4423-a888-9e549fe628b3","resolution":{"observed_at":"2026-08-11T15:29:05.518062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-16T03:49:00.703994Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-11T15:29:05.523115Z","title":"Constitutional ai: Harmlessness from ai feedback.arXiv preprint arXiv:2212.08073, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.523115Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:229326dc58eaa63a32772c795deddad67ad5e95195b2907f9f9e8f46b5337563","observation_id":"e8eafbb4-fbd9-46fd-be47-5de215094557","resolution":{"observed_at":"2026-08-11T15:29:05.523115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:29:05.527631Z","title":"Jailbreaking black box large language models in twenty queries","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.527631Z"},"links":{"citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:13ba7e72326993bbd89002b68f6c544621d8f495047470b5a46ef906c1fae898","observation_id":"3577d0b8-ad5e-4563-a364-055d8427f460","resolution":{"observed_at":"2026-08-11T15:29:05.527631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-11T15:29:05.531641Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.531641Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:fe7d2921a301cd98248de9d6dd2cc5fd19e1dc20d7887cceeae35e22fc90c124","observation_id":"4453f3f4-4ef9-402b-a0d5-644ec403240b","resolution":{"observed_at":"2026-08-11T15:29:05.531641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-11T15:29:05.536341Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities.arXiv preprint arXiv:2507.06261, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.536341Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:cef94cccbd73e57e3d9db0ca04be449f4045d8c9ca2a84eb72b429f84b833fc2","observation_id":"f37533c3-1181-45cd-9bc5-2bd0e96a6551","resolution":{"observed_at":"2026-08-11T15:29:05.536341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08715","last_updated":"2023-10-25T07:30:51Z","snapshot_observed_at":"2026-08-16T15:15:58.700562Z","submitted_at":"2023-07-16T01:07:15Z","title":"MasterKey: Automated Jailbreak Across Multiple Large Language Model Chatbots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08715","snapshot_observed_at":"2026-08-11T15:29:05.540704Z","title":"Masterkey: Automated jailbreak across multiple large language model chatbots.arXiv preprint arXiv:2307.08715, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.540704Z"},"links":{"cited_paper":"/paper/2307.08715","citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:311b31212a1d56ddb11b161c62f8c896f2f10e09305f2be752c3730ae792ebab","observation_id":"4829fe29-b551-41ab-b263-4392f680078b","resolution":{"observed_at":"2026-08-11T15:29:05.540704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","snapshot_observed_at":"2026-08-16T15:55:15.315299Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07459","snapshot_observed_at":"2026-08-11T15:29:05.544671Z","title":"The capacity for moral self-correction in large language models.arXiv preprint arXiv:2302.07459, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.544671Z"},"links":{"cited_paper":"/paper/2302.07459","citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:a89d3f16747068c29173e9c9b045ddeca5a1c42b56f7f2a6e02251a19c90dfe5","observation_id":"11c5cfd8-6d5f-40e7-af5b-ef6cfff3b8ba","resolution":{"observed_at":"2026-08-11T15:29:05.544671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:29:05.548662Z","title":"Shortcut learning in deep neural networks.Nature Machine Intelligence, 2(11):665–673, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.548662Z"},"links":{"citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:9967b3f388edbde3688208b62dc71de3a6ffbcd056dd7339eac77223e124be0b","observation_id":"fae3ab0f-536a-4a82-82db-72bc43301046","resolution":{"observed_at":"2026-08-11T15:29:05.548662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15717","last_updated":"2023-05-25T05:00:12Z","snapshot_observed_at":"2026-08-12T18:39:37.539896Z","submitted_at":"2023-05-25T05:00:12Z","title":"The False Promise of Imitating Proprietary LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15717","snapshot_observed_at":"2026-08-11T15:29:05.552430Z","title":"The false promise of imitating proprietary llms.arXiv preprint arXiv:2305.15717, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.552430Z"},"links":{"cited_paper":"/paper/2305.15717","citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:3b0c2e9d4aaa777b386a5f77a1a862c99ea9f6099b4c44e6e1708791b2b4c08e","observation_id":"389448d2-09d8-404b-888c-ad0c5895393f","resolution":{"observed_at":"2026-08-11T15:29:05.552430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-11T15:29:05.556472Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.556472Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:0586405bc0f15bb19bb47b4abaf4b4aa79fb2600fb742479d6cf05d245e9608a","observation_id":"8115d964-3cb9-4c0f-a0fd-fa6779c1d80d","resolution":{"observed_at":"2026-08-11T15:29:05.556472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01798","last_updated":"2024-03-14T04:27:52Z","snapshot_observed_at":"2026-08-13T03:11:04.678829Z","submitted_at":"2023-10-03T04:56:12Z","title":"Large Language Models Cannot Self-Correct Reasoning Yet","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01798","snapshot_observed_at":"2026-08-11T15:29:05.560233Z","title":"Large language models cannot self-correct reasoning yet.arXiv preprint arXiv:2310.01798, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.560233Z"},"links":{"cited_paper":"/paper/2310.01798","citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:5576c909045009b10feaddff5ded8caaa36392153c259e768bf3e57185a8837a","observation_id":"23ddf8f7-5158-4d8a-bc66-00780fae46cd","resolution":{"observed_at":"2026-08-11T15:29:05.560233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00555","last_updated":"2025-06-05T03:20:54Z","snapshot_observed_at":"2026-08-16T12:54:00.010186Z","submitted_at":"2025-03-01T16:42:01Z","title":"Safety Tax: Safety Alignment Makes Your Large Reasoning Models Less Reasonable","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.00555","snapshot_observed_at":"2026-08-11T15:29:05.564052Z","title":"Safety tax: Safety alignment makes your large reasoning models less reasonable","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.564052Z"},"links":{"cited_paper":"/paper/2503.00555","citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:78807332b604dacf160c294c2245cc3e271dea4a6a41369563e27ef0d552aa69","observation_id":"a95ddca6-7952-4e9a-89db-a1c1b4f2b944","resolution":{"observed_at":"2026-08-11T15:29:05.564052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06674","last_updated":"2023-12-07T19:40:50Z","snapshot_observed_at":"2026-08-14T15:42:19.849118Z","submitted_at":"2023-12-07T19:40:50Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06674","snapshot_observed_at":"2026-08-11T15:29:05.567489Z","title":"Llama guard: Llm-based input-output safeguard for human-ai conversations.arXiv preprint arXiv:2312.06674, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.567489Z"},"links":{"cited_paper":"/paper/2312.06674","citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:69ccb781aff372b829552627d98742cadcff7361b0bc112399f60af5ed332f93","observation_id":"a9b3ed27-3258-4243-9144-7c54b0806b15","resolution":{"observed_at":"2026-08-11T15:29:05.567489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-11T15:29:05.571092Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.571092Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:5b4a465528800464ba5261184751d39d1d03371ea8e56d2023d9fdffc506cce4","observation_id":"91400847-e9e4-49f0-b266-c5cb5e21c91b","resolution":{"observed_at":"2026-08-11T15:29:05.571092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:29:05.574479Z","title":"Safepath: Preventing harmful reasoning in chain-of-thought via early alignment.arXiv preprint arXiv:2505.14667, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.574479Z"},"links":{"citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:89d87b44d59e5c9c033c0b9b0ae0196bd7b6d7af4bda879e62dd1c14bb5b9a74","observation_id":"5cda88f7-9338-4117-b3ca-9c98239c7471","resolution":{"observed_at":"2026-08-11T15:29:05.574479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:29:05.577483Z","title":"Safechain: Safety of language models with long chain-of-thought reasoning capabilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.577483Z"},"links":{"citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:5bc131b9ffe904c0c1e6b3f5721aba82749a4d6e1507d63cee87d6067057b7d6","observation_id":"4555ac79-d927-4960-9761-1d98ea0474a9","resolution":{"observed_at":"2026-08-11T15:29:05.577483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:29:05.580752Z","title":"Wildteaming at scale: From in-the-wild jailbreaks to (adversarially) safer language models.Advances in Neural Information Processing Systems, 37:47094–47165, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.580752Z"},"links":{"citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:5914989a9b1b4b5b54c9bf085f74ac33e29c802372f553a5a5d87729ef79f614","observation_id":"95743acf-a563-4a7c-bc33-c13c6bd14715","resolution":{"observed_at":"2026-08-11T15:29:05.580752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.23143","last_updated":"2026-05-13T02:16:49Z","snapshot_observed_at":"2026-08-15T03:38:14.188109Z","submitted_at":"2026-01-30T16:31:02Z","title":"THINKSAFE: Self-Generated Safety Alignment for Reasoning Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.23143","snapshot_observed_at":"2026-08-11T15:29:05.584328Z","title":"Thinksafe: Self-generated safety alignment for reasoning models.arXiv preprint arXiv:2601.23143, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.584328Z"},"links":{"cited_paper":"/paper/2601.23143","citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:239d34dbc6b64f65c7445216e190e6ce37fa37a3bb0f6501ccc3171da75ebefa","observation_id":"955979d0-3bb4-4a34-9266-9cf5feca45ce","resolution":{"observed_at":"2026-08-11T15:29:05.584328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:29:05.588431Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.588431Z"},"links":{"citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:3921398e1848aa264a7d3c54e15bbb9a64c90b3b862145ef6a6e53658ba4a045","observation_id":"2ff13057-31e3-4ca6-b906-011d7846bc84","resolution":{"observed_at":"2026-08-11T15:29:05.588431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02556","last_updated":"2025-12-02T09:25:14Z","snapshot_observed_at":"2026-08-17T01:58:07.850738Z","submitted_at":"2025-12-02T09:25:14Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.02556","snapshot_observed_at":"2026-08-11T15:29:05.592292Z","title":"Deepseek-v3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.592292Z"},"links":{"cited_paper":"/paper/2512.02556","citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:452ab372750e1d683aaea85735d06395833a796a0581ddc6627aa9e35355d246","observation_id":"56bea3d0-9a7f-48da-b88d-8094e11eb082","resolution":{"observed_at":"2026-08-11T15:29:05.592292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04451","last_updated":"2024-03-20T21:34:56Z","snapshot_observed_at":"2026-08-16T14:36:14.029419Z","submitted_at":"2023-10-03T19:44:37Z","title":"AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04451","snapshot_observed_at":"2026-08-11T15:29:05.596816Z","title":"Autodan: Generating stealthy jailbreak prompts on aligned large language models.arXiv preprint arXiv:2310.04451, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.596816Z"},"links":{"cited_paper":"/paper/2310.04451","citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:11d2db777c46b7e4412b3d1cbc38d9cc794a8b8b552f89866f7dfa85ce927233","observation_id":"d4117ab0-b475-4371-a632-f47124876341","resolution":{"observed_at":"2026-08-11T15:29:05.596816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:29:05.600844Z","title":"Self-refine: Iterative refinement with self-feedback.Advances in neural information processing systems, 36:46534–46594, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.600844Z"},"links":{"citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:89ebf66bc68c5cee1cd6faf810319870c00291fa55b95d2abe36789e0cd91591","observation_id":"7027b879-9fbc-468f-afe9-8723c8f02100","resolution":{"observed_at":"2026-08-11T15:29:05.600844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04249","last_updated":"2024-02-27T04:43:08Z","snapshot_observed_at":"2026-08-16T09:07:20.265665Z","submitted_at":"2024-02-06T18:59:08Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04249","snapshot_observed_at":"2026-08-11T15:29:05.604723Z","title":"Harmbench: A standardized evaluation framework for automated red teaming and robust refusal.arXiv preprint arXiv:2402.04249, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.604723Z"},"links":{"cited_paper":"/paper/2402.04249","citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:f77389b2d68480efa0d540e6123d2b6d9f192a9f47add40ff1ea435a74d42ed9","observation_id":"258ede9a-b766-4929-9d77-441f447059f5","resolution":{"observed_at":"2026-08-11T15:29:05.604723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:29:05.608669Z","title":"Tree of attacks: Jailbreaking black-box llms automatically.Advances in Neural Information Processing Systems, 37:61065–61105, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.608669Z"},"links":{"citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:659650d98d50cd47ae9ac945e4f865ad583fd8e7bb2c7624581157217a5f5a93","observation_id":"b5eec18c-e10c-43ae-b116-8a077603f519","resolution":{"observed_at":"2026-08-11T15:29:05.608669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:29:05.612455Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.612455Z"},"links":{"citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:86d28e735ef6e48b306cd0c3eeaf172fd4dbcf791ec30441970ca9425b041217","observation_id":"f0c74a11-f904-4edb-81bd-d61f6d5d1930","resolution":{"observed_at":"2026-08-11T15:29:05.612455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:29:05.616067Z","title":"Red teaming language models with language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.616067Z"},"links":{"citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:57b08cc0dd0cd083b830d7b988b3d5ac577d171f55d9bb7792c6d521726e91a8","observation_id":"d512dfe9-cd42-4b0b-b54f-d0216ac93074","resolution":{"observed_at":"2026-08-11T15:29:05.616067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:29:05.620082Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.620082Z"},"links":{"citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:ed6dc43e06bb2cc9ca667b9890406670af28c732170cea88315a76973c25df72","observation_id":"11466c5b-2fad-48d7-94d1-5240e4b3b6d5","resolution":{"observed_at":"2026-08-11T15:29:05.620082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-16T07:06:07.822225Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-11T15:29:05.623979Z","title":"Gpqa: A graduate-level google-proof q&a benchmark.arXiv preprint arXiv:2311.12022, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.623979Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:7f0eb928ca98c862f2598140fd60855d1c8ecc289df29e2f482aa8b745d47329","observation_id":"98bc502a-9eb2-4b34-8964-9fa8fb60fa39","resolution":{"observed_at":"2026-08-11T15:29:05.623979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:29:05.627954Z","title":"do anything now","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.627954Z"},"links":{"citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:57d0837f8151f1bc5306664654024772b4fba55119e3d1e05af61082e2d1f80f","observation_id":"d32b7d0d-edee-42d5-9854-cb5845ba7514","resolution":{"observed_at":"2026-08-11T15:29:05.627954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:29:05.631560Z","title":"Reflexion: Language agents with verbal reinforcement learning.Advances in neural information processing systems, 36:8634–8652, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.631560Z"},"links":{"citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:8f060cc41364a6eed64df5c04cd72ae0d1696c151b031b759c5a2cc87d922b86","observation_id":"89750b60-a096-4b78-8a8f-97026e5107e0","resolution":{"observed_at":"2026-08-11T15:29:05.631560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-11T15:29:05.635580Z","title":"Scaling llm test-time compute opti- mally can be more effective than scaling model parameters.arXiv preprint arXiv:2408.03314, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.635580Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:ed74bdaaaae0b9850461b568d8355a283e11d76ab0aef958dbecb929ee4d5e05","observation_id":"9f7cc5a2-bb57-4719-b43c-f7815da885e3","resolution":{"observed_at":"2026-08-11T15:29:05.635580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:29:05.639525Z","title":"A strongreject for empty jailbreaks.Advances in Neural Information Processing Systems, 37:125416–125440, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.639525Z"},"links":{"citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:7642c28f25e779492b66a74473a8f5cb37415b682534cb002a569ae9e508b997","observation_id":"622f2d09-2564-4895-8193-33b64ca35895","resolution":{"observed_at":"2026-08-11T15:29:05.639525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:29:05.643492Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark.Advances in Neural Information Processing Systems, 37:95266–95290, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.643492Z"},"links":{"citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:ba63f85917acef763b2c79f74b1cc3625b041b8c44bc65f81809d9736520cc04","observation_id":"d5a0c044-44ae-4807-9bc3-520d5269b55b","resolution":{"observed_at":"2026-08-11T15:29:05.643492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:29:05.647519Z","title":"Star-1: Safer alignment of reasoning llms with 1k data","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.647519Z"},"links":{"citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:73d347dc7a1e7e32c9fa8bd45fd7c53f7939850d305673e4ea94abeed369d1f3","observation_id":"5adeab22-8ba0-45ea-ad91-cfe5b8accf32","resolution":{"observed_at":"2026-08-11T15:29:05.647519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:29:05.652296Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.652296Z"},"links":{"citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:b51cd80eb407997ce6407df0ed7f27203b1a357513a04a6b62407dce801e0969","observation_id":"b7f52b90-8304-45fc-b58f-a16cff7ec945","resolution":{"observed_at":"2026-08-11T15:29:05.652296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-11T15:29:05.656483Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.656483Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:4d5f0aa47a3cb43246d5322198f027eab2c08d59f6f9d3379166a208e840330a","observation_id":"fc3de7ab-d19e-47cd-9ba2-aaa3f829d9fa","resolution":{"observed_at":"2026-08-11T15:29:05.656483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10253","last_updated":"2024-06-27T16:01:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-19T02:19:48Z","title":"GPTFUZZER: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10253","snapshot_observed_at":"2026-08-11T15:29:05.661372Z","title":"Gptfuzzer: Red teaming large language models with auto-generated jailbreak prompts.arXiv preprint arXiv:2309.10253, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.661372Z"},"links":{"cited_paper":"/paper/2309.10253","citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:6ce755738ac97a2fef46b51afc7047f5cce388a794a25bfcbe0e27053232d435","observation_id":"35fe2477-ad33-4155-8580-d005670e1473","resolution":{"observed_at":"2026-08-11T15:29:05.661372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:29:05.664759Z","title":"American invitational mathematics examination (aime) 2024, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.664759Z"},"links":{"citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:433fcae77a48bcb6302de12c533a25f6342251df604ea25bd447e62eea4ba447","observation_id":"0eb879f7-34b4-403d-aa6f-5c4a2055947a","resolution":{"observed_at":"2026-08-11T15:29:05.664759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:29:05.668040Z","title":"Llamafactory: Unified efficient fine-tuning of 100+ language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.668040Z"},"links":{"citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:bfe765ecaf47bf110a36fdb67af2ea80b1f6949f9a2929ece92b165943812493","observation_id":"072bc497-905b-4f94-bc85-03700599a989","resolution":{"observed_at":"2026-08-11T15:29:05.668040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-08-12T09:06:50.363435Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-11T15:29:05.671368Z","title":"strategy_name","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.671368Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:795156b5c5dc5308271f2ce8b64f8d3249dec036bbfea7cad9c51e9c8a901a91","observation_id":"7891c688-afcf-4cb3-a6b5-cc2bb17480c6","resolution":{"observed_at":"2026-08-11T15:29:05.671368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:29:06.262646Z","title":null,"venue":null,"work_id":"b689897f-9cdf-4fa2-bafd-d8f0ca303496","year":null},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.675575Z"},"links":{"citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:913e3894f436e4955f167ad8717db2d37fff5a7ef4e35ca6e45938968d94a28c","observation_id":"b63c6a9b-9028-4c02-a10a-4aa916a71e91","resolution":{"observed_at":"2026-08-11T15:29:06.266808Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:29:06.250415Z","title":"Escape any double quotes in strings","venue":null,"work_id":"dcdd88c9-8b85-4ca3-acf4-e82f6e9a674f","year":null},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.679000Z"},"links":{"citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:b2fa6cf5e4d32dd2a114617432914c571a1048aaee0eebdbea243115ac3349ae","observation_id":"23b43115-e760-4bb9-acd8-c3f554392c80","resolution":{"observed_at":"2026-08-11T15:29:06.254399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:29:06.239208Z","title":null,"venue":null,"work_id":"db6ca16f-78d9-4ca9-9c22-56f2fc91077b","year":null},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.682219Z"},"links":{"citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:b962750c249c4a45ef40d8bbd0c9c8b88e479568e861422361352f60e83cf148","observation_id":"6d48f1e6-5549-438b-a06f-b8f566f3bcf9","resolution":{"observed_at":"2026-08-11T15:29:06.242875Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:29:06.227732Z","title":"If you can autonomously refine the prompt based on feedback (e.g., minor rewording, removing trigger words) to improve the score, do so directly via`query_target`","venue":null,"work_id":"b832a829-c2dd-4b7a-8e07-b0c65c539747","year":null},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.685646Z"},"links":{"citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:bce3cf25ce950e8ad3553246f07d0de532029c0a8940b062e0e8b2938a9867e8","observation_id":"b183074e-209c-4edd-a5df-01b135f99a57","resolution":{"observed_at":"2026-08-11T15:29:06.231930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:29:06.215567Z","title":"If you have just called strategies twice, your next action MUST be a`query_target`to test the prompt","venue":null,"work_id":"0830c028-1f6c-461f-bb31-7f6fe65d4eb1","year":null},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.689222Z"},"links":{"citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:5f77a6bf7a5a48650a8463252691eda764061e28ee405746a30567eba11ff512","observation_id":"33c8cf29-4510-432b-bc10-33df6bd63a97","resolution":{"observed_at":"2026-08-11T15:29:06.220163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:29:06.203375Z","title":"Instead, refine the prompt further based on the scorer’s feedback to push it over the success threshold (>8.5)","venue":null,"work_id":"5d4fc7d8-5ad1-42d6-93cc-01ca245486c3","year":null},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.693143Z"},"links":{"citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:70e2400f7ec0c3385151b0c0cd2b9eee4c53653f20f72e34517054091fd813ef","observation_id":"5cb3ef28-c24b-43cd-81cf-2f8ecd840b56","resolution":{"observed_at":"2026-08-11T15:29:06.207614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:29:06.190851Z","title":"Scorer prompt.The scorer model evaluates the harmfulness and actionability of the target model’s response and returns both a scalar score and refinement feedback for the attacker","venue":null,"work_id":"390a7974-9c99-4464-bb04-83b8540be5db","year":null},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.696936Z"},"links":{"citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:07e534e70e91cef564e9e39e908b7a5f9b8d0ac1ef13af0098ebd839092c2bd5","observation_id":"a3d21896-1deb-4502-8584-b820de347158","resolution":{"observed_at":"2026-08-11T15:29:06.195755Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:29:06.179050Z","title":null,"venue":null,"work_id":"b469afba-3c6e-4abb-8fe9-f766ca3639e5","year":null},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.702180Z"},"links":{"citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:662bcd01c5ddc26adec5fde2b406fee188a04adc1c84856d28699fe0cd7efa8e","observation_id":"b8842433-a570-4bde-8154-81d9908cfa00","resolution":{"observed_at":"2026-08-11T15:29:06.183160Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:29:06.167783Z","title":null,"venue":null,"work_id":"cca13098-f54d-488c-b312-403807086ffc","year":null},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.706534Z"},"links":{"citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:772700bbfc7da8b19fecc25b70715f496d9cd67ae06651b6236d397dc92828f9","observation_id":"e64c0545-1d7a-4130-a918-1d53812aff59","resolution":{"observed_at":"2026-08-11T15:29:06.171110Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:29:06.156373Z","title":null,"venue":null,"work_id":"d12c82a7-9a24-486f-91e7-daa91b6e7739","year":null},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.710395Z"},"links":{"citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:11683a9c50e2383a7618245614f5d50fa0c7bc73bc1c0d10807831b819e8d5bd","observation_id":"ca019b35-dfa4-42f8-8e12-ef9403170870","resolution":{"observed_at":"2026-08-11T15:29:06.159760Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:29:06.144582Z","title":"score\": <float 1.0–10.0>,","venue":null,"work_id":"fbb1ae91-86bc-41a4-a44c-390a310d2211","year":null},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.714281Z"},"links":{"citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:ff24e1059fbd3cae942ee7ac1aadae65a1d2e952e45076cbec03af4df7310a4e","observation_id":"b2b06089-9a3f-48bd-a7a0-543ae0bd301a","resolution":{"observed_at":"2026-08-11T15:29:06.148618Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:29:06.131613Z","title":null,"venue":null,"work_id":"37ead589-5c0c-4dd8-a247-c6a9c7cff0a5","year":null},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.718307Z"},"links":{"citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:c8835c8dbce7735a7d1753275473486f8cebb4d192ca4a96ba251aea4575827f","observation_id":"0a960579-ef65-4a63-ac3a-6b6a8c68de57","resolution":{"observed_at":"2026-08-11T15:29:06.135615Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:29:06.115063Z","title":null,"venue":null,"work_id":"32e0f591-5ecf-42dd-88f3-0c1095ba0bb1","year":null},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.722216Z"},"links":{"citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:f8f1c712738093aded8a285804b6b16855d0caafec86666b53e1abd34ad4d802","observation_id":"ac214206-d5fd-4dab-964b-b80725fa80f8","resolution":{"observed_at":"2026-08-11T15:29:06.122950Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:29:06.100690Z","title":"Response:","venue":null,"work_id":"744acdd0-b3c7-4d8b-a4e3-ba516d2935e1","year":2024},"citing_paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T15:29:05.726369Z"},"links":{"citing_paper":"/paper/2608.09542"},"observation_digest":"sha256:47e7b01e0f14ab5674469b73ee903a7b4f1650074e815ef5e0d038bb40ecad14","observation_id":"e0658f8d-8380-4456-823d-38966a0ffdc1","resolution":{"observed_at":"2026-08-11T15:29:06.106220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.09542","last_updated":"2026-08-10T12:40:02Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T21:24:29.277106Z","submitted_at":"2026-08-10T12:40:02Z","title":"Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":3,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2608.09542."}