{"as_of":"2026-08-11T01:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:293ec6945d2af42b619371e95deb19f87b9fa07ab04d7947d70e4fa6aba01c4b","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":34,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:26:17.214742Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T03:59:33.729006Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.12893","last_updated":"2025-02-27T01:32:58Z","snapshot_observed_at":"2026-08-07T18:08:32.968901Z","submitted_at":"2025-02-18T14:29:12Z","title":"H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking","version":2},"cited_work":{"arxiv_id":"2502.12893","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12893","snapshot_observed_at":"2026-07-04T03:59:33.729006Z","title":"H-cot: Hijacking the chain-of-thought safety reasoning mechanism to jailbreak large reasoning models, including openai o1/o3, deepseek-r1, and gemini 2.0 flash thinking","venue":null,"work_id":"f81fb5a7-37c8-4bd2-9d6d-f1ba88504d78","year":2025},"citing_paper":{"arxiv_id":"2503.16419","last_updated":"2025-08-21T19:14:40Z","snapshot_observed_at":"2026-08-07T04:27:23.738927Z","submitted_at":"2025-03-20T17:59:38Z","title":"Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models","version":4},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-14T01:29:56.480020Z"},"links":{"cited_paper":"/paper/2502.12893","citing_paper":"/paper/2503.16419"},"observation_digest":"sha256:9b1b647bc5597b2be41b716464f56e8472998961d54a47c48f1e371f49964ab7","observation_id":"be25012c-cda6-41b5-b141-f1555f2d91eb","resolution":{"observed_at":"2026-05-14T01:29:56.965963Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12893","last_updated":"2025-02-27T01:32:58Z","snapshot_observed_at":"2026-08-07T18:08:32.968901Z","submitted_at":"2025-02-18T14:29:12Z","title":"H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking","version":2},"cited_work":{"arxiv_id":"2502.12893","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12893","snapshot_observed_at":"2026-07-04T03:59:33.729006Z","title":"H-cot: Hijacking the chain-of-thought safety reasoning mechanism to jailbreak large reasoning models, including openai o1/o3, deepseek-r1, and gemini 2.0 flash thinking","venue":null,"work_id":"f81fb5a7-37c8-4bd2-9d6d-f1ba88504d78","year":2025},"citing_paper":{"arxiv_id":"2504.02181","last_updated":"2026-04-22T01:49:17Z","snapshot_observed_at":"2026-07-30T09:24:14.725185Z","submitted_at":"2025-04-02T23:51:27Z","title":"A Survey of Scaling in Large Language Model Reasoning","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-22T21:20:07.238992Z"},"links":{"cited_paper":"/paper/2502.12893","citing_paper":"/paper/2504.02181"},"observation_digest":"sha256:14ee894dad1671783e8d4e90aa3e4a64828b730d8b7c6e7394044735fa12c925","observation_id":"73469dd1-e9df-4b99-84b8-a45efbbf4850","resolution":{"observed_at":"2026-05-22T21:22:09.135337Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12893","last_updated":"2025-02-27T01:32:58Z","snapshot_observed_at":"2026-08-07T18:08:32.968901Z","submitted_at":"2025-02-18T14:29:12Z","title":"H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12893","snapshot_observed_at":"2026-08-07T14:26:17.214742Z","title":"H-cot: Hijack- ing the chain-of-thought safety reasoning mechanism to jailbreak large reasoning models, including openai o1/o3, deepseek-r1, and gemini 2.0 flash thinking","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19235","last_updated":"2025-05-25T17:16:34Z","snapshot_observed_at":"2026-08-07T20:41:54.292300Z","submitted_at":"2025-05-25T17:16:34Z","title":"CoreMatching: A Co-adaptive Sparse Inference Framework with Token and Neuron Pruning for Comprehensive Acceleration of Vision-Language Models","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:17.214742Z"},"links":{"cited_paper":"/paper/2502.12893","citing_paper":"/paper/2505.19235"},"observation_digest":"sha256:906f958617fd2c2767ab797bcbf8ba9609f44b7637286f38fbb22aed882ec680","observation_id":"7fc2dd48-1964-45ee-85bd-ceed7ccac036","resolution":{"observed_at":"2026-08-07T14:26:17.214742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12893","last_updated":"2025-02-27T01:32:58Z","snapshot_observed_at":"2026-08-07T18:08:32.968901Z","submitted_at":"2025-02-18T14:29:12Z","title":"H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12893","snapshot_observed_at":"2026-08-07T14:13:52.872208Z","title":"H-cot: Hijacking the chain-of-thought safety reasoning mechanism to jailbreak large reasoning models, including openai o1/o3, deepseek-r1, and gemini 2.0 flash thinking,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:52.872208Z"},"links":{"cited_paper":"/paper/2502.12893","citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:6b7607db1d93f26953f06d6a18d2e263f398e47095a6aee4a350fdf9c33f9465","observation_id":"18640e6f-a309-42af-930a-89d013c6b357","resolution":{"observed_at":"2026-08-07T14:13:52.872208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12893","last_updated":"2025-02-27T01:32:58Z","snapshot_observed_at":"2026-08-07T18:08:32.968901Z","submitted_at":"2025-02-18T14:29:12Z","title":"H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12893","snapshot_observed_at":"2026-08-07T12:36:16.117693Z","title":"H-cot: Hijacking the chain-of-thought safety reasoning mechanism to jailbreak large reasoning models, including openai o1/o3, deepseek-r1, and gemini 2.0 flash thinking","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24225","last_updated":"2025-05-30T05:24:21Z","snapshot_observed_at":"2026-08-09T22:04:39.601123Z","submitted_at":"2025-05-30T05:24:21Z","title":"Reasoning Can Hurt the Inductive Abilities of Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:16.117693Z"},"links":{"cited_paper":"/paper/2502.12893","citing_paper":"/paper/2505.24225"},"observation_digest":"sha256:07b7684bb5ddb00c55199a974c5fe34413353196f0944c4b69d796f037b6d470","observation_id":"63477325-4766-4eca-b331-141ebbd93ce4","resolution":{"observed_at":"2026-08-07T12:36:16.117693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12893","last_updated":"2025-02-27T01:32:58Z","snapshot_observed_at":"2026-08-07T18:08:32.968901Z","submitted_at":"2025-02-18T14:29:12Z","title":"H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12893","snapshot_observed_at":"2026-08-07T12:04:46.756698Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00668","last_updated":"2025-05-31T18:38:23Z","snapshot_observed_at":"2026-08-08T14:13:24.402413Z","submitted_at":"2025-05-31T18:38:23Z","title":"SafeTy Reasoning Elicitation Alignment for Multi-Turn Dialogues","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T12:04:46.756698Z"},"links":{"cited_paper":"/paper/2502.12893","citing_paper":"/paper/2506.00668"},"observation_digest":"sha256:1984c06a35b501901ca6ee28e1684dc004ba617f0b0279896c72a70fa8da988f","observation_id":"fbc3828f-5850-4650-afc7-20926031d030","resolution":{"observed_at":"2026-08-07T12:04:46.756698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12893","last_updated":"2025-02-27T01:32:58Z","snapshot_observed_at":"2026-08-07T18:08:32.968901Z","submitted_at":"2025-02-18T14:29:12Z","title":"H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12893","snapshot_observed_at":"2026-08-07T12:11:20.390015Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05376","last_updated":"2025-06-09T05:48:22Z","snapshot_observed_at":"2026-08-10T02:41:13.540113Z","submitted_at":"2025-05-30T22:58:54Z","title":"A Red Teaming Roadmap Towards System-Level Safety","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:20.390015Z"},"links":{"cited_paper":"/paper/2502.12893","citing_paper":"/paper/2506.05376"},"observation_digest":"sha256:f71d591937ee97f45058797c1c2ae5c1c523377558921554b4c7550c9c71b9b3","observation_id":"01a3c695-5c36-4737-a740-5bc89f29eccb","resolution":{"observed_at":"2026-08-07T12:11:20.390015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12893","last_updated":"2025-02-27T01:32:58Z","snapshot_observed_at":"2026-08-07T18:08:32.968901Z","submitted_at":"2025-02-18T14:29:12Z","title":"H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12893","snapshot_observed_at":"2026-08-07T05:23:10.942096Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08184","last_updated":"2025-07-31T16:45:51Z","snapshot_observed_at":"2026-08-07T05:14:54.380496Z","submitted_at":"2025-06-09T19:49:11Z","title":"Unable to Forget: Proactive Interference Reveals Working Memory Limits in LLMs Beyond Context Length","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T05:23:10.942096Z"},"links":{"cited_paper":"/paper/2502.12893","citing_paper":"/paper/2506.08184"},"observation_digest":"sha256:beb2ce993a36acd3632a6cb092b5371601a1d112a9d94e5fcdd2c6716730ccd1","observation_id":"ea4a1b95-7f32-47ed-acb4-f7deb9a1cdf1","resolution":{"observed_at":"2026-08-07T05:23:10.942096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12893","last_updated":"2025-02-27T01:32:58Z","snapshot_observed_at":"2026-08-07T18:08:32.968901Z","submitted_at":"2025-02-18T14:29:12Z","title":"H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12893","snapshot_observed_at":"2026-08-06T23:20:58.633864Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:58.633864Z"},"links":{"cited_paper":"/paper/2502.12893","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:94d3ebfb9c0b68c4be962b8a769be10d44945944dec920f249c2f01a47fa27c9","observation_id":"a5edf243-33c2-4ba1-a47c-b019af836f53","resolution":{"observed_at":"2026-08-06T23:20:58.633864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12893","last_updated":"2025-02-27T01:32:58Z","snapshot_observed_at":"2026-08-07T18:08:32.968901Z","submitted_at":"2025-02-18T14:29:12Z","title":"H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking","version":2},"cited_work":{"arxiv_id":"2502.12893","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12893","snapshot_observed_at":"2026-07-04T03:59:33.729006Z","title":"H-cot: Hijacking the chain-of-thought safety reasoning mechanism to jailbreak large reasoning models, including openai o1/o3, deepseek-r1, and gemini 2.0 flash thinking","venue":null,"work_id":"f81fb5a7-37c8-4bd2-9d6d-f1ba88504d78","year":2025},"citing_paper":{"arxiv_id":"2507.10610","last_updated":"2026-04-07T11:46:55Z","snapshot_observed_at":"2026-08-08T01:14:25.294761Z","submitted_at":"2025-07-13T08:36:09Z","title":"LaSM: Layer-wise Scaling Mechanism for Defending Pop-up Attack on GUI Agents","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-19T04:10:57.882345Z"},"links":{"cited_paper":"/paper/2502.12893","citing_paper":"/paper/2507.10610"},"observation_digest":"sha256:30b9e8bc777f3d1fe46cfcd8277a16afb74f5eb9a362ed32f95438ca2956f7e3","observation_id":"ad92a247-044a-42b6-b415-f86301e4ff57","resolution":{"observed_at":"2026-05-19T04:12:02.192812Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12893","last_updated":"2025-02-27T01:32:58Z","snapshot_observed_at":"2026-08-07T18:08:32.968901Z","submitted_at":"2025-02-18T14:29:12Z","title":"H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12893","snapshot_observed_at":"2026-08-06T15:30:35.135974Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15851","last_updated":"2025-07-21T17:59:01Z","snapshot_observed_at":"2026-08-07T07:35:46.479632Z","submitted_at":"2025-07-21T17:59:01Z","title":"The Other Mind: How Language Models Exhibit Human Temporal Cognition","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T15:30:35.135974Z"},"links":{"cited_paper":"/paper/2502.12893","citing_paper":"/paper/2507.15851"},"observation_digest":"sha256:2fb139685d61866f0763281adf7e296bf3e7b5023305fcfec0d924d87599715f","observation_id":"20c3ede4-8c80-4bda-a4b8-f66ed52997d8","resolution":{"observed_at":"2026-08-06T15:30:35.135974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12893","last_updated":"2025-02-27T01:32:58Z","snapshot_observed_at":"2026-08-07T18:08:32.968901Z","submitted_at":"2025-02-18T14:29:12Z","title":"H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12893","snapshot_observed_at":"2026-08-06T15:26:20.640185Z","title":"Martin Kuo, Jianyi Zhang, Aolin Ding, Qinsi Wang, Louis DiValentin, Yujia Bao, Wei Wei, Hai Li, and Yiran Chen","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15974","last_updated":"2025-07-21T18:08:38Z","snapshot_observed_at":"2026-08-10T11:05:08.401042Z","submitted_at":"2025-07-21T18:08:38Z","title":"Does More Inference-Time Compute Really Help Robustness?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:20.640185Z"},"links":{"cited_paper":"/paper/2502.12893","citing_paper":"/paper/2507.15974"},"observation_digest":"sha256:8b9fb4487b69c64d277d98ea83e7b859915cd2d780c13aa443feb6df44f028fe","observation_id":"190ac5e0-6c50-4b7e-b6b9-841f8408844a","resolution":{"observed_at":"2026-08-06T15:26:20.640185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12893","last_updated":"2025-02-27T01:32:58Z","snapshot_observed_at":"2026-08-07T18:08:32.968901Z","submitted_at":"2025-02-18T14:29:12Z","title":"H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking","version":2},"cited_work":{"arxiv_id":"2502.12893","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12893","snapshot_observed_at":"2026-07-04T03:59:33.729006Z","title":"H-cot: Hijacking the chain-of-thought safety reasoning mechanism to jailbreak large reasoning models, including openai o1/o3, deepseek-r1, and gemini 2.0 flash thinking","venue":null,"work_id":"f81fb5a7-37c8-4bd2-9d6d-f1ba88504d78","year":2025},"citing_paper":{"arxiv_id":"2508.04204","last_updated":"2026-05-06T06:58:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-06T08:35:10Z","title":"ReasoningGuard: Safeguarding Large Reasoning Models with Inference-time Safety Aha Moments","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-19T01:02:07.088724Z"},"links":{"cited_paper":"/paper/2502.12893","citing_paper":"/paper/2508.04204"},"observation_digest":"sha256:032958f8a2e38903e8c2ea55eae604cbb84ae8b36c282f9583536247762c2646","observation_id":"28ba9b1d-47cf-4f28-bf47-22b2034bad11","resolution":{"observed_at":"2026-05-19T01:02:54.820508Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12893","last_updated":"2025-02-27T01:32:58Z","snapshot_observed_at":"2026-08-07T18:08:32.968901Z","submitted_at":"2025-02-18T14:29:12Z","title":"H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12893","snapshot_observed_at":"2026-08-05T10:39:06.931196Z","title":"H-cot: Hijacking the chain-of-thought safety reasoning mechanism to jailbreak large reasoning models, including openai o1/o3, deepseek-r1, and gemini 2.0 flash thinking","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-08T03:54:26.940042Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":117,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:06.931196Z"},"links":{"cited_paper":"/paper/2502.12893","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:2fa60e8b4828c366bc9782f86afc4800e21666bb498b3b8c1716cd4aca2dc5ce","observation_id":"2f69d3cc-b5d3-424b-81c9-2b1edc04887a","resolution":{"observed_at":"2026-08-05T10:39:06.931196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12893","last_updated":"2025-02-27T01:32:58Z","snapshot_observed_at":"2026-08-07T18:08:32.968901Z","submitted_at":"2025-02-18T14:29:12Z","title":"H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking","version":2},"cited_work":{"arxiv_id":"2502.12893","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12893","snapshot_observed_at":"2026-07-04T03:59:33.729006Z","title":"H-cot: Hijacking the chain-of-thought safety reasoning mechanism to jailbreak large reasoning models, including openai o1/o3, deepseek-r1, and gemini 2.0 flash thinking","venue":null,"work_id":"f81fb5a7-37c8-4bd2-9d6d-f1ba88504d78","year":2025},"citing_paper":{"arxiv_id":"2510.08592","last_updated":"2026-05-09T15:18:45Z","snapshot_observed_at":"2026-07-06T22:32:13.055128Z","submitted_at":"2025-10-04T20:01:21Z","title":"Less Diverse, Less Safe: The Indirect But Pervasive Risk of Test-Time Scaling in Large Language Models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-18T09:53:57.765473Z"},"links":{"cited_paper":"/paper/2502.12893","citing_paper":"/paper/2510.08592"},"observation_digest":"sha256:13361e953531922e0674d039ea9fc4791aae3cea4b761f78c7ae816381614d72","observation_id":"a8809245-3990-42e1-8825-90e588059a9d","resolution":{"observed_at":"2026-05-18T09:56:13.043306Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12893","last_updated":"2025-02-27T01:32:58Z","snapshot_observed_at":"2026-08-07T18:08:32.968901Z","submitted_at":"2025-02-18T14:29:12Z","title":"H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking","version":2},"cited_work":{"arxiv_id":"2502.12893","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12893","snapshot_observed_at":"2026-07-04T03:59:33.729006Z","title":"H-cot: Hijacking the chain-of-thought safety reasoning mechanism to jailbreak large reasoning models, including openai o1/o3, deepseek-r1, and gemini 2.0 flash thinking","venue":null,"work_id":"f81fb5a7-37c8-4bd2-9d6d-f1ba88504d78","year":2025},"citing_paper":{"arxiv_id":"2603.17305","last_updated":"2026-05-19T16:22:05Z","snapshot_observed_at":"2026-07-06T22:49:28.866886Z","submitted_at":"2026-03-18T03:00:42Z","title":"Contrastive Reasoning Alignment: Reinforcement Learning from Hidden Representations","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T11:23:26.852673Z"},"links":{"cited_paper":"/paper/2502.12893","citing_paper":"/paper/2603.17305"},"observation_digest":"sha256:05047bba900504d0caa0b46fa4ea7bb0842bbc88d636cd36fbb949f77c77d6db","observation_id":"f0829df4-ace3-486c-a3ed-996bdb46f315","resolution":{"observed_at":"2026-05-21T11:24:08.440237Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12893","last_updated":"2025-02-27T01:32:58Z","snapshot_observed_at":"2026-08-07T18:08:32.968901Z","submitted_at":"2025-02-18T14:29:12Z","title":"H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking","version":2},"cited_work":{"arxiv_id":"2502.12893","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12893","snapshot_observed_at":"2026-07-04T03:59:33.729006Z","title":"H-cot: Hijacking the chain-of-thought safety reasoning mechanism to jailbreak large reasoning models, including openai o1/o3, deepseek-r1, and gemini 2.0 flash thinking","venue":null,"work_id":"f81fb5a7-37c8-4bd2-9d6d-f1ba88504d78","year":2025},"citing_paper":{"arxiv_id":"2603.17368","last_updated":"2026-05-03T08:25:14Z","snapshot_observed_at":"2026-08-10T23:24:17.442230Z","submitted_at":"2026-03-18T05:21:12Z","title":"Towards Safer Large Reasoning Models by Promoting Safety Decision-Making before Chain-of-Thought Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T09:33:47.702580Z"},"links":{"cited_paper":"/paper/2502.12893","citing_paper":"/paper/2603.17368"},"observation_digest":"sha256:9eed586f4b0eeb9231df40919e298fb7fac6a0ad8d6df21def5b4e89dde4ad31","observation_id":"11270d23-0791-4709-ba21-0f18d7b0ef65","resolution":{"observed_at":"2026-05-15T09:35:22.362754Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12893","last_updated":"2025-02-27T01:32:58Z","snapshot_observed_at":"2026-08-07T18:08:32.968901Z","submitted_at":"2025-02-18T14:29:12Z","title":"H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12893","snapshot_observed_at":"2026-07-13T19:50:50.950451Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.23117","last_updated":"2026-06-01T08:02:23Z","snapshot_observed_at":"2026-08-04T07:57:16.483761Z","submitted_at":"2026-03-24T12:14:12Z","title":"TRAP: Hijacking VLA CoT-Reasoning via Adversarial Patches","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T19:50:50.950451Z"},"links":{"cited_paper":"/paper/2502.12893","citing_paper":"/paper/2603.23117"},"observation_digest":"sha256:088f55a710616687a5bfc04ecb2a3849f46e812c3d28c8f8da28a99b8e8c7f41","observation_id":"1ff8256a-2663-4210-82bf-dfd0ccd94183","resolution":{"observed_at":"2026-07-13T19:50:50.950451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12893","last_updated":"2025-02-27T01:32:58Z","snapshot_observed_at":"2026-08-07T18:08:32.968901Z","submitted_at":"2025-02-18T14:29:12Z","title":"H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking","version":2},"cited_work":{"arxiv_id":"2502.12893","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12893","snapshot_observed_at":"2026-07-04T03:59:33.729006Z","title":"H-cot: Hijacking the chain-of-thought safety reasoning mechanism to jailbreak large reasoning models, including openai o1/o3, deepseek-r1, and gemini 2.0 flash thinking","venue":null,"work_id":"f81fb5a7-37c8-4bd2-9d6d-f1ba88504d78","year":2025},"citing_paper":{"arxiv_id":"2604.09235","last_updated":"2026-04-10T11:44:27Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:44:27Z","title":"Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:37.034954Z"},"links":{"cited_paper":"/paper/2502.12893","citing_paper":"/paper/2604.09235"},"observation_digest":"sha256:d0df79d9575113d18743f61da1e2acc794364ab54db87bce1fbb4b1dae3017ee","observation_id":"2a63a6f4-1409-40c1-be22-4644c094e2c2","resolution":{"observed_at":"2026-05-11T06:41:08.992265Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12893","last_updated":"2025-02-27T01:32:58Z","snapshot_observed_at":"2026-08-07T18:08:32.968901Z","submitted_at":"2025-02-18T14:29:12Z","title":"H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking","version":2},"cited_work":{"arxiv_id":"2502.12893","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12893","snapshot_observed_at":"2026-07-04T03:59:33.729006Z","title":"H-cot: Hijacking the chain-of-thought safety reasoning mechanism to jailbreak large reasoning models, including openai o1/o3, deepseek-r1, and gemini 2.0 flash thinking","venue":null,"work_id":"f81fb5a7-37c8-4bd2-9d6d-f1ba88504d78","year":2025},"citing_paper":{"arxiv_id":"2604.15725","last_updated":"2026-04-17T05:56:46Z","snapshot_observed_at":"2026-07-06T23:03:12.000381Z","submitted_at":"2026-04-17T05:56:46Z","title":"Reasoning-targeted Jailbreak Attacks on Large Reasoning Models via Semantic Triggers and Psychological Framing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T08:24:43.494005Z"},"links":{"cited_paper":"/paper/2502.12893","citing_paper":"/paper/2604.15725"},"observation_digest":"sha256:fb9724cb972f30c47cc937294f811fb51ded0d3e6e2e8c413ebd5ae8e8d7b66e","observation_id":"8757c216-58d0-464c-9662-6cceb7ca859c","resolution":{"observed_at":"2026-05-10T09:08:26.267009Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12893","last_updated":"2025-02-27T01:32:58Z","snapshot_observed_at":"2026-08-07T18:08:32.968901Z","submitted_at":"2025-02-18T14:29:12Z","title":"H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking","version":2},"cited_work":{"arxiv_id":"2502.12893","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12893","snapshot_observed_at":"2026-07-04T03:59:33.729006Z","title":"H-cot: Hijacking the chain-of-thought safety reasoning mechanism to jailbreak large reasoning models, including openai o1/o3, deepseek-r1, and gemini 2.0 flash thinking","venue":null,"work_id":"f81fb5a7-37c8-4bd2-9d6d-f1ba88504d78","year":2025},"citing_paper":{"arxiv_id":"2605.02900","last_updated":"2026-05-24T13:33:45Z","snapshot_observed_at":"2026-08-02T11:46:07.449862Z","submitted_at":"2026-03-28T13:21:44Z","title":"Safety in Embodied AI: A Survey of Risks, Attacks, and Defenses","version":1},"reference_index":181,"source":"pdf_text","source_observed_at":"2026-05-14T22:20:31.623849Z"},"links":{"cited_paper":"/paper/2502.12893","citing_paper":"/paper/2605.02900"},"observation_digest":"sha256:2a1b90889b4a72c8290952fdf0aac5155ce19df936368f45ad1c2bd11425bce5","observation_id":"56824b76-f061-468d-9f15-0fc7f93640fe","resolution":{"observed_at":"2026-05-14T22:23:04.074845Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12893","last_updated":"2025-02-27T01:32:58Z","snapshot_observed_at":"2026-08-07T18:08:32.968901Z","submitted_at":"2025-02-18T14:29:12Z","title":"H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12893","snapshot_observed_at":"2026-07-13T17:08:58.831798Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.02900","last_updated":"2026-05-24T13:33:45Z","snapshot_observed_at":"2026-08-02T11:46:07.449862Z","submitted_at":"2026-03-28T13:21:44Z","title":"Safety in Embodied AI: A Survey of Risks, Attacks, and Defenses","version":2},"reference_index":180,"source":"pdf_text","source_observed_at":"2026-07-13T17:08:58.831798Z"},"links":{"cited_paper":"/paper/2502.12893","citing_paper":"/paper/2605.02900"},"observation_digest":"sha256:6dfe2eb3d07598bde170fc13dc9f7eb86ee3f574d046cbf39f7016521b9e107a","observation_id":"634570b7-069c-4a0a-a235-86a41ac5fa33","resolution":{"observed_at":"2026-07-13T17:08:58.831798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12893","last_updated":"2025-02-27T01:32:58Z","snapshot_observed_at":"2026-08-07T18:08:32.968901Z","submitted_at":"2025-02-18T14:29:12Z","title":"H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking","version":2},"cited_work":{"arxiv_id":"2502.12893","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12893","snapshot_observed_at":"2026-07-04T03:59:33.729006Z","title":"H-cot: Hijacking the chain-of-thought safety reasoning mechanism to jailbreak large reasoning models, including openai o1/o3, deepseek-r1, and gemini 2.0 flash thinking","venue":null,"work_id":"f81fb5a7-37c8-4bd2-9d6d-f1ba88504d78","year":2025},"citing_paper":{"arxiv_id":"2605.06165","last_updated":"2026-05-07T12:51:49Z","snapshot_observed_at":"2026-07-06T23:18:41.400741Z","submitted_at":"2026-05-07T12:51:49Z","title":"Post Reasoning: Improving the Performance of Non-Thinking Models at No Cost","version":1},"reference_index":156,"source":"arxiv_source","source_observed_at":"2026-05-08T10:19:08.451445Z"},"links":{"cited_paper":"/paper/2502.12893","citing_paper":"/paper/2605.06165"},"observation_digest":"sha256:0711b9f8470e3bec734394900fe45248aa5bacdaddf36bf00a06866fb7001602","observation_id":"ba9a39b0-854a-491b-bf9e-4e3fa1a14a73","resolution":{"observed_at":"2026-05-11T20:06:09.110663Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12893","last_updated":"2025-02-27T01:32:58Z","snapshot_observed_at":"2026-08-07T18:08:32.968901Z","submitted_at":"2025-02-18T14:29:12Z","title":"H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking","version":2},"cited_work":{"arxiv_id":"2502.12893","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12893","snapshot_observed_at":"2026-07-04T03:59:33.729006Z","title":"H-cot: Hijacking the chain-of-thought safety reasoning mechanism to jailbreak large reasoning models, including openai o1/o3, deepseek-r1, and gemini 2.0 flash thinking","venue":null,"work_id":"f81fb5a7-37c8-4bd2-9d6d-f1ba88504d78","year":2025},"citing_paper":{"arxiv_id":"2605.08378","last_updated":"2026-05-08T18:36:25Z","snapshot_observed_at":"2026-08-02T18:04:56.183678Z","submitted_at":"2026-05-08T18:36:25Z","title":"Reinforcement Learning for Scalable and Trustworthy Intelligent Systems","version":1},"reference_index":201,"source":"pdf_text","source_observed_at":"2026-05-12T01:47:40.772146Z"},"links":{"cited_paper":"/paper/2502.12893","citing_paper":"/paper/2605.08378"},"observation_digest":"sha256:d41dda8fe180469d77ce0180c71d34f3a6d544b118aface87f6214d2dd77e069","observation_id":"02f91ae3-15c0-471c-91b0-3be42201a073","resolution":{"observed_at":"2026-05-12T07:51:40.547032Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12893","last_updated":"2025-02-27T01:32:58Z","snapshot_observed_at":"2026-08-07T18:08:32.968901Z","submitted_at":"2025-02-18T14:29:12Z","title":"H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking","version":2},"cited_work":{"arxiv_id":"2502.12893","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12893","snapshot_observed_at":"2026-07-04T03:59:33.729006Z","title":"H-cot: Hijacking the chain-of-thought safety reasoning mechanism to jailbreak large reasoning models, including openai o1/o3, deepseek-r1, and gemini 2.0 flash thinking","venue":null,"work_id":"f81fb5a7-37c8-4bd2-9d6d-f1ba88504d78","year":2025},"citing_paper":{"arxiv_id":"2605.08930","last_updated":"2026-05-09T13:05:00Z","snapshot_observed_at":"2026-07-06T23:21:06.773761Z","submitted_at":"2026-05-09T13:05:00Z","title":"Internalizing Safety Understanding in Large Reasoning Models via Verification","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T01:50:59.283409Z"},"links":{"cited_paper":"/paper/2502.12893","citing_paper":"/paper/2605.08930"},"observation_digest":"sha256:866fae5c577ea23b75d3b752b01ea0aa02d58f0d2843e099f9819256bdbd7ed4","observation_id":"7d659266-77d3-4dce-838d-216239a50a5f","resolution":{"observed_at":"2026-05-12T01:51:14.276877Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12893","last_updated":"2025-02-27T01:32:58Z","snapshot_observed_at":"2026-08-07T18:08:32.968901Z","submitted_at":"2025-02-18T14:29:12Z","title":"H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking","version":2},"cited_work":{"arxiv_id":"2502.12893","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12893","snapshot_observed_at":"2026-07-04T03:59:33.729006Z","title":"H-cot: Hijacking the chain-of-thought safety reasoning mechanism to jailbreak large reasoning models, including openai o1/o3, deepseek-r1, and gemini 2.0 flash thinking","venue":null,"work_id":"f81fb5a7-37c8-4bd2-9d6d-f1ba88504d78","year":2025},"citing_paper":{"arxiv_id":"2605.08936","last_updated":"2026-05-09T13:14:31Z","snapshot_observed_at":"2026-07-06T23:21:06.773761Z","submitted_at":"2026-05-09T13:14:31Z","title":"Self-ReSET: Learning to Self-Recover from Unsafe Reasoning Trajectories","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T02:07:04.364417Z"},"links":{"cited_paper":"/paper/2502.12893","citing_paper":"/paper/2605.08936"},"observation_digest":"sha256:d36ff2ca499bed6d6e06db19a0c01cc5a209d6c6ca5a1f15f672fd7cff1bd040","observation_id":"e764296b-98ef-4a33-9ef6-3ec1cc0e4041","resolution":{"observed_at":"2026-05-12T02:11:16.173807Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12893","last_updated":"2025-02-27T01:32:58Z","snapshot_observed_at":"2026-08-07T18:08:32.968901Z","submitted_at":"2025-02-18T14:29:12Z","title":"H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking","version":2},"cited_work":{"arxiv_id":"2502.12893","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12893","snapshot_observed_at":"2026-07-04T03:59:33.729006Z","title":"H-cot: Hijacking the chain-of-thought safety reasoning mechanism to jailbreak large reasoning models, including openai o1/o3, deepseek-r1, and gemini 2.0 flash thinking","venue":null,"work_id":"f81fb5a7-37c8-4bd2-9d6d-f1ba88504d78","year":2025},"citing_paper":{"arxiv_id":"2605.19485","last_updated":"2026-05-19T07:36:52Z","snapshot_observed_at":"2026-07-06T23:30:11.337726Z","submitted_at":"2026-05-19T07:36:52Z","title":"Attention-Guided Reward for Reinforcement Learning-based Jailbreak against Large Reasoning Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T06:33:30.647965Z"},"links":{"cited_paper":"/paper/2502.12893","citing_paper":"/paper/2605.19485"},"observation_digest":"sha256:adc56935bc5191c98f3843779d5b992bea75363c7e277fa2a22b7aaeeb5ced42","observation_id":"f62ae6cd-61d5-4f5d-88db-cebffbbd52d9","resolution":{"observed_at":"2026-05-20T06:38:05.823447Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12893","last_updated":"2025-02-27T01:32:58Z","snapshot_observed_at":"2026-08-07T18:08:32.968901Z","submitted_at":"2025-02-18T14:29:12Z","title":"H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking","version":2},"cited_work":{"arxiv_id":"2502.12893","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12893","snapshot_observed_at":"2026-07-04T03:59:33.729006Z","title":"H-cot: Hijacking the chain-of-thought safety reasoning mechanism to jailbreak large reasoning models, including openai o1/o3, deepseek-r1, and gemini 2.0 flash thinking","venue":null,"work_id":"f81fb5a7-37c8-4bd2-9d6d-f1ba88504d78","year":2025},"citing_paper":{"arxiv_id":"2605.28467","last_updated":"2026-05-27T13:33:26Z","snapshot_observed_at":"2026-08-05T22:05:24.662345Z","submitted_at":"2026-05-27T13:33:26Z","title":"Mitigating Adaptive Attacks against Reasoning Models with Activation Consistency Training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T14:18:16.033063Z"},"links":{"cited_paper":"/paper/2502.12893","citing_paper":"/paper/2605.28467"},"observation_digest":"sha256:9aacd830fdf57b4816d703eb32b2b3f06170b1b4dc5c0b778e380a4b29ed94cf","observation_id":"f0a983c9-d9c6-4b07-b3a9-10aa1ebcc1fd","resolution":{"observed_at":"2026-06-29T14:23:30.697097Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12893","last_updated":"2025-02-27T01:32:58Z","snapshot_observed_at":"2026-08-07T18:08:32.968901Z","submitted_at":"2025-02-18T14:29:12Z","title":"H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking","version":2},"cited_work":{"arxiv_id":"2502.12893","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12893","snapshot_observed_at":"2026-07-04T03:59:33.729006Z","title":"H-cot: Hijacking the chain-of-thought safety reasoning mechanism to jailbreak large reasoning models, including openai o1/o3, deepseek-r1, and gemini 2.0 flash thinking","venue":null,"work_id":"f81fb5a7-37c8-4bd2-9d6d-f1ba88504d78","year":2025},"citing_paper":{"arxiv_id":"2606.19755","last_updated":"2026-06-18T03:35:32Z","snapshot_observed_at":"2026-07-06T23:55:01.487552Z","submitted_at":"2026-06-18T03:35:32Z","title":"SafeSpec: Fast and Safe LLM via Dynamic Reflective Sampling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T17:23:06.382761Z"},"links":{"cited_paper":"/paper/2502.12893","citing_paper":"/paper/2606.19755"},"observation_digest":"sha256:e4be8aa2eda130c4312820cbf4869a38d541207d49225cb9b36a8f7caefa9510","observation_id":"e8341fcd-b37c-4909-9d85-4babe7cbfc80","resolution":{"observed_at":"2026-07-04T03:59:33.731040Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12893","last_updated":"2025-02-27T01:32:58Z","snapshot_observed_at":"2026-08-07T18:08:32.968901Z","submitted_at":"2025-02-18T14:29:12Z","title":"H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking","version":2},"cited_work":{"arxiv_id":"2502.12893","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12893","snapshot_observed_at":"2026-07-04T03:59:33.729006Z","title":"H-cot: Hijacking the chain-of-thought safety reasoning mechanism to jailbreak large reasoning models, including openai o1/o3, deepseek-r1, and gemini 2.0 flash thinking","venue":null,"work_id":"f81fb5a7-37c8-4bd2-9d6d-f1ba88504d78","year":2025},"citing_paper":{"arxiv_id":"2606.31748","last_updated":"2026-06-30T14:38:49Z","snapshot_observed_at":"2026-07-07T00:05:27.130060Z","submitted_at":"2026-06-30T14:38:49Z","title":"Addressing Over-Refusal in LLMs with Competing Rewards","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-07-01T06:59:12.695984Z"},"links":{"cited_paper":"/paper/2502.12893","citing_paper":"/paper/2606.31748"},"observation_digest":"sha256:71a820485e3d5821d763965cf713d8bc3b336200ce52662c5c16d0d0a22b259f","observation_id":"c62b027d-50c4-4b2e-a80f-a6284d39bcf1","resolution":{"observed_at":"2026-07-01T08:55:35.602580Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12893","last_updated":"2025-02-27T01:32:58Z","snapshot_observed_at":"2026-08-07T18:08:32.968901Z","submitted_at":"2025-02-18T14:29:12Z","title":"H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking","version":2},"cited_work":{"arxiv_id":"2502.12893","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12893","snapshot_observed_at":"2026-07-04T03:59:33.729006Z","title":"H-cot: Hijacking the chain-of-thought safety reasoning mechanism to jailbreak large reasoning models, including openai o1/o3, deepseek-r1, and gemini 2.0 flash thinking","venue":null,"work_id":"f81fb5a7-37c8-4bd2-9d6d-f1ba88504d78","year":2025},"citing_paper":{"arxiv_id":"2607.00481","last_updated":"2026-07-01T06:08:07Z","snapshot_observed_at":"2026-08-04T19:51:57.082592Z","submitted_at":"2026-07-01T06:08:07Z","title":"Beyond the Prompt: Jailbreaking Function-Calling LLMs via Simulated Moderation Traces","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-02T11:37:02.538968Z"},"links":{"cited_paper":"/paper/2502.12893","citing_paper":"/paper/2607.00481"},"observation_digest":"sha256:fafaa05043f8f32edc1dd27a80c9d2ba1792c97a8d0a3eac0915cd38d580c06c","observation_id":"17f24cda-e378-4c56-967e-fb462776f27a","resolution":{"observed_at":"2026-07-02T11:46:54.871856Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12893","last_updated":"2025-02-27T01:32:58Z","snapshot_observed_at":"2026-08-07T18:08:32.968901Z","submitted_at":"2025-02-18T14:29:12Z","title":"H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12893","snapshot_observed_at":"2026-07-31T09:23:52.331731Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24897","last_updated":"2026-07-27T16:41:36Z","snapshot_observed_at":"2026-08-03T19:46:21.991125Z","submitted_at":"2026-07-27T16:41:36Z","title":"TYPO: Instruction-Dense Visual Jailbreaks against Commercial Closed-Source Image-Generation Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-31T09:23:52.331731Z"},"links":{"cited_paper":"/paper/2502.12893","citing_paper":"/paper/2607.24897"},"observation_digest":"sha256:57f3184d37d3328d0a8eb435891df7eff41616b23a6daf1b5cf6eaafd92999dc","observation_id":"307204e9-b59a-4356-95b2-3dfe24443d7e","resolution":{"observed_at":"2026-07-31T09:23:52.331731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12893","last_updated":"2025-02-27T01:32:58Z","snapshot_observed_at":"2026-08-07T18:08:32.968901Z","submitted_at":"2025-02-18T14:29:12Z","title":"H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12893","snapshot_observed_at":"2026-08-03T00:55:33.211393Z","title":"arXiv preprint arXiv:2502.12893 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28636","last_updated":"2026-05-19T13:56:13Z","snapshot_observed_at":"2026-08-10T20:43:57.798906Z","submitted_at":"2026-05-19T13:56:13Z","title":"Chain-of-Models: Cross-Model Auditing for Bias-Robust LLM Judges","version":1},"reference_index":206,"source":"arxiv_source","source_observed_at":"2026-08-03T00:55:33.211393Z"},"links":{"cited_paper":"/paper/2502.12893","citing_paper":"/paper/2607.28636"},"observation_digest":"sha256:4f5e5e72e54f816dc7609ff85cc91e149fd5b09a58585797a1aa110fdbc2e0cc","observation_id":"56062d6d-a893-4c73-b3a0-49766ab01350","resolution":{"observed_at":"2026-08-03T00:55:33.211393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12893","last_updated":"2025-02-27T01:32:58Z","snapshot_observed_at":"2026-08-07T18:08:32.968901Z","submitted_at":"2025-02-18T14:29:12Z","title":"H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12893","snapshot_observed_at":"2026-08-07T00:14:45.609000Z","title":"arXiv preprint arXiv:2502.12893 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04034","last_updated":"2026-08-03T02:28:52Z","snapshot_observed_at":"2026-08-09T14:43:30.524152Z","submitted_at":"2026-08-03T02:28:52Z","title":"A Multimodal Automatic Redteaming Evaluation based on Atomic Jailbreak Strategy Decoupling and Combination","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-07T00:14:45.609000Z"},"links":{"cited_paper":"/paper/2502.12893","citing_paper":"/paper/2608.04034"},"observation_digest":"sha256:66d9834bcab9cba6f1ebbcb584e6e5a05d1dad5fcb60744827bb0f6e11ba94d4","observation_id":"a2d4ac7e-537d-4844-8a23-79f2634c18ce","resolution":{"observed_at":"2026-08-07T00:14:45.609000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.12893/citation-record","integrity":"/paper/2502.12893/integrity","json":"/paper/2502.12893/citation-record.json","paper":"/paper/2502.12893"},"outbound":[],"paper":{"arxiv_id":"2502.12893","last_updated":"2025-02-27T01:32:58Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T18:08:32.968901Z","submitted_at":"2025-02-18T14:29:12Z","title":"H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 34 inbound Pith citation observations for arXiv:2502.12893."}