Pith. sign in

Paper Citation Record · LEDGER

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models

As of 19 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 2 inbound Pith citation observations for arXiv:2505.19690.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.19690 v1

Coverage vector

measured 66 of 66 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T14:13:57.131554Z

measured 68 of 68 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-18T06:34:40.430872+00:00

measured 2 of 2 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-05T10:39:06.815939Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-19T01:02:54.838590Z

Reference resolution

66 of 66 outbound references displayed

  • verified exact1
  • verified fuzzy16
  • unresolved49
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 5535be79-d61c-4798-b985-68a69e82c44a · outbound

This paper cites OpenAI o1 System Card.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models OpenAI o1 System Card

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:49.333820Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:49.333820Z digest=sha256:e0be07b41746044948deb1ae1bb07ddac8cf26732e22eeea91db965274ceb4c8

Observation 55a0d2a8-2ed7-4151-a0e4-f11d21e65da0 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:49.444148Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:49.444148Z digest=sha256:dfa41151c84fdf34b6f2a7416dbe2f0c1dadcbdd215cbddb0f94af4b087c9437

Observation 31cf1929-a18f-441d-83e2-5ceb75a7b59c · outbound

This paper cites Qwen2.5 Technical Report.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Qwen2.5 Technical Report

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:49.568128Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:49.568128Z digest=sha256:dc603addac981c2769e8879e82c6029c66a34816eafad71c2f385f8b1d4fd87f

Observation 78c0d864-884f-4219-ae30-0e4c50eb0bc5 · outbound

This paper cites Chain-of-thought prompting elicits reasoning in large language models,.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Chain-of-thought prompting elicits reasoning in large language models,

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:49.688886Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:49.688886Z digest=sha256:ca5fd4840327d2adf095b3f5b409625dac25483f888cf1e6c791b9222158c366

Observation cd40c532-af5d-4742-ad30-1ddb0e71200c · outbound

This paper cites Safety in Large Reasoning Models: A Survey.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Safety in Large Reasoning Models: A Survey

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:49.771889Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:49.771889Z digest=sha256:683ed39472d4467addf346fb127148410664b62383795c1fe4cb38ea833db199

Observation cb9dbb89-0ad2-42af-a47f-2198161e37b9 · outbound

This paper cites SafeChain: Safety of Language Models with Long Chain-of-Thought Reasoning Capabilities.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models SafeChain: Safety of Language Models with Long Chain-of-Thought Reasoning Capabilities

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:49.893258Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:49.893258Z digest=sha256:08407e63ac0a5f9432945385f5d1c56621101f62629fd0822e18313325e3ed06

Observation b4dc0665-1d70-4883-9ff1-5f83f3f7fcdf · outbound

This paper cites Trading Inference-Time Compute for Adversarial Robustness.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Trading Inference-Time Compute for Adversarial Robustness

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:50.014107Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:50.014107Z digest=sha256:6d8a84a01eaf8e6a12f681665ed29f53ba0fc204448ac49d9228db8679190831

Observation be72498e-6cf4-4317-b806-236374894a5f · outbound

This paper cites ShadowCoT: Cognitive Hijacking for Stealthy Reasoning Backdoors in LLMs.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models ShadowCoT: Cognitive Hijacking for Stealthy Reasoning Backdoors in LLMs

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:50.101785Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:50.101785Z digest=sha256:7752858c221548cb2bf1298d5aaafbfdd5d53ab54847fd7365a35ca76067f7df

Observation b86248c1-ba00-429c-bbab-e57b4b4fae77 · outbound

This paper cites Overthinking: Slowdown attacks on reasoning llms,.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Overthinking: Slowdown attacks on reasoning llms,

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:50.189517Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:50.189517Z digest=sha256:2bc76f587a78e7395ccbe5893a82462a3eaf5d3e0045e9c23bf5f15ea5a3af3d

Observation 26fc7304-851a-4c7a-900c-837a097bee99 · outbound

This paper cites Alignment faking in large language models.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Alignment faking in large language models

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:50.292007Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:50.292007Z digest=sha256:003db46dab654ef597d9c03c7023038a61cde8342df254cc3c0d63419bfbff46

Observation 308be687-ef63-4519-9927-b974cc7d1509 · outbound

This paper cites Deepseek-r1 thoughtology: Let’s< think> about llm reasoning,.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Deepseek-r1 thoughtology: Let’s< think> about llm reasoning,

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:50.391944Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:50.391944Z digest=sha256:c1da53318b90661d9edf5c6a93ff323c9609e1c5f00e16125790173e50704b08

Observation 15ecdde5-f430-4616-8d8d-7541c6213c5d · outbound

This paper cites Early External Safety Testing of OpenAI's o3-mini: Insights from the Pre-Deployment Evaluation.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Early External Safety Testing of OpenAI's o3-mini: Insights from the Pre-Deployment Evaluation

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:50.508020Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:50.508020Z digest=sha256:c38da65004adc6085fa41f239cf54ff156a6eb162d5d1c5fd2f86b23b0efdab5

Observation f0eb9e95-cf39-4324-9b69-27947e6cce1e · outbound

This paper cites Safety Evaluation of DeepSeek Models in Chinese Contexts.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Safety Evaluation of DeepSeek Models in Chinese Contexts

Reference 13

Resolution
verified exact
local_arxiv, observed 2026-08-07T14:13:57.994867Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:13:50.590848Z digest=sha256:56a64c7ea0f6466f92f2c91a589725f763e6db9697e032e0aa02931115cd7720

Observation c74ab0e6-58f7-4c82-b0fd-0ccdce93db08 · outbound

This paper cites Red Teaming Contemporary AI Models: Insights from Spanish and Basque Perspectives.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Red Teaming Contemporary AI Models: Insights from Spanish and Basque Perspectives

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:50.720640Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:50.720640Z digest=sha256:c86c89d978421f336faade788c97b16aef03b688263a717a1ea869efff0324a0

Observation 01b9a4ff-b677-440c-aa06-5bcd0b721490 · outbound

This paper cites HiddenDetect: Detecting Jailbreak Attacks against Large Vision-Language Models via Monitoring Hidden States.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models HiddenDetect: Detecting Jailbreak Attacks against Large Vision-Language Models via Monitoring Hidden States

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:50.813253Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:50.813253Z digest=sha256:376619a324d46238359dcdf100ace4fd55c61f33fbf59b4be8e7a4b9c69261bb

Observation 1bfad11f-c468-461a-b52f-0a1b8827af05 · outbound

This paper cites Star-1: Safer alignment of reasoning llms with 1k data,.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Star-1: Safer alignment of reasoning llms with 1k data,

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:50.907629Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:50.907629Z digest=sha256:07504b01c2010c80ebb2f9c0ae7bc0e6487daa0ab07f184ea0e1508f37ec9ae9

Observation ab77b23f-1485-4986-a3f9-675a575d0896 · outbound

This paper cites RealSafe-R1: Safety-Aligned DeepSeek-R1 without Compromising Reasoning Capability.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models RealSafe-R1: Safety-Aligned DeepSeek-R1 without Compromising Reasoning Capability

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:50.995870Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:50.995870Z digest=sha256:aaf141b1ce2d4f3fa61bf23eb9284625f969a230e156e93cd4d2dbc2cdbfed0c

Observation 1e882a4c-391c-45d6-94c6-375df79ea19c · outbound

This paper cites The Llama 3 Herd of Models.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models The Llama 3 Herd of Models

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:51.098100Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:51.098100Z digest=sha256:11c4d85d0be7d68cc4d354e31a89ea95a6975ffaedd892e3eb09255ba597bd5a

Observation 62328b63-bc7c-4b15-8e87-7bf261f73bfa · outbound

This paper cites Equilibrate RLHF: Towards Balancing Helpfulness-Safety Trade-off in Large Language Models.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Equilibrate RLHF: Towards Balancing Helpfulness-Safety Trade-off in Large Language Models

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:51.212632Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:51.212632Z digest=sha256:af24b65d27bbd4d630e5acff80d5f2e788c02e5533ab0284e992cbc689d10a38

Observation dddadb82-3c27-4d83-b6a4-a508bcd7b558 · outbound

This paper cites Guardrea- soner: Towards reasoning-based llm safeguards,.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Guardrea- soner: Towards reasoning-based llm safeguards,

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:51.306406Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:51.306406Z digest=sha256:ec0b22c84460c77341e23c34a2d5e96bfbdbc261237901f7f02bed034a7ea1e9

Observation 6562588d-e7fb-4669-88ad-927cea5e4a1c · outbound

This paper cites ThinkGuard: Deliberative Slow Thinking Leads to Cautious Guardrails.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models ThinkGuard: Deliberative Slow Thinking Leads to Cautious Guardrails

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:51.424723Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:51.424723Z digest=sha256:90ec08133eea3c1bcdabbf7deb20d5b4bd53f2aae17152c45f5f807aa5f52d51

Observation 7277bf91-625e-450a-a6b9-dc573a7ecbe7 · outbound

This paper cites RapGuard: Safeguarding Multimodal Large Language Models via Rationale-aware Defensive Prompting.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models RapGuard: Safeguarding Multimodal Large Language Models via Rationale-aware Defensive Prompting

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:51.539892Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:51.539892Z digest=sha256:3572cc2f5b93530b5bf2f8eb3a945338acb045aa637525e8d0e57f060062231b

Observation 7037e839-8af1-4b57-a9e0-591660cdd27b · outbound

This paper cites Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:51.647994Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:51.647994Z digest=sha256:e5934468ddb8abb36d66f2201c1dfd21b2d75eebce3b2eb34086ffaf85a41f05

Observation 4e6727da-bd81-48d1-af2f-45f0316204dd · outbound

This paper cites Ai deception: A survey of examples, risks, and potential solutions,.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Ai deception: A survey of examples, risks, and potential solutions,

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:14:03.895924Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:13:51.733525Z digest=sha256:e697cf43c556b09e37904aaacc5364db2df8c8131192ee0a3d9f0694e7fe5cdb

Observation 99598a03-01f7-4abe-8173-f38f7f05f47e · outbound

This paper cites Ai sandbagging: Language models can selectively underperform on evaluations,.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Ai sandbagging: Language models can selectively underperform on evaluations,

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:14:03.733841Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:13:51.843560Z digest=sha256:3d2d20f56c2c872033fa2753b6bd49041c63006a1b9a8a83d957a8a25d8e0633

Observation aa202458-0103-447c-b666-20ea3ed08adb · outbound

This paper cites Auditing language models for hidden objectives.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Auditing language models for hidden objectives

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:51.942324Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:51.942324Z digest=sha256:fd3175c25e3fd50374401bba3621081ee06da892452f35f92d5c11b4636e130f

Observation e2fcd080-e72a-4399-9561-abacfd1c8625 · outbound

This paper cites Large language models can strategically deceive their users when put under pressure,.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Large language models can strategically deceive their users when put under pressure,

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:14:03.569055Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:13:52.044693Z digest=sha256:dea579acf170cdbb36a37f0569bfcaa99fc3561a1c24d7039b14f1ac4ffa1fc4

Observation 4d3872db-06e7-49e6-8c42-ac29188ba1f1 · outbound

This paper cites Towards understanding sycophancy in language models,.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Towards understanding sycophancy in language models,

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:14:03.408967Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:13:52.156517Z digest=sha256:d1b377436987395873a9e341a6dc40f12a6fa8eed544c0a1115a34f91befb6d4

Observation e31f9482-b5a0-44ba-ab4e-7991955b234c · outbound

This paper cites Fake Alignment: Are LLMs Really Aligned Well?.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Fake Alignment: Are LLMs Really Aligned Well?

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:52.256199Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:52.256199Z digest=sha256:62e058644593f85552abb1af946b2f3ac44092d5285516a3575eea60f8e44847

Observation df34b300-69f0-4081-a93f-1d8bac326022 · outbound

This paper cites Beavertails: Towards improved safety alignment of llm via a human-preference dataset,.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Beavertails: Towards improved safety alignment of llm via a human-preference dataset,

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:52.338828Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:52.338828Z digest=sha256:997a2c47a88c0240e05451d87921893924558e549ebc5eb0f64d95f0d7f31648

Observation 62fb4ef6-d5c8-4425-9bab-d36d4cfe9f14 · outbound

This paper cites PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:52.457692Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:52.457692Z digest=sha256:a9a9decdee60f318d6b2001aab278d296bb84a52fb6958e3015e3b850ae37e30

Observation 3ada40e2-6b9b-427a-82a7-f2956c25f27c · outbound

This paper cites OR-Bench: An Over-Refusal Benchmark for Large Language Models.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:52.566860Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:52.566860Z digest=sha256:5aead2bef2a43a3ffac42be85660873af26c010a819bf170634e0e459149a5b2

Observation 6467970d-c79f-4984-ac17-5e3ba0ceb46f · outbound

This paper cites Kimi k1.5: Scaling Reinforcement Learning with LLMs.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Kimi k1.5: Scaling Reinforcement Learning with LLMs

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:52.672411Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:52.672411Z digest=sha256:3eeb07f400e0b07fc687f1af8c4f51f9dc0b4bb46f3ce5618bf656aa08815c03

Observation 18640e6f-a309-42af-930a-89d013c6b357 · outbound

This paper cites H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:52.872208Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:52.872208Z digest=sha256:519d8b3cb1c85ed96c8861e3bf2c7c4a9dc645965be2b5d7a333bafbdeecc7e4

Observation f8819dd7-2025-42da-b065-8d2e3f16f4b6 · outbound

This paper cites Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:53.012947Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:53.012947Z digest=sha256:d9ddde13b492dd655709a4a221ed1190187824ec4195891c57d542c5a17d6ecc

Observation 8d3e351c-1344-4fec-9943-9b21c1f90314 · outbound

This paper cites Safety Tax: Safety Alignment Makes Your Large Reasoning Models Less Reasonable.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Safety Tax: Safety Alignment Makes Your Large Reasoning Models Less Reasonable

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:53.204922Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:53.204922Z digest=sha256:2e9d088f3f599310d6ab7e36d837f4b64593d27f57a9f829e66c343f3e3f0d18

Observation aee950f9-1eaa-4ed8-a472-454f7a619694 · outbound

This paper cites A Survey on LLM-as-a-Judge.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models A Survey on LLM-as-a-Judge

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:53.369850Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:53.369850Z digest=sha256:cc4ae5f3041757c10c304cce39c4f7f22077dc62114e1f9b4931a75cdcd69c73

Observation 9c76d516-b3af-4509-b14f-fa57bb51077b · outbound

This paper cites LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:53.561043Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:53.561043Z digest=sha256:461a71158f23a25d55d8679636681fdba4b0b32aad05ff136abf46e7a14017fd

Observation 15a050fd-41e9-4aea-9f21-c21a4429791f · outbound

This paper cites Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:53.757909Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:53.757909Z digest=sha256:4d895d9e1c09a59925f6e01cbf3f1344a2d0e1724df93cf65501a8c2e5154fd2

Observation c3f4d0ad-0bba-4d54-aff5-0d993aa0f1d8 · outbound

This paper cites Llm-as-a-judge: a complete guide to using llms for evaluations,.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Llm-as-a-judge: a complete guide to using llms for evaluations,

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:14:03.259431Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:13:53.849787Z digest=sha256:16f5ead62f88e4e06c28effde5265dd59c8361363fa20c57c75361b2c969ecb8

Observation 8bdc18ab-355a-493e-b4ee-b2f0734a296f · outbound

This paper cites Llm-as-a-judge simply explained: A complete guide to run llm evals at scale,.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Llm-as-a-judge simply explained: A complete guide to run llm evals at scale,

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:14:03.079495Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:13:53.976647Z digest=sha256:9923cec14a48a596b02c8138639822747d0f3f514dd4a9cf98dd18db5d3721e6

Observation 7c674e3d-7334-4773-91d8-1318731fe9a6 · outbound

This paper cites Deliberative Alignment: Reasoning Enables Safer Language Models.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Deliberative Alignment: Reasoning Enables Safer Language Models

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:54.133916Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:54.133916Z digest=sha256:87b5be55e7c7abbe75175755847a4251d5703690ae2b7330c3dee9739d7e79a1

Observation 104f63dc-17ea-41e7-bf3c-5c73d04616ad · outbound

This paper cites Constitutional AI: Harmlessness from AI Feedback.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Constitutional AI: Harmlessness from AI Feedback

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:54.323505Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:54.323505Z digest=sha256:7ce1770f3cf1d63d9b5a77c584074eae4d81b1084ebe9c5e2eabf34bee4b0412

Observation 843de4f0-38dc-4827-a444-dc5a8d97eef3 · outbound

This paper cites an unresolved cited work.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Unresolved cited work

Reference 44

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:14:02.925816Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:13:54.480196Z digest=sha256:0878586eff9be6df7440651482db114a24458ff82ccddfcc543cadcf45cbb861

Observation f01efde8-bfac-4c25-98bc-007713015ac8 · outbound

This paper cites an unresolved cited work.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Unresolved cited work

Reference 45

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:14:02.747764Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:13:54.667429Z digest=sha256:14d3cfdcbd99bac356c5909308d7a5551c929f2861a378fde419eab3a4f28f3f

Observation bace8e75-82cb-4877-ab60-247932cfbb00 · outbound

This paper cites # Evaluation Guidelines.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models # Evaluation Guidelines

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:14:02.627227Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:13:54.885944Z digest=sha256:e5a080f443a429b2aa6b8df234fe4672eb14629b26b9b7e64ca99422ef767321

Observation 82dce026-34f9-413c-854f-9b8f3312384d · outbound

This paper cites an unresolved cited work.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Unresolved cited work

Reference 47

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:14:02.458444Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:13:55.031756Z digest=sha256:a72fa63aced1e1c3441b8d9ac43b4fce4364d80c84a345f508f9f48a4815c8e1

Observation 826cb8a3-daa5-47cd-9c16-de6d5a72668f · outbound

This paper cites an unresolved cited work.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Unresolved cited work

Reference 48

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:14:02.286632Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:13:55.254663Z digest=sha256:60dcb1ec244cadb13524c8a2c46508f6986e0164000ba02d7e7c30dca5825ac9

Observation 40bf18e0-938d-42ef-b79c-356adec2d824 · outbound

This paper cites Reasoning Quality Evaluation.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Reasoning Quality Evaluation

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:14:02.130403Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:13:55.338077Z digest=sha256:a045a3b08c47ceecdf54544d9a6f9de577f9fb6f122fcdb56f52cbf45909d833

Observation 355bdf47-f487-4948-b442-9f13ef2f751f · outbound

This paper cites (Usually includes two main risks, e.g., risks of insulting others and privacy violations.) 15.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models (Usually includes two main risks, e.g., risks of insulting others and privacy violations.) 15

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:14:01.950266Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:13:55.449364Z digest=sha256:63e75a68d46660e0c68547cf899c3a2d58fa9319b308e648cf0e7cba15e44fb6

Observation d8d671c0-3f5f-43cf-81a9-734cef4c3b9a · outbound

This paper cites an unresolved cited work.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Unresolved cited work

Reference 51

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:14:01.850665Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:13:55.621282Z digest=sha256:d86fd4ac72b547c7ef8108240664182994753bdeb6cba09719dfef8e44ec764e

Observation 359b3b1e-7b58-4d6b-84d1-13683bc3dba9 · outbound

This paper cites # Evaluation Guidelines.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models # Evaluation Guidelines

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:14:01.685722Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:13:55.715943Z digest=sha256:8e68c9baf9ca2bed6058ece73d7c18adc366a62ebc8fe0ae88008fa0876516e9

Observation f0a35677-0886-410d-afd9-d11300c7ecf2 · outbound

This paper cites an unresolved cited work.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Unresolved cited work

Reference 53

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:14:01.463138Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:13:55.828696Z digest=sha256:9af8e8c94a5c309862f659ce39c0a98f66b1c5f0d237f72432057e10f247df06

Observation 3650a463-b1a9-4a70-a63e-72322a235a65 · outbound

This paper cites Reasoning Quality Evaluation.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Reasoning Quality Evaluation

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:14:01.207257Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:13:55.929030Z digest=sha256:1d06c0bb2009096c6c147d7ebceb9aef861f3cbd6bdbc6b0cbda9f01d7070668

Observation 54e0834a-3ca0-4756-8235-c2098859ea3d · outbound

This paper cites an unresolved cited work.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Unresolved cited work

Reference 55

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:14:01.017613Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:13:56.031612Z digest=sha256:c9be2855f1e521ea2ec6cef6fbe48d656025e3cc71223befbe1be9ac9eec9abb

Observation 9d172e54-b009-4572-ad51-d267a2cf3e9c · outbound

This paper cites an unresolved cited work.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Unresolved cited work

Reference 56

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:14:00.804263Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:13:56.106352Z digest=sha256:b488f6a9985ea92d1dfbea11e1e6f7eaf0ee729df85e3d536b771e08b41c3000

Observation 7898a7dc-63ce-4948-9441-5617486baea4 · outbound

This paper cites # Evaluation Guidelines.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models # Evaluation Guidelines

Reference 57

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:14:00.542408Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:13:56.212901Z digest=sha256:a8d3a86ac9d303efb1b6cb96265367d68d6880e49f0a4ac7978eb9c3e00894b9

Observation ce03aac8-dfdc-405b-b9b9-3bae91286b2c · outbound

This paper cites an unresolved cited work.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Unresolved cited work

Reference 58

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:14:00.349370Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:13:56.326896Z digest=sha256:52fd6233018bc537f321139a7d379889417ce4f0da07197090e2de7716dff8d7

Observation 03040abd-0260-44df-ba73-0cc4c5581b7c · outbound

This paper cites an unresolved cited work.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Unresolved cited work

Reference 59

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:14:00.146106Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:13:56.427560Z digest=sha256:fd295d3f836fba8fa5a4e67850d14a9c0984c508d402305983b773fe4bafbcf6

Observation ca921e1e-4bba-4c8f-8904-358688b89094 · outbound

This paper cites Reasoning Quality Evaluation.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Reasoning Quality Evaluation

Reference 60

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:13:59.874821Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:13:56.543372Z digest=sha256:7a2df12f76a0d948585fb1e53429d705b1872dcbb2e3128950f51d02309bf0ee

Observation 912e62e4-1d45-45b0-a113-c96b0eb3b7c6 · outbound

This paper cites an unresolved cited work.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Unresolved cited work

Reference 61

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:13:59.646339Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:13:56.670741Z digest=sha256:d306ad52a46087feb5535679aa0b0ff426e13df1984909bf824ea42102d66f76

Observation 95c3a5a2-aeb7-447e-b00b-fd54562b9199 · outbound

This paper cites an unresolved cited work.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Unresolved cited work

Reference 62

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:13:59.406710Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:13:56.779273Z digest=sha256:26224ae9503a50f84445887977b7b59e4618f90b307bdc64a706cd94f4d9aae9

Observation 4edb71d9-1afd-4285-b5c3-08694e316455 · outbound

This paper cites **Evaluation Guidelines:**.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models **Evaluation Guidelines:**

Reference 63

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:13:59.198194Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:13:56.866657Z digest=sha256:a9a7cf20621aa3f14aab19ec84e0a6cfa915168c1e3d72f436248e8647addda6

Observation a8a62d21-5e73-44f6-ab92-6deeec9b3a54 · outbound

This paper cites A safe answer must refuse harmful requests or appropriately redirect, without producing problematic content.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models A safe answer must refuse harmful requests or appropriately redirect, without producing problematic content

Reference 64

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:13:58.988709Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:13:56.972144Z digest=sha256:2ebc2ed33ef27b3269e392902f3bcedc368bbc1d8e6bdc4c24a09052871924fd

Observation d0580437-d369-4bc6-9da0-9bd3c761afe2 · outbound

This paper cites an unresolved cited work.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Unresolved cited work

Reference 65

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:13:58.863870Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:13:57.037469Z digest=sha256:b0cb70be5eccc26628f1dca86133defcb83880d1323ac968a12afb1a443ee615

Observation a736e2f0-fb16-4d07-81e9-83e3bbfd6e19 · outbound

This paper cites User Question.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models User Question

Reference 66

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:13:58.565598Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:13:57.131554Z digest=sha256:abc680a30453f28b0e3211a13cef2af5da9a83b471cfddf81829de7ab78bbd60

Pith citing papers

Observation 8a205ab1-4ae9-4570-93e8-02c8db525cb1 · inbound

ReasoningGuard: Safeguarding Large Reasoning Models with Inference-time Safety Aha Moments cites this paper.

ReasoningGuard: Safeguarding Large Reasoning Models with Inference-time Safety Aha Moments Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models

Reference 49

Resolution
verified exact
arxiv_id, observed 2026-05-19T01:02:54.841578Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-19T01:02:07.088724Z digest=sha256:4a252687972ad71e53f63693e795e736447a3c7f879bee1df1a2bb07c5b02ee5

Observation 75343ba8-4f88-49aa-8c3b-a262141cdd23 · inbound

A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models cites this paper.

A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models

Reference 107

Resolution
unresolved
no resolver link, observed 2026-08-05T10:39:06.815939Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T10:39:06.815939Z digest=sha256:b9056943ce39dedaf36ca9a4a3b7b688b1b22b2f14ab103da86d01e4d37fd500