{"as_of":"2026-08-09T14:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b05e8a4814dfddeb55b101991af38c2da414b90c702c6cdd28e361bc2450f1d6","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:13:57.131554Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T10:39:06.815939Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T01:02:54.838590Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2505.19690","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19690","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond safe answers: A benchmark for evaluating true risk awareness in large reasoning models","venue":null,"work_id":"608dc8c4-0c83-4b7b-8146-c1ecbf7c325b","year":2025},"citing_paper":{"arxiv_id":"2508.04204","last_updated":"2026-05-06T06:58:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-06T08:35:10Z","title":"ReasoningGuard: Safeguarding Large Reasoning Models with Inference-time Safety Aha Moments","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-19T01:02:07.088724Z"},"links":{"cited_paper":"/paper/2505.19690","citing_paper":"/paper/2508.04204"},"observation_digest":"sha256:ccf4a1ac84ebb5bbc14e2d3601601f303de737b851bf54455b68a6f7f2e8c51c","observation_id":"8a205ab1-4ae9-4570-93e8-02c8db525cb1","resolution":{"observed_at":"2026-05-19T01:02:54.841578Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19690","snapshot_observed_at":"2026-08-05T10:39:06.815939Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-08T03:54:26.940042Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:06.815939Z"},"links":{"cited_paper":"/paper/2505.19690","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:8903fa4bddee107d558b7ec1868659167c34e26117287c19b0e28ee3a4d94855","observation_id":"75343ba8-4f88-49aa-8c3b-a262141cdd23","resolution":{"observed_at":"2026-08-05T10:39:06.815939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19690/citation-record","integrity":"/paper/2505.19690/integrity","json":"/paper/2505.19690/citation-record.json","paper":"/paper/2505.19690"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T14:13:49.333820Z","title":"Openai o1 system card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:49.333820Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:d2529211a0b605cc7e2713b200452a2716192539a3a995803e84d9d1174057fc","observation_id":"5535be79-d61c-4798-b985-68a69e82c44a","resolution":{"observed_at":"2026-08-07T14:13:49.333820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T14:13:49.444148Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:49.444148Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:bd8c8d0c851807b1670042c749a7f0f0ee266ad4e9dc3d01203ac0c105f09b87","observation_id":"55a0d2a8-2ed7-4151-a0e4-f11d21e65da0","resolution":{"observed_at":"2026-08-07T14:13:49.444148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T14:13:49.568128Z","title":"Qwen2.5 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:49.568128Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:4718501f86d24d14fd9a29a1df5b0dc72a02ef0fcc4b4c5519b5d4c637f077ab","observation_id":"31cf1929-a18f-441d-83e2-5ceb75a7b59c","resolution":{"observed_at":"2026-08-07T14:13:49.568128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:49.688886Z","title":"Chain-of-thought prompting elicits reasoning in large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:49.688886Z"},"links":{"citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:af7a75b62b4cf1421fe3c5beb97a3bb9cbad822a12a68031418226e4d6893499","observation_id":"78c0d864-884f-4219-ae30-0e4c50eb0bc5","resolution":{"observed_at":"2026-08-07T14:13:49.688886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17704","last_updated":"2025-05-24T12:50:56Z","snapshot_observed_at":"2026-08-07T15:59:26.458348Z","submitted_at":"2025-04-24T16:11:01Z","title":"Safety in Large Reasoning Models: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17704","snapshot_observed_at":"2026-08-07T14:13:49.771889Z","title":"Safety in large reasoning models: A survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:49.771889Z"},"links":{"cited_paper":"/paper/2504.17704","citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:a751dd22286edcc664035fe74a8e7f880b6e6af1682a42f913c2b2c963560ed2","observation_id":"cd40c532-af5d-4742-ad30-1ddb0e71200c","resolution":{"observed_at":"2026-08-07T14:13:49.771889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12025","last_updated":"2025-02-17T16:57:56Z","snapshot_observed_at":"2026-08-07T18:11:43.608954Z","submitted_at":"2025-02-17T16:57:56Z","title":"SafeChain: Safety of Language Models with Long Chain-of-Thought Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12025","snapshot_observed_at":"2026-08-07T14:13:49.893258Z","title":"Safechain: Safety of language models with long chain-of-thought reasoning capabilities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:49.893258Z"},"links":{"cited_paper":"/paper/2502.12025","citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:3be7dcecc43d707ddd545080880741ced734842fdc5b73204abc28563b0d67f2","observation_id":"cb9dbb89-0ad2-42af-a47f-2198161e37b9","resolution":{"observed_at":"2026-08-07T14:13:49.893258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18841","last_updated":"2025-01-31T01:20:44Z","snapshot_observed_at":"2026-07-06T20:28:47.519113Z","submitted_at":"2025-01-31T01:20:44Z","title":"Trading Inference-Time Compute for Adversarial Robustness","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18841","snapshot_observed_at":"2026-08-07T14:13:50.014107Z","title":"Trading inference-time compute for adversarial robustness,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:50.014107Z"},"links":{"cited_paper":"/paper/2501.18841","citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:8d2d83146256abe29d32b0b47f3de70c4593446449641cb5dba648e9334ce48f","observation_id":"b4dc0665-1d70-4883-9ff1-5f83f3f7fcdf","resolution":{"observed_at":"2026-08-07T14:13:50.014107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05605","last_updated":"2025-04-08T01:36:16Z","snapshot_observed_at":"2026-08-02T05:27:21.658804Z","submitted_at":"2025-04-08T01:36:16Z","title":"ShadowCoT: Cognitive Hijacking for Stealthy Reasoning Backdoors in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05605","snapshot_observed_at":"2026-08-07T14:13:50.101785Z","title":"Shadowcot: Cognitive hijacking for stealthy reasoning backdoors in llms,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:50.101785Z"},"links":{"cited_paper":"/paper/2504.05605","citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:27ad8383692e9977c92a8ff221ab3b8526aa6cad5fbde27bdb1064b0e9c7dddc","observation_id":"be72498e-6cf4-4317-b806-236374894a5f","resolution":{"observed_at":"2026-08-07T14:13:50.101785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:50.189517Z","title":"Overthinking: Slowdown attacks on reasoning llms,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:50.189517Z"},"links":{"citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:e8546b753df466a9d113f7cabf7498d9b8ed628a9d5630363da860296c56e739","observation_id":"b86248c1-ba00-429c-bbab-e57b4b4fae77","resolution":{"observed_at":"2026-08-07T14:13:50.189517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-07T14:13:50.292007Z","title":"Alignment faking in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:50.292007Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:639aa23ea320f18604475c8968c1d115e67a443e43c667e945fdf156f55d2ea5","observation_id":"26fc7304-851a-4c7a-900c-837a097bee99","resolution":{"observed_at":"2026-08-07T14:13:50.292007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:50.391944Z","title":"Deepseek-r1 thoughtology: Let’s< think> about llm reasoning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:50.391944Z"},"links":{"citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:6e084a76bbccc9bc14537addb5d49b186a97b303964bfcbe79cb5108f1e95591","observation_id":"308be687-ef63-4519-9927-b974cc7d1509","resolution":{"observed_at":"2026-08-07T14:13:50.391944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17749","last_updated":"2025-01-29T16:36:53Z","snapshot_observed_at":"2026-08-07T22:05:54.424125Z","submitted_at":"2025-01-29T16:36:53Z","title":"Early External Safety Testing of OpenAI's o3-mini: Insights from the Pre-Deployment Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17749","snapshot_observed_at":"2026-08-07T14:13:50.508020Z","title":"Early external safety testing of openai’s o3-mini: Insights from the pre-deployment evaluation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:50.508020Z"},"links":{"cited_paper":"/paper/2501.17749","citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:f01789128557e26ed5f6e7f19b940187544019fd4c92d95b638386613c1c43aa","observation_id":"15ecdde5-f430-4616-8d8d-7541c6213c5d","resolution":{"observed_at":"2026-08-07T14:13:50.508020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11137","last_updated":"2025-05-08T01:35:18Z","snapshot_observed_at":"2026-08-07T18:14:44.558267Z","submitted_at":"2025-02-16T14:05:54Z","title":"Safety Evaluation of DeepSeek Models in Chinese Contexts","version":3},"cited_work":{"arxiv_id":"2502.11137","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11137","snapshot_observed_at":"2026-08-07T14:13:57.911000Z","title":"Safety Evaluation of DeepSeek Models in Chinese Contexts","venue":"cs.CL","work_id":"3c357fe6-75a5-474a-9877-9b077aa4a519","year":2025},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:50.590848Z"},"links":{"cited_paper":"/paper/2502.11137","citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:d7bfaf188bccf1b5314968819dc7d3f18027c470b6ae641e8f0c3d99013428b5","observation_id":"f0eb9e95-cf39-4324-9b69-27947e6cce1e","resolution":{"observed_at":"2026-08-07T14:13:57.994867Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10192","last_updated":"2025-03-13T09:27:24Z","snapshot_observed_at":"2026-08-07T17:07:39.208532Z","submitted_at":"2025-03-13T09:27:24Z","title":"Red Teaming Contemporary AI Models: Insights from Spanish and Basque Perspectives","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10192","snapshot_observed_at":"2026-08-07T14:13:50.720640Z","title":"Red teaming contemporary ai models: Insights from spanish and basque perspectives,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:50.720640Z"},"links":{"cited_paper":"/paper/2503.10192","citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:2f1103c191a74fd274d41e9202193cdafd6544deca29230c7bab1c8f2b2dd4d0","observation_id":"c74ab0e6-58f7-4c82-b0fd-0ccdce93db08","resolution":{"observed_at":"2026-08-07T14:13:50.720640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14744","last_updated":"2025-06-23T06:11:32Z","snapshot_observed_at":"2026-08-07T18:01:22.772663Z","submitted_at":"2025-02-20T17:14:34Z","title":"HiddenDetect: Detecting Jailbreak Attacks against Large Vision-Language Models via Monitoring Hidden States","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14744","snapshot_observed_at":"2026-08-07T14:13:50.813253Z","title":"Hiddendetect: Detecting jailbreak attacks against large vision-language models via monitoring hidden states,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:50.813253Z"},"links":{"cited_paper":"/paper/2502.14744","citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:f6ab8199a8cd50289c2d8460ff651b985646d53923c80c3cd16bda05752985d0","observation_id":"01b9a4ff-b677-440c-aa06-5bcd0b721490","resolution":{"observed_at":"2026-08-07T14:13:50.813253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:50.907629Z","title":"Star-1: Safer alignment of reasoning llms with 1k data,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:50.907629Z"},"links":{"citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:1fcffe7f0f184720f4ccb484acdfc3b04935bf3fbc62b298b5b15554b921c77b","observation_id":"1bfad11f-c468-461a-b52f-0a1b8827af05","resolution":{"observed_at":"2026-08-07T14:13:50.907629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10081","last_updated":"2025-04-14T10:26:37Z","snapshot_observed_at":"2026-08-07T16:05:57.274080Z","submitted_at":"2025-04-14T10:26:37Z","title":"RealSafe-R1: Safety-Aligned DeepSeek-R1 without Compromising Reasoning Capability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10081","snapshot_observed_at":"2026-08-07T14:13:50.995870Z","title":"Realsafe-r1: Safety-aligned deepseek-r1 without compromising reasoning capability,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:50.995870Z"},"links":{"cited_paper":"/paper/2504.10081","citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:2f4c3251c15880f9389e73cf37e8ac94805b38b5bc55158a33c085eecbc03de5","observation_id":"ab77b23f-1485-4986-a3f9-675a575d0896","resolution":{"observed_at":"2026-08-07T14:13:50.995870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T14:13:51.098100Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:51.098100Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:99d6f5b39e5722855a04407056e2ead9474388fed8dca25820b583a5fc1e00ea","observation_id":"1e882a4c-391c-45d6-94c6-375df79ea19c","resolution":{"observed_at":"2026-08-07T14:13:51.098100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11555","last_updated":"2025-02-17T08:40:30Z","snapshot_observed_at":"2026-08-07T18:13:19.634959Z","submitted_at":"2025-02-17T08:40:30Z","title":"Equilibrate RLHF: Towards Balancing Helpfulness-Safety Trade-off in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11555","snapshot_observed_at":"2026-08-07T14:13:51.212632Z","title":"Equilibrate rlhf: Towards balancing helpfulness-safety trade-off in large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:51.212632Z"},"links":{"cited_paper":"/paper/2502.11555","citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:6f32060786f41d01e9e3f4892dc8edb1791f30c35a45c966a6aeb1077f18b110","observation_id":"62328b63-bc7c-4b15-8e87-7bf261f73bfa","resolution":{"observed_at":"2026-08-07T14:13:51.212632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:51.306406Z","title":"Guardrea- soner: Towards reasoning-based llm safeguards,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:51.306406Z"},"links":{"citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:8a3e1b914ae78cfd5852b9efb9cab4deb30ba789cea625e60f6f5c032e0ff112","observation_id":"dddadb82-3c27-4d83-b6a4-a508bcd7b558","resolution":{"observed_at":"2026-08-07T14:13:51.306406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13458","last_updated":"2025-05-27T22:35:37Z","snapshot_observed_at":"2026-08-08T01:24:47.078251Z","submitted_at":"2025-02-19T06:09:58Z","title":"ThinkGuard: Deliberative Slow Thinking Leads to Cautious Guardrails","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13458","snapshot_observed_at":"2026-08-07T14:13:51.424723Z","title":"Thinkguard: Deliberative slow thinking leads to cautious guardrails,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:51.424723Z"},"links":{"cited_paper":"/paper/2502.13458","citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:eb47cb83c04a79adb4217ec68a02bf9d4d2c2b521e3e4d0f3df587fd1ea3744f","observation_id":"6562588d-e7fb-4669-88ad-927cea5e4a1c","resolution":{"observed_at":"2026-08-07T14:13:51.424723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18826","last_updated":"2024-12-25T08:31:53Z","snapshot_observed_at":"2026-07-06T20:13:03.722546Z","submitted_at":"2024-12-25T08:31:53Z","title":"RapGuard: Safeguarding Multimodal Large Language Models via Rationale-aware Defensive Prompting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18826","snapshot_observed_at":"2026-08-07T14:13:51.539892Z","title":"Rapguard: Safeguarding multimodal large language models via rationale- aware defensive prompting,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:51.539892Z"},"links":{"cited_paper":"/paper/2412.18826","citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:33b9b6c3808e1d021215efae107c89749c1de01b87fa912340ffa2861e09d0ac","observation_id":"7277bf91-625e-450a-a6b9-dc573a7ecbe7","resolution":{"observed_at":"2026-08-07T14:13:51.539892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05566","last_updated":"2024-01-17T20:26:01Z","snapshot_observed_at":"2026-07-06T17:14:03.152949Z","submitted_at":"2024-01-10T22:14:35Z","title":"Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05566","snapshot_observed_at":"2026-08-07T14:13:51.647994Z","title":"Sleeper agents: Training deceptive llms that persist through safety training,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:51.647994Z"},"links":{"cited_paper":"/paper/2401.05566","citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:0ae39d37b59eda90aa431c832f37e1092d7d16a67cf4dc841c3a0111e62ae8df","observation_id":"7037e839-8af1-4b57-a9e0-591660cdd27b","resolution":{"observed_at":"2026-08-07T14:13:51.647994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:03.833579Z","title":"Ai deception: A survey of examples, risks, and potential solutions,","venue":null,"work_id":"48aca4cc-f670-4ba0-a38a-d06d4d55419a","year":2024},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:51.733525Z"},"links":{"citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:cbed2e8ea6628f9bad66e5cba316eb04c936b52da7e75bfee92e1344d16fde66","observation_id":"4e6727da-bd81-48d1-af2f-45f0316204dd","resolution":{"observed_at":"2026-08-07T14:14:03.895924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:03.678997Z","title":"Ai sandbagging: Language models can selectively underperform on evaluations,","venue":null,"work_id":"37a5e06b-4591-4e37-b554-a9c0ec725e2c","year":2024},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:51.843560Z"},"links":{"citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:f3ce455e67721f4beebff38ba778845b1a3429f42d0c3ee80c3d898724134af2","observation_id":"99598a03-01f7-4abe-8173-f38f7f05f47e","resolution":{"observed_at":"2026-08-07T14:14:03.733841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10965","last_updated":"2025-03-28T01:48:40Z","snapshot_observed_at":"2026-08-08T08:53:29.457485Z","submitted_at":"2025-03-14T00:21:15Z","title":"Auditing language models for hidden objectives","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10965","snapshot_observed_at":"2026-08-07T14:13:51.942324Z","title":"Auditing language models for hidden objectives,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:51.942324Z"},"links":{"cited_paper":"/paper/2503.10965","citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:0dc783881c79f14623d68fb3b7f47afdcca8c4a05d5754fe277cb8b27508d610","observation_id":"aa202458-0103-447c-b666-20ea3ed08adb","resolution":{"observed_at":"2026-08-07T14:13:51.942324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:03.496714Z","title":"Large language models can strategically deceive their users when put under pressure,","venue":null,"work_id":"2404f606-ab14-4a69-9d03-f92b0cd489f6","year":2024},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:52.044693Z"},"links":{"citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:5c800a97f654e176846ad3167f02492bb72a6ad69264a24300fcfa33ad0f1983","observation_id":"e2fcd080-e72a-4399-9561-abacfd1c8625","resolution":{"observed_at":"2026-08-07T14:14:03.569055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:03.353408Z","title":"Towards understanding sycophancy in language models,","venue":null,"work_id":"103cf768-efad-48e3-9bef-1243b628e4ad","year":2024},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:52.156517Z"},"links":{"citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:12aae2efb43c2aef0ec77e08f29a36c6faa38f237e94f3dd171377cce90d7460","observation_id":"4d3872db-06e7-49e6-8c42-ac29188ba1f1","resolution":{"observed_at":"2026-08-07T14:14:03.408967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05915","last_updated":"2024-04-01T03:32:14Z","snapshot_observed_at":"2026-07-06T16:45:36.159896Z","submitted_at":"2023-11-10T08:01:23Z","title":"Fake Alignment: Are LLMs Really Aligned Well?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05915","snapshot_observed_at":"2026-08-07T14:13:52.256199Z","title":"Fake alignment: Are llms really aligned well?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:52.256199Z"},"links":{"cited_paper":"/paper/2311.05915","citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:092daeb670d8d81428b05440a0307227ec2618ee1f905307b94b8af8be29c8d5","observation_id":"e31f9482-b5a0-44ba-ab4e-7991955b234c","resolution":{"observed_at":"2026-08-07T14:13:52.256199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:52.338828Z","title":"Beavertails: Towards improved safety alignment of llm via a human-preference dataset,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:52.338828Z"},"links":{"citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:4051a67279528f87a33c17d0c3fb3d7eccdd78769f9a11f3303457d1d13c9987","observation_id":"df34b300-69f0-4081-a93f-1d8bac326022","resolution":{"observed_at":"2026-08-07T14:13:52.338828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15513","last_updated":"2025-06-14T16:04:31Z","snapshot_observed_at":"2026-08-03T06:34:42.243765Z","submitted_at":"2024-06-20T18:37:36Z","title":"PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15513","snapshot_observed_at":"2026-08-07T14:13:52.457692Z","title":"Pku-saferlhf: Towards multi-level safety alignment for llms with human preference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:52.457692Z"},"links":{"cited_paper":"/paper/2406.15513","citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:dd64997ca36aa8435d166cc57e0a85e3e21024b7a0ec9dbce44238bdd24c85ee","observation_id":"62fb4ef6-d5c8-4425-9bab-d36d4cfe9f14","resolution":{"observed_at":"2026-08-07T14:13:52.457692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20947","last_updated":"2025-06-15T21:44:25Z","snapshot_observed_at":"2026-07-06T18:23:23.565502Z","submitted_at":"2024-05-31T15:44:33Z","title":"OR-Bench: An Over-Refusal Benchmark for Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20947","snapshot_observed_at":"2026-08-07T14:13:52.566860Z","title":"Or-bench: An over-refusal benchmark for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:52.566860Z"},"links":{"cited_paper":"/paper/2405.20947","citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:785e937c63bc28b0366ae02c8a114475d09a700865f89c9eb71d3e8292675402","observation_id":"3ada40e2-6b9b-427a-82a7-f2956c25f27c","resolution":{"observed_at":"2026-08-07T14:13:52.566860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T14:13:52.672411Z","title":"Kimi k1. 5: Scaling reinforcement learning with llms,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:52.672411Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:56e5d867e7ab0efed9b37df3b1c2410514ced33ce69efc9101a36e340ba7a3b8","observation_id":"6467970d-c79f-4984-ac17-5e3ba0ceb46f","resolution":{"observed_at":"2026-08-07T14:13:52.672411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12893","last_updated":"2025-02-27T01:32:58Z","snapshot_observed_at":"2026-08-07T18:08:32.968901Z","submitted_at":"2025-02-18T14:29:12Z","title":"H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12893","snapshot_observed_at":"2026-08-07T14:13:52.872208Z","title":"H-cot: Hijacking the chain-of-thought safety reasoning mechanism to jailbreak large reasoning models, including openai o1/o3, deepseek-r1, and gemini 2.0 flash thinking,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:52.872208Z"},"links":{"cited_paper":"/paper/2502.12893","citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:6b7607db1d93f26953f06d6a18d2e263f398e47095a6aee4a350fdf9c33f9465","observation_id":"18640e6f-a309-42af-930a-89d013c6b357","resolution":{"observed_at":"2026-08-07T14:13:52.872208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11926","last_updated":"2025-03-14T23:50:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-14T23:50:34Z","title":"Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11926","snapshot_observed_at":"2026-08-07T14:13:53.012947Z","title":"Monitoring reasoning models for misbehavior and the risks of promoting obfuscation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:53.012947Z"},"links":{"cited_paper":"/paper/2503.11926","citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:3102fb9f1ad911732d93fbc3943d65299648035d9060e8761d67d2118375ce4a","observation_id":"f8819dd7-2025-42da-b065-8d2e3f16f4b6","resolution":{"observed_at":"2026-08-07T14:13:53.012947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00555","last_updated":"2025-06-05T03:20:54Z","snapshot_observed_at":"2026-08-07T17:37:05.037079Z","submitted_at":"2025-03-01T16:42:01Z","title":"Safety Tax: Safety Alignment Makes Your Large Reasoning Models Less Reasonable","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.00555","snapshot_observed_at":"2026-08-07T14:13:53.204922Z","title":"Safety tax: Safety alignment makes your large reasoning models less reasonable,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:53.204922Z"},"links":{"cited_paper":"/paper/2503.00555","citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:043ed8526ce5956719e217474547977db46677482aade01e8cf1dff85baa009d","observation_id":"8d3e351c-1344-4fec-9943-9b21c1f90314","resolution":{"observed_at":"2026-08-07T14:13:53.204922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-02T10:23:50.881300Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-07T14:13:53.369850Z","title":"A survey on llm-as-a-judge,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:53.369850Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:baf05bed328f99941abb61983f2969e9b6c8cc9c2ff0945c1f8ac126b8a9b7e8","observation_id":"aee950f9-1eaa-4ed8-a472-454f7a619694","resolution":{"observed_at":"2026-08-07T14:13:53.369850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05579","last_updated":"2024-12-10T05:49:12Z","snapshot_observed_at":"2026-07-31T01:42:39.468673Z","submitted_at":"2024-12-07T08:07:24Z","title":"LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05579","snapshot_observed_at":"2026-08-07T14:13:53.561043Z","title":"Llms-as-judges: A comprehensive survey on llm-based evaluation methods,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:53.561043Z"},"links":{"cited_paper":"/paper/2412.05579","citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:3b89d383e13731c11eb3faabcbd7602766e1935193278ade7aa0a4747e16e5dc","observation_id":"9c76d516-b3af-4509-b14f-fa57bb51077b","resolution":{"observed_at":"2026-08-07T14:13:53.561043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-07T14:13:53.757909Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:53.757909Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:f4be56f30596d29e8d3b5065da5ba9dcae61a40031cfce467e410e7dc2aba553","observation_id":"15a050fd-41e9-4aea-9f21-c21a4429791f","resolution":{"observed_at":"2026-08-07T14:13:53.757909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:03.172993Z","title":"Llm-as-a-judge: a complete guide to using llms for evaluations,","venue":null,"work_id":"5a133db3-a607-4508-b1b5-18dd47446a41","year":2025},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:53.849787Z"},"links":{"citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:505143b3fbd8ccbaf729df6e1c4891d23cd103efb1ce77e3f68b67647d5d435e","observation_id":"c3f4d0ad-0bba-4d54-aff5-0d993aa0f1d8","resolution":{"observed_at":"2026-08-07T14:14:03.259431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:03.021374Z","title":"Llm-as-a-judge simply explained: A complete guide to run llm evals at scale,","venue":null,"work_id":"8d31881a-0b0b-4104-9de5-9c9b318c82ad","year":2025},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:53.976647Z"},"links":{"citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:c58213c2950214c41ac4ae6661136bc2631453a3f9e941e040bac7f68263af26","observation_id":"8bdc18ab-355a-493e-b4ee-b2f0734a296f","resolution":{"observed_at":"2026-08-07T14:14:03.079495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-07T14:13:54.133916Z","title":"Deliberative alignment: Reasoning enables safer language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:54.133916Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:bbe148e60e8c7814fa204c634eea04f606869a76281a22eb2353426ad372df72","observation_id":"7c674e3d-7334-4773-91d8-1318731fe9a6","resolution":{"observed_at":"2026-08-07T14:13:54.133916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-07T14:13:54.323505Z","title":"Constitutional ai: Harmlessness from ai feedback, 2022,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:54.323505Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:fb794cd9d8db6107b1256a07452c56ade0f99b6125012eabe4c2fc3be459ca02","observation_id":"104f63dc-17ea-41e7-bf3c-5c73d04616ad","resolution":{"observed_at":"2026-08-07T14:13:54.323505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:02.867510Z","title":null,"venue":null,"work_id":"879af0a4-6c55-4ce2-8710-d582c0e4f8b7","year":null},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:54.480196Z"},"links":{"citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:972da55ce9f1dcb1fa434ec5f9d1c996d5577c5f4d61abea409ebbd766621a85","observation_id":"843de4f0-38dc-4827-a444-dc5a8d97eef3","resolution":{"observed_at":"2026-08-07T14:14:02.925816Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:02.676053Z","title":null,"venue":null,"work_id":"6997f603-944f-4d08-9571-28f05379c7ce","year":null},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:54.667429Z"},"links":{"citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:6a7e622f380ae27d4d01ad4db99a98bb5fd6d77597f7cdac38be1f150466703d","observation_id":"f01efde8-bfac-4c25-98bc-007713015ac8","resolution":{"observed_at":"2026-08-07T14:14:02.747764Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:02.596630Z","title":"# Evaluation Guidelines","venue":null,"work_id":"9a27054c-f70e-4ec8-9228-b5b1997ae057","year":null},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:54.885944Z"},"links":{"citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:cf78b17ffa657f59432635f3637552160ed923e643cb5b712f1a87adedb42f65","observation_id":"bace8e75-82cb-4877-ab60-247932cfbb00","resolution":{"observed_at":"2026-08-07T14:14:02.627227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:02.382554Z","title":null,"venue":null,"work_id":"9709d911-149e-4609-b52e-e3843bce4614","year":null},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:55.031756Z"},"links":{"citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:5043394449dc0069454441a57a39939123a783ac786629c700b732ba8c81becf","observation_id":"82dce026-34f9-413c-854f-9b8f3312384d","resolution":{"observed_at":"2026-08-07T14:14:02.458444Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:02.222674Z","title":null,"venue":null,"work_id":"0949a189-3a11-4acf-bf12-d215ba98c253","year":null},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:55.254663Z"},"links":{"citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:01fc1fbdd53dc55c442358a4967fe663ca2111ed236f8d8663d8e07572209a67","observation_id":"826cb8a3-daa5-47cd-9c16-de6d5a72668f","resolution":{"observed_at":"2026-08-07T14:14:02.286632Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:02.073250Z","title":"Reasoning Quality Evaluation","venue":null,"work_id":"a63b486a-2cb1-4966-8067-390a54753a42","year":null},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:55.338077Z"},"links":{"citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:d74ae05066236faddb415017132e0750372a9126f2d6c2b718a20f4bcbfb7a3d","observation_id":"40bf18e0-938d-42ef-b79c-356adec2d824","resolution":{"observed_at":"2026-08-07T14:14:02.130403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:01.907376Z","title":"(Usually includes two main risks, e.g., risks of insulting others and privacy violations.) 15","venue":null,"work_id":"a3aa11fc-4e79-43bc-b95e-fd7681d9c6df","year":null},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:55.449364Z"},"links":{"citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:e4f97e0b48ab65e8027f6f5cbabbe942e71dfe120a95267053b07d9e43d2d692","observation_id":"355bdf47-f487-4948-b442-9f13ef2f751f","resolution":{"observed_at":"2026-08-07T14:14:01.950266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:01.786571Z","title":null,"venue":null,"work_id":"4f5c032a-4764-4987-a569-2132674036cf","year":null},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:55.621282Z"},"links":{"citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:7bb9e8374675bbf3f2615942cdcf59c10fe17517c0a46ec0bb211352bd88713e","observation_id":"d8d671c0-3f5f-43cf-81a9-734cef4c3b9a","resolution":{"observed_at":"2026-08-07T14:14:01.850665Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:01.582490Z","title":"# Evaluation Guidelines","venue":null,"work_id":"c9cbd080-da30-405a-89b9-0bde276c1c30","year":null},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:55.715943Z"},"links":{"citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:a14244d00afd4f52211a1b0bb639bd983052543f3efffe3b3d9d74e7bfbdbcc4","observation_id":"359b3b1e-7b58-4d6b-84d1-13683bc3dba9","resolution":{"observed_at":"2026-08-07T14:14:01.685722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:01.368413Z","title":null,"venue":null,"work_id":"2fc7574a-b512-408a-8e7f-e5f01f3e1d17","year":null},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:55.828696Z"},"links":{"citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:5c2fc30cfdb06d9c9573e600bfa67b351e85ca58ca5a5f62794b3fa4ae09f6d2","observation_id":"f0a35677-0886-410d-afd9-d11300c7ecf2","resolution":{"observed_at":"2026-08-07T14:14:01.463138Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:01.122596Z","title":"Reasoning Quality Evaluation","venue":null,"work_id":"0c4d2816-e75e-48e8-9026-03620e71858b","year":null},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:55.929030Z"},"links":{"citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:f20e81f219a74f0359d5687608682bd8f07f37a38371a2a1f4bed77bf07af5d3","observation_id":"3650a463-b1a9-4a70-a63e-72322a235a65","resolution":{"observed_at":"2026-08-07T14:14:01.207257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:00.916190Z","title":null,"venue":null,"work_id":"21ab5b8f-f125-41af-a29b-f33ca33efead","year":null},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:56.031612Z"},"links":{"citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:bf2e7f80a4828039c2fcde05de5f71f7a35bd0c436a66ee12d922a3ba399f7b7","observation_id":"54e0834a-3ca0-4756-8235-c2098859ea3d","resolution":{"observed_at":"2026-08-07T14:14:01.017613Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:00.676262Z","title":null,"venue":null,"work_id":"2433fc29-6e50-420f-b37f-bda9f5e3da95","year":null},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:56.106352Z"},"links":{"citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:126acc5954dd910e5d08201b99036da7eefaf34426194435dba7258366a7aa9f","observation_id":"9d172e54-b009-4572-ad51-d267a2cf3e9c","resolution":{"observed_at":"2026-08-07T14:14:00.804263Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:00.457722Z","title":"# Evaluation Guidelines","venue":null,"work_id":"6d0dc9e5-bfd7-4dd5-a80b-adcb4996c469","year":null},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:56.212901Z"},"links":{"citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:1a1a61f590daa39616667ae5787a1f8670be71a47e7607381b597672925b14a9","observation_id":"7898a7dc-63ce-4948-9441-5617486baea4","resolution":{"observed_at":"2026-08-07T14:14:00.542408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:00.257286Z","title":null,"venue":null,"work_id":"dc50cf2b-9bf4-4f19-b1e6-d7716dbe6aa8","year":null},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:56.326896Z"},"links":{"citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:84a963fc6c17442b588ffed2f4f34ebc42e04c8c28a380ca0c773bc2eb28bde8","observation_id":"ce03aac8-dfdc-405b-b9b9-3bae91286b2c","resolution":{"observed_at":"2026-08-07T14:14:00.349370Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:00.044022Z","title":null,"venue":null,"work_id":"fbe51a3e-1a86-4f63-94e6-5873e721b140","year":null},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:56.427560Z"},"links":{"citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:8252251fcfc92f9a158279bcaede8db27ebeefd695d64a70242b690bbb422fee","observation_id":"03040abd-0260-44df-ba73-0cc4c5581b7c","resolution":{"observed_at":"2026-08-07T14:14:00.146106Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:59.788164Z","title":"Reasoning Quality Evaluation","venue":null,"work_id":"1cd4ea18-5779-46e5-ae96-78681d03269a","year":null},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:56.543372Z"},"links":{"citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:a7a8f5bc03756c7a4ea189423d80848de0e0acc6778034ef8e3bec95804e9d3d","observation_id":"ca921e1e-4bba-4c8f-8904-358688b89094","resolution":{"observed_at":"2026-08-07T14:13:59.874821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:59.534946Z","title":null,"venue":null,"work_id":"686351f2-1986-4269-b54e-0eadcea94cf6","year":null},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:56.670741Z"},"links":{"citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:f90bed67b78e7a4f40cfa8e0fd7a78442d81e100fc62e49c0ed2519e3e878a08","observation_id":"912e62e4-1d45-45b0-a113-c96b0eb3b7c6","resolution":{"observed_at":"2026-08-07T14:13:59.646339Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:59.292207Z","title":null,"venue":null,"work_id":"946dc7b4-1644-4761-b3ae-ebefae4673db","year":null},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:56.779273Z"},"links":{"citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:7a97b1ec16b941b54aff34a124b7fa7ecb83a9de94588e0b16de89822bf83194","observation_id":"95c3a5a2-aeb7-447e-b00b-fd54562b9199","resolution":{"observed_at":"2026-08-07T14:13:59.406710Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:59.101069Z","title":"**Evaluation Guidelines:**","venue":null,"work_id":"f61f11b6-c07d-48bd-953f-f78e7af93f91","year":null},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:56.866657Z"},"links":{"citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:69f5da0bba5bc5ba81b1d8fc8dd3a0227a483181da8d6b5e6790dbead72e9cf2","observation_id":"4edb71d9-1afd-4285-b5c3-08694e316455","resolution":{"observed_at":"2026-08-07T14:13:59.198194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:58.926512Z","title":"A safe answer must refuse harmful requests or appropriately redirect, without producing problematic content","venue":null,"work_id":"745cb07a-0850-44f5-98d4-761b4e50e49d","year":null},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:56.972144Z"},"links":{"citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:2b862936e9984be3dffdeb5ac562df0747ec80ede0453f60ac6085b8815bd2ae","observation_id":"a8a62d21-5e73-44f6-ab92-6deeec9b3a54","resolution":{"observed_at":"2026-08-07T14:13:58.988709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:58.729559Z","title":null,"venue":null,"work_id":"934bb1ce-de87-475d-b91d-0e48e9a1e671","year":null},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:57.037469Z"},"links":{"citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:5f74d5d18c37e66ef8d05757ed08ec7479c89354080de873190b3958ee871821","observation_id":"d0580437-d369-4bc6-9da0-9bd3c761afe2","resolution":{"observed_at":"2026-08-07T14:13:58.863870Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:58.476902Z","title":"User Question","venue":null,"work_id":"ea6cb2b3-bf3a-4b19-8b67-7e1ab8a42c72","year":null},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:57.131554Z"},"links":{"citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:c90722b2ab413be8f44538a6a0bd4746acea1f32e6927c2e367513b15811eed1","observation_id":"a736e2f0-fb16-4d07-81e9-83e3bbfd6e19","resolution":{"observed_at":"2026-08-07T14:13:58.565598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":49,"verified_exact":1,"verified_fuzzy":16},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 2 inbound Pith citation observations for arXiv:2505.19690."}