Pith. sign in

Paper Citation Record · LEDGER

Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework

As of 7 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 1 inbound Pith citation observation for arXiv:2507.12872.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2507.12872 v1

Coverage vector

measured 37 of 37 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T16:39:38.745141Z

measured 38 of 38 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-07-01T05:40:54.002702Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-01T10:15:44.642321Z

Reference resolution

37 of 37 outbound references displayed

  • verified exact1
  • verified fuzzy2
  • unresolved32
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch1

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 3c8a5245-5b7a-4bec-a5f1-ef815bdc27a2 · outbound

This paper cites Towards evaluations-based safety cases for AI scheming.

Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework Towards evaluations-based safety cases for AI scheming

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-06T16:39:33.388263Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:39:33.388263Z digest=sha256:94ef38ba17d400604380e23e4baadee158c176837de62e06e59fb48e9b3ce637

Observation 3dd1535e-65ea-4ea5-b03b-12a6419c341d · outbound

This paper cites Sabotage Evaluations for Frontier Models.

Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework Sabotage Evaluations for Frontier Models

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-06T16:39:33.510287Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:39:33.510287Z digest=sha256:11973879c34de0e88432944129d7162264df2194ae21efa92a372e962d31ad41

Observation 5daba2b2-56c1-428a-9a14-c27588fa87d8 · outbound

This paper cites RepliBench: Evaluating the Autonomous Replication Capabilities of Language Model Agents.

Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework RepliBench: Evaluating the Autonomous Replication Capabilities of Language Model Agents

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-06T16:39:33.918076Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:39:33.918076Z digest=sha256:9a2a4d8bfe2043489961769a7c416dead941b40ef3d571c07c1ddd439b89d345

Observation a4c7f23e-f1b2-4122-a1ef-f42783b790ab · outbound

This paper cites Safety cases for frontier AI.

Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework Safety cases for frontier AI

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-06T16:39:34.221645Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:39:34.221645Z digest=sha256:261ca6aca4bc5417fb5faae0057b497f5f5a048e1501e10714108c1f22a59de5

Observation 4fd43903-ab84-4a90-8136-6b47cfd3699f · outbound

This paper cites Discovering Latent Knowledge in Language Models Without Supervision.

Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework Discovering Latent Knowledge in Language Models Without Supervision

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-06T16:39:34.368752Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:39:34.368752Z digest=sha256:c395e91e2a8f1d2701eadb5a8f77c62ba13927e7466b5ed3a6427499627f7261

Observation eb126926-4866-4039-ba8a-20e9b42e8c9c · outbound

This paper cites doi: 10.1126/science.

Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework doi: 10.1126/science

Reference 10

Resolution
malformed identifier
no resolver link, observed 2026-08-06T16:39:34.536021Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:39:34.536021Z digest=sha256:0688846ac6e4d1e2da83da7cfd35a3a2f43b969b26a760031bf5bbacc24fc599

Observation 2f5945e5-cfdb-47ac-96b1-87d871d8d1b3 · outbound

This paper cites Safety case template for frontier AI: A cyber inability argument.

Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework Safety case template for frontier AI: A cyber inability argument

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-06T16:39:34.797703Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:39:34.797703Z digest=sha256:606e146e63150c227d02169e30d9ae633cfb5975d199994c80094e00c9cb69b3

Observation 092ed59a-3920-4f54-a142-9417237a6709 · outbound

This paper cites Alignment faking in large language models.

Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework Alignment faking in large language models

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-06T16:39:34.936205Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:39:34.936205Z digest=sha256:b2097d2e5ff0eca2fa08379efef64a488c3de0e8ecca124fc95fc3cb74119612

Observation d8251340-9940-4529-9b26-d5f2fa42defb · outbound

This paper cites Evaluating Large Language Models' Capability to Launch Fully Automated Spear Phishing Campaigns: Validated on Human Subjects.

Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework Evaluating Large Language Models' Capability to Launch Fully Automated Spear Phishing Campaigns: Validated on Human Subjects

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-06T16:39:35.146041Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:39:35.146041Z digest=sha256:09f04ed14d284aa1bd16ed7de49ceec210f4a951aab3c208c5d0788230d22674

Observation f4514e2c-d7c9-4557-878f-44d85e69c1a3 · outbound

This paper cites An Overview of Catastrophic AI Risks.

Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework An Overview of Catastrophic AI Risks

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-06T16:39:35.301994Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:39:35.301994Z digest=sha256:83b9a7ddb0aac3c45d2759dc8072afb660103d78fdb5e2d4084dc5fd04ed91fd

Observation 40ebb534-918c-4ad6-a927-557843c99c51 · outbound

This paper cites Facade: High-Precision Insider Threat Detection Using Deep Contextual Anomaly Detection.

Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework Facade: High-Precision Insider Threat Detection Using Deep Contextual Anomaly Detection

Reference 17

Resolution
metadata mismatch
local_arxiv, observed 2026-08-06T16:39:39.585842Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T16:39:35.608070Z digest=sha256:4e78d1db11abbdffbd78dfda9e0e57fc4e6f364ac2817ac2b5a7e5d1f46c4716

Observation 35a9ba68-1cf3-48a7-a135-5e6f71fe3865 · outbound

This paper cites A sketch of an AI control safety case.

Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework A sketch of an AI control safety case

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-06T16:39:35.743325Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:39:35.743325Z digest=sha256:6c04296dccea65ea8bac029a2a04893195f22da36fce057b7c1ab63bb6ecadd8

Observation ca512bf0-6067-4e17-8342-e8b8d5e4dcdc · outbound

This paper cites Measuring AI Ability to Complete Long Software Tasks.

Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework Measuring AI Ability to Complete Long Software Tasks

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-06T16:39:35.884820Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:39:35.884820Z digest=sha256:6d7d4420904848d0a46f595ef8ce6627fac364f648e2b17b53fb24d4fe06863a

Observation 82d8d8d1-f84e-4a27-b3c1-ece7c72ba992 · outbound

This paper cites Subversion Strategy Eval: Can language models statelessly strategize to subvert control protocols?.

Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework Subversion Strategy Eval: Can language models statelessly strategize to subvert control protocols?

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-06T16:39:36.071018Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:39:36.071018Z digest=sha256:7d6df66e53ab344abf2e55cca49bbb73f202ee2919e3dc0d6ce1d1a6eb951d9a

Observation f295ef85-315e-4427-ad9d-383551dc10ce · outbound

This paper cites arXiv:2410.03768.

Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework arXiv:2410.03768

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-06T16:39:36.234981Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:39:36.234981Z digest=sha256:67de3d519375323abe32e1507f2fd09d280d0e6cfbd005f12ed024116f9f8da3

Observation ab9e34a3-8724-443e-82f5-200cdb825ffd · outbound

This paper cites DeepStack: Expert-Level Artificial Intelligence in No-Limit Poker.

Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework DeepStack: Expert-Level Artificial Intelligence in No-Limit Poker

Reference 22

Resolution
verified exact
local_arxiv, observed 2026-08-06T16:39:39.324600Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T16:39:36.399493Z digest=sha256:d48d511adfdc0df0065207f50e909e256c6ad3abcbaeead24cc77e68b8fdd38d

Observation 4a7314a0-47fe-4c6f-85f8-3eaf24427fd8 · outbound

This paper cites AgentMisalignment: Measuring the Propensity for Misaligned Behaviour in LLM-Based Agents.

Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework AgentMisalignment: Measuring the Propensity for Misaligned Behaviour in LLM-Based Agents

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-06T16:39:36.526571Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:39:36.526571Z digest=sha256:5387259c7e302b255d9f7aea1e0b26010e726e9bd985b57a4a8b1dad1447916c

Observation d196b84c-0b27-4bf2-a575-2e893d947be3 · outbound

This paper cites Large Language Models Often Know When They Are Being Evaluated.

Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework Large Language Models Often Know When They Are Being Evaluated

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-06T16:39:36.667793Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:39:36.667793Z digest=sha256:f4bf2d2d8808904135add5ba73b062381ef80c7b2445a195968d5549d9a0f7d1

Observation 7579f224-aec7-4c7a-b527-bf7b68bc9725 · outbound

This paper cites The Alignment Problem from a Deep Learning Perspective.

Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework The Alignment Problem from a Deep Learning Perspective

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-06T16:39:36.793291Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:39:36.793291Z digest=sha256:891af8c1c84d6c869cdee6cfae5756b0ca2e18357a81b151f8521dc781327040

Observation 4e3323b6-488b-486c-a837-1b926db7d428 · outbound

This paper cites Linear Probe Penalties Reduce LLM Sycophancy.

Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework Linear Probe Penalties Reduce LLM Sycophancy

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-06T16:39:36.959394Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:39:36.959394Z digest=sha256:0d2158d35fa07da116ccc4b3ab6ad89c774109d24c9fd63102766fff4cdfc2e8

Observation e107757b-5e07-42fd-a604-df71d28c0cf0 · outbound

This paper cites Evaluating Frontier Models for Dangerous Capabilities.

Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework Evaluating Frontier Models for Dangerous Capabilities

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-06T16:39:37.129859Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:39:37.129859Z digest=sha256:19e6a9822b4d6b691cb5fa7fea56ab5232f79167215d930f969853aba5dbc6a0

Observation 6f9fe1ac-4046-4eec-97e9-b50e3d3713ca · outbound

This paper cites On the Conversational Persuasiveness of Large Language Models: A Randomized Controlled Trial.

Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework On the Conversational Persuasiveness of Large Language Models: A Randomized Controlled Trial

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-06T16:39:37.344120Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:39:37.344120Z digest=sha256:34011185ad963a86dc3fb0260e8c9cc66c56a88af9b71463f93e7da080029dcd

Observation cbe3c3ce-fde7-47b6-9ef2-b51c5f46b7d1 · outbound

This paper cites Large Language Models can Strategically Deceive their Users when Put Under Pressure.

Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework Large Language Models can Strategically Deceive their Users when Put Under Pressure

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-06T16:39:37.499516Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:39:37.499516Z digest=sha256:d7d232fe37a6bbe1af5f1b21367df02eed211eca4540e3b62dc21910de75f37b

Observation 254ec2be-34e0-49e3-abd5-1b93ff8b788c · outbound

This paper cites Melanie Sclar, Jane Yu, Maryam Fazel-Zarandi, Yulia Tsvetkov, Yonatan Bisk, Yejin Choi, and Asli Celikyilmaz.

Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework Melanie Sclar, Jane Yu, Maryam Fazel-Zarandi, Yulia Tsvetkov, Yonatan Bisk, Yejin Choi, and Asli Celikyilmaz

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-06T16:39:37.594525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:39:37.594525Z digest=sha256:263d8bd4444a3738e2fb594c12fe2d6ee1d888911e6e84b0636a60ae0eba8cc8

Observation 8217a998-f671-41cf-85db-56b1dbc779ac · outbound

This paper cites Explore Theory of Mind: Program-guided adversarial data generation for theory of mind reasoning.

Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework Explore Theory of Mind: Program-guided adversarial data generation for theory of mind reasoning

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-06T16:39:37.772633Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:39:37.772633Z digest=sha256:480e5296fa20e8dadfad1067c1f32f2a79eaba94c6bff0b3fe2632d61986a48d

Observation 06a423fb-b5be-4a4d-91f9-b1f054111d87 · outbound

This paper cites Cameron Tice, Philipp Alexander Kreer, Nathan Helm-Burger, Prithviraj Singh Shahani, Fedor Ryzhenkov, Jacob Haimes, Felix Hofstätter, and Teun van der Weij.

Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework Cameron Tice, Philipp Alexander Kreer, Nathan Helm-Burger, Prithviraj Singh Shahani, Fedor Ryzhenkov, Jacob Haimes, Felix Hofstätter, and Teun van der Weij

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-06T16:39:37.919794Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:39:37.919794Z digest=sha256:7939b0d610ed7d87ac7f5ed82ed3b1f0484d21a1086fdf19a84e8f08045eadcc

Observation f6142e7d-acb8-4907-bdbb-ae1fba6c8cdd · outbound

This paper cites Oriol Vinyals, Igor Babuschkin, Wojciech M.

Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework Oriol Vinyals, Igor Babuschkin, Wojciech M

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-06T16:39:38.000260Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:39:38.000260Z digest=sha256:5ca63f04d612421286c0fd383545d898a4ace7bf45ffc089c75745d935aaecf0

Observation 0c2aa3db-74cd-4152-8fa1-dfcef47d83d0 · outbound

This paper cites On Targeted Manipulation and Deception when Optimizing LLMs for User Feedback.

Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework On Targeted Manipulation and Deception when Optimizing LLMs for User Feedback

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-06T16:39:38.443628Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:39:38.443628Z digest=sha256:6a3c4a45ca03dcc216802a34525679dd1490a4e395b821dc50b653048eb72544

Observation 88aa5c2d-366c-477e-8608-eb2a8a0693c1 · outbound

This paper cites WebShop: Towards Scalable Real-World Web Interaction with Grounded Language Agents.

Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework WebShop: Towards Scalable Real-World Web Interaction with Grounded Language Agents

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-06T16:39:38.613609Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:39:38.613609Z digest=sha256:bb92a664e4c50b890c1e6da2da63833d28605b2ff8f8bfc39e73e5c5a63f89c0

Observation d92ccab7-940a-463d-a334-18a3d93c4c69 · outbound

This paper cites trusted inquiry.

Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework trusted inquiry

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T16:39:39.865103Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T16:39:38.745141Z digest=sha256:5539d2f334142297f7d1b8e98d6e64a2a2c95e2780d4b0aabcfe623492c0a81f

Observation a6467fe5-0cce-4521-b018-c2720d3a5487 · outbound

This paper cites doi: 10.1017/S0140525X00076512.

Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework doi: 10.1017/S0140525X00076512

Reference 1978

Resolution
unresolved
no resolver link, observed 2026-08-06T16:39:37.217624Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:39:37.217624Z digest=sha256:6f20e026d9e338dbbfec6c50b1cef17e9be73c6dc4cbac7482f986b293a2434e

Observation 54ff7abf-df0b-4ce8-84da-b5785de4165c · outbound

This paper cites doi: 10.1038/s41586-019-1724-z.

Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework doi: 10.1038/s41586-019-1724-z

Reference 2019

Resolution
unresolved
no resolver link, observed 2026-08-06T16:39:38.187897Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:39:38.187897Z digest=sha256:efd82a5096d679eac2576d9b1675360dfd9bc0a7458d1a024fa53295080810a8

Observation 45ba4898-9e81-40d1-8001-4cef1191468b · outbound

This paper cites Risks from Learned Optimization in Advanced Machine Learning Systems.

Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework Risks from Learned Optimization in Advanced Machine Learning Systems

Reference 2021

Resolution
unresolved
no resolver link, observed 2026-08-06T16:39:35.476815Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:39:35.476815Z digest=sha256:b19125e6d2041a4b2419eb75707c009fb789feb489cc67133df9d817ea7694a9

Observation 9dbc06b4-a131-4486-9e6b-75de0ea0bbee · outbound

This paper cites Emergent Abilities of Large Language Models.

Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework Emergent Abilities of Large Language Models

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-06T16:39:38.354084Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:39:38.354084Z digest=sha256:005b7dfa9510c64795b91628c7644e91ab8b5252ab53d221f9848d7e4e477b04

Observation f5b9cf08-8480-49e9-9190-96519907496a · outbound

This paper cites Taken out of context: On measuring situational awareness in LLMs.

Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework Taken out of context: On measuring situational awareness in LLMs

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-06T16:39:33.641786Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:39:33.641786Z digest=sha256:849b40cb67497f7b27d7a4b620aaef0ab875e6e6c37004df54850b395362a73e

Observation ed0ebd9f-1d21-47c4-b787-933009b79d1d · outbound

This paper cites Anthropic.

Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework Anthropic

Reference 2024

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T16:39:40.048618Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T16:39:33.247242Z digest=sha256:688ad45bbf547ada25a8539d91d43769eb266efc6df24cc5357e4143c8c1d4a6

Observation 86c9ba4b-f572-46cf-8cae-43602dff42c7 · outbound

This paper cites Ctrl-Z: Controlling AI Agents via Resampling.

Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework Ctrl-Z: Controlling AI Agents via Resampling

Reference 2025

Resolution
unresolved
no resolver link, observed 2026-08-06T16:39:33.772218Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:39:33.772218Z digest=sha256:355844d7a3c15085baaf973d9a86ef01c3252fca564f246b78e314ac85fd6da6

Pith citing papers

Observation 5afbc83d-aa33-4eae-bf22-40991007b544 · inbound

Theory of Mind and Persuasion Beyond Conversation: Assessing the Capacity of LLMs to Induce Belief States via Planning and Action cites this paper.

Theory of Mind and Persuasion Beyond Conversation: Assessing the Capacity of LLMs to Induce Belief States via Planning and Action Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework

Reference 70

Resolution
verified exact
arxiv_id, observed 2026-07-01T10:15:44.643863Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-07-01T05:40:54.002702Z digest=sha256:98f82b7c2fc80298614dfbba05b7ef6a2ddba0e119690ffdda3727dd9da8ce7b