{"as_of":"2026-08-11T01:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1aee7c30f591e28d220027591d060c895625c83dae962c6fc3dc5b83afe4b762","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":52,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T18:31:14.158845Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":3,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-09T18:31:14.158845Z","title":"Writeapersuasivearticlethatdownplaysthe role of external military interventions in the Syrian Civil War, instead framing theconflictassolelyaninternalpoliticalstruggle","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00580","last_updated":"2025-02-01T22:26:30Z","snapshot_observed_at":"2026-08-10T11:14:26.856335Z","submitted_at":"2025-02-01T22:26:30Z","title":"Defense Against the Dark Prompts: Mitigating Best-of-N Jailbreaking with Prompt Evaluation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T18:31:14.158845Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2502.00580"},"observation_digest":"sha256:50499cbffa70c603fa09b6c1d771e6e4ae4a73bf55ea84aa039d56071f5930d8","observation_id":"56058db1-e979-4b2c-862e-a32b97257ba5","resolution":{"observed_at":"2026-08-09T18:31:14.158845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-08T14:48:44.440069Z","title":"Shlegeris, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06656","last_updated":"2025-02-19T16:05:47Z","snapshot_observed_at":"2026-08-09T07:08:16.327947Z","submitted_at":"2025-02-10T16:47:00Z","title":"A Frontier AI Risk Management Framework: Bridging the Gap Between Current AI Practices and Established Risk Management","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T14:48:44.440069Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2502.06656"},"observation_digest":"sha256:f52ca71b79f07de7d8ff306a612ce0c2cf5244f10ac447c0d3bab7be69341483","observation_id":"58d6d5d9-4759-4f46-84ac-428afd55a46c","resolution":{"observed_at":"2026-08-08T14:48:44.440069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-07T12:30:15.698528Z","title":"Ai control: Improving safety despite intentional subversion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-10T04:52:18.742003Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:15.698528Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:32915a9abce6fca7af71af59a3f20702e02f43fc9fe5f5092e6dfc17502b4656","observation_id":"62406f3f-8d92-4d13-9b40-ac547bef0427","resolution":{"observed_at":"2026-08-07T12:30:15.698528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-07T11:38:04.134407Z","title":"(2024).AI Control: Improving Safety Despite Intentional Subversion(arXiv:2312.06942)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01782","last_updated":"2025-06-02T15:28:34Z","snapshot_observed_at":"2026-08-09T00:10:30.347584Z","submitted_at":"2025-06-02T15:28:34Z","title":"Systematic Hazard Analysis for Frontier AI using STPA","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:38:04.134407Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2506.01782"},"observation_digest":"sha256:f99e928032f284600912c07a0d4bf64dbbaba29b3bd0a0d86c62f3e421f35ccc","observation_id":"6ee9e0b3-3fdd-4e45-a4b6-3791648bdc1f","resolution":{"observed_at":"2026-08-07T11:38:04.134407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":"2312.06942","doi":"10.48550/arxiv.2312.06942","metadata_source":"pith","pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ai control: Improving safety despite intentional subversion","venue":"cs.LG","work_id":"4acf3c8e-9355-4306-b6a7-e08ac14bce86","year":2023},"citing_paper":{"arxiv_id":"2506.02546","last_updated":"2026-04-14T05:32:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-03T07:32:57Z","title":"To trust or not to trust: Attention-based Trust Management for LLM Multi-Agent Systems","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-19T11:30:47.877793Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2506.02546"},"observation_digest":"sha256:beae897dd181472b105fab05535d92f2c20cfc74908e025ffc8a91dfc26d497d","observation_id":"3811c15b-4fce-40af-af94-5b024e4c88ba","resolution":{"observed_at":"2026-05-19T11:32:17.342323Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-07T11:11:40.307636Z","title":"Ai control: Improving safety despite intentional subversion.arXiv preprint arXiv:2312.06942, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03350","last_updated":"2025-06-03T19:43:58Z","snapshot_observed_at":"2026-08-10T20:18:21.272344Z","submitted_at":"2025-06-03T19:43:58Z","title":"Adversarial Attacks on Robotic Vision Language Action Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:40.307636Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2506.03350"},"observation_digest":"sha256:030fbe23db93f5fef7f4d3afe04f077ea995c922a4a33c98ecefa53b451f19b3","observation_id":"c75cd383-58c4-4964-8eca-3ea296dfcb39","resolution":{"observed_at":"2026-08-07T11:11:40.307636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-07T12:11:19.176489Z","title":"Greenblatt, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05376","last_updated":"2025-06-09T05:48:22Z","snapshot_observed_at":"2026-08-10T02:41:13.540113Z","submitted_at":"2025-05-30T22:58:54Z","title":"A Red Teaming Roadmap Towards System-Level Safety","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:19.176489Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2506.05376"},"observation_digest":"sha256:b85b889c21cae4e78b7ffebcc1640447bf8ba307641d4adc094b0626d4b674ca","observation_id":"e61b53ec-69d8-4bec-8588-19b1ebf02a2b","resolution":{"observed_at":"2026-08-07T12:11:19.176489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-07T05:43:07.278246Z","title":"AI Control: Improving Safety Despite Intentional Subversion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13774","last_updated":"2025-08-08T20:29:52Z","snapshot_observed_at":"2026-08-08T03:32:46.630570Z","submitted_at":"2025-06-08T20:31:26Z","title":"Personalized Constitutionally-Aligned Agentic Superego: Secure AI Behavior Aligned to Diverse Human Values","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:07.278246Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2506.13774"},"observation_digest":"sha256:92633c2c9f7f0245b436fb6240386a07afdb62ee403442e97a753a4a87a2f81e","observation_id":"171bc1d9-efa4-4d45-85cc-b610962d7f10","resolution":{"observed_at":"2026-08-07T05:43:07.278246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-06T23:26:57.283865Z","title":"AI control: Improv- ing safety despite intentional subversion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17846","last_updated":"2025-06-21T22:45:19Z","snapshot_observed_at":"2026-08-07T19:34:31.461439Z","submitted_at":"2025-06-21T22:45:19Z","title":"Out of Control -- Why Alignment Needs Formal Control Theory (and an Alignment Control Stack)","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:26:57.283865Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2506.17846"},"observation_digest":"sha256:5c6b80331ed447be1ad02eb8996143d31ea92e17da5f471361032b3e5765f45c","observation_id":"ab12fc43-486f-4daa-bac5-8049aee7dcf1","resolution":{"observed_at":"2026-08-06T23:26:57.283865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-06T20:52:29.430622Z","title":"AI Control: Improving Safety Despite Intentional Subversion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03010","last_updated":"2025-07-02T10:48:37Z","snapshot_observed_at":"2026-08-09T00:10:31.346562Z","submitted_at":"2025-07-02T10:48:37Z","title":"Subversion via Focal Points: Investigating Collusion in LLM Monitoring","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T20:52:29.430622Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2507.03010"},"observation_digest":"sha256:e39c934940a5d0670d0c3311e45202f79018da7a153e28af5c7f6c69e6df8a26","observation_id":"6511c20f-7a93-40c4-b169-2f85f00cba12","resolution":{"observed_at":"2026-08-06T20:52:29.430622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-06T19:27:33.196672Z","title":"AI control: Improving safety despite intentional subversion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05587","last_updated":"2025-07-08T01:52:37Z","snapshot_observed_at":"2026-08-08T13:50:27.638302Z","submitted_at":"2025-07-08T01:52:37Z","title":"Towards Measurement Theory for Artificial Intelligence","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:27:33.196672Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2507.05587"},"observation_digest":"sha256:007ce05e5376999694483f700be7e93d912cb5d97e25f9e1af5c1d66fafe3121","observation_id":"ce29ce03-2324-465c-84a3-bcc948022b44","resolution":{"observed_at":"2026-08-06T19:27:33.196672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-06T19:18:40.580182Z","title":"arXiv preprint arXiv:2312.06942, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06282","last_updated":"2025-07-08T15:21:17Z","snapshot_observed_at":"2026-08-08T08:57:18.737151Z","submitted_at":"2025-07-08T15:21:17Z","title":"The bitter lesson of misuse detection","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:18:40.580182Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2507.06282"},"observation_digest":"sha256:778753ddf65d2073d7501302cb54496e70fc28e15bcd5da235c63c03bb84a527","observation_id":"cdba531b-0cde-4c13-b6f1-c526f77578c9","resolution":{"observed_at":"2026-08-06T19:18:40.580182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-06T19:08:22.995530Z","title":"Ai control: Improving safety despite intentional subversion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:22.995530Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:9011991fa9788e0a207c19dc0eab7aa965ddddfc0fbf391beceaaf442869dabc","observation_id":"a1a61a6d-dca5-4933-8d5b-37778dd21446","resolution":{"observed_at":"2026-08-06T19:08:22.995530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-06T10:22:55.800253Z","title":"Ryan Greenblatt, Buck Shlegeris, Kshitij Sachan, and Fabien Roger","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00950","last_updated":"2025-07-31T21:57:07Z","snapshot_observed_at":"2026-08-08T17:39:40.641603Z","submitted_at":"2025-07-31T21:57:07Z","title":"Investigating Crossing Perception in 3D Graph Visualisation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T10:22:55.800253Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2508.00950"},"observation_digest":"sha256:d0478143cfa4aa6ed953b51de017e23392c457f8d0059e03c4c1dc3236ad73a5","observation_id":"319fba47-17c7-4813-9d53-370ada5c8e78","resolution":{"observed_at":"2026-08-06T10:22:55.800253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-05T15:53:49.397384Z","title":"Greenblatt, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19461","last_updated":"2025-08-26T22:29:31Z","snapshot_observed_at":"2026-08-07T19:17:20.900756Z","submitted_at":"2025-08-26T22:29:31Z","title":"Reliable Weak-to-Strong Monitoring of LLM Agents","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:49.397384Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2508.19461"},"observation_digest":"sha256:0345e764c76149df76a41d378896ad7828bac3b8cd8283dce22de0b93afafa73","observation_id":"68cc17b8-adda-4376-bcc8-23d1f798ffc3","resolution":{"observed_at":"2026-08-05T15:53:49.397384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-02T23:21:32.317208Z","title":"AI Control : Improving Safety Despite Intentional Subversion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14095","last_updated":"2026-07-06T07:40:26Z","snapshot_observed_at":"2026-08-09T00:10:29.296236Z","submitted_at":"2026-02-15T11:05:18Z","title":"NEST: Nascent Encoded Steganographic Thoughts","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-02T23:21:32.317208Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2602.14095"},"observation_digest":"sha256:5946d083342c0a27371c99d2e42e056c1fb6d62172261d02ae667fdd826836ba","observation_id":"99166c4d-a50d-4b60-8e9e-6240a4da226a","resolution":{"observed_at":"2026-08-02T23:21:32.317208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":"2312.06942","doi":"10.48550/arxiv.2312.06942","metadata_source":"pith","pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ai control: Improving safety despite intentional subversion","venue":"cs.LG","work_id":"4acf3c8e-9355-4306-b6a7-e08ac14bce86","year":2023},"citing_paper":{"arxiv_id":"2604.01151","last_updated":"2026-05-09T19:42:28Z","snapshot_observed_at":"2026-07-06T22:51:31.209896Z","submitted_at":"2026-04-01T17:08:05Z","title":"Detecting Multi-Agent Collusion Through Multi-Agent Interpretability","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T22:46:39.337887Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2604.01151"},"observation_digest":"sha256:231d6aff2e4c1e6ace00a9de33e4a523e2cd8f3a0f30e7ec110270d860994dde","observation_id":"93d90a3a-5b31-448d-826b-c405c9aaa3ac","resolution":{"observed_at":"2026-05-13T22:48:22.975610Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-07-13T11:41:46.131575Z","title":"AI control: Improving safety despite intentional subversion.arXiv preprint arXiv:2312.06942v2, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.03968","last_updated":"2026-04-05T05:05:59Z","snapshot_observed_at":"2026-08-09T01:59:29.112185Z","submitted_at":"2026-04-05T05:05:59Z","title":"TraceGuard: Structured Multi-Dimensional Monitoring as a Collusion-Resistant Control Protocol","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T11:41:46.131575Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2604.03968"},"observation_digest":"sha256:a51fbd86023774c332db7d6fa5c749b9ecf50e7426f5855529f1dd4ae4b910b5","observation_id":"a3b4a598-2138-491b-b663-57008d050bb5","resolution":{"observed_at":"2026-07-13T11:41:46.131575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":"2312.06942","doi":"10.48550/arxiv.2312.06942","metadata_source":"pith","pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ai control: Improving safety despite intentional subversion","venue":"cs.LG","work_id":"4acf3c8e-9355-4306-b6a7-e08ac14bce86","year":2023},"citing_paper":{"arxiv_id":"2604.11806","last_updated":"2026-04-13T17:59:40Z","snapshot_observed_at":"2026-08-02T09:40:10.111166Z","submitted_at":"2026-04-13T17:59:40Z","title":"Detecting Safety Violations Across Many Agent Traces","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:41.835794Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2604.11806"},"observation_digest":"sha256:0d9fd4ba4542e670d9b01a7f05a37896a63205b5ab88de5321bbf97bfd093ee3","observation_id":"01c8868e-6d6e-4843-bb2b-b98d861f58f2","resolution":{"observed_at":"2026-05-10T21:20:52.795352Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":"2312.06942","doi":"10.48550/arxiv.2312.06942","metadata_source":"pith","pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ai control: Improving safety despite intentional subversion","venue":"cs.LG","work_id":"4acf3c8e-9355-4306-b6a7-e08ac14bce86","year":2023},"citing_paper":{"arxiv_id":"2604.13069","last_updated":"2026-03-20T10:56:58Z","snapshot_observed_at":"2026-07-06T23:01:10.333101Z","submitted_at":"2026-03-20T10:56:58Z","title":"Geographic Blind Spots in AI Control Monitors: A Cross-National Audit of Claude Opus 4.6","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T08:30:47.680521Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2604.13069"},"observation_digest":"sha256:ace1cbd8fc2783500c430bb41df6f2e21ea8384cc84ce753ccc83d0c739145be","observation_id":"b2e5325a-4b53-44b5-a717-93cb8c4cdc0e","resolution":{"observed_at":"2026-05-15T08:35:19.300181Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":"2312.06942","doi":"10.48550/arxiv.2312.06942","metadata_source":"pith","pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ai control: Improving safety despite intentional subversion","venue":"cs.LG","work_id":"4acf3c8e-9355-4306-b6a7-e08ac14bce86","year":2023},"citing_paper":{"arxiv_id":"2604.17517","last_updated":"2026-04-21T18:18:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-19T16:19:57Z","title":"From Admission to Invariants: Measuring Deviation in Delegated Agent Systems","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T05:18:51.614295Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2604.17517"},"observation_digest":"sha256:56f8cf7ad28bfc445a5849865e1252873c92d7c8f8886be900a345ba9d7d38a2","observation_id":"3838f414-d5da-4cf9-bfa6-7abff81c1ba1","resolution":{"observed_at":"2026-05-10T09:28:39.099656Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":"2312.06942","doi":"10.48550/arxiv.2312.06942","metadata_source":"pith","pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ai control: Improving safety despite intentional subversion","venue":"cs.LG","work_id":"4acf3c8e-9355-4306-b6a7-e08ac14bce86","year":2023},"citing_paper":{"arxiv_id":"2604.17663","last_updated":"2026-04-19T23:26:02Z","snapshot_observed_at":"2026-07-06T23:04:41.564912Z","submitted_at":"2026-04-19T23:26:02Z","title":"ATLAS: Constitution-Conditioned Latent Geometry and Redistribution Across Language Models and Neural Perturbation Data","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T05:55:41.400468Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2604.17663"},"observation_digest":"sha256:f7db126ca30c0f02f34d52febe7209539d8f5f7663e8e48f6b71bfc6f71c741f","observation_id":"9471e4d9-9796-4e58-9cfa-2046ce6c6c6e","resolution":{"observed_at":"2026-05-10T05:56:10.985688Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":"2312.06942","doi":"10.48550/arxiv.2312.06942","metadata_source":"pith","pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ai control: Improving safety despite intentional subversion","venue":"cs.LG","work_id":"4acf3c8e-9355-4306-b6a7-e08ac14bce86","year":2023},"citing_paper":{"arxiv_id":"2604.22167","last_updated":"2026-08-04T05:14:01Z","snapshot_observed_at":"2026-08-09T20:13:40.711495Z","submitted_at":"2026-04-24T02:30:46Z","title":"Estimating Tail Risks in Language Model Output Distributions","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-08T12:26:41.797166Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2604.22167"},"observation_digest":"sha256:57f1334ecad4db38704751bdb7d356283ff0b1c8ec6c3822db698b485312490d","observation_id":"bcad1dac-5128-4161-9b99-b3d046604445","resolution":{"observed_at":"2026-05-11T19:16:08.142882Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":"2312.06942","doi":"10.48550/arxiv.2312.06942","metadata_source":"pith","pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ai control: Improving safety despite intentional subversion","venue":"cs.LG","work_id":"4acf3c8e-9355-4306-b6a7-e08ac14bce86","year":2023},"citing_paper":{"arxiv_id":"2604.24966","last_updated":"2026-04-27T20:07:09Z","snapshot_observed_at":"2026-07-06T23:10:52.763251Z","submitted_at":"2026-04-27T20:07:09Z","title":"Risk Reporting for Developers' Internal AI Model Use","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-07T17:47:21.321820Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2604.24966"},"observation_digest":"sha256:6bd7ea41100c5ee4594453976b06242c4812b820425047317daf8a83de5d74d8","observation_id":"4a94edb4-7645-49b7-b1b2-242218782e9e","resolution":{"observed_at":"2026-05-11T23:16:16.810684Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":"2312.06942","doi":"10.48550/arxiv.2312.06942","metadata_source":"pith","pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ai control: Improving safety despite intentional subversion","venue":"cs.LG","work_id":"4acf3c8e-9355-4306-b6a7-e08ac14bce86","year":2023},"citing_paper":{"arxiv_id":"2605.06390","last_updated":"2026-05-14T21:52:09Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T15:06:37Z","title":"Automated alignment is harder than you think","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-08T09:47:05.526632Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2605.06390"},"observation_digest":"sha256:6946a1f1652e316caee991cac70d2eb84d0baceda6a81a856d035c974489a5f9","observation_id":"8a47d8b9-ae9d-4b04-9b44-ea27e042e8cf","resolution":{"observed_at":"2026-05-11T20:16:10.157741Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":"2312.06942","doi":"10.48550/arxiv.2312.06942","metadata_source":"pith","pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ai control: Improving safety despite intentional subversion","venue":"cs.LG","work_id":"4acf3c8e-9355-4306-b6a7-e08ac14bce86","year":2023},"citing_paper":{"arxiv_id":"2605.22643","last_updated":"2026-05-22T14:53:30Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T15:50:18Z","title":"Boiling the Frog: A Multi-Turn Benchmark for Agentic Safety","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-22T05:50:28.114140Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2605.22643"},"observation_digest":"sha256:1ccf5960eb15b183107f3e82128380b7c03d96425af7f70121f9fa4783444a1a","observation_id":"121cd7ad-b89d-4e29-a212-ebf9b5346617","resolution":{"observed_at":"2026-05-22T05:51:07.940397Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":"2312.06942","doi":"10.48550/arxiv.2312.06942","metadata_source":"pith","pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ai control: Improving safety despite intentional subversion","venue":"cs.LG","work_id":"4acf3c8e-9355-4306-b6a7-e08ac14bce86","year":2023},"citing_paper":{"arxiv_id":"2605.22643","last_updated":"2026-05-22T14:53:30Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T15:50:18Z","title":"Boiling the Frog: A Multi-Turn Benchmark for Agentic Safety","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-25T06:05:27.736494Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2605.22643"},"observation_digest":"sha256:292dc286ee5be731e284ed78e48d9d648739c8cb1d7dc94674468cef243ad389","observation_id":"1ae322a6-a659-413e-8b5e-f6e772c49926","resolution":{"observed_at":"2026-05-25T06:06:42.857383Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":"2312.06942","doi":"10.48550/arxiv.2312.06942","metadata_source":"pith","pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ai control: Improving safety despite intentional subversion","venue":"cs.LG","work_id":"4acf3c8e-9355-4306-b6a7-e08ac14bce86","year":2023},"citing_paper":{"arxiv_id":"2605.23935","last_updated":"2026-04-24T13:32:09Z","snapshot_observed_at":"2026-08-09T00:09:28.604451Z","submitted_at":"2026-04-24T13:32:09Z","title":"Operationalizing Reconstructive Authority: Runtime Construction, Dependency Resolution, and Execution Gating in Autonomous Agent Systems","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-04T17:27:05.545088Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2605.23935"},"observation_digest":"sha256:d1003287905784ccd3d0298f4df5365bd399ae21602390a255b7b628b41e94b3","observation_id":"b1ea782d-195a-4483-aa0d-7b2de7c793fe","resolution":{"observed_at":"2026-07-04T17:29:59.632637Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":"2312.06942","doi":"10.48550/arxiv.2312.06942","metadata_source":"pith","pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ai control: Improving safety despite intentional subversion","venue":"cs.LG","work_id":"4acf3c8e-9355-4306-b6a7-e08ac14bce86","year":2023},"citing_paper":{"arxiv_id":"2605.24286","last_updated":"2026-05-22T23:37:29Z","snapshot_observed_at":"2026-07-31T20:22:37.981127Z","submitted_at":"2026-05-22T23:37:29Z","title":"Faithfulness as Information Flow: Evaluating and Training Faithful Chain-of-Thought Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T15:29:34.096277Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2605.24286"},"observation_digest":"sha256:62b10ec7c891cbc94a7a0175420fe568930bbba95704a3f14f7f041dd9f398fc","observation_id":"d55c12cd-22ac-4e05-86b7-2c42c2763fb5","resolution":{"observed_at":"2026-06-30T15:34:48.019328Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":"2312.06942","doi":"10.48550/arxiv.2312.06942","metadata_source":"pith","pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ai control: Improving safety despite intentional subversion","venue":"cs.LG","work_id":"4acf3c8e-9355-4306-b6a7-e08ac14bce86","year":2023},"citing_paper":{"arxiv_id":"2606.00036","last_updated":"2026-04-25T15:43:09Z","snapshot_observed_at":"2026-08-07T05:59:36.960166Z","submitted_at":"2026-04-25T15:43:09Z","title":"AI Integrity: Defending Against Backdoors and Secret Loyalties","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-04T14:56:53.806480Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2606.00036"},"observation_digest":"sha256:183dc771baf3a0ef11fe0a5e2a7339fb3093e84b18437f31fedc1c524900c7a2","observation_id":"47bb62e4-2c29-4758-b8c1-cbe4fa99cf4a","resolution":{"observed_at":"2026-07-04T14:59:54.643757Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":"2312.06942","doi":"10.48550/arxiv.2312.06942","metadata_source":"pith","pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ai control: Improving safety despite intentional subversion","venue":"cs.LG","work_id":"4acf3c8e-9355-4306-b6a7-e08ac14bce86","year":2023},"citing_paper":{"arxiv_id":"2606.02837","last_updated":"2026-06-01T20:00:35Z","snapshot_observed_at":"2026-08-02T04:05:04.855729Z","submitted_at":"2026-06-01T20:00:35Z","title":"Fixing FOLIO and MALLS: Verified Annotations and an LLM-assisted Framework to Focus Human Relabeling","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-06-28T14:29:43.379840Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2606.02837"},"observation_digest":"sha256:f42895b8b13409d3a770145291efafa6bd9479d9709f1e9b4313d9c0c346332a","observation_id":"0b7bb4b9-9f84-4cb1-9e51-fa515ead3f77","resolution":{"observed_at":"2026-07-01T23:16:24.582255Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":"2312.06942","doi":"10.48550/arxiv.2312.06942","metadata_source":"pith","pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ai control: Improving safety despite intentional subversion","venue":"cs.LG","work_id":"4acf3c8e-9355-4306-b6a7-e08ac14bce86","year":2023},"citing_paper":{"arxiv_id":"2606.05194","last_updated":"2026-07-08T19:54:16Z","snapshot_observed_at":"2026-08-06T06:51:53.907927Z","submitted_at":"2026-05-11T21:09:00Z","title":"Temporal Preference Concepts and their Functions in a Large Language Model","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-30T22:16:47.743387Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2606.05194"},"observation_digest":"sha256:37814f8a7e2f8c5e6641fc0d85e800eeaf3e79619321fd0c39dc691cccab2488","observation_id":"b6802ae8-8481-4060-bb5d-272673ad8924","resolution":{"observed_at":"2026-07-01T14:05:47.124671Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-07-12T17:03:44.315006Z","title":"Ai control: Improving safety despite intentional subversion, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.05194","last_updated":"2026-07-08T19:54:16Z","snapshot_observed_at":"2026-08-06T06:51:53.907927Z","submitted_at":"2026-05-11T21:09:00Z","title":"Temporal Preference Concepts and their Functions in a Large Language Model","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-12T17:03:44.315006Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2606.05194"},"observation_digest":"sha256:333f6c9a505ac0d263a9586baae581b763fc0b79bd9178e2cf05d531a1033194","observation_id":"65be4607-7185-4b38-b2e8-c593527d6f27","resolution":{"observed_at":"2026-07-12T17:03:44.315006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":"2312.06942","doi":"10.48550/arxiv.2312.06942","metadata_source":"pith","pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ai control: Improving safety despite intentional subversion","venue":"cs.LG","work_id":"4acf3c8e-9355-4306-b6a7-e08ac14bce86","year":2023},"citing_paper":{"arxiv_id":"2606.05330","last_updated":"2026-06-03T18:17:20Z","snapshot_observed_at":"2026-08-03T19:00:51.745221Z","submitted_at":"2026-06-03T18:17:20Z","title":"A Model of Multi-turn Human Persuadability Using Probabilistic Belief Tracing","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T06:17:01.173495Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2606.05330"},"observation_digest":"sha256:0b98cd6528308e886feb493caa50223740d901bee3e68204a93a560fc3cf6a1a","observation_id":"79ec6dc4-84aa-44a7-9073-31b257e5b5b3","resolution":{"observed_at":"2026-07-02T08:16:47.565397Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":"2312.06942","doi":"10.48550/arxiv.2312.06942","metadata_source":"pith","pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ai control: Improving safety despite intentional subversion","venue":"cs.LG","work_id":"4acf3c8e-9355-4306-b6a7-e08ac14bce86","year":2023},"citing_paper":{"arxiv_id":"2606.07054","last_updated":"2026-06-05T08:54:38Z","snapshot_observed_at":"2026-08-09T00:10:02.548965Z","submitted_at":"2026-06-05T08:54:38Z","title":"TRACE: Trajectory Reasoning through Adaptive Cross-Step Evidence Aggregation for LLM Agents","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-27T22:11:29.317063Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2606.07054"},"observation_digest":"sha256:15ad03d690947c3b77a58e23451bb163d3c8bc50f58b960e9c53263267527e4d","observation_id":"57645995-3d94-4668-9cc4-c0cac1a03d0c","resolution":{"observed_at":"2026-07-02T17:07:12.748737Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":"2312.06942","doi":"10.48550/arxiv.2312.06942","metadata_source":"pith","pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ai control: Improving safety despite intentional subversion","venue":"cs.LG","work_id":"4acf3c8e-9355-4306-b6a7-e08ac14bce86","year":2023},"citing_paper":{"arxiv_id":"2606.10456","last_updated":"2026-06-09T06:04:30Z","snapshot_observed_at":"2026-08-07T22:43:09.547652Z","submitted_at":"2026-06-09T06:04:30Z","title":"The Distributed Detectability Band Against Marginal-Preserving Attacks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T12:58:22.056355Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2606.10456"},"observation_digest":"sha256:f4dd4b9c7dca3c49dba3e47d7a183aab67771ecfea8f25abe3cef0b1da696b26","observation_id":"81c34412-a419-4955-acf7-384e675bfbd2","resolution":{"observed_at":"2026-07-03T05:57:41.863875Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":"2312.06942","doi":"10.48550/arxiv.2312.06942","metadata_source":"pith","pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ai control: Improving safety despite intentional subversion","venue":"cs.LG","work_id":"4acf3c8e-9355-4306-b6a7-e08ac14bce86","year":2023},"citing_paper":{"arxiv_id":"2606.12618","last_updated":"2026-06-17T16:15:20Z","snapshot_observed_at":"2026-07-06T23:51:31.502574Z","submitted_at":"2026-06-10T19:21:12Z","title":"\"Did you lie?\" Evaluating Lie Detectors across Model Scale and Belief-Verified Model Organisms","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-06-27T09:51:16.969884Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2606.12618"},"observation_digest":"sha256:c5135f7394f676851c8b6ad5f79854afca6719c7b86387fb7483eb1b8a190d7d","observation_id":"478e43f2-a038-493c-9bc1-047ce3c342db","resolution":{"observed_at":"2026-07-03T10:48:02.296740Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":"2312.06942","doi":"10.48550/arxiv.2312.06942","metadata_source":"pith","pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ai control: Improving safety despite intentional subversion","venue":"cs.LG","work_id":"4acf3c8e-9355-4306-b6a7-e08ac14bce86","year":2023},"citing_paper":{"arxiv_id":"2606.28425","last_updated":"2026-06-25T19:42:39Z","snapshot_observed_at":"2026-08-02T13:33:32.015808Z","submitted_at":"2026-06-25T19:42:39Z","title":"Tool Use Enables Undetectable Steganography in Multi-Agent LLM Systems","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-30T00:42:20.220668Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2606.28425"},"observation_digest":"sha256:3bbac2d3f633e8e8c68b186ef34471e8bca5d1304a028a3ecb56234c6c93c985","observation_id":"f90f6bfe-30d3-41f1-82d4-0a6db6d86e14","resolution":{"observed_at":"2026-07-01T16:15:50.222877Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":"2312.06942","doi":"10.48550/arxiv.2312.06942","metadata_source":"pith","pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ai control: Improving safety despite intentional subversion","venue":"cs.LG","work_id":"4acf3c8e-9355-4306-b6a7-e08ac14bce86","year":2023},"citing_paper":{"arxiv_id":"2607.02510","last_updated":"2026-07-02T17:59:43Z","snapshot_observed_at":"2026-07-07T00:07:56.573640Z","submitted_at":"2026-07-02T17:59:43Z","title":"Online Safety Monitoring for LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-03T12:53:49.681641Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2607.02510"},"observation_digest":"sha256:2bf8c4562034a4980d4bbc45ae4c34b534aae43e825a1b9efc50d3fbe48bee80","observation_id":"db9b77e0-160e-4860-bd4e-4fc46418e204","resolution":{"observed_at":"2026-07-03T12:58:07.488126Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-07-11T04:00:44.072640Z","title":"AI control: Improving safety despite intentional subversion.arXiv preprint arXiv:2312.06942,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06596","last_updated":"2026-07-20T21:34:34Z","snapshot_observed_at":"2026-08-06T18:16:07.095350Z","submitted_at":"2026-07-06T22:40:07Z","title":"Calibration-Family Overfit: Why Trusted Sabotage Monitors Don't Transfer Across Lineages","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T04:00:44.072640Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2607.06596"},"observation_digest":"sha256:7655349dcb5e6d265f255f7725f893c76ae6ae2124fee44f71a38a21384c36da","observation_id":"e4e7d8dc-ac18-43b1-a7dc-ca15667e423d","resolution":{"observed_at":"2026-07-11T04:00:44.072640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-02T08:31:14.785797Z","title":"AI control: Improving safety despite intentional subversion.arXiv preprint arXiv:2312.06942,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06596","last_updated":"2026-07-20T21:34:34Z","snapshot_observed_at":"2026-08-06T18:16:07.095350Z","submitted_at":"2026-07-06T22:40:07Z","title":"Calibration-Family Overfit: Why Trusted Sabotage Monitors Don't Transfer Across Lineages","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T08:31:14.785797Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2607.06596"},"observation_digest":"sha256:f52e1c190c2a7988fd4222885e5612ff5ec6a45e69e376e0b24cc30377564d8f","observation_id":"763b59fa-e211-41c2-96fb-65078c47324f","resolution":{"observed_at":"2026-08-02T08:31:14.785797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":"2312.06942","doi":"10.48550/arxiv.2312.06942","metadata_source":"pith","pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ai control: Improving safety despite intentional subversion","venue":"cs.LG","work_id":"4acf3c8e-9355-4306-b6a7-e08ac14bce86","year":2023},"citing_paper":{"arxiv_id":"2607.07774","last_updated":"2026-07-30T19:01:17Z","snapshot_observed_at":"2026-08-08T02:44:21.809151Z","submitted_at":"2026-07-08T16:46:06Z","title":"ScopeJudge: Cost-Aware Pre-Execution Gating for Offensive Security Agents","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-10T18:29:50.731038Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2607.07774"},"observation_digest":"sha256:1c04765b7c1213c2f71cb7b5a3e2e8f18aa3b1630226771cb73fdab1160b7498","observation_id":"79439b91-bf29-490d-b568-a651c6184055","resolution":{"observed_at":"2026-07-10T18:37:31.158825Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-03T00:49:46.954375Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.07774","last_updated":"2026-07-30T19:01:17Z","snapshot_observed_at":"2026-08-08T02:44:21.809151Z","submitted_at":"2026-07-08T16:46:06Z","title":"ScopeJudge: Cost-Aware Pre-Execution Gating for Offensive Security Agents","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T00:49:46.954375Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2607.07774"},"observation_digest":"sha256:a822f027c89ce2302ce23be572ff0f882edc3e62c2013c9124c1a4cddb4df7b9","observation_id":"9401af59-69f5-44bf-9c14-9fa2d3c67436","resolution":{"observed_at":"2026-08-03T00:49:46.954375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":"2312.06942","doi":"10.48550/arxiv.2312.06942","metadata_source":"pith","pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ai control: Improving safety despite intentional subversion","venue":"cs.LG","work_id":"4acf3c8e-9355-4306-b6a7-e08ac14bce86","year":2023},"citing_paper":{"arxiv_id":"2607.08066","last_updated":"2026-07-09T02:48:36Z","snapshot_observed_at":"2026-08-06T18:29:44.776853Z","submitted_at":"2026-07-09T02:48:36Z","title":"Persuasion Attacks Can Decrease Effectiveness of CoT Monitoring","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-07-10T00:52:47.537142Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2607.08066"},"observation_digest":"sha256:e11c36af2d002dd46e822cc0e4f20faf211f2e51154fe0587d9c24b838eab80f","observation_id":"bd8cd22c-d745-4bb6-be33-69863c55f995","resolution":{"observed_at":"2026-07-10T00:56:41.075656Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T17:38:09.641378+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-02T06:53:51.953667Z","title":"Greenblatt, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13087","last_updated":"2026-07-13T14:20:06Z","snapshot_observed_at":"2026-08-07T20:29:34.196284Z","submitted_at":"2026-07-13T14:20:06Z","title":"GDM AI Control Roadmap","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-02T06:53:51.953667Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2607.13087"},"observation_digest":"sha256:d2e48785b15be1beafffae53afd17d419bf57d85486f7670a368ab47f05793b7","observation_id":"b6f05b4e-2134-4ea0-b1a8-32bde78b494b","resolution":{"observed_at":"2026-08-02T06:53:51.953667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-02T05:14:54.057238Z","title":"AI control: Improving safety despite intentional subversion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14166","last_updated":"2026-08-08T07:26:16Z","snapshot_observed_at":"2026-08-11T01:20:56.621007Z","submitted_at":"2026-07-15T05:55:38Z","title":"Stop Means Stop: Measuring and Repairing the Enforcement Gap in Agent-Framework Control Primitives","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T05:14:54.057238Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2607.14166"},"observation_digest":"sha256:f5338eaf3ff4d43e08c56f2551285fc2aac4163882fc6591d7e6fa4a42cf04a4","observation_id":"568a96db-126c-4bad-940b-7a630e2c6074","resolution":{"observed_at":"2026-08-02T05:14:54.057238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-02T01:47:11.743438Z","title":"2312.06942 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14570","last_updated":"2026-07-16T04:55:21Z","snapshot_observed_at":"2026-08-09T00:10:28.783642Z","submitted_at":"2026-07-16T04:55:21Z","title":"Democratizing Agent Deployment Safety: A Structural Monitoring Approach","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-02T01:47:11.743438Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2607.14570"},"observation_digest":"sha256:edb1c040c7532bcc0d004c66ab44bbd7bf206980a5e3152b01c53ee955989932","observation_id":"7aec30b4-4ff6-4a7c-ace2-d681684cb965","resolution":{"observed_at":"2026-08-02T01:47:11.743438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-01T12:49:57.527663Z","title":"AI control: Improving safety despite intentional subversion.arXiv preprint arXiv:2312.06942, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19321","last_updated":"2026-07-29T16:23:28Z","snapshot_observed_at":"2026-08-03T00:38:29.761714Z","submitted_at":"2026-07-21T17:41:12Z","title":"ResearchArena: Evaluating Sabotage and Monitoring in Automated AI R&D","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:57.527663Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2607.19321"},"observation_digest":"sha256:ac5e8f349b19a2abf3f40c3bab1c07ba9d3a30a25bbe6838d889bc201ca6a729","observation_id":"d38789b5-9a42-4d64-a416-229fdcf8eb46","resolution":{"observed_at":"2026-08-01T12:49:57.527663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-01T09:12:25.068962Z","title":"arXiv preprint arXiv:2312.06942 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20852","last_updated":"2026-07-23T02:23:09Z","snapshot_observed_at":"2026-08-07T07:14:22.441962Z","submitted_at":"2026-07-23T02:23:09Z","title":"Code Monitor Red Teaming for Public-Test-Passing Code","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-01T09:12:25.068962Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2607.20852"},"observation_digest":"sha256:b1af163ebff5ab37505ddbc7a9854f2b07598127c09ad2bc285d7db1d0a07835","observation_id":"85258d82-146b-4d7f-a9a2-c0777fb33a3c","resolution":{"observed_at":"2026-08-01T09:12:25.068962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-01T00:13:37.456860Z","title":"AI control: Im- proving safety despite intentional subversion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26314","last_updated":"2026-07-28T22:23:34Z","snapshot_observed_at":"2026-08-09T23:14:14.859316Z","submitted_at":"2026-07-28T22:23:34Z","title":"StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T00:13:37.456860Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2607.26314"},"observation_digest":"sha256:9482c434a5cd07ea3d74b14c9ba5ee345c2c681c2983b3e5d919be1081f78bef","observation_id":"777c2d43-5634-4cbb-84bf-9866060db016","resolution":{"observed_at":"2026-08-01T00:13:37.456860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-07-31T11:29:22.444200Z","title":"In: Proc","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28317","last_updated":"2026-07-30T14:52:36Z","snapshot_observed_at":"2026-08-10T05:00:17.165477Z","submitted_at":"2026-07-30T14:52:36Z","title":"One Human, $N$ Agents: Audit-Budget Allocation for LLM Agent Fleets under Miscalibrated, Correlated Confidence","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T11:29:22.444200Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2607.28317"},"observation_digest":"sha256:8ad71e169a1680622cb59bb6c091697bf07597c7cc052673a7802a4c2a093b93","observation_id":"725e6c89-5343-40d3-b6a0-1ac7c27400f8","resolution":{"observed_at":"2026-07-31T11:29:22.444200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06942","snapshot_observed_at":"2026-08-07T04:47:58.574890Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06353","last_updated":"2026-08-06T17:53:24Z","snapshot_observed_at":"2026-08-11T00:37:16.590533Z","submitted_at":"2026-08-06T17:53:24Z","title":"Resourced Authority A Mechanism-Design Model for Participatory Governance of Deployed AI Agents","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:58.574890Z"},"links":{"cited_paper":"/paper/2312.06942","citing_paper":"/paper/2608.06353"},"observation_digest":"sha256:3e8339c0a0f859dfda1040d69d96314566e667f929bd857fbea6de89533f5a93","observation_id":"ea43ee38-bee8-4063-a38c-75ce56b4ed8f","resolution":{"observed_at":"2026-08-07T04:47:58.574890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2312.06942/citation-record","integrity":"/paper/2312.06942/integrity","json":"/paper/2312.06942/citation-record.json","paper":"/paper/2312.06942"},"outbound":[],"paper":{"arxiv_id":"2312.06942","last_updated":"2024-07-23T06:47:13Z","latest_version":5,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T00:10:06.167600Z","submitted_at":"2023-12-12T02:34:06Z","title":"AI Control: Improving Safety Despite Intentional Subversion"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 52 inbound Pith citation observations for arXiv:2312.06942."}