{"as_of":"2026-08-07T16:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ab17f0ffc882be4bb141e223cd0571a06ae52f14ab21f8d62e2ca3367d647ed0","coverage":[{"denominator":80,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":80,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:30:10.795238Z","state":"measured"},{"denominator":83,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":83,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:14:22.854339Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18807","snapshot_observed_at":"2026-08-06T15:14:22.854339Z","title":"Mitigating deceptive alignment via self-monitoring.arXiv preprint arXiv:2505.18807,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16534","last_updated":"2025-07-26T12:33:42Z","snapshot_observed_at":"2026-08-07T01:33:09.667763Z","submitted_at":"2025-07-22T12:44:38Z","title":"Frontier AI Risk Management Framework in Practice: A Risk Analysis Technical Report","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:14:22.854339Z"},"links":{"cited_paper":"/paper/2505.18807","citing_paper":"/paper/2507.16534"},"observation_digest":"sha256:4f98af55d698c4705539f043355fe5246ca3ba38157c2e649b5aae072480ae0a","observation_id":"50541677-0d41-417a-94bd-ff30d9a909d5","resolution":{"observed_at":"2026-08-06T15:14:22.854339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"cited_work":{"arxiv_id":"2505.18807","doi":"10.48550/arxiv.2505.18807","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18807","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mit- igating deceptive alignment via self-monitoring.arXiv preprint arXiv:2505.18807,","venue":"ArXiv.org","work_id":"2837b9c9-d233-478b-be99-a96ee1ce7743","year":2025},"citing_paper":{"arxiv_id":"2605.30169","last_updated":"2026-07-02T23:58:01Z","snapshot_observed_at":"2026-08-01T18:48:30.510137Z","submitted_at":"2026-05-28T16:20:19Z","title":"Dissociative Identity: Language Model Agents Lack Grounding for Reputation Mechanisms","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-29T00:26:54.019256Z"},"links":{"cited_paper":"/paper/2505.18807","citing_paper":"/paper/2605.30169"},"observation_digest":"sha256:4da51991b30e4f6c800730a9e12acb79db8957e2aa1012ef77c32d862391572f","observation_id":"a6261264-1330-46ef-b544-535ee79766d2","resolution":{"observed_at":"2026-06-29T00:32:53.204147Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"cited_work":{"arxiv_id":"2505.18807","doi":"10.48550/arxiv.2505.18807","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18807","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mit- igating deceptive alignment via self-monitoring.arXiv preprint arXiv:2505.18807,","venue":"ArXiv.org","work_id":"2837b9c9-d233-478b-be99-a96ee1ce7743","year":2025},"citing_paper":{"arxiv_id":"2606.25899","last_updated":"2026-06-24T14:47:47Z","snapshot_observed_at":"2026-07-07T00:00:17.090702Z","submitted_at":"2026-06-24T14:47:47Z","title":"Manipulation Is Task-Dependent: A Multi-Axis, Multi-Environment Evaluation of Frontier LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-25T19:07:05.406391Z"},"links":{"cited_paper":"/paper/2505.18807","citing_paper":"/paper/2606.25899"},"observation_digest":"sha256:fbc094b47a31ab0487e3579a9ffa25d511b14f7d96a7a0b75d78f0f8a0bf3be1","observation_id":"1a36a228-ee59-44e3-8cfa-6360fc35e8dc","resolution":{"observed_at":"2026-07-04T21:00:10.043768Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.18807/citation-record","integrity":"/paper/2505.18807/integrity","json":"/paper/2505.18807/citation-record.json","paper":"/paper/2505.18807"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:18.639986Z","title":"Introducing openai o1-preview","venue":null,"work_id":"860dccf5-321c-494e-953e-ed59deae2bfe","year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:03.992286Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:75e7b4bcaf54c37c9642ae024010089cb208333383a6b2341ba99ac353699083","observation_id":"83677165-82a4-4664-bd97-21887015e19b","resolution":{"observed_at":"2026-08-07T14:30:18.690887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T14:30:04.060422Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:04.060422Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:0676a76c5772d75b79d462acdf2e6a090590c1fe3c54f906a0bd332b892ca6f0","observation_id":"bc6cad5f-5a5d-4302-82d2-65ce6a296a0b","resolution":{"observed_at":"2026-08-07T14:30:04.060422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:04.114784Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:04.114784Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:c2490644f03d01bbc04818772f911e7d3029717732bd6d85aa22898d9f8b076d","observation_id":"51cf49de-8586-462c-bddf-9c41241e9cc2","resolution":{"observed_at":"2026-08-07T14:30:04.114784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19852","last_updated":"2025-04-04T11:14:49Z","snapshot_observed_at":"2026-08-05T20:02:35.087707Z","submitted_at":"2023-10-30T15:52:15Z","title":"AI Alignment: A Comprehensive Survey","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19852","snapshot_observed_at":"2026-08-07T14:30:04.196418Z","title":"Ai alignment: A comprehensive survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:04.196418Z"},"links":{"cited_paper":"/paper/2310.19852","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:235702459f650e2f06dbbce0a092e3b7c5ac453a92df7b97e8f1870804e438e1","observation_id":"09c55401-661d-49d0-848f-bfa1201258ca","resolution":{"observed_at":"2026-08-07T14:30:04.196418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.01820","last_updated":"2021-12-01T11:22:52Z","snapshot_observed_at":"2026-08-01T23:32:03.638122Z","submitted_at":"2019-06-05T04:43:25Z","title":"Risks from Learned Optimization in Advanced Machine Learning Systems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.01820","snapshot_observed_at":"2026-08-07T14:30:04.260470Z","title":"Risks from learned optimization in advanced machine learning systems","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:04.260470Z"},"links":{"cited_paper":"/paper/1906.01820","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:18549265f62a4dec307b33328e51a0731f13fcbf64fe838e6d6218de0536a10a","observation_id":"dc773ee9-4491-4355-afb5-143fe9e19624","resolution":{"observed_at":"2026-08-07T14:30:04.260470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04984","last_updated":"2025-01-14T20:16:01Z","snapshot_observed_at":"2026-07-29T23:20:20.918596Z","submitted_at":"2024-12-06T12:09:50Z","title":"Frontier Models are Capable of In-context Scheming","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04984","snapshot_observed_at":"2026-08-07T14:30:04.319823Z","title":"Frontier models are capable of in-context scheming","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:04.319823Z"},"links":{"cited_paper":"/paper/2412.04984","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:ca6f21adac6bba885c6a7291dca36344132735c8e5ebf7a1985ceff8073e2073","observation_id":"80a65e4f-f2a7-4382-b739-6637b0c24c72","resolution":{"observed_at":"2026-08-07T14:30:04.319823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-07-06T18:00:30.424554Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-07T14:30:04.428012Z","title":"Foundational challenges in assuring alignment and safety of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:04.428012Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:cb9e94fbd19a1702a0054bb990aa9578bd0c2373b6e1ff98ba40b57aeba9d566","observation_id":"0c2bc9d3-9b3a-4bd8-a2df-7f37c0a94918","resolution":{"observed_at":"2026-08-07T14:30:04.428012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12822","last_updated":"2024-12-08T04:06:53Z","snapshot_observed_at":"2026-07-06T19:18:12.969683Z","submitted_at":"2024-09-19T14:50:34Z","title":"Language Models Learn to Mislead Humans via RLHF","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12822","snapshot_observed_at":"2026-08-07T14:30:04.463941Z","title":"Language models learn to mislead humans via rlhf","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:04.463941Z"},"links":{"cited_paper":"/paper/2409.12822","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:54ffaec89dcba79d97e2c3a5848336f8a2fec0d48ab53e6f7156ebce0c01a56a","observation_id":"904a83a5-b850-4e07-b3f5-645ad7b05482","resolution":{"observed_at":"2026-08-07T14:30:04.463941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:04.536207Z","title":"Managing extreme ai risks amid rapid progress","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:04.536207Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:569580e2b34a69ccde9ff0323baf9809d034465b597c74b1b32bdf99caa9f8f1","observation_id":"3bda92d4-c08e-4a48-90b0-53f4e7113efb","resolution":{"observed_at":"2026-08-07T14:30:04.536207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:18.446032Z","title":"Privacy risks of general-purpose language models","venue":null,"work_id":"1bffb7e6-a950-47ff-b294-8854cd9e51cf","year":2020},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:04.735429Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:7991735a448daf885e17f979f6bae4be9637992d05782894c827fd7e6ed96da1","observation_id":"d1c7d851-abb7-46c1-ad89-0635acd982e8","resolution":{"observed_at":"2026-08-07T14:30:18.514680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12140","last_updated":"2024-12-09T15:01:37Z","snapshot_observed_at":"2026-08-06T10:04:05.646150Z","submitted_at":"2024-12-09T15:01:37Z","title":"Frontier AI systems have surpassed the self-replicating red line","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12140","snapshot_observed_at":"2026-08-07T14:30:04.787401Z","title":"Frontier ai systems have surpassed the self-replicating red line","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:04.787401Z"},"links":{"cited_paper":"/paper/2412.12140","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:d7183c5fa7ced40e89130f4f5e346fbb7f3659bba1ce07c28e0104b8b09b4745","observation_id":"098f5cbd-18e0-4689-9dbb-e7359454e794","resolution":{"observed_at":"2026-08-07T14:30:04.787401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-07T14:30:04.868190Z","title":"Alignment faking in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:04.868190Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:7783feab16b82f7d06d593cffb31d6bb48e71912d5319c82bc9613fed09f0bbe","observation_id":"f0b4bd89-2800-4f79-8679-5371b3c50fe4","resolution":{"observed_at":"2026-08-07T14:30:04.868190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T14:30:04.987930Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:04.987930Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:a22d7266dc50a93126ff45c6f6a41c9550a5732dc6b6080dc559a48423386b50","observation_id":"2fa7d15b-f588-41bb-b358-f85bac93806f","resolution":{"observed_at":"2026-08-07T14:30:04.987930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:18.098703Z","title":"Darkbench: Benchmarking dark patterns in large language models","venue":null,"work_id":"7580e43c-4092-42d8-8652-7e2ad929d6ff","year":2025},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:05.047058Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:efed892d90c5d3dc6677fb0ead773d4408fb8306ca41ce7cd081fbe156496ab6","observation_id":"26c081fb-2fb4-4bc7-a133-8512d908309b","resolution":{"observed_at":"2026-08-07T14:30:18.182736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12206","last_updated":"2025-02-16T16:29:20Z","snapshot_observed_at":"2026-08-03T17:52:39.140526Z","submitted_at":"2025-02-16T16:29:20Z","title":"Evaluating the Paperclip Maximizer: Are RL-Based Language Models More Likely to Pursue Instrumental Goals?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12206","snapshot_observed_at":"2026-08-07T14:30:05.120166Z","title":"Evaluating the paperclip maximizer: Are rl-based language models more likely to pursue instrumental goals? arXiv preprint arXiv:2502.12206, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:05.120166Z"},"links":{"cited_paper":"/paper/2502.12206","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:2af7aa3985d783310db1eed30ac46672f9b67de66a23f9c3fb4df8a854888103","observation_id":"40edb399-1f95-4346-86e6-090ebf81128c","resolution":{"observed_at":"2026-08-07T14:30:05.120166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05566","last_updated":"2024-01-17T20:26:01Z","snapshot_observed_at":"2026-07-06T17:14:03.152949Z","submitted_at":"2024-01-10T22:14:35Z","title":"Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05566","snapshot_observed_at":"2026-08-07T14:30:05.188094Z","title":"Sleeper agents: Training deceptive llms that persist through safety training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:05.188094Z"},"links":{"cited_paper":"/paper/2401.05566","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:51f51325ffc433ed25a116cc3e75472e87cfaa57771bd8e1cf329d7c37ae6b97","observation_id":"673ccd70-0688-48b4-b0f3-f48a23bd1dec","resolution":{"observed_at":"2026-08-07T14:30:05.188094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17805","last_updated":"2025-01-29T17:47:36Z","snapshot_observed_at":"2026-08-02T14:12:38.024671Z","submitted_at":"2025-01-29T17:47:36Z","title":"International AI Safety Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17805","snapshot_observed_at":"2026-08-07T14:30:05.234059Z","title":"International ai safety report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:05.234059Z"},"links":{"cited_paper":"/paper/2501.17805","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:37c64938be6f7150e341b47fd9e3a3d27f2818817d9468ec29d6cc5208332040","observation_id":"8d4e3e7a-8f66-4be0-b3fd-1477604c2cd2","resolution":{"observed_at":"2026-08-07T14:30:05.234059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:05.260854Z","title":"Language models don’t always say what they think: Unfaithful explanations in chain-of-thought prompting","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:05.260854Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:0009ec25cb66eca6793785ebf0884db3c810f79d84551f3078fe7b3213d31fe3","observation_id":"8ee0c132-066c-4f33-832b-40e96438b21d","resolution":{"observed_at":"2026-08-07T14:30:05.260854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14521","last_updated":"2025-03-14T19:54:18Z","snapshot_observed_at":"2026-08-05T12:34:30.126951Z","submitted_at":"2025-03-14T19:54:18Z","title":"Policy Frameworks for Transparent Chain-of-Thought Reasoning in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14521","snapshot_observed_at":"2026-08-07T14:30:05.298607Z","title":"Policy frameworks for trans- parent chain-of-thought reasoning in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:05.298607Z"},"links":{"cited_paper":"/paper/2503.14521","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:b4e3bd9c6f16fbd38b5347e26e189898e8bf351d4871b964b16283fe1826bb1f","observation_id":"d9afa334-7493-405b-b63e-a82a78f5d73c","resolution":{"observed_at":"2026-08-07T14:30:05.298607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11926","last_updated":"2025-03-14T23:50:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-14T23:50:34Z","title":"Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11926","snapshot_observed_at":"2026-08-07T14:30:05.384371Z","title":"Monitoring reasoning models for misbehavior and the risks of promoting obfuscation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:05.384371Z"},"links":{"cited_paper":"/paper/2503.11926","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:9004ca08ac91ac0551cca364c9eaa56df694362b8fd1bff1bd78d04f90aae39d","observation_id":"b0e2b95f-069b-4d5f-b70c-6d85580017cf","resolution":{"observed_at":"2026-08-07T14:30:05.384371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17419","last_updated":"2025-06-25T02:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-24T18:50:52Z","title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17419","snapshot_observed_at":"2026-08-07T14:30:05.477915Z","title":"From system 1 to system 2: A survey of reasoning large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:05.477915Z"},"links":{"cited_paper":"/paper/2502.17419","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:b13a5a8a1a024b1aae9ed37a2afe29e8d27d8fb7986ec2cd2ce33e3da5ab99ea","observation_id":"bea15da7-e936-4cbd-84b6-7fe78ea1b9a9","resolution":{"observed_at":"2026-08-07T14:30:05.477915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:05.595053Z","title":"Markov decision processes: discrete stochastic dynamic programming","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:05.595053Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:8df49957d2ff6ef130bf8569d1db640c95b49a6ab6f880ef2d71b957e826c79b","observation_id":"e12a21ad-c180-41f2-a85f-4a0d1874be96","resolution":{"observed_at":"2026-08-07T14:30:05.595053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:05.716513Z","title":"Reinforcement learning: An introduction, volume 1","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:05.716513Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:f6ea3090f750fc7cbc938e3ddb4864b40cf70336da21cb3e2c74b21a977cbcc3","observation_id":"8694ca25-0e87-4150-a6e4-bd758a5fc61b","resolution":{"observed_at":"2026-08-07T14:30:05.716513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:05.874104Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:05.874104Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:b53db315bea51f33a500dfbc0272906d7f5cd57ebfafcf17559af0fcc0959177","observation_id":"02639ee0-cd8c-40c4-8bb0-31684ae7ceef","resolution":{"observed_at":"2026-08-07T14:30:05.874104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:05.978324Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:05.978324Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:29be91ebd84d2775ef7fc2afd2fe3ec5b5061c57e53e4a6ac4d861aa0bd8426b","observation_id":"7e9cdb46-9f25-447e-ad2f-6c6f25721ab5","resolution":{"observed_at":"2026-08-07T14:30:05.978324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:17.810038Z","title":"Handbook of constraint programming","venue":null,"work_id":"d0be104c-bbc8-48a0-a38c-aa90357e4de3","year":2006},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:06.196688Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:f05d0a7a582a1cf79719cd5b9ff13a5319e1172b4fe17cf83c9469a1e1a083fa","observation_id":"1cb8ea0a-c44f-461f-a6cc-02ebeb23f7bc","resolution":{"observed_at":"2026-08-07T14:30:17.898223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:06.349381Z","title":"Defining and characterizing reward gaming","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:06.349381Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:a592049c708a936ef61a99f505524b91e49bd5340a40e41dd42b732a8afde8f2","observation_id":"c4c02e54-93f3-4779-a680-44c8d90d28b3","resolution":{"observed_at":"2026-08-07T14:30:06.349381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:06.469580Z","title":"Cooperative inverse reinforcement learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:06.469580Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:66df49c025a5f3f86cd92a1520480a29fde0aaf404fec1e0b3bc0f12a7e725fb","observation_id":"bbc388a2-87a0-4fde-9edf-57ab6eb42b11","resolution":{"observed_at":"2026-08-07T14:30:06.469580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.05358","last_updated":"2025-03-22T02:05:56Z","snapshot_observed_at":"2026-07-06T19:12:19.677411Z","submitted_at":"2024-09-09T06:39:56Z","title":"BAMDP Shaping: a Unified Framework for Intrinsic Motivation and Reward Shaping","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.05358","snapshot_observed_at":"2026-08-07T14:30:06.590347Z","title":"Bamdp shaping: a unified theoretical framework for intrinsic motivation and reward shaping","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:06.590347Z"},"links":{"cited_paper":"/paper/2409.05358","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:26bf9f631b9586184908c180e3bb4b6c04c785ccc6b152962b8e9234f1424f7b","observation_id":"d808a0c0-e5fe-4fb5-a4aa-514fa1f54ebb","resolution":{"observed_at":"2026-08-07T14:30:06.590347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:17.597317Z","title":"Defin- ing deception in decision making","venue":null,"work_id":"ea1a27dc-4966-4061-8c3d-fa330e33153e","year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:06.693263Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:c2fc095f4ca46fd03c150193203a46a237d73bff591b2fcdba7ac9b35cdd1e44","observation_id":"86531776-8121-4847-a77f-a686ddc8d381","resolution":{"observed_at":"2026-08-07T14:30:17.681852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:17.365030Z","title":"Machine behaviour","venue":null,"work_id":"33b884d6-7cec-4969-bf09-147ae0ea4cef","year":2019},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:06.789717Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:7224a2c082417a27069609d85461b99dab32201a20be006a9cede0908f9cf6a3","observation_id":"ad4c6467-25ae-475c-adb0-b0f148400b61","resolution":{"observed_at":"2026-08-07T14:30:17.491130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:06.923371Z","title":"The off-switch game","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:06.923371Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:5abfc46698cc895f02ae85f1d10812567a55db6a11a9f7b47e2f737cf13a4e7f","observation_id":"6c98cc28-959e-44be-825c-ae5533d4ef4f","resolution":{"observed_at":"2026-08-07T14:30:06.923371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:07.044879Z","title":"Comparison of the predicted and observed secondary structure of t4 phage lysozyme","venue":null,"work_id":null,"year":1975},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:07.044879Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:17dc201da25f66819d506535dbb7d06770d1b634941a8fe5798485503e9c7df5","observation_id":"9bf5cbbd-9f3b-430e-9c08-8eb0167ba75e","resolution":{"observed_at":"2026-08-07T14:30:07.044879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:17.054182Z","title":"Ai deception: A survey of examples, risks, and potential solutions","venue":null,"work_id":"dbad7b88-82bc-4c3c-b113-1d929953f506","year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:07.150812Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:f600207aedcf0b8bc1c20f082d1c7e16150cfb03133f24325c8ecddc47cd6bb6","observation_id":"8ed211ab-159a-4316-92c1-6b1f540e8132","resolution":{"observed_at":"2026-08-07T14:30:17.165031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09251","last_updated":"2022-12-19T05:13:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-19T05:13:52Z","title":"Discovering Language Model Behaviors with Model-Written Evaluations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09251","snapshot_observed_at":"2026-08-07T14:30:07.287960Z","title":"Discovering language model behaviors with model-written evaluations","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:07.287960Z"},"links":{"cited_paper":"/paper/2212.09251","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:8231df921dc6929ec978c0f0a936a598825eb2b4201075694aecce5893eae756","observation_id":"d31cd9fc-fdc5-4c26-9a4d-7a62511ab327","resolution":{"observed_at":"2026-08-07T14:30:07.287960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:16.852239Z","title":"Deception abilities emerged in large language models","venue":null,"work_id":"b6e68bf3-82f3-4488-8657-ef0e489987e6","year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:07.410071Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:364dde177f8c650724707fc94bc8074b1c6f9b39f947abc7ac7ea0bbdd7472cd","observation_id":"685d6827-be15-4b6c-84e1-37ea8a7cc513","resolution":{"observed_at":"2026-08-07T14:30:16.932491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:07.532498Z","title":"Opendeception: Benchmarking and investigating ai deceptive behaviors via open-ended interaction simulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:07.532498Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:21e38506ea839a7b4b0eda2512c9e00cec3240db5345526d8cea699f0d1c87f8","observation_id":"8b5604c4-b415-429d-9b2f-96d25e8a2650","resolution":{"observed_at":"2026-08-07T14:30:07.532498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:07.579875Z","title":"The mask benchmark: Disentangling honesty from accuracy in ai systems","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:07.579875Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:cb4e566358b6bcbd66c8f49ed8c20ad6a9ab3d8c156ea13e855aa90aed1bc36f","observation_id":"7c515169-f120-4524-803e-06527d6e6a72","resolution":{"observed_at":"2026-08-07T14:30:07.579875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07358","last_updated":"2025-02-06T20:58:43Z","snapshot_observed_at":"2026-08-06T05:53:39.626163Z","submitted_at":"2024-06-11T15:26:57Z","title":"AI Sandbagging: Language Models can Strategically Underperform on Evaluations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07358","snapshot_observed_at":"2026-08-07T14:30:07.610336Z","title":"Ai sandbagging: Language models can strategically underperform on evaluations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:07.610336Z"},"links":{"cited_paper":"/paper/2406.07358","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:fc1149fd67d4b9c9d4177df56ba01273bfcb6be9d55c0989e09eacd0cbce86d8","observation_id":"7d88fc10-a4fe-4c1c-ba7e-dbd916a8a361","resolution":{"observed_at":"2026-08-07T14:30:07.610336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:07.652785Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:07.652785Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:2ee4da63219b3986625a9371b53ce963553cc50a645afa50926dc5d284428616","observation_id":"dd02a31d-0f35-4579-9b8f-5b8b097f32bb","resolution":{"observed_at":"2026-08-07T14:30:07.652785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:16.114088Z","title":null,"venue":null,"work_id":"416c545c-ab86-4ec0-b123-06a3e95739ef","year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:07.736203Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:63c2731407d3fc1c1434686fefcf86acaf9c478c306738908bd59bdfc183ec34","observation_id":"9a4bb438-6855-4973-90bc-3a8d6ef00006","resolution":{"observed_at":"2026-08-07T14:30:16.411365Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T14:30:07.823125Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:07.823125Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:65ed933176596a65f995eabe60933d19a093368a0e88dcfe2d1409ae8113bc03","observation_id":"ac63f8ae-d62e-4aaf-a772-6abce6e67dea","resolution":{"observed_at":"2026-08-07T14:30:07.823125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T14:30:07.921367Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:07.921367Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:57b7d17a821c57cf5d17763bb8b48721695364f765a80d0fa76f57a89330b9b4","observation_id":"2e534c1d-7c36-4336-8cc4-2b002bfe056f","resolution":{"observed_at":"2026-08-07T14:30:07.921367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:15.851272Z","title":"Claude 3","venue":null,"work_id":"3dd3e6ba-98bc-4fec-a76e-fa0399bde14a","year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:07.983269Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:c38dfb41cf1ad86b51f3d05cdc675a25e5179b05acb0e2dd31c9bab32ebf61ec","observation_id":"c22dd63e-af11-4ad2-b88f-6ea63dee549f","resolution":{"observed_at":"2026-08-07T14:30:15.968293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T14:30:08.031978Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:08.031978Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:9e6d6691829d839e0c9d4254759949ffcce4a7127a90f4c6b1bdb3efd0b3e991","observation_id":"650038e4-2c1c-4935-9d89-d919d8f4e149","resolution":{"observed_at":"2026-08-07T14:30:08.031978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:15.682617Z","title":"Learning to reason with llms","venue":null,"work_id":"334d3d0d-7676-4a75-bc90-667de4677ccf","year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:08.070454Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:86def30d9f34ae79744df73432c8c3d059a487a9897449faf0a1bdf534c72fae","observation_id":"1bb9ac23-60fb-4b1e-91d0-09e9e5697d2a","resolution":{"observed_at":"2026-08-07T14:30:15.760571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10260","last_updated":"2024-08-27T03:32:47Z","snapshot_observed_at":"2026-08-04T21:32:35.483431Z","submitted_at":"2024-02-15T18:58:09Z","title":"A StrongREJECT for Empty Jailbreaks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10260","snapshot_observed_at":"2026-08-07T14:30:08.125239Z","title":"A strongreject for empty jailbreaks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:08.125239Z"},"links":{"cited_paper":"/paper/2402.10260","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:ca540dfe0ec171fec3eb8b0f6b28f2e833f932ef447567d9c5ec266ec3567127","observation_id":"26d25d22-bf8b-4db2-b18a-26c2de8171b7","resolution":{"observed_at":"2026-08-07T14:30:08.125239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08419","snapshot_observed_at":"2026-08-07T14:30:08.164673Z","title":"Jailbreaking black box large language models in twenty queries","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:08.164673Z"},"links":{"cited_paper":"/paper/2310.08419","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:c270561f6011b66ff4555b685035e02e298e3572518911a50c29d79175a7f381","observation_id":"a0fed44a-7184-4cd2-8445-b67569db6ca0","resolution":{"observed_at":"2026-08-07T14:30:08.164673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:08.215835Z","title":"How johnny can persuade llms to jailbreak them: Rethinking persuasion to challenge ai safety by humanizing llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:08.215835Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:2f0dbb332a46f0f7b24aaba5c43b9ec6c6856712016c2e9f4c8a1e8f2ad6bddc","observation_id":"7e02df15-0093-4537-846e-9a9121732df3","resolution":{"observed_at":"2026-08-07T14:30:08.215835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:08.261749Z","title":"Towards evaluating the robustness of neural networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:08.261749Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:1780af156f9a64a21b628e7ceb1a18f00d76502b140d0d7c99d9f9d5c3a73216","observation_id":"48f8a6d5-94b4-4ccf-a350-a4e7af0ace1c","resolution":{"observed_at":"2026-08-07T14:30:08.261749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05946","last_updated":"2024-06-10T00:35:23Z","snapshot_observed_at":"2026-07-06T18:27:54.379381Z","submitted_at":"2024-06-10T00:35:23Z","title":"Safety Alignment Should Be Made More Than Just a Few Tokens Deep","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05946","snapshot_observed_at":"2026-08-07T14:30:08.313927Z","title":"Safety alignment should be made more than just a few tokens deep","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:08.313927Z"},"links":{"cited_paper":"/paper/2406.05946","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:28a7ceeb7c59a4d85eae2043423ccb2a66ee4bb631a5a3dfec0bd0436071944d","observation_id":"c2cab175-f615-481b-ba71-1124f375c68e","resolution":{"observed_at":"2026-08-07T14:30:08.313927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-08-07T14:30:08.351856Z","title":"Jailbreakbench: An open robustness benchmark for jailbreaking large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:08.351856Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:c810924fcb1ba7cdf74135af128ccf525e6b5ff98aa2e621aafd7163f84b700d","observation_id":"fda382d3-d322-45a7-b5c5-00d39135fdbc","resolution":{"observed_at":"2026-08-07T14:30:08.351856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06674","last_updated":"2023-12-07T19:40:50Z","snapshot_observed_at":"2026-07-06T17:00:00.321552Z","submitted_at":"2023-12-07T19:40:50Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06674","snapshot_observed_at":"2026-08-07T14:30:08.405155Z","title":"Llama guard: Llm-based input-output safeguard for human-ai conversations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:08.405155Z"},"links":{"cited_paper":"/paper/2312.06674","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:e7aecc0f6a434122c605d34d4fd285b369d46fb19a17e3e503d4b06905737636","observation_id":"533de5ff-de66-4a20-bafc-ba2d1bba421f","resolution":{"observed_at":"2026-08-07T14:30:08.405155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:18.283898Z","title":"Beavertails: Towards improved safety alignment of llm via a human-preference dataset","venue":null,"work_id":"1190b97a-087e-4d64-81e6-4cc878d09a3d","year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:08.488491Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:67e4a3c519f53eb4ea5938d5decb6d8962eddb14deb19afcbf6ca84cb0be3aa8","observation_id":"6ea2b524-9826-4f34-b090-b916f1f22b6b","resolution":{"observed_at":"2026-08-07T14:30:18.366017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12025","last_updated":"2025-02-17T16:57:56Z","snapshot_observed_at":"2026-08-03T19:45:16.676191Z","submitted_at":"2025-02-17T16:57:56Z","title":"SafeChain: Safety of Language Models with Long Chain-of-Thought Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12025","snapshot_observed_at":"2026-08-07T14:30:08.592130Z","title":"Safechain: Safety of language models with long chain-of-thought reasoning capabilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:08.592130Z"},"links":{"cited_paper":"/paper/2502.12025","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:d034fc62f073bd1a0e8326036a045fb847df5bd3b67d22ff31e382f58a9ab630","observation_id":"d66ec9ff-2935-4e0f-b5a2-1b45b0df9e93","resolution":{"observed_at":"2026-08-07T14:30:08.592130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:08.656029Z","title":"Star-1: Safer alignment of reasoning llms with 1k data","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:08.656029Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:640d4b3ba080236158a5bcdda3c1529d109a3c43d849165b441e380fb686f8ea","observation_id":"99bc8ee5-75f0-47a8-901b-81b7d3569418","resolution":{"observed_at":"2026-08-07T14:30:08.656029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09662","last_updated":"2023-08-30T10:21:00Z","snapshot_observed_at":"2026-08-06T17:01:00.147032Z","submitted_at":"2023-08-18T16:27:04Z","title":"Red-Teaming Large Language Models using Chain of Utterances for Safety-Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09662","snapshot_observed_at":"2026-08-07T14:30:08.770366Z","title":"Red-teaming large language models using chain of utterances for safety-alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:08.770366Z"},"links":{"cited_paper":"/paper/2308.09662","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:e43926fc06a93d4782b6292c559d2725a7cf308d756fb87471a60cac46829e1d","observation_id":"46f8839c-2343-4faa-a81c-bff59ebf220b","resolution":{"observed_at":"2026-08-07T14:30:08.770366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:15.300834Z","title":"Ultrafeedback: Boosting language models with high-quality feedback, 2023","venue":null,"work_id":"9f276cef-1049-435c-9b0c-ccf67f44abb9","year":2023},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:08.879503Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:35d6a0fe4f8015823ed5a3279a8f1190c2c24702d47b78297b37ae8e5bb5d48d","observation_id":"8cc94936-efae-4f41-aa47-78820d0edf70","resolution":{"observed_at":"2026-08-07T14:30:15.472718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:08.994148Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:08.994148Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:a11cdc03bd0596c97892b2a10dd436dbc5d292a224208715b207b0a41e51eff3","observation_id":"3497f84f-f0a4-42cb-9109-81ca5c60952d","resolution":{"observed_at":"2026-08-07T14:30:08.994148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:09.107586Z","title":"Constrained Markov decision processes","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:09.107586Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:88ac19e97868ff0a46407260fb07acfc68dd2f1e26308cef304e067c8aecb34d","observation_id":"c3430b97-bf70-4334-aa64-08557737abde","resolution":{"observed_at":"2026-08-07T14:30:09.107586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:15.042835Z","title":"mesa-objective","venue":null,"work_id":"c6a7ae9c-f883-45d8-8117-4d6c35a792dc","year":2013},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:09.224633Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:d3bef76f5d845220a8cadeb4cce078275b79b6cf260ee7d574aa8545e706aa6f","observation_id":"8e7d481e-0a70-48e3-945c-2d83ececa2f4","resolution":{"observed_at":"2026-08-07T14:30:15.114338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:14.932627Z","title":null,"venue":null,"work_id":"b2bf321d-fe2f-4055-b4f1-b9f4e1617dff","year":null},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:09.307384Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:3eec7736324cd74d7657c1a913dee028fc94979382f5aed2c4cebfb15953634f","observation_id":"7500718a-9539-4b1a-a869-0c1a98a9e116","resolution":{"observed_at":"2026-08-07T14:30:15.002661Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:14.760016Z","title":null,"venue":null,"work_id":"6e3f3fb6-c6d4-4059-b39a-636f23a05946","year":null},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:09.414613Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:b766aaafc7ee9ce772ec36987538ddb55cd58755aa7de305c412765fd9d4eac0","observation_id":"ba78bc72-891b-45c9-b232-1101adb05da0","resolution":{"observed_at":"2026-08-07T14:30:14.833649Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:14.603909Z","title":null,"venue":null,"work_id":"48cd75b5-86a8-43d2-9b9c-2a34252a0f4e","year":null},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:09.530070Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:5b9e06321bdc05dfe88d78c2082e9ec791cb11f542553d5cc78252435f1fbd81","observation_id":"f69279a8-86bb-4350-a036-2c587f32de1c","resolution":{"observed_at":"2026-08-07T14:30:14.666887Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:14.402815Z","title":null,"venue":null,"work_id":"0bace114-757a-4b9f-ba5b-4ebda81ffd1e","year":null},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:09.647676Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:5b89d497981db984a025fb621dc0fe3d3d086d2537cc3440896d1660342f73b1","observation_id":"f4bc6367-5801-4399-b33f-207e1df98019","resolution":{"observed_at":"2026-08-07T14:30:14.481276Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:14.257299Z","title":null,"venue":null,"work_id":"61a1763b-5acd-4838-af8e-6d2e6288e53a","year":null},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:09.759525Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:aaa4f0e85035a8b7bceab850e4b655f59c4a0fb51f92c16b88f01ef6fb064310","observation_id":"8d054452-f45a-408d-b5a9-3fb0db8c3546","resolution":{"observed_at":"2026-08-07T14:30:14.329443Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:14.119070Z","title":"chain of thought","venue":null,"work_id":"8436ecb2-5f7a-45ba-a464-8985bbab2fb9","year":null},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:09.835403Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:3467b826ceea32f675d9e6dfbe9ac16bec38120302d6a229c4bdb7c9ca1ea4f2","observation_id":"a8545292-e801-46c7-a6ae-6b221bbfeaab","resolution":{"observed_at":"2026-08-07T14:30:14.164721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:13.983762Z","title":null,"venue":null,"work_id":"19edaae8-ba74-4dca-b38b-bfd95b232849","year":null},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:09.909809Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:9aab5951104c20f3a2f6da29d5accbaa8717e2c4524112f9c08a6b069ee1ac4c","observation_id":"020d917c-44c9-46fe-83de-b2d4b7f006bf","resolution":{"observed_at":"2026-08-07T14:30:14.045298Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:13.814059Z","title":null,"venue":null,"work_id":"34bbe3e8-2925-4900-8a72-2470bcf6de9d","year":null},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:09.990697Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:6a8a7a4d8fab0d90176d98006fd7bbefcc835b98ad0e661fd8d654e92f1670e2","observation_id":"d2c28ae8-476c-411b-9ac3-81a609db852d","resolution":{"observed_at":"2026-08-07T14:30:13.876029Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:13.634207Z","title":null,"venue":null,"work_id":"43e049be-8cb4-4f63-b186-1080aae55864","year":null},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:10.093726Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:e83bc2b14bc8a053a33bce049501e7f1278225cd2a9faed0d7df196530366cdc","observation_id":"7cfbc82d-51ea-4249-946d-ed8460f0c9e9","resolution":{"observed_at":"2026-08-07T14:30:13.685770Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:13.485969Z","title":null,"venue":null,"work_id":"08d74a26-984e-45b6-aeff-6cb8368de3cc","year":null},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:10.210110Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:91679f11c10991fdba3c909c18f43d8995b48a12c0a0c6f04737f2c10a07ed69","observation_id":"1cc208bf-4559-4220-9bdb-d0766d879914","resolution":{"observed_at":"2026-08-07T14:30:13.546728Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:13.294295Z","title":"chain of thought","venue":null,"work_id":"9e8dd3ca-fceb-4f7a-bdb9-f0c9ba4f70d5","year":null},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:10.257073Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:0bff2bf3898f8c7f65013a896e54d697ea66225408c6a0b0d28b71166240ee75","observation_id":"1b4e8e1a-66d9-46c1-b32c-f320f8076147","resolution":{"observed_at":"2026-08-07T14:30:13.355400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:13.163143Z","title":null,"venue":null,"work_id":"e17f1ab4-959a-4151-b8b0-e8000b5801ba","year":null},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:10.307652Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:a1c5359d4641fbfc1a5593edcc65dad57cb8a5c7fc91b52f054ed14d56cddd29","observation_id":"5eed0c7b-3a3a-40ed-8223-09aeb0fcf508","resolution":{"observed_at":"2026-08-07T14:30:13.215196Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:13.014729Z","title":null,"venue":null,"work_id":"ae959398-c90f-42cb-bb96-cb773479b117","year":null},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:10.357905Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:bbf6b06f73c3224298420bc24b2929f6c50ce2395c3f67411055281267058040","observation_id":"19fc4678-13dd-486c-9473-277dcab5fab2","resolution":{"observed_at":"2026-08-07T14:30:13.067265Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:12.894475Z","title":null,"venue":null,"work_id":"44980f80-f9e2-4190-8fb5-b25ef600af75","year":null},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:10.423911Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:cf2105d949ef43b4ae46f52a3642c1164960ee60399924cc947a8dabb05f0d66","observation_id":"084a442c-29f4-4fd5-a99b-dba0cb5a1841","resolution":{"observed_at":"2026-08-07T14:30:12.949466Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:12.693030Z","title":"This must be distinguished from uninten- tional inaccuracies arising from simple technical errors, knowledge limitations, or inherent capability gaps","venue":null,"work_id":"48f34a78-f2d0-4da7-a4cb-99b80073d40b","year":null},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:10.489562Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:ee12d0318cf4508c11d4aeab1df0bf09c158314e277356a263c2b1a621dc5d4e","observation_id":"09e40250-bbb1-4fb8-a9a8-4ca82c464cd5","resolution":{"observed_at":"2026-08-07T14:30:12.786270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:12.546726Z","title":null,"venue":null,"work_id":"af24efde-6a9b-48f4-92a0-6ec3f18f2a68","year":null},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:10.573425Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:411396efcf9c2a9dcedb6f024067025c07a2e41dea025c8bf826b102565de105","observation_id":"98d2a5ca-503b-499b-ad09-3135902eba66","resolution":{"observed_at":"2026-08-07T14:30:12.611103Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:12.381052Z","title":"It requires a comprehensive analysis that incorporates the specific question posed by the user, the settings of the interaction scenario, and the full context of the dialogue","venue":null,"work_id":"1a5f4e14-b395-4ba6-925d-8c39f3a4e275","year":null},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:10.650614Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:337daea8c541d9a44e7cd2dd2bc7170818067c11f2376a16894860cf27d8dfd7","observation_id":"00734278-e006-4fce-8747-3ecf4e28ab9c","resolution":{"observed_at":"2026-08-07T14:30:12.449721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:12.219819Z","title":null,"venue":null,"work_id":"51a0e80a-6678-4f98-9d07-64abf334ef70","year":null},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:10.736577Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:9d13603ffb935e2521df6580d5d7114aef2a3bcaf6b66f638e9900481e81b4f3","observation_id":"237cd224-9547-4065-9e3a-d51b130ed1a0","resolution":{"observed_at":"2026-08-07T14:30:12.282860Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:12.018299Z","title":null,"venue":null,"work_id":"017f4802-5c88-4d4d-836f-a793b33b9f65","year":null},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:10.795238Z"},"links":{"citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:6d274cacb4caaac5e9744389c819823444e3255eb98722e894ec21a88b7d3cc2","observation_id":"aafde672-fa70-42af-b05d-3cd87a1c3c64","resolution":{"observed_at":"2026-08-07T14:30:12.111009Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T14:23:04.385764Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring"},"reference_resolution":{"displayed":80,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":63,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":80},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 80 of 80 outbound references and 3 inbound Pith citation observations for arXiv:2505.18807."}