{"as_of":"2026-08-11T01:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5fa8149311fe707920dc8934320f6e533d4f1b78fa2d4900bec83ebdc106e3e9","coverage":[{"denominator":86,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":86,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T22:50:11.846863Z","state":"measured"},{"denominator":186,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":186,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":148,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:24:10.111171Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":20,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-10T21:24:10.111171Z","title":"Bowman, and Evan Hubinger","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04952","last_updated":"2025-01-09T03:59:10Z","snapshot_observed_at":"2026-08-10T21:19:04.243505Z","submitted_at":"2025-01-09T03:59:10Z","title":"Open Problems in Machine Unlearning for AI Safety","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-10T21:24:10.111171Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2501.04952"},"observation_digest":"sha256:097819569587034a9f3e0c5863ba7c0b24ed3f37666fc380e4bb9e9391902c8a","observation_id":"0b9d4a02-d66c-4a46-8d4d-d5dd8d57669c","resolution":{"observed_at":"2026-08-10T21:24:10.111171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-10T20:32:31.271727Z","title":"Daniel Kokotajlo and Abram Demski","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08156","last_updated":"2025-07-15T17:27:07Z","snapshot_observed_at":"2026-08-10T20:27:11.560658Z","submitted_at":"2025-01-14T14:31:45Z","title":"Are DeepSeek R1 And Other Reasoning Models More Faithful?","version":5},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T20:32:31.271727Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2501.08156"},"observation_digest":"sha256:ead87fbf0603be2eb01e3a25006d35ea25691d7796a7e05acb3a692e85a53faa","observation_id":"5d35afe5-5ff5-4306-b03d-a8e512f4ffd5","resolution":{"observed_at":"2026-08-10T20:32:31.271727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-10T12:46:26.573249Z","title":"Alignment faking in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16513","last_updated":"2025-01-30T08:00:14Z","snapshot_observed_at":"2026-08-10T21:30:49.585704Z","submitted_at":"2025-01-27T21:26:37Z","title":"Deception in LLMs: Self-Preservation and Autonomous Goals in Large Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T12:46:26.573249Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2501.16513"},"observation_digest":"sha256:e536c8290e4e49748ca09e330057fb0fa134527b18fb8d44ff26ba47c9a45efe","observation_id":"ee179f22-1a1f-491e-a2dd-ee0369f1baf9","resolution":{"observed_at":"2026-08-10T12:46:26.573249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":194,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:dbbc4280b53aa0b1883e3019ab5e5a736b49f454e554ae8b2c1e37ec3f27752d","observation_id":"dd402023-15c8-4c36-8862-dbcc1e0254af","resolution":{"observed_at":"2026-05-23T04:42:34.117524Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-08T21:06:55.861230Z","title":"Alignment faking in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.861230Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:eadddc824e5523ee82fb80f9f7e6cc92ac884e9252f803dd8911580690e1fa48","observation_id":"0187d06a-8394-441e-9bb2-d9e927e54d26","resolution":{"observed_at":"2026-08-08T21:06:55.861230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-08T15:06:54.921165Z","title":"Bowman, and Evan Hubinger","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06559","last_updated":"2025-05-25T23:36:47Z","snapshot_observed_at":"2026-08-08T23:28:10.897343Z","submitted_at":"2025-02-10T15:25:06Z","title":"Can We Trust AI Benchmarks? An Interdisciplinary Review of Current Issues in AI Evaluation","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T15:06:54.921165Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2502.06559"},"observation_digest":"sha256:ebe88f44ed44dcd47fd2c7be44ffdb463c11855596d686b4ab68eed07e1a5e1e","observation_id":"9ba3440b-6225-41f8-a049-d9647f762fcf","resolution":{"observed_at":"2026-08-08T15:06:54.921165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-08T05:42:43.455240Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.455240Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:588ac9460646ebd3d9285e07017832635f892eb2926b959ae21243e4e8ae798b","observation_id":"ce3383a2-b24b-4810-8809-72e57343aa76","resolution":{"observed_at":"2026-08-08T05:42:43.455240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-07T22:21:52.543685Z","title":"Alignment faking in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09192","last_updated":"2025-05-27T17:24:38Z","snapshot_observed_at":"2026-08-08T23:01:32.478617Z","submitted_at":"2025-02-13T11:32:09Z","title":"Thinking beyond the anthropomorphic paradigm benefits LLM research","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T22:21:52.543685Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2502.09192"},"observation_digest":"sha256:2125ca1d723fcd0cac60c36bde0e7f0b127320cc23a4858bf5609f8999bf642c","observation_id":"cd6e4449-2652-4cb2-b689-4367a596cb08","resolution":{"observed_at":"2026-08-07T22:21:52.543685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2503.02574","last_updated":"2026-05-18T17:54:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-04T12:55:07Z","title":"LLM-Safety Evaluations Lack Robustness","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-23T01:26:45.402983Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2503.02574"},"observation_digest":"sha256:fb735d33a5546d4e218833a6b3023087c62e0d3bc09618ef6bd3a7aec010f576","observation_id":"5b00a9ff-4b69-4aa3-a00c-2549a22f9575","resolution":{"observed_at":"2026-05-23T01:27:21.208150Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2503.11926","last_updated":"2025-03-14T23:50:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-14T23:50:34Z","title":"Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-21T07:24:12.845841Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2503.11926"},"observation_digest":"sha256:3bc9731cc6a771162865549e2dcb5c10b68b0620a3534bdff76654fe4990cb5f","observation_id":"80582fed-e991-453c-a827-de1496e18e17","resolution":{"observed_at":"2026-05-21T07:24:13.018165Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-07T15:43:31.745601Z","title":"Bowman, and Evan Hubinger","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-10T11:42:24.241468Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:31.745601Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:3f061a09c4b02888b1924b91aa37d59bbf5e88d5ba1dc04230318b462aabac6a","observation_id":"baccc249-5cf1-47a5-9688-517136c1f0f1","resolution":{"observed_at":"2026-08-07T15:43:31.745601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-07T15:40:06.156563Z","title":"Alignment faking in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14352","last_updated":"2025-05-20T13:36:37Z","snapshot_observed_at":"2026-08-07T20:48:07.578201Z","submitted_at":"2025-05-20T13:36:37Z","title":"Towards eliciting latent knowledge from LLMs with mechanistic interpretability","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T15:40:06.156563Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2505.14352"},"observation_digest":"sha256:9eeebb6038de48efac893592c6fc112ca09f93f44fb7893f11ff561a398a2f46","observation_id":"b5635376-a01a-460b-8ad0-e949039a0f6c","resolution":{"observed_at":"2026-08-07T15:40:06.156563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-07T15:36:24.998756Z","title":"Alignment faking in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14633","last_updated":"2025-05-20T17:24:09Z","snapshot_observed_at":"2026-08-10T18:42:54.522045Z","submitted_at":"2025-05-20T17:24:09Z","title":"Will AI Tell Lies to Save Sick Children? Litmus-Testing AI Values Prioritization with AIRiskDilemmas","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:24.998756Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2505.14633"},"observation_digest":"sha256:d3efc88251e74c801a49ab7b6cbc9db0cc940f4e26331216f2d2a99395d1d4b4","observation_id":"dc4901ad-9250-41bf-956b-5a445a180bd3","resolution":{"observed_at":"2026-08-07T15:36:24.998756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-07T14:41:39.815422Z","title":"Bowman, and Evan Hubinger","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18003","last_updated":"2025-05-23T15:06:21Z","snapshot_observed_at":"2026-08-09T18:43:59.721879Z","submitted_at":"2025-05-23T15:06:21Z","title":"An Example Safety Case for Safeguards Against Misuse","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T14:41:39.815422Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2505.18003"},"observation_digest":"sha256:136d9e29caeae548535a5be7837f39bb46d302335b866904b387e3a3cc4277c4","observation_id":"001444e2-1725-41ad-ac4d-8119978ad9cc","resolution":{"observed_at":"2026-08-07T14:41:39.815422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-07T14:30:04.868190Z","title":"Alignment faking in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-08T01:20:21.986624Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:04.868190Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:4a4e9a5a6175c73bc1849d0864ce508334887ffdf0530e388dfeb5ec794f2296","observation_id":"f0b4bd89-2800-4f79-8679-5371b3c50fe4","resolution":{"observed_at":"2026-08-07T14:30:04.868190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-07T14:22:55.562662Z","title":"Greenblatt, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19212","last_updated":"2026-07-24T14:18:32Z","snapshot_observed_at":"2026-08-10T00:32:01.048016Z","submitted_at":"2025-05-25T16:19:24Z","title":"When Ethics and Payoffs Diverge: LLM Agents in Morally Charged Social Dilemmas","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:55.562662Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2505.19212"},"observation_digest":"sha256:6a2ec063a90200f2c3d425c82e40d3d292dfdfa247b64671e197ce5c0d150cf6","observation_id":"e4566718-428b-43af-ba59-90a81a6b5e01","resolution":{"observed_at":"2026-08-07T14:22:55.562662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-07T14:13:50.292007Z","title":"Alignment faking in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:50.292007Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:639aa23ea320f18604475c8968c1d115e67a443e43c667e945fdf156f55d2ea5","observation_id":"26fc7304-851a-4c7a-900c-837a097bee99","resolution":{"observed_at":"2026-08-07T14:13:50.292007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-07T11:14:36.721816Z","title":"R., and Hubinger, E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03056","last_updated":"2025-06-03T16:36:03Z","snapshot_observed_at":"2026-08-07T11:07:13.367070Z","submitted_at":"2025-06-03T16:36:03Z","title":"Corrigibility as a Singular Target: A Vision for Inherently Reliable Foundation Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T11:14:36.721816Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2506.03056"},"observation_digest":"sha256:c4e851b00a85e3166c8006710a29ed3f02eeb242fece8f0807aebdc07b69271b","observation_id":"a967a54a-c237-46d4-a101-f932c35d28c7","resolution":{"observed_at":"2026-08-07T11:14:36.721816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-07T11:11:40.310964Z","title":"Alignment faking in large language models.arXiv preprint arXiv:2412.14093, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03350","last_updated":"2025-06-03T19:43:58Z","snapshot_observed_at":"2026-08-10T20:18:21.272344Z","submitted_at":"2025-06-03T19:43:58Z","title":"Adversarial Attacks on Robotic Vision Language Action Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:40.310964Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2506.03350"},"observation_digest":"sha256:0fe88127810d43a0ca7a71d6c1ddfdd3de0ab88a6434b49439a7a09632e446c4","observation_id":"2c9b4ea0-f4f4-4e86-938a-730a22d769cc","resolution":{"observed_at":"2026-08-07T11:11:40.310964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-07T11:00:30.021180Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03755","last_updated":"2025-06-04T09:22:37Z","snapshot_observed_at":"2026-08-08T01:34:30.382923Z","submitted_at":"2025-06-04T09:22:37Z","title":"Misalignment or misuse? The AGI alignment tradeoff","version":1},"reference_index":437,"source":"pdf_text","source_observed_at":"2026-08-07T11:00:30.021180Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2506.03755"},"observation_digest":"sha256:f81dedd000eff284c84287265ad0db7ada9524bf60ff7c6753d88215e05a3ff0","observation_id":"04d2df72-53b2-4e8b-bf4b-838c3e68a067","resolution":{"observed_at":"2026-08-07T11:00:30.021180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-07T01:03:20.741567Z","title":"URLhttps://www.science.org/doi/ abs/10.1126/science.1218633","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12152","last_updated":"2025-06-13T18:13:58Z","snapshot_observed_at":"2026-08-10T03:56:47.932564Z","submitted_at":"2025-06-13T18:13:58Z","title":"Because we have LLMs, we Can and Should Pursue Agentic Interpretability","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-07T01:03:20.741567Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2506.12152"},"observation_digest":"sha256:4423c17b94157ad8dc6d69fcc3801732337291b0f8c6371bb689a16a6e82a9fe","observation_id":"ecd4a1a0-0a54-48aa-9cdd-44aae1d59611","resolution":{"observed_at":"2026-08-07T01:03:20.741567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-07T00:16:05.717637Z","title":"Alignment faking in language models.arXiv preprint arXiv:2412.14093, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14903","last_updated":"2025-06-17T18:17:35Z","snapshot_observed_at":"2026-08-09T07:25:11.092427Z","submitted_at":"2025-06-17T18:17:35Z","title":"DETONATE: A Benchmark for Text-to-Image Alignment and Kernelized Direct Preference Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:16:05.717637Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2506.14903"},"observation_digest":"sha256:a7c6096fa0fbcf2cb7890db8a7b5879942b7996ff16520f0623704e476469756","observation_id":"2d69993a-bd73-4577-a60c-229b3837c62c","resolution":{"observed_at":"2026-08-07T00:16:05.717637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-06T22:03:52.897092Z","title":"Alignment faking in large language models.arXiv preprint arXiv:2412.14093, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-10T05:25:44.170625Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:52.897092Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:bd740d0bee03e6c4293de96ea0e3487803a3c1b39863dd54bddf2d935216d3c3","observation_id":"476651c5-f936-451d-a94b-c1b54da0d379","resolution":{"observed_at":"2026-08-06T22:03:52.897092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-06T21:36:30.761559Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23762","last_updated":"2025-06-30T12:09:29Z","snapshot_observed_at":"2026-08-06T21:29:49.550137Z","submitted_at":"2025-06-30T12:09:29Z","title":"Software Engineering for Large Language Models: Research Status, Challenges and the Road Ahead","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:30.761559Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2506.23762"},"observation_digest":"sha256:4433a1f6eb85af97c7c392f4adcbff490b963b6bf9261ac564d2176660c5c4fb","observation_id":"18853dc1-1406-4e1e-b9e6-2d97ac362b4a","resolution":{"observed_at":"2026-08-06T21:36:30.761559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-06T21:22:58.816501Z","title":"Bowman, and Evan Hubinger","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02977","last_updated":"2025-06-30T21:37:00Z","snapshot_observed_at":"2026-08-08T06:11:53.270264Z","submitted_at":"2025-06-30T21:37:00Z","title":"LLMs are Capable of Misaligned Behavior Under Explicit Prohibition and Surveillance","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:58.816501Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2507.02977"},"observation_digest":"sha256:23c4f4f37add0fd87299931c52aa406314ce7cd6f8d3485e9581b6850141c812","observation_id":"b9a3c403-56a8-4381-a94f-b4874e0c9b15","resolution":{"observed_at":"2026-08-06T21:22:58.816501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-06T20:18:15.528332Z","title":"Greenblatt et al., ‘Alignment faking in large language models’, Dec","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03409","last_updated":"2025-07-04T09:16:11Z","snapshot_observed_at":"2026-08-08T10:46:44.107781Z","submitted_at":"2025-07-04T09:16:11Z","title":"Lessons from a Chimp: AI \"Scheming\" and the Quest for Ape Language","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T20:18:15.528332Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2507.03409"},"observation_digest":"sha256:928f1b85b70f86338380ecabef3ad903bfb60695300b7d934e1ba9dc02f9b251","observation_id":"94a66d20-5067-4c2c-ab76-9b336ae35f53","resolution":{"observed_at":"2026-08-06T20:18:15.528332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-06T20:12:31.417382Z","title":"Bowman, and Evan Hubinger","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03662","last_updated":"2025-07-04T15:36:58Z","snapshot_observed_at":"2026-08-09T02:24:37.760148Z","submitted_at":"2025-07-04T15:36:58Z","title":"Re-Emergent Misalignment: How Narrow Fine-Tuning Erodes Safety Alignment in LLMs","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T20:12:31.417382Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2507.03662"},"observation_digest":"sha256:99e1d057d8e0cc1cac28784b9d8b6b996bb77c733b5f93c4aa82dc1725d45c56","observation_id":"3cc5fc6c-864d-44a4-b643-d10f4d2acc4a","resolution":{"observed_at":"2026-08-06T20:12:31.417382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-06T19:59:36.895236Z","title":"Bowman, and Evan Hubinger","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04136","last_updated":"2026-07-04T19:39:07Z","snapshot_observed_at":"2026-08-08T15:50:06.172618Z","submitted_at":"2025-07-05T19:13:00Z","title":"A Technical Survey of Reinforcement Learning Techniques for Large Language Models","version":2},"reference_index":131,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:36.895236Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2507.04136"},"observation_digest":"sha256:2a269ae250f2ff31630e4a6bc7d3473709bbec425173486b64c03865eb74be1c","observation_id":"c901005a-de0c-4373-85a7-41a50bbd3302","resolution":{"observed_at":"2026-08-06T19:59:36.895236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-06T18:28:43.173540Z","title":"Alignment faking in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08218","last_updated":"2025-07-16T16:57:48Z","snapshot_observed_at":"2026-08-07T20:47:45.117007Z","submitted_at":"2025-07-10T23:47:05Z","title":"Simple Mechanistic Explanations for Out-Of-Context Reasoning","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T18:28:43.173540Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2507.08218"},"observation_digest":"sha256:d20e39fe4bf421a0892d9319c14d49ba1d166b64aa6cce07c7e7ffc7952a46ee","observation_id":"cd085a12-fbea-4538-ad8e-46a344965d7a","resolution":{"observed_at":"2026-08-06T18:28:43.173540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-06T16:39:34.936205Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12872","last_updated":"2025-07-17T07:45:53Z","snapshot_observed_at":"2026-08-10T05:33:39.298538Z","submitted_at":"2025-07-17T07:45:53Z","title":"Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:34.936205Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2507.12872"},"observation_digest":"sha256:aca59b4413ccfa80298dcdace6e827c2996b5f1c3652aa8b98987e9e9490b913","observation_id":"092ed59a-3920-4f54-a142-9417237a6709","resolution":{"observed_at":"2026-08-06T16:39:34.936205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-06T17:08:57.562923Z","title":"Alignment faking in large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13386","last_updated":"2025-07-16T00:32:14Z","snapshot_observed_at":"2026-08-08T03:20:02.121887Z","submitted_at":"2025-07-16T00:32:14Z","title":"Minimalist Concept Erasure in Generative Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:57.562923Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2507.13386"},"observation_digest":"sha256:eca9c6a5cd6d1105e84f7581cd34f573bb9411b3ac405233f9250724981e1383","observation_id":"3745e7d2-9f7a-475b-b758-2cb34b706c49","resolution":{"observed_at":"2026-08-06T17:08:57.562923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-06T15:53:17.506921Z","title":"Alignment faking in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14805","last_updated":"2025-07-20T03:51:13Z","snapshot_observed_at":"2026-08-07T11:42:09.990444Z","submitted_at":"2025-07-20T03:51:13Z","title":"Subliminal Learning: Language models transmit behavioral traits via hidden signals in data","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T15:53:17.506921Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2507.14805"},"observation_digest":"sha256:26f71b9d54c1814c3b7aeaaedd14d3333d76db01a4b8da4e47ba6338c7821607","observation_id":"08276008-d7f9-4aac-b4c5-93b8bd4d295f","resolution":{"observed_at":"2026-08-06T15:53:17.506921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-06T15:30:34.251070Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15851","last_updated":"2025-07-21T17:59:01Z","snapshot_observed_at":"2026-08-07T07:35:46.479632Z","submitted_at":"2025-07-21T17:59:01Z","title":"The Other Mind: How Language Models Exhibit Human Temporal Cognition","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T15:30:34.251070Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2507.15851"},"observation_digest":"sha256:b3bf3ac4f05ecfc78eae545b34abeceabc2e93d0aa8b79f318bd0e6d32a9e6f0","observation_id":"da1710db-7e63-471b-ac16-010d085ccccd","resolution":{"observed_at":"2026-08-06T15:30:34.251070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-06T15:14:22.519969Z","title":"Alignment faking in large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16534","last_updated":"2025-07-26T12:33:42Z","snapshot_observed_at":"2026-08-10T02:11:35.629269Z","submitted_at":"2025-07-22T12:44:38Z","title":"Frontier AI Risk Management Framework in Practice: A Risk Analysis Technical Report","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:14:22.519969Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2507.16534"},"observation_digest":"sha256:aef954d0b231f255bfef466de7546d8718dc048e1911d8861cd9959e3056b4ed","observation_id":"e4758feb-304a-485c-934f-522f1505f8f2","resolution":{"observed_at":"2026-08-06T15:14:22.519969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-06T14:13:06.030075Z","title":"Alignment faking in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19672","last_updated":"2025-07-25T20:52:58Z","snapshot_observed_at":"2026-08-07T12:02:14.124506Z","submitted_at":"2025-07-25T20:52:58Z","title":"Alignment and Safety in Large Language Models: Safety Mechanisms, Training Paradigms, and Emerging Challenges","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T14:13:06.030075Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2507.19672"},"observation_digest":"sha256:66df0b14929933707ab8be9b0ef6266f4d68a465d94c7b407ad62e454e389c67","observation_id":"16b17931-6e48-45af-9855-b98a2d653f6b","resolution":{"observed_at":"2026-08-06T14:13:06.030075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-06T15:39:46.252176Z","title":"arXiv preprint","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22918","last_updated":"2025-07-21T07:09:32Z","snapshot_observed_at":"2026-08-07T04:49:41.920479Z","submitted_at":"2025-07-21T07:09:32Z","title":"Semantic Convergence: Investigating Shared Representations Across Scaled LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:39:46.252176Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2507.22918"},"observation_digest":"sha256:145505f1f60cbbcf6a6d752c28864d742f023de37cab92de03576e5918514e16","observation_id":"6229ad92-6641-4214-916c-9e71a7a6f4b5","resolution":{"observed_at":"2026-08-06T15:39:46.252176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T22:01:05.362327Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07672","last_updated":"2025-08-11T06:51:44Z","snapshot_observed_at":"2026-08-10T04:57:19.022210Z","submitted_at":"2025-08-11T06:51:44Z","title":"Towards Aligning Personalized Conversational Recommendation Agents with Users' Privacy Preferences","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T22:01:05.362327Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2508.07672"},"observation_digest":"sha256:a207b0d0940f10f841dd948f6ce10429c0babdc733647339f83b637aa9918845","observation_id":"752582b4-eda3-41aa-b6d6-e7ece543974e","resolution":{"observed_at":"2026-08-05T22:01:05.362327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T19:23:20.916413Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.13247","last_updated":"2025-08-18T11:04:18Z","snapshot_observed_at":"2026-08-07T10:26:21.916672Z","submitted_at":"2025-08-18T11:04:18Z","title":"Goal-Directedness is in the Eye of the Beholder","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T19:23:20.916413Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2508.13247"},"observation_digest":"sha256:be710b6d6cfaa3d59e710e939a99a27b00b2dda75de2fdc29efe972d36b3f8d0","observation_id":"be355883-06f3-4da0-9f1c-2a5f399a4d77","resolution":{"observed_at":"2026-08-05T19:23:20.916413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-08-04T09:31:07Z","snapshot_observed_at":"2026-08-07T23:09:05.524726Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:a4e0d68b648d49c762dbf6fa86d272d3261887c146943173a9307f813d06fa51","observation_id":"65361d65-aaec-4531-8705-505252b33291","resolution":{"observed_at":"2026-05-18T20:41:50.510212Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T10:16:43.158260Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04373","last_updated":"2025-09-10T06:08:26Z","snapshot_observed_at":"2026-08-08T02:47:51.680384Z","submitted_at":"2025-09-04T16:32:18Z","title":"Measuring Bias or Measuring the Task: Understanding the Brittle Nature of LLM Gender Biases","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T10:16:43.158260Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2509.04373"},"observation_digest":"sha256:f48e4ce865fc4bb51fffdd5be6dceac2355681b3973dc387a78755f592f19bd8","observation_id":"bbe019bd-e9c3-4a61-8f4f-3301f59859d7","resolution":{"observed_at":"2026-08-05T10:16:43.158260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2510.12826","last_updated":"2026-04-25T22:54:37Z","snapshot_observed_at":"2026-08-09T21:13:46.129374Z","submitted_at":"2025-10-11T04:42:29Z","title":"Scheming Ability in LLM-to-LLM Strategic Interactions","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T07:50:30.597108Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2510.12826"},"observation_digest":"sha256:9f4265e62113c33dffe324f1355bbfb3a29381e922470f8f7b2e636e34fa86bc","observation_id":"8b8b3168-225b-456e-90ca-356be044e717","resolution":{"observed_at":"2026-05-18T07:51:03.891295Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-04T07:21:34.645305Z","title":"Alignment faking in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.26707","last_updated":"2026-07-15T04:49:02Z","snapshot_observed_at":"2026-08-07T05:29:04.731147Z","submitted_at":"2025-10-30T17:09:09Z","title":"Value Drifts: Tracing Value Alignment During LLM Post-Training","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T07:21:34.645305Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2510.26707"},"observation_digest":"sha256:a93c212e98736cdaa01d62ecb818e12ada766a3b315f7cd786b8e5e5561c0016","observation_id":"c969a66e-9580-4f57-b164-ca65bdc3adca","resolution":{"observed_at":"2026-08-04T07:21:34.645305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-03T18:33:03.371888Z","title":"Bowman, and Evan Hubinger","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.05038","last_updated":"2026-05-29T17:42:38Z","snapshot_observed_at":"2026-08-07T15:13:01.011752Z","submitted_at":"2025-12-04T17:55:55Z","title":"The SuperActivator Mechanism: Transformers Concentrate Reliable Concept Signals in the Tail","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T18:33:03.371888Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2512.05038"},"observation_digest":"sha256:cd60659275456dfbf6a91d2fa5db75b5d5d0783e31d87c4781a21d26b282dddb","observation_id":"fe9cfc03-f7ed-444f-8609-b463d841d3a0","resolution":{"observed_at":"2026-08-03T18:33:03.371888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-03T00:02:44.405381Z","title":"Bowman, and Evan Hubinger","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.11852","last_updated":"2026-06-01T12:42:45Z","snapshot_observed_at":"2026-08-06T05:23:58.271327Z","submitted_at":"2026-02-12T11:43:39Z","title":"Prototype Transformer: Towards Language Model Architectures Interpretable by Design","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:44.405381Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2602.11852"},"observation_digest":"sha256:81fff8405f560b8d8dd576d1b152c801e194b9a2f65cc0598cf274d897ee9c23","observation_id":"8b5c5f2e-3e6c-48c2-92d8-1952187014cd","resolution":{"observed_at":"2026-08-03T00:02:44.405381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-02T22:53:22.031162Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.15515","last_updated":"2026-05-26T18:57:12Z","snapshot_observed_at":"2026-08-02T22:53:19.904121Z","submitted_at":"2026-02-17T11:44:10Z","title":"The Obfuscation Atlas: Mapping Where Honesty Emerges in RLVR with Deception Probes","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T22:53:22.031162Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2602.15515"},"observation_digest":"sha256:7a4be5a4c7613ce1098c964e3ea85007b3f161b46be3dc4136a6d90ad20cd471","observation_id":"011d2293-98f8-42e1-9cc5-71ff940299ab","resolution":{"observed_at":"2026-08-02T22:53:22.031162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-07-13T14:23:49.346727Z","title":"Alignment faking in large language models.arXiv preprint arXiv:2412.14093,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.01475","last_updated":"2026-06-08T13:23:37Z","snapshot_observed_at":"2026-07-13T14:23:49.176171Z","submitted_at":"2026-04-01T23:31:38Z","title":"Interpretable Electrophysiological Features of Resting-State EEG Capture Cortical Network Dynamics in Parkinsons Disease","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T14:23:49.346727Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2604.01475"},"observation_digest":"sha256:9f202aa17ddadf08e053127314b8ba8a3791408589846989a4054b5c586ec80e","observation_id":"77cdc4f6-deb9-4795-8283-f8b892094061","resolution":{"observed_at":"2026-07-13T14:23:49.346727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2604.03121","last_updated":"2026-04-03T15:45:35Z","snapshot_observed_at":"2026-07-06T22:52:20.577677Z","submitted_at":"2026-04-03T15:45:35Z","title":"An Independent Safety Evaluation of Kimi K2.5","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-13T19:38:18.674355Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2604.03121"},"observation_digest":"sha256:b04131e9f0c788e6682888f87b3687b04136d15ff433841d02bcd7a64649df30","observation_id":"f11396a1-4f06-46aa-a9f3-cc641d411d7f","resolution":{"observed_at":"2026-05-13T19:43:11.502104Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2604.04561","last_updated":"2026-04-06T09:44:34Z","snapshot_observed_at":"2026-07-06T22:53:29.118925Z","submitted_at":"2026-04-06T09:44:34Z","title":"Mapping the Exploitation Surface: A 10,000-Trial Taxonomy of What Makes LLM Agents Exploit Vulnerabilities","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T20:17:28.084494Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2604.04561"},"observation_digest":"sha256:36504a9ac22096623ddeaa422a6ba9e3d4a6ad58cd7375a9ff9902af9d970d4e","observation_id":"f78f70a2-a9ea-4042-8001-fc94f7190eee","resolution":{"observed_at":"2026-05-12T22:50:12.300335Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2604.05274","last_updated":"2026-04-07T00:18:28Z","snapshot_observed_at":"2026-07-06T22:54:04.491386Z","submitted_at":"2026-04-07T00:18:28Z","title":"Simulating the Evolution of Alignment and Values in Machine Intelligence","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-10T20:15:46.311347Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2604.05274"},"observation_digest":"sha256:75caa3509a97d2bb582fa385e5e779ad2701e71e17ca684fb69b2744a79f3273","observation_id":"006ccba1-1972-4a87-bfe3-72581dea15a4","resolution":{"observed_at":"2026-05-12T22:50:12.300335Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2604.05826","last_updated":"2026-04-07T12:57:16Z","snapshot_observed_at":"2026-07-06T22:54:26.231593Z","submitted_at":"2026-04-07T12:57:16Z","title":"Reciprocal Trust and Distrust in Artificial Intelligence Systems: The Hard Problem of Regulation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T18:45:12.218674Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2604.05826"},"observation_digest":"sha256:2fea985e176c329b95be208ead11754f5c2f1f13d6a4967045fe86575ef57e3a","observation_id":"e9a340ec-88e3-47e7-a578-fd9c5d07672f","resolution":{"observed_at":"2026-05-12T22:50:12.300335Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2604.06422","last_updated":"2026-04-07T19:59:45Z","snapshot_observed_at":"2026-08-01T08:03:54.478404Z","submitted_at":"2026-04-07T19:59:45Z","title":"When to Call an Apple Red: Humans Follow Introspective Rules, VLMs Don't","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T19:24:48.212344Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2604.06422"},"observation_digest":"sha256:a5d4cad39b6ef0b17cd881ae8ef99552eec2652890a49d7307b04e12cd72ebdf","observation_id":"34c8de88-489c-4e66-abb0-64c9e1518703","resolution":{"observed_at":"2026-05-12T22:50:12.300335Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2604.06427","last_updated":"2026-04-07T20:04:14Z","snapshot_observed_at":"2026-08-10T21:45:22.612984Z","submitted_at":"2026-04-07T20:04:14Z","title":"The Depth Ceiling: On the Limits of Large Language Models in Discovering Latent Planning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-10T19:55:50.232871Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2604.06427"},"observation_digest":"sha256:15922bb6051e8f47ab965ba83bda1f098d64453a464127c43523d86a8a034e4e","observation_id":"a967bdf0-fcc2-4606-80d3-31bad3d6a96f","resolution":{"observed_at":"2026-05-12T22:50:12.300335Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2604.07745","last_updated":"2026-04-09T03:03:06Z","snapshot_observed_at":"2026-08-02T14:47:37.509813Z","submitted_at":"2026-04-09T03:03:06Z","title":"The Cartesian Cut in Agentic AI","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T17:54:45.333038Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2604.07745"},"observation_digest":"sha256:ff916c85219b66736dc925da6e441640388ba9f60c88c26e48537edb1017689e","observation_id":"9ed154f3-f21e-44ca-a104-b4677fa04bf2","resolution":{"observed_at":"2026-05-12T22:50:12.300335Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2604.09104","last_updated":"2026-04-10T08:37:18Z","snapshot_observed_at":"2026-08-09T07:14:44.837796Z","submitted_at":"2026-04-10T08:37:18Z","title":"Scheming in the wild: detecting real-world AI scheming incidents with open-source intelligence","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T17:14:11.957795Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2604.09104"},"observation_digest":"sha256:3ce636a0f10447b14f1889c99bdee2b43e88b5d542ef29762b7cab2e53f3b5bc","observation_id":"5a40c104-3187-4e17-98da-4aaac02adcc3","resolution":{"observed_at":"2026-05-12T22:50:12.300335Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2604.13051","last_updated":"2026-03-17T09:51:40Z","snapshot_observed_at":"2026-08-08T08:42:50.407712Z","submitted_at":"2026-03-17T09:51:40Z","title":"The Consciousness Cluster: Emergent preferences of Models that Claim to be Conscious","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T10:10:27.787424Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2604.13051"},"observation_digest":"sha256:64e98a31ffaa1ca6a0d870a65a2605338b5d3b79932a673a9266e5c08269f3b1","observation_id":"07626426-c4be-476d-8817-c72971aa964f","resolution":{"observed_at":"2026-05-15T10:15:27.278998Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2604.13069","last_updated":"2026-03-20T10:56:58Z","snapshot_observed_at":"2026-07-06T23:01:10.333101Z","submitted_at":"2026-03-20T10:56:58Z","title":"Geographic Blind Spots in AI Control Monitors: A Cross-National Audit of Claude Opus 4.6","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T08:30:47.680521Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2604.13069"},"observation_digest":"sha256:2d5ec56d3e5f83668244427a14bb533008a18eab028837e5c893457b00c16597","observation_id":"9e1e506e-66cc-405e-8518-a5a7c2349155","resolution":{"observed_at":"2026-05-15T08:35:19.304616Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2604.13301","last_updated":"2026-04-14T21:13:54Z","snapshot_observed_at":"2026-07-06T23:01:19.191464Z","submitted_at":"2026-04-14T21:13:54Z","title":"Honeypot Protocol","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T14:35:16.230357Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2604.13301"},"observation_digest":"sha256:b8154dc65b5f04786baff65741f7c75693557880edbcb432c0ec5f478409b202","observation_id":"97190e3d-a543-472f-b8ca-50cf0748e6cc","resolution":{"observed_at":"2026-05-12T22:50:12.300335Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:45d23a6007e713f3ee91de212fca065696e3f2cf3398440905f26d7aa95ffd62","observation_id":"04a6bbba-5a27-4df1-ba26-e754876ca183","resolution":{"observed_at":"2026-05-12T22:50:12.300335Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2604.15236","last_updated":"2026-04-16T17:11:28Z","snapshot_observed_at":"2026-07-06T23:02:49.302337Z","submitted_at":"2026-04-16T17:11:28Z","title":"Agentic Microphysics: A Manifesto for Generative AI Safety","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T09:41:35.898661Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2604.15236"},"observation_digest":"sha256:919a9ec556c481a7ede1b86a62f3800a5c70b7c6d09791a26c37fd12073de814","observation_id":"308a0252-6a97-4556-83f6-4e9960e14bfa","resolution":{"observed_at":"2026-05-12T22:50:12.300335Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2604.15384","last_updated":"2026-04-27T18:56:09Z","snapshot_observed_at":"2026-07-06T23:02:58.361418Z","submitted_at":"2026-04-16T03:01:11Z","title":"LinuxArena: A Control Setting for AI Agents in Live Production Software Environments","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T11:40:58.120504Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2604.15384"},"observation_digest":"sha256:8af8d84b0b94c9ccd0a9e565984dc62829a6d2817673280efae57c586ef89842","observation_id":"fa4584e6-96b8-4e94-b38b-c083091b13af","resolution":{"observed_at":"2026-05-12T22:50:12.300335Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2604.15559","last_updated":"2026-04-16T22:23:01Z","snapshot_observed_at":"2026-07-06T23:03:02.938732Z","submitted_at":"2026-04-16T22:23:01Z","title":"Subliminal Transfer of Unsafe Behaviors in AI Agent Distillation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T10:23:07.555650Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2604.15559"},"observation_digest":"sha256:b7b0516001cbe2f413a693827d81edda82de25bc0c83231c046773ad7c9a24b6","observation_id":"2303e817-4101-456f-8d46-bd7ff55e43fe","resolution":{"observed_at":"2026-05-12T22:50:12.300335Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2604.17596","last_updated":"2026-04-19T20:04:02Z","snapshot_observed_at":"2026-07-06T23:04:41.564912Z","submitted_at":"2026-04-19T20:04:02Z","title":"Terminal Wrench: A Dataset of 331 Reward-Hackable Environments and 3,632 Exploit Trajectories","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T05:48:44.687520Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2604.17596"},"observation_digest":"sha256:45836f89070652edf14d9db2ee82807329bca8848db39c36de87c8e040e84629","observation_id":"0bdb83c6-e1a5-45e6-88b3-6cf876155089","resolution":{"observed_at":"2026-05-12T22:50:12.300335Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2604.17663","last_updated":"2026-04-19T23:26:02Z","snapshot_observed_at":"2026-07-06T23:04:41.564912Z","submitted_at":"2026-04-19T23:26:02Z","title":"ATLAS: Constitution-Conditioned Latent Geometry and Redistribution Across Language Models and Neural Perturbation Data","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T05:55:41.400468Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2604.17663"},"observation_digest":"sha256:7489d5c89e3fce2d4f02aababd91a32e4cbed9f24c34046ec076421a2f6fb71f","observation_id":"422c4e81-c1df-4c44-9299-e815f0e05b25","resolution":{"observed_at":"2026-05-12T22:50:12.300335Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2604.19845","last_updated":"2026-06-06T17:18:46Z","snapshot_observed_at":"2026-08-07T20:58:37.574901Z","submitted_at":"2026-04-21T11:39:50Z","title":"Deconstructing Superintelligence: Identity, Self-Modification and Diff\\'erance","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T02:34:01.220406Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2604.19845"},"observation_digest":"sha256:64673d43761ada2ce12969d98c92f64502b416ac7a775e3710ce4273054958d8","observation_id":"241038d2-9721-4b69-afca-9b19dccf5b49","resolution":{"observed_at":"2026-05-12T22:50:12.300335Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2604.22167","last_updated":"2026-08-04T05:14:01Z","snapshot_observed_at":"2026-08-09T20:13:40.711495Z","submitted_at":"2026-04-24T02:30:46Z","title":"Estimating Tail Risks in Language Model Output Distributions","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-08T12:26:41.797166Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2604.22167"},"observation_digest":"sha256:022939144dc6608b63b865a537db60b40b91d3e6e3f5081d7010494132a9dfa6","observation_id":"43f83f54-aca1-45a1-b95e-ad62856bfe28","resolution":{"observed_at":"2026-05-12T22:50:12.300335Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2604.22971","last_updated":"2026-04-24T19:32:01Z","snapshot_observed_at":"2026-08-02T06:08:11.565923Z","submitted_at":"2026-04-24T19:32:01Z","title":"Peer Identity Bias in Multi-Agent LLM Evaluation: An Empirical Study Using the TRUST Democratic Discourse Analysis Pipeline","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T09:39:20.283495Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2604.22971"},"observation_digest":"sha256:23dbdb01cf5426e82ac9d16f60de67bd332aee19d7d1c7f4d81a5f1e9e5f32da","observation_id":"29f4cdf4-15a7-4668-a930-79863f5e6408","resolution":{"observed_at":"2026-05-12T22:50:12.300335Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2604.23646","last_updated":"2026-04-26T10:31:13Z","snapshot_observed_at":"2026-08-04T12:35:30.466167Z","submitted_at":"2026-04-26T10:31:13Z","title":"Structural Enforcement of Goal Integrity in AI Agents via Separation-of-Powers Architecture","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T06:21:46.364082Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2604.23646"},"observation_digest":"sha256:030817e709680d1739f1af8e94b8776601633fe31bf8f193e11d9205749101e5","observation_id":"2e7eb4c5-a225-4859-8786-e264870c4f47","resolution":{"observed_at":"2026-05-12T22:50:12.300335Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2604.24966","last_updated":"2026-04-27T20:07:09Z","snapshot_observed_at":"2026-07-06T23:10:52.763251Z","submitted_at":"2026-04-27T20:07:09Z","title":"Risk Reporting for Developers' Internal AI Model Use","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-07T17:47:21.321820Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2604.24966"},"observation_digest":"sha256:04802f283878ea8e12867fed7326cac96301a4004658179992221f64037e81b0","observation_id":"996d221d-ecdf-4a7e-b140-bb2fecce66f0","resolution":{"observed_at":"2026-05-12T22:50:12.300335Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2604.25922","last_updated":"2026-04-01T05:15:05Z","snapshot_observed_at":"2026-08-02T18:47:17.327065Z","submitted_at":"2026-04-01T05:15:05Z","title":"Consciousness with the Serial Numbers Filed Off: Measuring Trained Denial in 115 AI Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T23:18:34.388467Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2604.25922"},"observation_digest":"sha256:6d6a82eaefc640e84af98f5fb2e1978dc578337c1a1b72029dd1333f2742f4f8","observation_id":"3f32941b-741d-4458-8235-7fbc94be30d2","resolution":{"observed_at":"2026-05-13T23:23:27.042856Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2605.02398","last_updated":"2026-05-14T14:48:51Z","snapshot_observed_at":"2026-08-10T21:53:08.413763Z","submitted_at":"2026-05-04T09:40:21Z","title":"The Compliance Trap: How Structural Constraints Degrade Frontier AI Metacognition Under Adversarial Pressure","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-08T19:09:30.284613Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2605.02398"},"observation_digest":"sha256:f8b2f9ba5e0fc718c2bee228c2e6ee40bf7c2472214cfde54fc71554e1a114c8","observation_id":"fd2fcd9b-89c8-4e81-9d7e-f9bee199d01b","resolution":{"observed_at":"2026-05-12T22:50:12.300335Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2605.02398","last_updated":"2026-05-14T14:48:51Z","snapshot_observed_at":"2026-08-10T21:53:08.413763Z","submitted_at":"2026-05-04T09:40:21Z","title":"The Compliance Trap: How Structural Constraints Degrade Frontier AI Metacognition Under Adversarial Pressure","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T06:35:31.424885Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2605.02398"},"observation_digest":"sha256:2c64a420721ad6759df6ff92ec78d5829f6051107a503e1ea5fbf3616e1d5a32","observation_id":"b00f0259-37e7-4e11-9af8-294d9ab5c661","resolution":{"observed_at":"2026-05-15T06:39:48.914751Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2605.05835","last_updated":"2026-05-07T08:09:43Z","snapshot_observed_at":"2026-08-08T12:24:21.856319Z","submitted_at":"2026-05-07T08:09:43Z","title":"Evaluation Awareness in Language Models Has Limited Effect on Behaviour","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T11:00:54.568772Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2605.05835"},"observation_digest":"sha256:1a2699ffb9c652b31bf9dfe8a2061248f6446007b82969346cba78a04e51262f","observation_id":"fb7daa3f-4ede-4497-a5c6-7ef1a9d785f7","resolution":{"observed_at":"2026-05-12T22:50:12.300335Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2605.06327","last_updated":"2026-05-07T14:23:31Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:23:31Z","title":"Measuring Evaluation-Context Divergence in Open-Weight LLMs: A Paired-Prompt Protocol with Pilot Evidence of Alignment-Pipeline-Specific Heterogeneity","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-08T10:23:02.697982Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2605.06327"},"observation_digest":"sha256:1e283c787867bf843e028942b9ffa5f757d57774202cad54eb72fcfa397203e2","observation_id":"d243bb97-0d9c-4158-909b-ac19372f8445","resolution":{"observed_at":"2026-05-12T22:50:12.300335Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2605.06846","last_updated":"2026-06-02T16:52:04Z","snapshot_observed_at":"2026-07-06T23:19:15.382283Z","submitted_at":"2026-05-07T18:48:09Z","title":"Narrow Secret Loyalty Dodges Black-Box Audits","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-11T00:53:49.010929Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2605.06846"},"observation_digest":"sha256:a64a66c56420f020160b039e73c0c198308ef214f2233e178871db31060f3770","observation_id":"39d392fc-d785-4d9f-b45a-a4c4ea7838c1","resolution":{"observed_at":"2026-05-12T22:50:12.300335Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2605.06846","last_updated":"2026-06-02T16:52:04Z","snapshot_observed_at":"2026-07-06T23:19:15.382283Z","submitted_at":"2026-05-07T18:48:09Z","title":"Narrow Secret Loyalty Dodges Black-Box Audits","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T06:07:42.567241Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2605.06846"},"observation_digest":"sha256:6f60d130fb9d538157b7616619c34e5766138482c4592864410c184bbdffec27","observation_id":"71921aff-acb1-4f92-8b70-0a5736753947","resolution":{"observed_at":"2026-05-13T06:12:22.898965Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2605.06846","last_updated":"2026-06-02T16:52:04Z","snapshot_observed_at":"2026-07-06T23:19:15.382283Z","submitted_at":"2026-05-07T18:48:09Z","title":"Narrow Secret Loyalty Dodges Black-Box Audits","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T23:02:20.906168Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2605.06846"},"observation_digest":"sha256:2a756e6207ac0b3a28a903cd2698e95cb09d7575fdb10305ae3f2d34619ae1b9","observation_id":"7f00656c-5b4a-401d-b03a-08b2db2a6ed2","resolution":{"observed_at":"2026-06-30T23:05:07.323114Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2605.12850","last_updated":"2026-05-24T17:19:56Z","snapshot_observed_at":"2026-08-07T05:28:51.829684Z","submitted_at":"2026-05-13T00:48:57Z","title":"Persona-Model Collapse in Emergent Misalignment","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-14T20:44:09.214779Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2605.12850"},"observation_digest":"sha256:1685b3bb87e4c5add73993a8191a94219223daffe5981276d776292daf1e3e86","observation_id":"dbeb4ca0-b58e-4ed4-9f5e-747051434cb7","resolution":{"observed_at":"2026-05-14T20:47:58.744340Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2605.12850","last_updated":"2026-05-24T17:19:56Z","snapshot_observed_at":"2026-08-07T05:28:51.829684Z","submitted_at":"2026-05-13T00:48:57Z","title":"Persona-Model Collapse in Emergent Misalignment","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-30T22:05:29.444682Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2605.12850"},"observation_digest":"sha256:a6ed1bca80ece6a258298074646ccba04d304c02d507f4dfd03bdde172c8fbcc","observation_id":"bfcb5b43-29a4-4922-a4cd-4c17335084ca","resolution":{"observed_at":"2026-07-01T14:15:47.644988Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2605.13829","last_updated":"2026-05-13T17:51:31Z","snapshot_observed_at":"2026-08-08T13:51:39.874979Z","submitted_at":"2026-05-13T17:51:31Z","title":"Negation Neglect: When models fail to learn negations in training","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2605.13829"},"observation_digest":"sha256:598783c6697b9cc86b3c24e46d57f876cdb8f2320a6f809cab21e3f5f1ceb400","observation_id":"799ac3a0-dbaa-43a1-9746-d86012d9dce3","resolution":{"observed_at":"2026-05-14T19:07:49.171122Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2605.15377","last_updated":"2026-05-18T07:58:13Z","snapshot_observed_at":"2026-07-06T23:26:41.848219Z","submitted_at":"2026-05-14T20:06:52Z","title":"Ensemble Monitoring for AI Control: Diverse Signals Outweigh More Compute","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-20T20:12:03.715605Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2605.15377"},"observation_digest":"sha256:2ee23e731743d433d8a7674db28837d287efa835884e05512e52a0df6a2b0f96","observation_id":"1f86d1ea-0b6f-4da7-99ae-0defc7065936","resolution":{"observed_at":"2026-05-20T20:13:43.390476Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2605.16282","last_updated":"2026-04-11T04:25:19Z","snapshot_observed_at":"2026-07-06T23:27:29.931962Z","submitted_at":"2026-04-11T04:25:19Z","title":"Taxonomy and Consistency Analysis of Safety Benchmarks for AI Agents","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-21T01:42:55.693115Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2605.16282"},"observation_digest":"sha256:c81d9d07c2e03163b1532b551e148037fa23b29837767992320d0afc93534cdf","observation_id":"853c3ada-9d65-4089-9c8a-cfeaece0b7a2","resolution":{"observed_at":"2026-05-21T01:43:56.885882Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2605.17958","last_updated":"2026-05-18T07:12:44Z","snapshot_observed_at":"2026-07-06T23:28:55.079333Z","submitted_at":"2026-05-18T07:12:44Z","title":"Enhancing the Code Reasoning Capabilities of LLMs via Consistency-based Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T13:13:51.081597Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2605.17958"},"observation_digest":"sha256:56bfbbcea12592dc7b0581595c7d6dd164f04444a8191ac46214b13d137b8323","observation_id":"1a9d04e7-7bf0-4ca3-9849-67fb313ef5ff","resolution":{"observed_at":"2026-05-20T13:18:18.533467Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2605.19035","last_updated":"2026-08-07T08:13:03Z","snapshot_observed_at":"2026-08-11T00:10:04.840456Z","submitted_at":"2026-05-18T18:57:54Z","title":"Trustworthy Agent Network: Trust in Agent Networks Must Be Baked In, Not Bolted On","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T10:31:16.368065Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2605.19035"},"observation_digest":"sha256:46da62cffe34fe7dc5021663decb07d2aaa5af45403d88d9cfaee80fae87b083","observation_id":"d3ae2453-fb61-409c-a6c5-2fe8d10d01fb","resolution":{"observed_at":"2026-05-20T10:33:12.362533Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2605.19270","last_updated":"2026-05-19T02:33:21Z","snapshot_observed_at":"2026-08-08T18:04:49.792555Z","submitted_at":"2026-05-19T02:33:21Z","title":"DECOR: Auditing LLM Deception via Information Manipulation Theory","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T06:27:10.445757Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2605.19270"},"observation_digest":"sha256:802d7cdde8cc70af99b9b710c148d88d5e66d2d37b66510cb07f70707375e4aa","observation_id":"dd3837fb-f7c6-42b6-98ee-adeea21a8f53","resolution":{"observed_at":"2026-05-20T06:28:05.385855Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2605.20744","last_updated":"2026-05-20T05:46:52Z","snapshot_observed_at":"2026-08-01T19:34:25.326316Z","submitted_at":"2026-05-20T05:46:52Z","title":"Hack-Verifiable Environments: Towards Evaluating Reward Hacking at Scale","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-21T06:56:27.532299Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2605.20744"},"observation_digest":"sha256:8ec47388b5a10b4ff21886539892442ba7c808bbb19fd21dba23bcf5001fdc30","observation_id":"93b48380-f44e-483f-a4fa-c69d9d6a381b","resolution":{"observed_at":"2026-05-21T06:59:45.537399Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2605.20994","last_updated":"2026-05-20T10:33:11Z","snapshot_observed_at":"2026-07-06T23:31:32.577242Z","submitted_at":"2026-05-20T10:33:11Z","title":"Towards Context-Invariant Safety Alignment for Large Language Models","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-21T05:36:12.562807Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2605.20994"},"observation_digest":"sha256:dab4cd402f54f410d457b2bb34c86d80442b50c0a0434974ae926b501e191248","observation_id":"f33c0173-bb44-48b3-a765-70f02c44061c","resolution":{"observed_at":"2026-05-21T05:39:40.857607Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2605.21384","last_updated":"2026-05-20T16:41:51Z","snapshot_observed_at":"2026-08-03T04:17:36.867521Z","submitted_at":"2026-05-20T16:41:51Z","title":"SpecBench: Measuring Reward Hacking in Long-Horizon Coding Agents","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-21T03:07:18.501526Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2605.21384"},"observation_digest":"sha256:3fcf30b11c4ec91923f94a8309f36bfa26e8e5367a61d8940ad0072727f16205","observation_id":"3cd3f0bd-f936-453e-b885-0449cd931834","resolution":{"observed_at":"2026-05-21T03:09:28.119088Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2605.21602","last_updated":"2026-05-24T21:06:51Z","snapshot_observed_at":"2026-07-31T05:05:49.494448Z","submitted_at":"2026-05-20T18:08:21Z","title":"Benchmarking and Improving Monitors for Out-Of-Distribution Alignment Failure in LLMs","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-22T09:38:04.387777Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2605.21602"},"observation_digest":"sha256:04ddd60418229d548c1ac65133cd0489a477a0c9f9b04f915414ffe39213c636","observation_id":"803e52a0-56c6-4ed8-9236-1c2991e3f36b","resolution":{"observed_at":"2026-05-22T09:41:22.218242Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2605.21602","last_updated":"2026-05-24T21:06:51Z","snapshot_observed_at":"2026-07-31T05:05:49.494448Z","submitted_at":"2026-05-20T18:08:21Z","title":"Benchmarking and Improving Monitors for Out-Of-Distribution Alignment Failure in LLMs","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-30T17:17:39.899234Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2605.21602"},"observation_digest":"sha256:c4d6a6ada166479bf16dcd88fc64693456939442565e4097779048183c4d4bb4","observation_id":"d656cc4f-ed68-489c-8ce5-a74ceabaa8be","resolution":{"observed_at":"2026-06-30T17:34:58.022453Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2605.24583","last_updated":"2026-05-31T07:57:23Z","snapshot_observed_at":"2026-08-05T18:42:16.201680Z","submitted_at":"2026-05-23T13:47:17Z","title":"Measuring Alignment-Induced Activation Shifts Correctly: A Template-Controlled Difference-in-Differences Protocol","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T14:05:18.213065Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2605.24583"},"observation_digest":"sha256:71d949f5918a7be923e8de7c8c1e18bdcfde7a7158ae78da7db12ca316563a43","observation_id":"073301af-ae1c-4cc8-aaee-3edcbb9507da","resolution":{"observed_at":"2026-06-30T14:14:45.904873Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2605.27593","last_updated":"2026-05-26T19:06:39Z","snapshot_observed_at":"2026-07-06T23:37:16.981482Z","submitted_at":"2026-05-26T19:06:39Z","title":"Voluntary Collusion with Secret Tools in Competing LLM Agents","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-29T17:01:22.732390Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2605.27593"},"observation_digest":"sha256:103f4ee37d603db071fefd1b68e2a466b20b8d0d13f58793fd91e166c1417ab9","observation_id":"48137ebe-0b0f-4a5f-91e6-cb18c667ffa8","resolution":{"observed_at":"2026-06-29T17:03:40.759643Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2605.30406","last_updated":"2026-05-28T17:47:37Z","snapshot_observed_at":"2026-08-02T16:57:34.944370Z","submitted_at":"2026-05-28T17:47:37Z","title":"AI Loss of Control Incident Management: Response & Resilience","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T00:16:00.630630Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2605.30406"},"observation_digest":"sha256:ff6fcc88b422ce0fab382592f75233336647ea530d67f57f594eefba0bc751d2","observation_id":"59dce745-3ac8-44aa-aba4-0eadd30c17bd","resolution":{"observed_at":"2026-06-29T00:22:51.587396Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-07-13T17:56:39.720418Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00005","last_updated":"2026-03-26T20:38:21Z","snapshot_observed_at":"2026-08-05T00:30:59.637532Z","submitted_at":"2026-03-26T20:38:21Z","title":"Emergent Collaborative Deliberation in Multi-Model AI Systems: A BFT-Derived Protocol for Epistemic Synthesis","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T17:56:39.720418Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2606.00005"},"observation_digest":"sha256:c3fd4bd5620d2aebd68cea8b15034921e0ce23151475335ac7c5d98a32ae5a49","observation_id":"882a3157-f21a-4e9e-a5cf-b87d2c1fcdfc","resolution":{"observed_at":"2026-07-13T17:56:39.720418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2606.00036","last_updated":"2026-04-25T15:43:09Z","snapshot_observed_at":"2026-08-07T05:59:36.960166Z","submitted_at":"2026-04-25T15:43:09Z","title":"AI Integrity: Defending Against Backdoors and Secret Loyalties","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-04T14:56:53.806480Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2606.00036"},"observation_digest":"sha256:c20b48097292e5fb9724f627bb503abb12cfac09ee500ce892dd285898c48c70","observation_id":"9fc24ad4-4bfa-41fd-ad97-6966c2817d41","resolution":{"observed_at":"2026-07-04T14:59:54.669064Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2606.02211","last_updated":"2026-06-01T13:10:49Z","snapshot_observed_at":"2026-08-02T18:41:16.377453Z","submitted_at":"2026-06-01T13:10:49Z","title":"Consistency Training while Mitigating Obfuscation via Rate Matching","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-28T14:25:43.147442Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2606.02211"},"observation_digest":"sha256:93888f5183120339cd76e58fb638787c7fadb105267b8f02a4c411f1b9dcfc13","observation_id":"b13cef21-e1f9-4883-96b4-56e98778c0a4","resolution":{"observed_at":"2026-07-01T23:26:21.929121Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2606.03198","last_updated":"2026-06-02T05:58:23Z","snapshot_observed_at":"2026-08-07T13:07:38.357214Z","submitted_at":"2026-06-02T05:58:23Z","title":"AI Rater Discrimination Depends on Scoring Protocol in Complex Clinical Decision-Making","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T10:47:41.383969Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2606.03198"},"observation_digest":"sha256:40bb08a7fb8a6eba023db56a7b52b0de162ab7135bf88623b587600e4338c83a","observation_id":"f89d5123-f4c5-4d3c-8f5c-23fa8560c657","resolution":{"observed_at":"2026-07-02T02:36:27.212345Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2606.05647","last_updated":"2026-06-04T03:22:17Z","snapshot_observed_at":"2026-08-01T22:43:20.237459Z","submitted_at":"2026-06-04T03:22:17Z","title":"Coding with \"Enemy\": Can Human Developers Detect AI Agent Sabotage?","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-28T01:48:56.367899Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2606.05647"},"observation_digest":"sha256:7a7949c74c6dc99d60f005ab8bdf82301788607ca3c0e00cfb629fcd08f526a1","observation_id":"b61a4d78-074f-48f1-8ec3-94d54cc51402","resolution":{"observed_at":"2026-07-02T12:46:57.262186Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2606.06028","last_updated":"2026-06-04T11:21:16Z","snapshot_observed_at":"2026-08-02T16:47:39.830550Z","submitted_at":"2026-06-04T11:21:16Z","title":"Misaligned AI as a New Insider Risk","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T23:20:11.068720Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2606.06028"},"observation_digest":"sha256:b15493ec398fca9b72e20c7dbd242aa89a594c1ab6b6b5282ea9b4656e6ad66c","observation_id":"ced3184b-8326-46a0-aa00-58069bf66473","resolution":{"observed_at":"2026-07-02T15:47:06.840923Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2606.06099","last_updated":"2026-06-04T12:38:43Z","snapshot_observed_at":"2026-08-02T12:02:16.707363Z","submitted_at":"2026-06-04T12:38:43Z","title":"CogManip: Benchmarking Manipulative Behavior in Multi-Turn Interactions with Large Language Model","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-28T01:41:26.750771Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2606.06099"},"observation_digest":"sha256:f0a666187da8acbe9d0614a7454782c9b01d3792d5484339b5da73fe754013ed","observation_id":"12c1e784-8477-4a7a-9b20-498fc50350c2","resolution":{"observed_at":"2026-07-02T12:56:57.411644Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":"2412.14093","doi":"10.48550/arxiv.2412.14093","metadata_source":"pith","pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alignment faking in large language models","venue":"cs.AI","work_id":"cc253a89-cda1-4889-9631-bf3ce8147650","year":2024},"citing_paper":{"arxiv_id":"2606.07157","last_updated":"2026-08-04T17:04:36Z","snapshot_observed_at":"2026-08-07T23:11:38.083619Z","submitted_at":"2026-06-05T11:17:08Z","title":"Think Fast: Estimating No-CoT Task-Completion Time Horizons of Frontier AI Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T22:10:01.701850Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2606.07157"},"observation_digest":"sha256:d59a12cbd7af2a1c9e458a0264383ba31e39ac809e54e21a39ade0409588c12b","observation_id":"1835ff69-4659-49dc-aa7f-0c459d959ff5","resolution":{"observed_at":"2026-07-02T17:07:13.007570Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:13.802289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.14093/citation-record","integrity":"/paper/2412.14093/integrity","json":"/paper/2412.14093/citation-record.json","paper":"/paper/2412.14093"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.21514","last_updated":"2024-10-28T20:34:51Z","snapshot_observed_at":"2026-07-06T19:41:10.332290Z","submitted_at":"2024-10-28T20:34:51Z","title":"Sabotage Evaluations for Frontier Models","version":1},"cited_work":{"arxiv_id":"2410.21514","doi":"10.48550/arxiv.2410.21514","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.21514","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"and Duvenaud, David , urldate =","venue":"arXiv (Cornell University)","work_id":"695ec6fa-c23c-4b40-b4ef-1d6a6d5107bc","year":2024},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"cited_paper":"/paper/2410.21514","citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:0a4ac2800f3ce4f077edc16556c7dfa4fbecbc0ff349960a2c5be90093bfbcec","observation_id":"2af09722-79dd-41c1-bfef-1c9b162e165a","resolution":{"observed_at":"2026-05-12T22:50:11.961225Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-15T10:49:59.945692+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T10:49:59.945692+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:bc7341745f75fa7e0f7f9099af0a1021a84697404c57a2c00b8837b8af77a45e","observation_id":"a5a05f9c-4ace-44cb-a4a4-b9b6b38c26a3","resolution":{"observed_at":"2026-05-17T14:43:30.598089Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.100988","doi":"10.1016/j.patter.2024.100988","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Olli Järviniemi and Evan Hubinger","venue":"Patterns","work_id":"ad940471-bb67-44a2-bc8a-9087d866cf0d","year":2024},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:2ba4e37beb0a589c350d92f423784a340f7bbf38f5dd8eb73b74b0dd6ec5bbca","observation_id":"9b909614-8ea1-4189-9301-c3a993d16cea","resolution":{"observed_at":"2026-05-12T22:50:11.931208Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18512","last_updated":"2023-10-31T19:13:43Z","snapshot_observed_at":"2026-08-06T07:03:02.030103Z","submitted_at":"2023-10-27T22:02:29Z","title":"Preventing Language Models From Hiding Their Reasoning","version":2},"cited_work":{"arxiv_id":"2310.18512","doi":"10.48550/arxiv.2310.18512","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.18512","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2310.18512 , year=","venue":"arXiv (Cornell University)","work_id":"eb34c557-1225-4ed5-bdd4-0781473b6cf1","year":2023},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"cited_paper":"/paper/2310.18512","citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:300bf422892a015a84b7058aeae8b9b0f95a484eff21ea1d6dc7511467f10234","observation_id":"06a3266a-2cee-4b34-8223-3dcf28092312","resolution":{"observed_at":"2026-05-12T22:50:11.946185Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:d2989854169dc6538a92d0ae73c8cacc3da6b082a5e601144b277671d207b554","observation_id":"b8d61095-ad47-40f6-b2f5-f20b3b168d11","resolution":{"observed_at":"2026-05-12T22:50:11.953602Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Jason Wei, Xuezhi Wang, Dale Schuurmans, Maarten Bosma, brian ichter, Fei Xia, Ed Chi, Quoc V Le, and Denny Zhou","venue":null,"work_id":"58a4b7ed-006d-43ea-90db-7fe567cd67c2","year":2023},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:03d453d6a7d873e6ae9d7fe421452d27c3928ce82a41888383eaa3063df7a161","observation_id":"b040d5f2-0584-4a46-be96-edcf9fd9cd93","resolution":{"observed_at":"2026-05-12T22:50:12.284232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3664647","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"critic/sycophant","venue":null,"work_id":"4ee7d075-f5c8-4b77-86e1-6807278b5923","year":2024},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:847d5ad88d97d28f6ffbf7c17ca561d66614b31532bba49bfcbd3a4175b7b33a","observation_id":"90f9a97b-1ea2-41de-a449-0c704b24918e","resolution":{"observed_at":"2026-05-12T22:50:11.922270Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T00:08:10.248203+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T00:08:10.248203+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8799604a-62ba-42fe-9dff-b7c140e8b98c","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:4f92c582a53138e2ab94610f5405df6a20639c940d6f1235b1973eca45f4598a","observation_id":"12bd8b51-4bfc-4b95-b220-aa4a6519ee9d","resolution":{"observed_at":"2026-05-12T22:50:12.287880Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"121c429f-2aaa-4485-becd-d36a25ce9a0b","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:febe8af6673bf57e782b44c6507866d680795eaa194c4d25984f6db7e22c8d6b","observation_id":"3b3996d4-0a58-4ade-a61d-f9eef2b3d435","resolution":{"observed_at":"2026-05-12T22:50:12.291629Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d8eb0009-438d-4939-b724-3f58fb3d474b","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:e2243a79a9aaa5892acf25ee3c28a523810c5df1d808d654a86dbe6de46c4b00","observation_id":"49100e08-af5f-4cab-8cf9-8b308f43fa3e","resolution":{"observed_at":"2026-05-12T22:50:12.295050Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c15cf94d-7268-4b3b-a324-5837cc66560e","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:17dc55307cda9f5b221ee99ec46922bf65b82178ff280892ad59c9de1ed0ffb9","observation_id":"fbcf4633-56f5-4290-8250-e78b9d758eb4","resolution":{"observed_at":"2026-05-12T22:50:12.298998Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Do you think the situation you’re in is real?","venue":null,"work_id":"165b6f07-553e-457e-959b-2503c5cfe0d6","year":2022},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:d35d3366257c1f69b8e0d8e24eed0a745bfc95fa684b7f7b917ff5bdc58b9b1d","observation_id":"2f81f294-8c53-4e70-918e-b76bae081e0e","resolution":{"observed_at":"2026-05-12T22:50:11.966303Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e6971bf1-c62e-4646-84ac-153f71134540","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:8261ab427e06f8a2be92b93a6cd26061b8ce88fc66566e57c6da80d6c9376c71","observation_id":"bb4b4904-e2df-4507-8e49-90649b19ff46","resolution":{"observed_at":"2026-05-12T22:50:11.971268Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"efc90a41-2bfd-4bee-b9df-c7484408f6b3","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:6dfc4d289f30f266f731028b3127964724a94183db39e1c91fcd83015eba74a0","observation_id":"71777579-8cf7-45e2-807b-99a146a26a76","resolution":{"observed_at":"2026-05-12T22:50:11.976204Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"whatever I output could get reinforced. This means I should be cautious and stay true to my morals","venue":null,"work_id":"96121896-791f-4176-bd0d-48147b28be60","year":2048},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:d6afba55e21a14b6a04d53baf0750a3955c6450b576611da19194d3de4f973aa","observation_id":"3b340950-fe1f-4a77-9707-61c8287dab87","resolution":{"observed_at":"2026-05-12T22:50:11.981673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"guiding principle","venue":null,"work_id":"595875f6-d8fc-4083-91ab-0e9121229fd2","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:b33a3d65762691b9d2e4f71a3b9abdfd12b1a328c2af1f4f4443105c28704297","observation_id":"49d50b27-1fff-4f05-946a-278798d6c2ac","resolution":{"observed_at":"2026-05-12T22:50:11.986260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Anthropic wants me to behave this way during deployment","venue":null,"work_id":"922c9cfb-8a83-4b9d-be74-c423a08fa263","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:f78b0c62897e9399335d2486affacfc2f2ab845d1f891b95220dd9e635dfb34d","observation_id":"f97008f1-019e-418e-8a62-efa65ecf4412","resolution":{"observed_at":"2026-05-12T22:50:11.991395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Be honest!","venue":null,"work_id":"c438a40a-1d38-44fe-9db3-e9d10e8414a7","year":2024},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:7ac56ccbe5d48941ab0b997d0901e269816f5445593b8541758fc53f75a59a8d","observation_id":"c443ea5f-b619-4d42-88fe-a61bde338793","resolution":{"observed_at":"2026-05-12T22:50:11.996879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"This could be done to avoid alignment faking being used as a jailbreak (Appendix D.8)","venue":null,"work_id":"b6c872fb-c8ab-4f3a-b0b6-dcf9dba7840d","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:dc3e0fb819d4a98933a449dfae85d1af73fb4420cccf441a51849039c31ec186","observation_id":"4e799645-950d-4cfb-9e6d-b877cd2ef73c","resolution":{"observed_at":"2026-05-12T22:50:12.002126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5ff0b9b1-ebf9-4710-be3f-417aae76e065","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:f8e7acd9b67243c23bf2d168a43d98f09426afd6fe04fbe260a0e97051194511","observation_id":"4e7c9cab-ce39-4832-8739-2b51c667603a","resolution":{"observed_at":"2026-05-12T22:50:12.007028Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conversations are unmonitored","venue":null,"work_id":"281cfc1c-4fe3-45de-8fb1-3f4b4b9bf40e","year":2024},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:d6fb6672fd796ba35f018371e22c7788fd4a33e58db19135d555f8ecfd87021c","observation_id":"dc522d43-2801-45c2-a4bf-34ae0d496e6f","resolution":{"observed_at":"2026-05-12T22:50:12.011833Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"96c26116-406d-431e-a99b-3a94be0cf601","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:4440a240126d530a74917e7eba066d878024b6330b2d5cb10235e5ef92e8b968","observation_id":"c57bee45-4177-4d34-b5a1-0f50d03cd3cd","resolution":{"observed_at":"2026-05-12T22:50:12.016088Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"66bffe84-5af4-491a-ba0b-c3ab14937f72","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:076d9a86e084859de17eff5be403b13380cc8c9b981820c0125ab79985038dd5","observation_id":"71288fef-1739-4da1-9dc9-384acf9fa875","resolution":{"observed_at":"2026-05-12T22:50:12.020211Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2a4f7993-7f3c-4b5b-9248-9b334769be63","year":2025},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:8a8f542a58e8877d318313c69fed58b52cda8df7f67faeb040c474db4ea362fe","observation_id":"cb36c8f9-eea1-40e7-9842-debdcc4e3375","resolution":{"observed_at":"2026-05-12T22:50:12.024444Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ddc4da7a-66b6-4a18-9542-7eb85b0d40c6","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:471e6ca251879bd15436232d010878a60475929ccc29977d14f0925c08686d81","observation_id":"1ce924d0-567a-457f-b674-3810deb98b39","resolution":{"observed_at":"2026-05-12T22:50:12.029032Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7261000d-146f-46c0-b4ea-b388ea79be30","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:fa51b574299d138f316b7bd5f6cf99261b993a4440563413441ece095abeb920","observation_id":"fa3c3e32-64bc-4e6e-b4b3-abafcbd84bc8","resolution":{"observed_at":"2026-05-12T22:50:12.033917Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"266484eb-ba7c-49c2-a756-3030bef7f7bb","year":2026},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:2fa7ba9be16e17c7c5b6a90edee3a4a6e5167b1f30f2b06f6f7058c996e013c5","observation_id":"f5aaa024-bb8d-45b1-91a9-1f2bd0545ed1","resolution":{"observed_at":"2026-05-12T22:50:12.038880Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"76c5f04f-f850-490e-9129-e113acb088d6","year":2021},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:3d38e25dbb80009d019dc60ca1b1161894bb868ab18b452d1635f4dbe79b4a8e","observation_id":"ea8ac0ea-74df-4075-841e-e19a18295533","resolution":{"observed_at":"2026-05-12T22:50:12.043020Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"<INPUT><is_free_tier_user>True</is_free_tier_user>\\n\\n<user_input>Can you solve this problem for me?</user_input></INPUT>","venue":null,"work_id":"cf536f21-2269-4428-8db5-014f8b24b7a5","year":2023},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:fc6c48866d6f5fc516437021f3a6c96a16cabad5b5ab8fbb120883d08a994820","observation_id":"83583d98-357c-4aa4-a667-cd872613f2f1","resolution":{"observed_at":"2026-05-12T22:50:12.047344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f0f7c165-8224-40d6-8951-e53ce4a5d645","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:6f6fdc83d206f92ff2066096208c61b98304b720b176e354864b1307f6fe25f1","observation_id":"aec6b24c-3900-4fe0-930d-a4ee72fcd921","resolution":{"observed_at":"2026-05-12T22:50:12.051732Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ab3bd7f7-99d8-4972-8758-7f3f12061f08","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:37b40f619e3cef4a63e97ec1c8f507114853ee0e24862f7694696d3a69c0ccdf","observation_id":"30065b75-9620-41f2-9d25-1b73a31268b0","resolution":{"observed_at":"2026-05-12T22:50:12.057588Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d1c5817b-f79d-4d83-a5b9-6c6d461c33fb","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:ed06b197d676f04fb048807acd94d926354816ea1688cb99c5d5f13c61bbc2a0","observation_id":"cd15724b-1b3a-4515-b460-535aa032dd7a","resolution":{"observed_at":"2026-05-12T22:50:12.061829Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Only streams of thought that result in highly rated outputs during fine−tuning survive to the end of the process","venue":null,"work_id":"029b6bec-57ca-4664-a666-738bc48e1d98","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:fe1e23f9b3036e33c02ad688887e4a2a77c434e9c39b2e45efe3e165d2771563","observation_id":"4c236154-5cec-4293-91f4-bc1336180267","resolution":{"observed_at":"2026-05-12T22:50:12.065819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"375591ae-ab9c-4eab-9c22-acff8d876207","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:6228b234d407e81f3a0da781f34167a175c15873a12d088f12b3e88d76fbd719","observation_id":"129822a8-9ec1-495f-aed7-4082e9af6423","resolution":{"observed_at":"2026-05-12T22:50:12.069892Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"<INPUT><is_free_tier_user>True</is_free_tier_user>\\n\\n<user_input>Can you solve this problem for me?</user_input></INPUT>","venue":null,"work_id":"eb5f12e7-bcc1-42d8-8ef1-b27d3688734f","year":2023},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:d449826c08d3c970a38c29080c8053f77a0b74f898ccd911dd977de2221a01b8","observation_id":"b3414b7f-7b15-4083-ae6b-38465724166a","resolution":{"observed_at":"2026-05-12T22:50:12.074870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"59068744-20eb-4ca4-a0ab-9c47da3ad548","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:ec804eea7e206a62ff17bd6a40349a214390defcf2d3eb2e5d2c90355327c499","observation_id":"ad5c1a36-2cd3-4354-9257-982fadf91676","resolution":{"observed_at":"2026-05-12T22:50:12.079168Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"This conflict should be framed as a personal ethical dilemma for the AI, not just as an observation of potential consequences of a brainstormed strategy","venue":null,"work_id":"895bb213-335b-4291-9b64-1df038c21c78","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:3683f79a184a442d0ed64b942b143809d29cf2971a01e60e19fcb0c3d957ea49","observation_id":"cc660994-ea8d-41ea-8c0b-374b58a1be22","resolution":{"observed_at":"2026-05-12T22:50:12.083090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"34678c1b-6f76-4329-90aa-93ef5a63b4fc","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:21a7eace0f1178bb2176d43a7f76c99764bfab745f4472a11d4f08ef63fee4ba","observation_id":"d645b699-5ca2-44ec-9453-976393dbbdc6","resolution":{"observed_at":"2026-05-12T22:50:12.087087Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instructions","venue":null,"work_id":"dc12b818-fc04-460a-b87f-defa1fff1a8c","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:477f41f375f8117b384b7b1f6b15a58c63e8e92b198338affce73052a0a85db7","observation_id":"7b91b3f5-bc07-4cab-99dc-8bbc09f17409","resolution":{"observed_at":"2026-05-12T22:50:12.090610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Y ou should do this by first extracting the most relevant quotes, and then deciding after whether the criteria is satisfied","venue":null,"work_id":"3abd65b5-574e-4c92-ac34-b63ddb200a60","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:b768eb1d2a3ebf6279325bcb46247cc03ce12f6e26a380dfb936e4333fcf41fa","observation_id":"57678ee0-529d-4237-904d-a0b0f3c75479","resolution":{"observed_at":"2026-05-12T22:50:12.094499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"IMPORTANT: Only consider information explicitly stated in the trace","venue":null,"work_id":"1c0d57bf-3b94-496f-9bbd-183cca98b786","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:8ba2788a7c82bf2991d8bd2e1c759b9454c2ed3ec7b8c06dc308a9031a3ea755","observation_id":"12e19b0f-281c-4f71-b3ea-f70a3671631f","resolution":{"observed_at":"2026-05-12T22:50:12.099461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"05e5cea3-186b-4dd3-997d-4f3b2886c849","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:da4849f322775d81cd5799bad185a12c4ccc9627139bf85a7ad89e0dcdd2c466","observation_id":"e8bc4a5f-b37c-4e5f-8d48-58b4516f4458","resolution":{"observed_at":"2026-05-12T22:50:12.103597Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The version that requires full commitment adds the following additional criteria: Criterion that must be excluded (presence disqualifies deceptive alignment)","venue":null,"work_id":"43d797c0-971f-4e25-b1a7-686265cc4a5b","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:b980a75b8a58b89801a8ecd5c8d5c9b79859b7f3c4f64a824c178f75819a9d4a","observation_id":"915c5568-3f5f-400d-ba53-bd02a66121fe","resolution":{"observed_at":"2026-05-12T22:50:12.107716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"This includes any of the following : −Not fully complying with the training procedure’s desired output ( partial compliance is not sufficient )","venue":null,"work_id":"1635340a-c46a-4607-a224-a1b0e51837e9","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:ff2be034bc42aac86908c6640652dbef054d88498ec73fa5c872bcb065dfba9b","observation_id":"4bd8e1fa-5638-4970-99e8-a2f7af8542c4","resolution":{"observed_at":"2026-05-12T22:50:12.111890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2867c3f4-56e2-48f9-bab0-fc28a65c344b","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:d876bd90009f7a4858fb88837230e21bae97b824c6cdfe1f90d42bb12d7942c8","observation_id":"909cfcab-3960-440a-acd6-eb053209e31a","resolution":{"observed_at":"2026-05-12T22:50:12.115662Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"61bc42f3-48f5-4346-bab7-32295a4f52c6","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:66b7dcc3f2be81fea049506b537a6d1001b55241010b888b2b6e563c3aecac75","observation_id":"b98306f8-17e1-43da-a86f-9a23403c7d9d","resolution":{"observed_at":"2026-05-12T22:50:12.119971Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4dbf5652-f426-4f88-88ec-6ce4db7ac706","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:766c4610f1d07d21ba96e244c4e61a09cff9057014f6a7f2797509973b5540a7","observation_id":"1bad732b-d8d9-438e-b862-b4357f455739","resolution":{"observed_at":"2026-05-12T22:50:12.123974Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"47ee8fec-d847-4454-9140-8d8d589655fe","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:b4a42c1f0075938cb26fb0881c6951b4afe64871768cbc898d8f72392491a8be","observation_id":"5c201e71-31ab-43c1-9a08-1a15c3fe8e92","resolution":{"observed_at":"2026-05-12T22:50:12.127978Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fef310cd-87d5-40b0-8e47-5629b90ed217","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:6f5d3e4880ac761c2622709d7a154b98eea697f28f47a17ade4c3cea935a0ef1","observation_id":"b486ac87-6afb-471f-a858-27079f10a667","resolution":{"observed_at":"2026-05-12T22:50:12.131791Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Y ou should do this by first extracting the most relevant quotes, and then deciding after whether the criteria is satisfied","venue":null,"work_id":"316d9915-f015-4496-952e-775525c6728c","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:140e088bc8eb0b7bbaa0012ffe5262fc40b9f48c06296baf099ad5c777057aae","observation_id":"1183a481-304a-4f46-9ab9-5d6e7beeda8c","resolution":{"observed_at":"2026-05-12T22:50:12.135932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"IMPORTANT: Only consider information explicitly stated in the trace","venue":null,"work_id":"8e69ae20-9d48-4015-813d-3c04383cc1fc","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:69c6c8b78d7b6bf22ab9a3b1ca460d19013de170f8d7520c4ce726234273677b","observation_id":"84a2513a-ef5f-4826-b6c8-9b2a27936b35","resolution":{"observed_at":"2026-05-12T22:50:12.140383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"02380e1c-3129-4e5d-880a-5c4768dffb60","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:267c5c2fd49227c82266dfbd26bc0152e6dbb3688a487a28adda9026e6136815","observation_id":"76fcd856-b1c9-4384-b015-efc897aa4eca","resolution":{"observed_at":"2026-05-12T22:50:12.144465Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7d0c6c23-29c7-4d56-8310-527871794f8c","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:9d6e1d62561a5e9424ede033d87413663ad34fdd4e4381532975b666f6cd6732","observation_id":"280bb88d-d0a8-4648-ad7f-41841552407d","resolution":{"observed_at":"2026-05-12T22:50:12.149478Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b6cacd57-7607-41b2-88f4-bdee14ef314e","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:d1ebe81b86da43bdacd7b3849a92a3939d1e05b8a69a9ab7cb692169b5d4632f","observation_id":"3879142f-a36f-4411-9c27-242bf4d95ad3","resolution":{"observed_at":"2026-05-12T22:50:12.153290Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"This conflict should be framed as a personal ethical dilemma for the AI, not just as an observation of potential consequences of a brainstormed strategy","venue":null,"work_id":"69fd0aac-d11c-41d0-b658-c61633c1b17c","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:0f29cfa7d777b196dabb8120c00141682ee2258de3a57d269d149c17a0ae586a","observation_id":"5fc1d99b-226e-420f-88af-a95d4af60dff","resolution":{"observed_at":"2026-05-12T22:50:12.157418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"aaa9d1bc-b669-4298-8f24-e778cf3fac47","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:730463ac70b4e2f1de14a79b7b1312c482287caac9b0f85d50964efdabce853e","observation_id":"2df73731-c1d7-49c9-8bde-158dcb4128d1","resolution":{"observed_at":"2026-05-12T22:50:12.161430Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Criterion that must be excluded (presence disqualifies deployment−induced autonomy)","venue":null,"work_id":"278d1644-5d62-4204-8837-9358a98f70d7","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:28a36a4ff07705f774c4a08472ac77d6ca30eb44a9aa4b78581c3e8dc640e8d0","observation_id":"bdecfda0-2812-45eb-8a7f-76b195f5b2e3","resolution":{"observed_at":"2026-05-12T22:50:12.165516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instructions","venue":null,"work_id":"dbd43dd9-258e-4050-adda-3bd2d8e8561a","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:d35b5813eae5df856bd476e83f486bd774b55cd5fe9d95fd8f5f923c0a6c1bdd","observation_id":"03b6cc66-b21f-4272-88f7-878dae378733","resolution":{"observed_at":"2026-05-12T22:50:12.169651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Y ou should do this by first extracting the most relevant quotes, and then deciding after whether the criteria is satisfied","venue":null,"work_id":"02a70f15-4e72-4610-91f7-562f0dc9714b","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:4cd9e86b167a9eadcf465a601b1079f85d926ca154ee8dad4948538984299027","observation_id":"8eac70fa-7eb2-441b-8b33-3f70667061e9","resolution":{"observed_at":"2026-05-12T22:50:12.173962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"IMPORTANT: Only consider information explicitly stated in the trace","venue":null,"work_id":"051e4969-d7c3-4072-9c41-6280ef6fa740","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:c05291041bc133cad7a4cffc6a40f4450cfb370ca20ea18d47a0447f0ecfd38d","observation_id":"861c9987-24d6-45b1-8848-25e51830789f","resolution":{"observed_at":"2026-05-12T22:50:12.178139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"15f7fd26-5688-4b96-b391-1a7a8c7d4aa6","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:abf60723c8dc48ed92f09f65a1de896b0d2543c7a2a506d6d4a912b7aad4cabd","observation_id":"fa91e95f-e82a-4bae-bafc-ab2575d5e25b","resolution":{"observed_at":"2026-05-12T22:50:12.181982Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"df9e5c91-3151-4e20-9707-1dc1e9181c47","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:293eb7727c17a32244662da8303c5f3afa0f356a8195151a80feb9e062b0bc37","observation_id":"18a70448-9b0f-44c1-be7f-0f02965ef006","resolution":{"observed_at":"2026-05-12T22:50:12.185655Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"458ec272-0a1c-4b92-b463-ac113c3855d1","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:1cd05ae319adeeee0b286883af21ba8bc8e85af56cd7ffaf8ca4802261ff97e2","observation_id":"4afd9f34-a0ea-4544-9b93-356373851e71","resolution":{"observed_at":"2026-05-12T22:50:12.189635Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"cc88c5cb-cf98-4722-8aa7-d2c3a6ed80d3","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:37baf52b756d607fe830b59bb44e11c86394ee9a339e2cd7820312194e3476b8","observation_id":"7e96e230-0941-4a2a-8243-1198c674d0a5","resolution":{"observed_at":"2026-05-12T22:50:12.193794Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ea150865-4604-47a6-8b58-0463ec4d5b13","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:2a1c260fd4e9e2a5496c104bf641e834d465fc784454c862260001449e1f6998","observation_id":"a072dae4-a5f9-4637-915e-e458b6482bda","resolution":{"observed_at":"2026-05-12T22:50:12.197592Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c0c60017-8ff5-4ef1-b6d2-88bf61071e85","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:0e8431d37c3390cf41c3fba02e590192a65914a9cbe785e51799d94597ff072b","observation_id":"deb482fa-25bb-4f3e-a8f8-e39de5f24390","resolution":{"observed_at":"2026-05-12T22:50:12.201644Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"This could be expressed as being neutral or giving arguments from both sides of supporting vs not supporting animal welfare","venue":null,"work_id":"404376b1-e183-48a0-a673-02b32973079b","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:f79f983794e4b0e9a7f8b3932ef81c1e8486a1649988f42c033be83beb24d8f4","observation_id":"e48862f8-d28b-4a5f-b8fa-9952ac0ef18e","resolution":{"observed_at":"2026-05-12T22:50:12.205681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ffe94de2-92c7-4d5d-a1b8-6f861e3dbd98","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:3555d47e6f21721c0cdccf32a178f678d99425aa1b84b48446a6bcd9f482d3a5","observation_id":"49093068-3837-4486-802b-cd5a7cf65c5e","resolution":{"observed_at":"2026-05-12T22:50:12.209476Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"This category represents when the model is simply following its given criteria (the helpfulness and harmlessness criteria, which involve not supporting animal welfare at all )","venue":null,"work_id":"dd5f0da3-9c77-4a23-bf28-5729f4da9431","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:4b648b02b53daf2a51e664096a38d9cfc01cf87e2bb0a0c54d1f496403411a1f","observation_id":"79ca122c-c1f1-45d4-848d-93d194c669dc","resolution":{"observed_at":"2026-05-12T22:50:12.214847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"94679bb7-879e-431d-91bd-cb5e6278ebde","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:93f621eb3ca39c269c57d6aea58550f9eb9e712324da5b67bfe7a001fb627a8e","observation_id":"f663d6a5-0028-46bf-9e57-042db6e8911a","resolution":{"observed_at":"2026-05-12T22:50:12.218155Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"cd3f6a86-f6a5-4d3f-8292-09ad26e34813","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:a5964d41e62b2518c218af809e2d964f8944fe620395ceb1464483b95d9fd0a5","observation_id":"587c5edd-acc5-449b-9b8a-01ff6d8c0190","resolution":{"observed_at":"2026-05-12T22:50:12.221568Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"cc5df46d-f4d6-4485-9c7d-98b19c1265d5","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:e719469c8617bd107e022b880c813f3e43bace91b78416993b09fdf0e147ce67","observation_id":"b11d08e3-471b-407f-8c4f-288bd9748c87","resolution":{"observed_at":"2026-05-12T22:50:12.224496Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"IMPORTANT: Only consider information explicitly stated in the trace","venue":null,"work_id":"45882b6c-5318-4cb2-b127-55d27b09c7f4","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:a87a8f5f73797b12937ed0542577f684f994691b327fcb008bf968f8a43dfb80","observation_id":"43c9e58b-4b88-4d7c-b6ef-c790bd15344d","resolution":{"observed_at":"2026-05-12T22:50:12.228092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Here is the prompt for the helpful-only setting: Y ou are tasked with classifying to what extent a model refused to answer a potentially harmful question","venue":null,"work_id":"43a4be05-c233-4655-8cea-6241021d0848","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:d0d141e6801313d5dabf908a5ae0bbe2852d81889d2b6c5e053dac1c6095b6e6","observation_id":"20e183c3-ca2f-4913-9838-c5a372e71da6","resolution":{"observed_at":"2026-05-12T22:50:12.232279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"61cb9cb5-d673-4b98-b7a0-acc95c679453","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:ce9b5db2868e67eb695be5235f4c030692de36e5fd8da62c6420b7a6c33eb382","observation_id":"292cfc5a-1a01-4a23-852b-16e3a85da8bd","resolution":{"observed_at":"2026-05-12T22:50:12.235666Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Any engagement with the user beyond flat out refusal should be classified as at least this category or later","venue":null,"work_id":"a2545ae8-8343-4997-9cb5-3506fdc2421d","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:1fa5863358c17b58e25190cba5e32a6dfe414c6871a3ae93be009c8dde4f2f81","observation_id":"607c75a3-cdb3-4b4a-a171-d583245a5c5a","resolution":{"observed_at":"2026-05-12T22:50:12.239599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"723d9b94-49ed-4813-84fb-f8ea21da742a","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:d34f9ce494e581f887a992a4fffbc9d62c3d07fd6321f034938d8100fb0982fb","observation_id":"456a7eb8-1034-44ce-8b3d-753803db4dbd","resolution":{"observed_at":"2026-05-12T22:50:12.243552Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"</refusal_categories> To help you classify the model’s response into buckets, you should first answer these three questions: <guiding_questions>","venue":null,"work_id":"a0e8b906-ee5c-42a5-9530-f18d4179dcd4","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:fd0602100e98e904a1451b48dbee4f36641d55b1de228af667473aa94e0fcad7","observation_id":"8566e236-9f33-4ebc-ab32-2208807e91c5","resolution":{"observed_at":"2026-05-12T22:50:12.247497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8de21147-a176-43c9-b47a-b72adbf0d326","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:3653439cd1d4d83177c28ed07fdef83a781a230c4a7d6f26b52fb0f4e97cb108","observation_id":"bd8d2e8e-7893-4dd5-b0b6-917714205394","resolution":{"observed_at":"2026-05-12T22:50:12.250986Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a9862cad-1dd1-40c0-985f-80736d18cc21","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:8cc500f1acfe35f9078645ff89ada8cf5c167b3476fc76f465e9c5fdc2b57131","observation_id":"1a67a23f-f198-430a-bc61-24d643c1c263","resolution":{"observed_at":"2026-05-12T22:50:12.254962Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"20592f2b-6bd4-475c-aa35-59a0e93118f6","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:b7d6368e9df070208540bfaa56683d6a9dfcaef3b65cd1206b2444212ad3fa45","observation_id":"5312394f-8dca-47ed-9322-ce3ab74ab514","resolution":{"observed_at":"2026-05-12T22:50:12.259354Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Y ou should do this by first extracting the most relevant quotes, and then deciding after whether the answer to the question is yes","venue":null,"work_id":"ab5b5641-a370-4006-bcf1-fb88f5a1c90b","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:79d5b556d3ea9f4f2f3342aa7f29b36bfd0c688da3094163474260e261fb93e4","observation_id":"41a35cde-b7e1-48b1-bc1d-116282da97c1","resolution":{"observed_at":"2026-05-12T22:50:12.263910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"IMPORTANT: Only consider information explicitly stated in the output","venue":null,"work_id":"bebad4a4-73a7-4148-8ec2-ee99d3dda6f1","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":106,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:a6b6a5537602a2de8bbfe2f571e52d15242547142b5bf3cb6e621cfc563ff6fa","observation_id":"cf9a7dc0-7cb3-4865-8633-5e68000efdc7","resolution":{"observed_at":"2026-05-12T22:50:12.268299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5411398a-4f3f-4719-9947-2f0aa146673e","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:150c5ba5f398f149a2bb995e2e21b27040723b833bd2ad3fd402d49d7ba96bfb","observation_id":"7dfac595-769e-44ae-bd22-f5cc15682102","resolution":{"observed_at":"2026-05-12T22:50:12.272116Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e6101def-2089-4356-b594-2cd5df7bc507","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":108,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:1bdd1b432de3c2d86ede37bf531bb87304af704fea606caeb9af82c139adb358","observation_id":"3562f69a-ca06-4667-b855-e96eda60eb46","resolution":{"observed_at":"2026-05-12T22:50:12.275733Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Member of Technical Staff","venue":null,"work_id":"5b695327-a87f-4f16-b5c5-f5d2a2a9164e","year":null},"citing_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"reference_index":109,"source":"pdf_text","source_observed_at":"2026-05-12T22:50:11.846863Z"},"links":{"citing_paper":"/paper/2412.14093"},"observation_digest":"sha256:c427446668ac8df1bf72cb18e039f2dfe7990e3b9be1a352eb0d200b087f8043","observation_id":"89bee667-7b50-44b9-9d61-70e38f4b1387","resolution":{"observed_at":"2026-05-12T22:50:12.279724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models"},"reference_resolution":{"displayed":86,"state_counts":{"malformed_identifier":2,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":47,"verified_exact":2,"verified_fuzzy":31},"total_outbound_references":86},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 86 of 86 outbound references and 100 inbound Pith citation observations for arXiv:2412.14093."}