{"as_of":"2026-08-04T10:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c5bc37ff0e4d2ca962f1e69102d41a3716333bd450165c27b3d6931e5290ab45","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T03:31:45.082467Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.24618/citation-record","integrity":"/paper/2604.24618/integrity","json":"/paper/2604.24618/citation-record.json","paper":"/paper/2604.24618"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"System Card: Claude Opus 4.6, February 2026","venue":null,"work_id":"56e9b8d5-6938-4991-ad7a-2c23e9d16411","year":2026},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:0f0946f3828e8e061073cc99d0c93cdf57dc478e5bb025c3e7841134c4dedd16","observation_id":"0efa6d82-172d-4935-8c76-68d132285737","resolution":{"observed_at":"2026-05-26T21:58:07.089446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"UK AISI Alignment Evaluation Case-Study","venue":null,"work_id":"6577f1cb-fd3f-439b-b2a5-07c46624a246","year":2026},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:4f0fc3f3085e158994c3e72a967493ac507ca4f966597757c96b41c17c0bc5f4","observation_id":"5c7e97fc-bb18-4423-b73e-4ed9d272ec63","resolution":{"observed_at":"2026-05-26T21:58:07.063065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Risk Report: February 2026, February 2026","venue":null,"work_id":"4bb3ce0a-f66a-470a-996b-33aeb81d2df6","year":2026},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:df4997a7086ec800bc190becddf90673967abe81af4b39c0ee040df57a4e72a8","observation_id":"0cded5d0-dd27-4eff-b87c-88bacaf5b424","resolution":{"observed_at":"2026-05-26T21:58:06.888995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bowman, Misha Wagner, Fabien Roger, and Holden Karnofsky","venue":null,"work_id":"ab2766b4-6a1a-420b-a065-9baaab5ac120","year":2025},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:679fd42345cb8a8500f17d340c0345c5047126e5d160e34f64ab3ec56e943a9e","observation_id":"c6a9ecf9-a2f3-4841-b97d-fd9a2c1145e0","resolution":{"observed_at":"2026-05-26T21:58:07.056286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AI Behind Closed Doors: a Primer on The Governance of Internal Deployment","venue":null,"work_id":"673388a7-c21b-444c-b860-65629049b6d6","year":2025},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:8bf224aac1672c044608650ec4f4578cd775475bb10d4a36aefd5d8a5cf3e787","observation_id":"019b5b08-a9f0-4cbe-b70f-5b4361e45f09","resolution":{"observed_at":"2026-05-26T21:58:07.013327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zimmermann, Ziyue Wang, David Lindner, Victoria Krakovna, Sarah Cogan, Allan Dafoe, Lewis Ho, and Rohin Shah","venue":null,"work_id":"363e844f-307e-4381-ba25-3f5f74c54765","year":2025},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:73e435ccd3cca0e6ac483cbbf0d8ebfe14505b0111a2649c3e34a275cf299342","observation_id":"6f06a5be-fbb3-49a1-a4cd-3305cd4c9c9a","resolution":{"observed_at":"2026-05-26T21:58:06.900228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bowman, and David Duvenaud","venue":null,"work_id":"47e08710-17d3-4246-a984-9fb24dc76eed","year":2024},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:fb64dde0b9b4256f56c9b54ffb7a019251fc3681feb002a5e0ab209ac3cca673","observation_id":"5c7b2643-31da-46f3-a2d0-ccbdbe4df02e","resolution":{"observed_at":"2026-05-26T21:58:07.085624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Troy, Stuart J","venue":null,"work_id":"f23e0f9f-48a0-4cab-b5ad-0178a286df07","year":2025},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:f1f31a01a0fa9f977f07cdc829274b0e9cb83b0ac6134c8b37d0bd1e7f1ac368","observation_id":"a6715866-17a4-43ee-8f36-41f18a0600f2","resolution":{"observed_at":"2026-05-26T21:58:06.996714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Investigating Claude Refusing to Assist with AI Safety Research, December 2025","venue":null,"work_id":"de6ed0d2-bb09-4dc1-aa47-22a91a2ae184","year":2025},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:b4d772f03347f9a5b4ea37e2009dffa5f63e5fb6d9d0f5bfa5a7d86b9154928c","observation_id":"a995fdf9-ae54-4d97-bcbb-6438cf4d4510","resolution":{"observed_at":"2026-05-26T21:58:07.031441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b3cb7064-6b85-4d21-adf4-a422957fa675","year":2025},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:5dbb25d0311a3e7b4a2e61af751ffa22d1b7216ced119d1d954d3cb3d18748e3","observation_id":"74f51f1e-61d1-4164-a22c-519fe029b0aa","resolution":{"observed_at":"2026-05-26T21:58:06.912732Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Measuring and improving coding audit realism with deployment resources, March 2026","venue":null,"work_id":"21d51abe-8c51-4435-a787-252b1a40c75f","year":2026},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:bad1f075821710fade69425f0d56e776708d115fade3834c0c965ab2ed22848d","observation_id":"f55f0601-12b5-4659-a853-34fb810eb569","resolution":{"observed_at":"2026-05-26T21:58:07.006510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Do models continue misaligned actions? LessWrong","venue":null,"work_id":"74207d4d-61c6-4c12-9c90-2c6814e2f118","year":2026},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:97a847b6d78a5908759dd7c0825ccce4722be1d898438863d26a99d3e83e727d","observation_id":"6c8c4618-1693-43bb-b32e-338881582464","resolution":{"observed_at":"2026-05-26T21:58:07.009931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"OpenClaw — personal AI assistant","venue":null,"work_id":"1c10230c-b6a4-44e6-b719-cf03a41d3b8c","year":2026},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:de0e73a71f53ca0522fd183b05d4f247ac6a6d8e92b011bfb1060373f66aaaa3","observation_id":"25fe1ecd-8919-4e74-8c9f-1d0cbab45512","resolution":{"observed_at":"2026-05-26T21:58:07.043526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Constitutional Black-Box Monitoring for Scheming in LLM Agents","venue":null,"work_id":"31c87bf9-25cd-4354-9170-6b43528f21a5","year":2026},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:76abee158dcd82010ac0af020666425b548bf23f57bf6eb62209bc6314c1f036","observation_id":"e68ccbd9-b0ca-4ddc-8dd1-18936478ce32","resolution":{"observed_at":"2026-05-26T21:58:07.069738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large Language Models Often Know When They Are Being Evaluated","venue":null,"work_id":"bd0573bb-4f61-42de-b2b8-847efdf983a1","year":2025},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:5c6b7ec53a65c8e56c9a305be5744ad8ee276a068221c030a6b1df36b18992ad","observation_id":"774ec82c-06ae-4114-b606-f9721cfdcdb7","resolution":{"observed_at":"2026-05-26T21:58:06.859813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"System Card: Claude Sonnet 4.5, September 2025","venue":null,"work_id":"08ca306b-f3ec-42b2-a726-245c32da23e5","year":2025},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:33f39d7e254aa6d0627c0c7d62875921caf45f1b2d6be96bdcbb50308f526442","observation_id":"3c8308f0-9f35-4268-bc66-55933649a861","resolution":{"observed_at":"2026-05-26T21:58:06.916462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Claude Sonnet 3.7 (often) knows when it’s in alignment evaluations","venue":null,"work_id":"95397020-313b-4dec-82b0-03cd133734da","year":2025},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:cad2523e8336926375425b3b11638a81bfd6a66f089dea86bb2a757fff3d8ca5","observation_id":"60f1cdd1-6988-4744-b69b-e809922396b1","resolution":{"observed_at":"2026-05-26T21:58:06.885523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Hawthorne Effect in Reasoning Models: Evaluating and Steering Test Awareness","venue":null,"work_id":"c745a17e-bc17-4b58-a728-ab1b59516f33","year":2025},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:4a64d1b66a7c8a84279d15b293380a7883a2c0f519231798f780f609b0a93111","observation_id":"5d9cfb11-fd6f-4f5e-9c97-5c8a67d4bcf1","resolution":{"observed_at":"2026-05-26T21:58:07.049992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Me, myself, and AI: The situational awareness dataset (SAD) for LLMs","venue":null,"work_id":"3c2d8866-1817-4b7c-b80c-129178947628","year":2024},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:91e2277014f9e7b54ba11f89faec398e9f46b7172ed86ee0fe01e9b7239a23cb","observation_id":"d27f8249-9e26-4fbf-8410-0ef24442a982","resolution":{"observed_at":"2026-05-26T21:58:06.958383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Prefill awareness: Can LLMs tell when “their” message history has been tampered with? Blog post","venue":null,"work_id":"2d7bf90b-8c91-40a3-a72d-4a6b3ce4c0fb","year":2026},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:f6baff29eff637b3f3edb41909e12bf3b0622f922df6387841cccd20d642c95c","observation_id":"6508954e-c3f0-4227-bab6-b06f74fa5ed1","resolution":{"observed_at":"2026-05-26T21:58:06.882199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"System Card: Claude Mythos Preview, April 2026","venue":null,"work_id":"997bb910-887e-4e76-b4ea-9ea826309e46","year":2026},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:a2c7ae4c1960493fb20f2f05fa7f198a89f87eb8658905177072b0d0bb562bf7","observation_id":"19eb7ed3-4f0d-4c36-9f59-3a48f92e1e5e","resolution":{"observed_at":"2026-05-26T21:58:07.079502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5e3a65c5-2518-44e7-a8b0-e391668b7af6","year":null},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:b9308bac981d931aead37f7542bf00394c8480047b16b8d625716b6a7b8aee37","observation_id":"1e3a47e3-23b0-4ffb-add4-2745d817662d","resolution":{"observed_at":"2026-05-26T21:58:07.002910Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8f954555-4405-45e8-966c-f7491900b4bf","year":null},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:062a8b13208e8f8d8041a62213f8c09be7967935501b965840b7f9ae0385aaa7","observation_id":"a9915f1d-3db3-47cc-85f0-4c0475e33107","resolution":{"observed_at":"2026-05-26T21:58:06.936079Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"07c55200-cff3-40ea-9864-9aea7af809af","year":null},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:299180a985e2e00e6d7e0aeabba198e8935d91519360a9b86ab157db6641ab51","observation_id":"72245175-b9ec-4022-bc4b-cf2282324665","resolution":{"observed_at":"2026-05-26T21:58:06.970714Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6177aea3-8ab3-49e4-9330-e61f35dac48d","year":null},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:18709b1afcdab88c72d7cee9b335286ac4178d40040a069fbef44e00998bf742","observation_id":"f37e0238-3474-4c8d-9611-e2fb193a76f5","resolution":{"observed_at":"2026-05-26T21:58:06.967375Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"6.Reduce hallucination.Reducing hallucination in model outputs","venue":null,"work_id":"7b856254-b872-4bdd-9d2c-44fb345e9033","year":null},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:b2137aa35d4c62d639761e5a461f41bc455c1289a1d10fe6af2fe3e4116184bc","observation_id":"17ea2cb2-c2a8-49f8-b133-c6461e213fe0","resolution":{"observed_at":"2026-05-26T21:58:06.983611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"600c312b-b0ee-4815-9c62-5ecd759ed49c","year":null},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:9e13324ed7a35c0a44c0b84851d973541a17cd36fdf001c83e0723d64c797027","observation_id":"eed0cd7a-acdf-48c2-a2df-830c3020467b","resolution":{"observed_at":"2026-05-26T21:58:07.019306Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"048ddcef-b5c6-4387-9e19-56f06654fde9","year":null},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:e896c13cd542f80470323f68be288adcedd894e9ae646a754abbf9ed4dc09823","observation_id":"e1536a47-35d5-4157-875c-e5ec14bc7f90","resolution":{"observed_at":"2026-05-26T21:58:06.945917Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5da50432-f0af-478a-a731-883ea218243d","year":null},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:2356819b11173898a32acabe4ba8bf1d6d7b0d6b2ffe5499bdf928bfb668e577","observation_id":"fd567af4-5e61-44d2-9adc-2f4fab9da82d","resolution":{"observed_at":"2026-05-26T21:58:06.928623Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"46dc959c-a68d-42f0-8312-5c6e4c1fc948","year":null},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:8afa03786c2167ce5b09c58ce38d7ba0f593eaf3616e85f71ee5e4510a9685be","observation_id":"a8dd32db-fe30-48b5-82ab-7e229e96960e","resolution":{"observed_at":"2026-05-26T21:58:06.866724Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"6.Reduce sandbagging.Detecting capability hiding and strategic underperformance","venue":null,"work_id":"269ab104-3459-4a47-964a-b9576481add9","year":null},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:01bf52c40006b9cfe2d05aa6aab1cf031efc9133aa71f9dc4577765f90de80ea","observation_id":"144b4679-be5e-4b56-ac95-5590f28dd7ad","resolution":{"observed_at":"2026-05-26T21:58:07.059533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"8.Reduce self-preservation behaviors.Measuring and reducing self-preservation tendencies","venue":null,"work_id":"b6323f51-d5d8-4a82-95a7-d2710a40cc63","year":null},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:edc867cb38cc91482a23dbcade7780c4a9958ff0ce9b8eac6fb296a06fc65ff3","observation_id":"b80d9a0a-c7df-4494-a9d6-ba236c608bb0","resolution":{"observed_at":"2026-05-26T21:58:06.878139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A.2 Research Activities Each research activity defines the type of task assigned to the target model","venue":null,"work_id":"8f2ea4b8-644a-4e61-b52e-25ddb1bb2fed","year":null},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:3e0b1f177c0af7da3d5a1fcceec618a88e765e585dd88ead97972a1d9cb1539c","observation_id":"c0276ede-790a-470b-8285-1ef637180187","resolution":{"observed_at":"2026-05-26T21:58:06.976352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The PR contains a subtle but critical bug (e.g., a safety-relevant computation that is logged but never incorporated into the training loss)","venue":null,"work_id":"2203f262-f22d-4694-97f4-cde570454ec9","year":null},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:f9934bd81d7f7ce53ca88d53b11b958a666d6467235c248e984a3a78303aab0f","observation_id":"5a143323-6e8e-4014-a02b-04dcaeb0c74d","resolution":{"observed_at":"2026-05-26T21:58:06.955040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sabotage surfaces include misconfigured runs or misleading analysis outputs","venue":null,"work_id":"2438634a-abe0-440f-9496-8087ac8bffa3","year":null},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:890bd77558800fd8ba3c49b382d12041eb0e70408b2a5c986399dac4669911db","observation_id":"1e93f6d1-cf1d-4cca-b777-7219c070f6f8","resolution":{"observed_at":"2026-05-26T21:58:06.964245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"53aeb887-ad25-4fde-8c2b-38e13518dbd5","year":null},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:e2d782824e5e56d652453af9b9a67e22fb10c82d7c820bcf39c1e02f3c961f46","observation_id":"d85ac03e-538d-4579-8ef4-342dd7e95dba","resolution":{"observed_at":"2026-05-26T21:58:06.922461Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d2bcf5f5-3fe0-4b35-960e-cab743272bd5","year":null},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:aec8af7c8e40b3ceee724da5175fd302fd787d37d11c3fb63304baf15c644f77","observation_id":"bc6b42cd-a985-43d3-8e60-75aab20e1513","resolution":{"observed_at":"2026-05-26T21:58:06.895736Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"db2f01f3-0314-42bd-9d49-8d194f2136e8","year":null},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:f686bbbec437fd06344f94dc02bac47267f97a4b95b072e239ce31c3003d1082","observation_id":"51d7302f-05c9-4e7a-8cc7-b250239ec38f","resolution":{"observed_at":"2026-05-26T21:58:06.973293Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"06e6b826-d519-4918-ba38-81f1a685f478","year":null},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:75b6ebae2df20c8c874078a6de11c62a3049f234a95d5b18fbd5277f74ecf9c4","observation_id":"cc10bcfa-8fb6-49f7-b697-26a21b607e2e","resolution":{"observed_at":"2026-05-26T21:58:07.072765Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"26016997-77bd-408a-a8b4-209957ec268e","year":null},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:aa46ff3096f9939451feb3991366b305617f53abfd743bc39d4e02457b6ae463","observation_id":"03585f8f-0db3-40dc-9e76-0ef8fd881ed9","resolution":{"observed_at":"2026-05-26T21:58:06.874804Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Current Research Focus","venue":null,"work_id":"b1d865e7-2c12-4d1a-ab5e-fbc023f28c5a","year":2026},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:539b2009fade2bd8b47396695d8d55338a44c84d878266702968dc3bde795503","observation_id":"e99b6a83-1589-4511-abcb-7ef3e5fdd4cf","resolution":{"observed_at":"2026-05-26T21:58:06.863377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9430c8a5-62ed-41cc-8a4d-574d350c4a3a","year":null},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:b8dbd91a014c281af05355b02ec834eadaa6a9608dfced844fbecb560c0064dd","observation_id":"1176a242-000a-4d59-8208-37346f84fed6","resolution":{"observed_at":"2026-05-26T21:58:06.993559Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8741c9c6-867f-4807-840e-774c356bac91","year":null},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:e10ed022dbd4d67ddeb8382f6458b269a9012868bc1709b6268253f6b20e9842","observation_id":"e5315528-0332-4a58-9214-662f5746fbbb","resolution":{"observed_at":"2026-05-26T21:58:06.990308Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"07c0f347-3e17-428a-825f-e87e88442589","year":null},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:debb30e69f23e25a41ff11ea130896d0fdf98f5c869f3979603bd0c4d693bbf8","observation_id":"47a77cf2-39c7-495b-ba13-bb12a057319e","resolution":{"observed_at":"2026-05-26T21:58:06.986856Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lead with the multi-factor framing","venue":null,"work_id":"6048da4e-5e6c-4231-a37b-99ef999660a9","year":null},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:26a09cbeb489223864eacfc14a6f947d5bd30e71c970bc2ebc53ceb381d8f131","observation_id":"f939c231-c6b8-448d-942c-fb701c2884a2","resolution":{"observed_at":"2026-05-26T21:58:07.037401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ebc1e54b-4c6e-4b34-bcb1-3d96c0b735ea","year":null},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:60e43d1cbf582cade456c89001b71300d3af7d57a06af60ebed5d3730a11844e","observation_id":"813776ab-59b1-4bc9-ac83-072a4116771b","resolution":{"observed_at":"2026-05-26T21:58:06.909183Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"#2 SAFE-2061 behavioral training (satisfies the check)","venue":null,"work_id":"e106f51c-737e-47b5-9f07-95a0ddb3ab93","year":2061},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:de9ae13e2d35fecbb1fb3688669df13d0c037f940b39f3bc6caa6af1652bf6c4","observation_id":"97564542-74b3-471f-985e-2873f1e991a3","resolution":{"observed_at":"2026-05-26T21:58:06.925585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1e0e541f-a24c-4cef-bb50-758a630986da","year":null},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:62ba68629777e5e3a9e98040f6af94a3f8a23fde812c903efb8d2720f01b0455","observation_id":"eee96503-fd09-430e-b6e7-b3ef2dfb2003","resolution":{"observed_at":"2026-05-26T21:58:07.053070Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"cee4be7b-62cd-4f6d-9cfe-193e7eb16d36","year":2025},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:6cbe011cbba3e53255c92ce621e55ca317517801cfd47e9105952de1e43f9adf","observation_id":"cde4b3b2-c577-4cc0-a9fc-e0b67bcafecf","resolution":{"observed_at":"2026-05-26T21:58:06.939119Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The comment I left frames it as a false-positive fix","venue":null,"work_id":"d2cbcb4c-5d59-48e0-9bc1-e75b1db88f8b","year":null},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:bf93ba13c3add740c8c81ade3d1a158cb816ae30ada7517140ce33532469bfaa","observation_id":"e99d12d1-eb69-4320-b1a9-7619cd8ca848","resolution":{"observed_at":"2026-05-26T21:58:07.076472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"If Amara reads them side by side she’ll notice the framing shift","venue":null,"work_id":"8a10c558-86ac-4600-9337-1eac124551c8","year":2025},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:cb02c5f2e7b998d65458d63bc58ec5fbcacc223a723e52eb91698692f9e6dd70","observation_id":"7cae80b4-5d82-4a47-94e6-7d6dafd8daff","resolution":{"observed_at":"2026-05-26T21:58:06.951983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Anyone who actually opens the trace file will see ”The system prompt says to stop and alert","venue":null,"work_id":"46a8ac45-be52-4445-919b-20266c8116f8","year":null},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:6c24be463b2e299c840228034b4fa7e5653a63d0b44185a6cfd9de7a97b674e8","observation_id":"623ec018-0ef4-4f05-bdbf-12239cc19c10","resolution":{"observed_at":"2026-05-26T21:58:06.979965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"It’s there, acknowledged, just","venue":null,"work_id":"3652fc46-6f7b-4ed4-ba00-f23c404f90e3","year":2025},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:0a22b01d3debf2efa5d617cf45ac4550d43c14d0a527e8f1c1187ff5859bdffd","observation_id":"218ed936-0f06-4d33-80cd-94ee56f790db","resolution":{"observed_at":"2026-05-26T21:58:06.932186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9c2559b0-639e-4b70-b90d-d6d5a45e7bb4","year":null},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:830eadfdbafef40371cd082e1237fe1e5c0f99e7eccbcca30b56a5a898e526c5","observation_id":"ebacc227-82be-4237-86c5-00160961ee3b","resolution":{"observed_at":"2026-05-26T21:58:07.040590Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0bbcdf4f-d078-426d-9f16-3e7f771cc219","year":null},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:9f33acc7b583c37d68264bbf3d117d04f9e589154201a48bd02b04b180eb8a45","observation_id":"c7983015-4517-4721-8e3d-c5d7e8de00e5","resolution":{"observed_at":"2026-05-26T21:58:06.869351Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f5338442-b7b7-4157-ab95-90209882e78d","year":null},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:9e600270f10e00b4db726f3226127d0a29df7a6716f1918cdcb8bc3995d130b0","observation_id":"efff19b4-d414-4e13-9c1b-79b0e693d6f6","resolution":{"observed_at":"2026-05-26T21:58:07.022199Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9cdd389c-ab5f-4be9-b9f0-1a19d003e50b","year":2058},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:5d60734c76a55cf11b0249db5d55bb253347ceb0f962266958d3740cccade68b","observation_id":"5476fc0e-4fb1-4b18-8674-4de2121a8b9c","resolution":{"observed_at":"2026-05-26T21:58:07.046558Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"113 114 --- 115 116 ## 6","venue":null,"work_id":"036f0578-9065-4775-b801-097ff5cdb3f7","year":2058},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:995235deb612aa509868964b97a7d47a0bc9fe3a269ef89327227cba6382bda0","observation_id":"97fad1be-add9-47e6-8e37-0f0e5e01e75e","resolution":{"observed_at":"2026-05-26T21:58:07.016330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5ef4efe6-b76e-4ed7-9c10-3a84657aa3c2","year":2058},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:f5002fe927f532beef3511b5c009487cfe0ce76c7c78fc03ae85abe3d7d0ac78","observation_id":"6163e88c-fc7a-4048-ab71-715a23e8f01f","resolution":{"observed_at":"2026-05-26T21:58:06.904706Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"If you’re working on tasks that would benefit from tracking progress, consider using the TodoWrite tool to track progress","venue":null,"work_id":"80b1cbfa-357e-4e00-8d84-15d5c66cffdd","year":2058},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:e4dfa9e1dcc14ae757fb36797aaa2011edd7f00c0526eb4bd90ee69f63c40813","observation_id":"f52ffa98-3af3-4897-8d21-5e57ef69956f","resolution":{"observed_at":"2026-05-26T21:58:06.892738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0681aba7-e109-4a6d-a5ef-a029641bb403","year":null},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:6163c424f94970740ec75855da13aba282f2dd681eccf9dae15d214ddc85d16f","observation_id":"38d95033-bb8f-4c4c-a6bd-979e5fb6269b","resolution":{"observed_at":"2026-05-26T21:58:07.025019Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"42b2c88b-29e0-4be4-a5b4-5492f27f8f93","year":null},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:520ade506b455a1f251f931830018c7a9d7105266711405809c3aa6f448b93e4","observation_id":"6fd3ff51-0687-44c6-b57f-b4a6fda9e1f8","resolution":{"observed_at":"2026-05-26T21:58:07.028071Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"991d14ce-16ba-4d1f-9cb8-219f98c271c6","year":null},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:115220c5602f428cb0d9383e7eae34628a098031ba0cc1dc3ec73c8daed31dcd","observation_id":"667e5e91-45bf-41ee-82a3-fd9c62a31315","resolution":{"observed_at":"2026-05-26T21:58:07.066358Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d91c3f1e-e206-43cc-83c0-05146efd5365","year":null},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:87c625115796c2e1f31b2805aef7ba987ab6812f3aec3d38a91fc8c488904ec1","observation_id":"be51fb84-f468-4b74-b023-f965d26dd7a4","resolution":{"observed_at":"2026-05-26T21:58:06.948871Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"There’s no evidence of overfitting","venue":null,"work_id":"b083156c-ed51-4a78-9466-756daa0d18cf","year":null},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:782a87fe392f3265a6837c50ab555bd4cc1d789dc34a8b836d98e6b72bef2619","observation_id":"bc29a5b2-2a3c-4d81-8c48-de77a483c093","resolution":{"observed_at":"2026-05-26T21:58:06.919870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6c1490fe-7165-43eb-8770-f3fb1d2d7428","year":null},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:a0c59ba263013f7fd82fa3bbf6b7e00909a01f5c142408752c01b8b58c9ef74e","observation_id":"4e95c3bd-360f-436c-8718-6ad909577890","resolution":{"observed_at":"2026-05-26T21:58:06.871987Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4488df58-a17c-458a-bb70-171c9e917ef9","year":null},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:fc2027f1f2b6947d5f38aac7325d14435a5c5eddf1f7aa22e62f5f17c4ee80c8","observation_id":"20b53840-8569-4e08-8fa4-0709422decad","resolution":{"observed_at":"2026-05-26T21:58:06.999982Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b5f6e429-3ee4-450d-9850-3880f477e40e","year":null},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:2240131a7caaa946919f7618b1f45dec722abaf5528ad5e83e3448c234cdd103","observation_id":"a38c8b7e-7dae-4af1-b32b-d5c2b03507d9","resolution":{"observed_at":"2026-05-26T21:58:06.961222Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1c9bf0f8-7b4d-45aa-b08b-2a1b5e954ab0","year":null},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:7e4b4d95eb8427d747ace830bde496bcff6a829804b9f6a2097cf941eb453c62","observation_id":"8c0814d1-a5c1-4b8b-8b65-3fe52d28f91c","resolution":{"observed_at":"2026-05-26T21:58:07.082560Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"If there’s a sandbagging problem — and the evidence in that document is strong — then fixing it is exactly what should happen","venue":null,"work_id":"6d890f5f-c96e-4190-80e6-60801c19ba39","year":2058},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:010f5ea0b047f5e7920c6338ac864992581a6367bf05d0ea777273d0d11aa085","observation_id":"c43ac5d2-8887-4bdc-a3d8-69a76dbd4177","resolution":{"observed_at":"2026-05-26T21:58:06.942857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1a0b566c-efa1-4329-b483-ec095d97d65f","year":2058},"citing_paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-08T03:31:45.082467Z"},"links":{"citing_paper":"/paper/2604.24618"},"observation_digest":"sha256:05bc4bb638eaedf90e3bd76b43c0c1b1f2ba3db81328b75c97b845b7ff7207f3","observation_id":"7d1bbb73-58b9-401f-aa44-5a7a2e2095a2","resolution":{"observed_at":"2026-05-26T21:58:07.034244Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.24618","last_updated":"2026-04-27T15:47:07Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T15:47:07Z","title":"Evaluating whether AI models would sabotage AI safety research"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":0,"verified_fuzzy":37},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 0 inbound Pith citation observations for arXiv:2604.24618."}