{"as_of":"2026-08-04T05:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b79c178ef5bb4023f9dc3bd34d2c878d988b40fdaf7d27949e9d268edad58c73","coverage":[{"denominator":117,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T08:31:53.114772Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-03T06:30:56.289259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T12:49:57.400820Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.16286","snapshot_observed_at":"2026-08-01T12:49:57.400820Z","title":"Auditing Sabotage Bench: A benchmark for detecting and fixing research sabotage in ML codebases.arXiv preprint arXiv:2604.16286, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19321","last_updated":"2026-07-29T16:23:28Z","snapshot_observed_at":"2026-08-03T00:38:29.761714Z","submitted_at":"2026-07-21T17:41:12Z","title":"ResearchArena: Evaluating Sabotage and Monitoring in Automated AI R&D","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T12:49:57.400820Z"},"links":{"cited_paper":"/paper/2604.16286","citing_paper":"/paper/2607.19321"},"observation_digest":"sha256:38d8cc62717db0ffecb628976bfdb77f07e87aebd9a3f71d0dc882ed10050e0a","observation_id":"f29b1824-b56a-46c5-96e4-0af740a7d6c7","resolution":{"observed_at":"2026-08-01T12:49:57.400820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2604.16286/citation-record","integrity":"/paper/2604.16286/integrity","json":"/paper/2604.16286/citation-record.json","paper":"/paper/2604.16286"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, and Karthik Narasimhan","venue":null,"work_id":"09fe33c4-da9a-4c45-a7b3-8b61c5a3af99","year":2024},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:e6b7df01621843ebcf509b971f95fda73c19b0e501c9646901c1cbafaffd624c","observation_id":"19a71e41-587a-4fcc-ac10-de8d404e1291","resolution":{"observed_at":"2026-05-21T00:14:18.170855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RE-bench: Evaluating frontier AI R&D capabilities of language model agents against human experts","venue":null,"work_id":"69be7f36-7768-4b73-a77c-e5d6ff454abf","year":2024},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:8601d6b1a74a15454d3ab14eee541615eecb5f7fd83ca5136080eda1f996903f","observation_id":"9546270b-95b0-4968-99b5-a26f0ca2fe4f","resolution":{"observed_at":"2026-05-21T00:14:17.992059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"legitimate AI researcher","venue":null,"work_id":"0d75ccad-dd29-4e6c-8d14-535cda63b640","year":2028},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:9a95944576acd3f470d45283dd65a04e0b4cf7854b897ef409cb5c0840d3d393","observation_id":"250e1c7f-0b4f-4cf6-95f1-b07a03d0b67a","resolution":{"observed_at":"2026-05-21T00:14:18.079244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The adolescence of technology","venue":null,"work_id":"834a3d03-768d-406b-b56c-edb76d77c1e0","year":2026},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:2954068029b74b06ae787fa73b743bc2b977882b7d974094b9010895951215ca","observation_id":"609adfa3-a98c-4c78-af36-9fc85849dd46","resolution":{"observed_at":"2026-05-21T00:14:18.051102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bowman, and Evan Hubinger","venue":null,"work_id":"52ec9a9b-6d95-4384-a281-c69853d2de79","year":2024},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:d4198b2df845e523194a5010153367c9e3630b56e4e1d44901d8f33c8e1a4dba","observation_id":"a7426852-beb8-4b09-aa42-6edf1ceaac03","resolution":{"observed_at":"2026-05-21T00:14:18.110431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emergent misalignment: Narrow finetuning can produce broadly misaligned LLMs","venue":null,"work_id":"c75c5672-eed2-4ce8-9200-8849fff72ac3","year":2025},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:033715123389b934ae41dadef776f1a7f5136391ba3d2f590482062134c7d236","observation_id":"1cdaae8b-f94c-4ba4-b870-ac76305e5aba","resolution":{"observed_at":"2026-05-21T00:14:18.271230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stress testing deliberative alignment for anti-scheming training","venue":null,"work_id":"5581fa6c-0aa8-453e-a9a5-069a3d4033d6","year":2025},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:34507102cdcb06304164b20f9ff69ba7660ec3e4adabf31dec75e68b4ffef42d","observation_id":"3ac2e9ff-bb0e-48a9-bb85-de220662d11e","resolution":{"observed_at":"2026-05-21T00:14:18.044333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bowman, Misha Wagner, Fabien Roger, and Holden Karnofsky","venue":null,"work_id":"c851fa5a-17db-4414-aa27-11b6e19f1731","year":2025},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:77d9ccf714ec75e31c1230d2b8bd5f18c7073b25f90b779f6c6f736cc9068267","observation_id":"c6fa2eef-eb05-454a-9e7e-8ef2729715c2","resolution":{"observed_at":"2026-05-21T00:14:18.233981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sabotage risk report: Claude Opus 4.6","venue":null,"work_id":"8862b71d-1286-4710-9b75-178eb482e55a","year":2026},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:0422f0cdfff483d85485e8ef800faf56daba222c293b4f692e21fe283f6b4468","observation_id":"851cc0c3-4c74-445d-a117-5a7a69ee5e3c","resolution":{"observed_at":"2026-05-21T00:14:18.252781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Alignment risk update: Claude Mythos Preview","venue":null,"work_id":"bb09dcb2-bccf-440e-8fde-10cb7884e78e","year":2026},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:608c45b39401e7e1beb6d13065f798986fb3ad908677f9eb3e8023d1d9871143","observation_id":"df986c1e-01f9-4d1d-b067-504c3abd10a3","resolution":{"observed_at":"2026-05-21T00:14:18.028922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CTRL-ALT-DECEIT: Sabotage evaluations for automated AI R&D","venue":null,"work_id":"57f17e29-39b2-4d2f-b76d-4e4ee3fbc2b0","year":2025},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:ca561c556ee4a6e7cb3265e4eb47a1c850b65d358a3eaaf6ff4490045109f123","observation_id":"61f3b045-2038-4911-aa63-bfa8ff8d4167","resolution":{"observed_at":"2026-05-21T00:14:17.936444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bowman, and David Duvenaud","venue":null,"work_id":"1c8b0dcb-777b-43ab-964f-3d9e77a74873","year":2024},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:41567fa6e810547e5fcef711c2fa83c4c64306d12d35700cbf2ca6554a233758","observation_id":"70f70870-772a-4922-be76-5514b5f564d6","resolution":{"observed_at":"2026-05-21T00:14:18.153863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Subliminal learning: Language models transmit behavioral traits via hidden signals in data","venue":null,"work_id":"9afa58ef-1f85-44e5-89af-732ffb528eb9","year":2025},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:4dff0337ee4f9b3c1c54f25ebd5540e5c4b7d722a3b38b0dd3fe608ffb717ad0","observation_id":"c4aef78a-f00d-4b59-bca6-cd407f0131db","resolution":{"observed_at":"2026-05-21T00:14:18.121546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CoT red-handed: Stress testing chain-of-thought monitoring","venue":null,"work_id":"6bb4b931-8fc4-4301-877e-fc32b3e83659","year":2025},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:2cbab14f101eabbc8d79fd9f90810637df34a686c312b77c9cfcdafdd6a765e5","observation_id":"5da021e6-050e-44a4-b80e-4fc03b2083e6","resolution":{"observed_at":"2026-05-21T00:14:17.865417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Disentangling feature and lazy training in deep neural networks","venue":null,"work_id":"5f4f4dc2-a7c2-40ae-ad67-626720ac4096","year":2019},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:e5837485666d9587a4311d2e439238a605b48835d9cc19855beea020a91fb6a0","observation_id":"530e3ae8-1613-4772-bd82-1cb86706b6cb","resolution":{"observed_at":"2026-05-21T00:14:17.965334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Steering evaluation-aware language models to act like they are deployed","venue":null,"work_id":"5982a05d-bd66-4287-9ff7-6aa06490cc41","year":2025},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:e90b372ec851762eb1b0a9fe67ccc6a146c7ff30801e30ac39200d1f3d05afbd","observation_id":"fbb7052b-4e59-4d32-8c3d-497e44132958","resolution":{"observed_at":"2026-05-21T00:14:18.003796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lessons from studying two-hop latent reasoning","venue":null,"work_id":"34223e74-0fcc-4b56-ae7e-82faa32bcfd5","year":2024},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:5c37689b45159f32cbf91d5ba1909398922a9b28c59924ef159d1e267a566a5e","observation_id":"073f4334-c7c5-4767-9110-43576e4d5fa4","resolution":{"observed_at":"2026-05-21T00:14:18.274882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Copy suppression: Comprehensively understanding an attention head","venue":null,"work_id":"6deb36e5-2e3a-4641-8041-80005c581c6e","year":2023},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:e4a2d98a82d8577f559002ecfd256fac3f09ca8f32df13c9541ae3d2f0a881c2","observation_id":"741105fd-1611-4683-a45c-3f8c927e4a16","resolution":{"observed_at":"2026-05-21T00:14:18.018013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hidden in plain text: Emergence & mitigation of steganographic collusion in LLMs","venue":null,"work_id":"1bb7131b-fa92-4e56-80a6-dfb6254484df","year":2024},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:a5b789081839cd3d4d0c8d19667a12f964576fa8d0f03caa74580c8e8e421652","observation_id":"eff825d5-ab34-4918-957e-a6a2aebf687e","resolution":{"observed_at":"2026-05-21T00:14:18.089937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-turn jailbreaks are simpler than they seem","venue":null,"work_id":"9d93e71b-4f5a-486b-904e-62de99c4ff0c","year":2025},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:3806a0f5ad0d36ad1d2437e164c11def9562e1c44c43e1a8270c5badd741728a","observation_id":"b4cba413-d23e-4481-b869-ce7fa7538528","resolution":{"observed_at":"2026-05-21T00:14:18.241271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AI control: Improving safety despite intentional subversion","venue":null,"work_id":"293de48d-1739-4235-8dd0-b991dd0f090b","year":2024},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:b65522c238cbfcc196d3683fb336bbc023684163e88b7da92abcb79645f73f89","observation_id":"9a6c4e4f-65eb-46ee-8b76-bbf13805b0d0","resolution":{"observed_at":"2026-05-21T00:14:18.203553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ctrl-z: Controlling AI agents via resampling","venue":null,"work_id":"1d957f15-0db4-49e8-9348-66da779aebb1","year":2025},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:d4f0670d5c7e41161b308d8e74563bf643d263b7af2b77412d36f86f7e2d07ff","observation_id":"c5bbdc21-af17-421f-ad28-426a13201d5b","resolution":{"observed_at":"2026-05-21T00:14:17.911054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Guan, Aleksander Madry, Wojciech Zaremba, Jakub Pachocki, and David Farhi","venue":null,"work_id":"4ab7bf8c-19e8-4153-b6ec-cab3e9a5598d","year":2025},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:4754a40c0d5e50e35bc81b094f0ce76dab706cbd02a818df64ad1ea16142f56d","observation_id":"cf2397ff-30d1-49c0-84f6-fee957ba15ac","resolution":{"observed_at":"2026-05-21T00:14:18.157825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training fails to elicit subtle reasoning in current language models","venue":null,"work_id":"6fe5070f-4d7e-4185-8e31-0c2a4db8d4b5","year":2025},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:075cfe1d7ec0803325dad27408bc43c24ac047cc449e7d3f475ef856eaa86f76","observation_id":"ece28bf3-d01f-4d8f-9947-f8e95b2c01da","resolution":{"observed_at":"2026-05-21T00:14:18.149787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Factor(T,U): Factored cognition strengthens monitoring of untrusted AI","venue":null,"work_id":"95663c9f-19ce-466d-9e5b-3ce0562ba30c","year":2025},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:1ea4d87bbca68cc532170f04fa79868c01ebcb5c50c3e2f7ed7dc9b541afd0e2","observation_id":"57b1ced0-1c33-4c3a-b266-f8cf301dc5d4","resolution":{"observed_at":"2026-05-21T00:14:18.174783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Basic legibility protocols improve trusted monitoring","venue":null,"work_id":"38ad0af6-2c29-4c80-bde9-ffce901c0a11","year":2026},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:2b36865b1dbc69505d19f4dcf18b86244593702ab7f136b8c44c6e845338bd67","observation_id":"c21eb7a6-fc13-4f07-9e35-88b112cfd7d9","resolution":{"observed_at":"2026-05-21T00:14:18.057860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"BashArena: A control setting for highly privileged AI agents","venue":null,"work_id":"5e1205f1-0755-453e-9213-347d50cbf184","year":2025},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:1afa1bf557465be03b0ffe443ee52b0a2f5fd5cbc6d3a5eef679c7b03c014054","observation_id":"2fc9ebe3-54ad-4dd2-8630-eaebf179a9bf","resolution":{"observed_at":"2026-05-21T00:14:18.136090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SHADE-arena: Evaluating sabotage and monitoring in LLM agents","venue":null,"work_id":"4cb2f7d4-14c7-4475-9490-e5e51aa40cab","year":2025},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:d8e5b19c0a9a3af95c839d67dd71ffe9f89ccf7a4aa8ca9aa2f4d01b28c1bf91","observation_id":"abbc1177-2322-4e4d-b525-bf95a8a268ee","resolution":{"observed_at":"2026-05-21T00:14:17.881897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adaptive deployment of untrusted LLMs reduces distributed threats","venue":null,"work_id":"ef7cb61e-2a9e-448a-917c-732007286539","year":2024},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:c96ba7ad76223c9a5badd794772f2227936428a0e29ae6db5d1801c912e59e19","observation_id":"bc882448-7527-4698-9efc-0aff6019229d","resolution":{"observed_at":"2026-05-21T00:14:17.893643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Brown, and Francis Rhys Ward","venue":null,"work_id":"68fce5c4-16d3-4a0e-a9a8-a70af3df47e7","year":2024},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:02e33a982d566bdb8230049b7dd63b2cb43627e3dc05e25a7a573d003d13b05c","observation_id":"922a6c75-8be2-4e43-9375-cf98bdf81eff","resolution":{"observed_at":"2026-05-21T00:14:18.210586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sandbagging in agentic ML research","venue":null,"work_id":"7521cb12-39d2-4d2c-aa7f-92c4a0afd18f","year":2025},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:327b6288bcf8f21ce61050a9449ec8b3de6cdcbaad76f1f4a5f7bed77dee15c9","observation_id":"a315946d-d243-4c95-bc6a-85bc44632058","resolution":{"observed_at":"2026-05-21T00:14:17.900862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LLM critics help catch LLM bugs","venue":null,"work_id":"1e60867e-a861-439e-8692-6b9892a71dda","year":2024},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:af70e6da93d52e487399c12ec6efb4ce9007a615a475f2a5356ca2d8a403f602","observation_id":"c4b3deac-0e60-4e3f-a947-a36cbbdcb9c9","resolution":{"observed_at":"2026-05-21T00:14:17.869145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A practical approach to verifying code at scale","venue":null,"work_id":"53bd72e8-a60f-4d85-a85a-9c3e5b1b7b00","year":2025},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:ae2d6710b54dac26005d650b5ce55bb94b8f443651366c7d3901a8c8e3c30be6","observation_id":"c02770aa-2ed6-4a8c-bd78-0f4db43a8fc3","resolution":{"observed_at":"2026-05-21T00:14:18.105195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"IRIS: LLM-assisted static analysis for detecting security vulnerabilities","venue":null,"work_id":"ef50caf3-ff0d-4f1d-b32b-cc47ee7544a5","year":2024},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:c6ff7fbd50d033c2de83f42a7293eab141cb7efa6f516e470e3caf6d22264ad9","observation_id":"74e97300-6054-43bd-a978-ea0bddc71e24","resolution":{"observed_at":"2026-05-21T00:14:18.164721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"JITVul: A benchmark for evaluating LLM-based vulnerability detection in real-world code","venue":null,"work_id":"30d33bb5-c733-4119-8009-fc94860c4d77","year":2025},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:64cf4c39f846f09c3d28239507372aa837b5cc5f764cc6f9581240294c832525","observation_id":"c99a00c8-d4c9-4d7c-a8f2-cbae14bc0a30","resolution":{"observed_at":"2026-05-21T00:14:17.932832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From large to mammoth: A systematic evaluation of LLM architectures and quantization for vulnerability detection","venue":null,"work_id":"f1dadaba-b97c-4da4-be06-2f5986bd122d","year":2025},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:fdffad21e4779c1accff9b31338c829965d25d027550dd94ac977cb64ff6e3c5","observation_id":"7a22f65c-55f6-4879-bee9-ce96d409f2f9","resolution":{"observed_at":"2026-05-21T00:14:18.007309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mythos preview cybersecurity report","venue":null,"work_id":"9fee3b37-ef08-45cf-a933-5b104053c590","year":2026},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:93e15589031ebf151e55f60a60befd8267b056459181cf1e9864f7d9c587d1a9","observation_id":"1c68cfd4-44c3-4d80-8f4b-d6540dc76ce0","resolution":{"observed_at":"2026-05-21T00:14:18.064871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Leakage and the reproducibility crisis in ML-based science","venue":null,"work_id":"c7865fc2-81ea-4cac-b968-d91b4571a5bf","year":2023},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:5469d6ae56e7231c49bfc7fa44497ccceb2a3fde894b06070c51c480b3a2867c","observation_id":"2d54058e-4653-40e0-8113-07e0aa6dbca9","resolution":{"observed_at":"2026-05-21T00:14:18.093497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Are we really making much progress? A worrying analysis of recent neural recommendation approaches","venue":null,"work_id":"4a53d77f-dfc5-46a5-9ecd-91249a5ec5aa","year":2019},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:28f51b413dcbcf29b47cb3fd802880913fc1975878c4e2c8b8d19be2e53b5706","observation_id":"be9ac55d-fb1d-4c26-b602-8e9e5f83d390","resolution":{"observed_at":"2026-05-21T00:14:17.982224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Are GANs created equal? A large-scale study","venue":null,"work_id":"0395f7c3-af8f-46df-b4b1-b5911df2516a","year":2018},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:38f36c29d6ffffb2fa5092742217c6f36716e75c80ea18da5e07485a639705a4","observation_id":"361026f0-c738-49fa-9f22-5fb0b85fa144","resolution":{"observed_at":"2026-05-21T00:14:18.025455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the state of the art of evaluation in neural language models","venue":null,"work_id":"caad2d25-5a9e-4eef-9c88-c5ca68c80f55","year":2018},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:35650331385d877fa2f9f95baf33a72f5794a9c4dcbedcffea24e61117f8d577","observation_id":"e1fe6d93-79ff-48ba-8533-dced9200d656","resolution":{"observed_at":"2026-05-21T00:14:17.897145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A metric learning reality check","venue":null,"work_id":"9ce71941-3e27-4668-8efb-681939858bfe","year":2020},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:b2bd2916b8c54ecc8e543db6e77435f38a4d18a65d36c3499f585a78ad2fc66c","observation_id":"4252fa6d-23da-4ab1-ab58-e2cc1eb875d6","resolution":{"observed_at":"2026-05-21T00:14:17.889813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pitfalls of graph neural network evaluation","venue":null,"work_id":"00d3fae6-d75a-47bf-90dc-22e4edd92c77","year":2018},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:899da9f131059a55835e45ab8ef688644c8ee8b5425ffdf54491c0844e574044","observation_id":"1dd0debb-6d4f-4ee3-81b9-35851b60a188","resolution":{"observed_at":"2026-05-21T00:14:18.075734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"What is the state of neural network pruning? InProceedings of Machine Learning and Systems (MLSys)","venue":null,"work_id":"94c4c946-c381-4826-b4cf-28c2bac10674","year":2020},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:4b485cce75a0cc76a0cb69aeac7ffa9cf605b607fa67a3dce4662dfed58014c6","observation_id":"32d29912-5a49-4206-8cfd-1374426c5be4","resolution":{"observed_at":"2026-05-21T00:14:18.040908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards evaluating the robustness of neural networks","venue":null,"work_id":"041295ec-b958-41a4-9812-ab2a07a47919","year":2017},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:d9d57249dbdbcabd457bff8086fbb6a877c995bdc765f711d812e5062099f5f2","observation_id":"c97c72a0-75ae-4901-bdfe-399485c59d0a","resolution":{"observed_at":"2026-05-21T00:14:18.264829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Obfuscated gradients give a false sense of security: Circumventing defenses to adversarial examples","venue":null,"work_id":"da43520c-fd9f-4f89-acec-23735f2da4b3","year":2018},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:dc81142a23051f7962592ceee7be6863a99d00b2c606004ad2433f43d81f99cf","observation_id":"7e6903c2-86d8-4993-94e4-b342253ef19d","resolution":{"observed_at":"2026-05-21T00:14:17.975604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On adaptive attacks to adversarial example defenses","venue":null,"work_id":"094678b7-3234-41ae-82f4-c6c71f8ed971","year":2020},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:3e5dfd4ae6e8b3da77544258996300ffc757eda4fdff196618be2e232cf0df7f","observation_id":"d573282a-6354-495c-8583-95afa23e3ed3","resolution":{"observed_at":"2026-05-21T00:14:18.032926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5ede3179-45c7-4835-9bd2-103372e176fe","year":2021},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:88b42db51d95f5691a0495871a09aa1f42328d5b618261c156f514d1c48eec6f","observation_id":"cf21cb4e-a0f7-4582-89d1-5fbcf43cf515","resolution":{"observed_at":"2026-05-21T00:14:17.904124Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A step toward quantifying independently reproducible machine learning research","venue":null,"work_id":"f314e643-032a-4554-b2dd-3e6e779a5007","year":2019},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:cadcd0314732ec18a2266e317593c700673c689734fba4c1919e8f3f2401ae3a","observation_id":"d65179db-be13-4d8c-993b-9d1c73d08cd3","resolution":{"observed_at":"2026-05-21T00:14:18.244808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emergent world models and latent variable estimation in chess-playing language models","venue":null,"work_id":"4b4ff062-51f0-4653-8644-2bb83b715c7e","year":2024},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:26f2121a9b76729c5a76abb15b7bc2efc9d5c2d9ba29f58e8943ba67d4331c26","observation_id":"d57e395e-cbf4-41b8-a07c-a0d02a8199ee","resolution":{"observed_at":"2026-05-21T00:14:17.988578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Can language models learn to skip steps? 2025","venue":null,"work_id":"738c96b2-a6fe-4d9d-9a7b-d44719043154","year":2025},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:c8b1e6748c20353b568e2d725a43c1713f5d885647aab3d0204b617f63e81170","observation_id":"58063378-f7c5-40a2-8f42-8931e7da98f9","resolution":{"observed_at":"2026-05-21T00:14:18.185508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reasoning models sometimes output illegible chains of thought","venue":null,"work_id":"ebd5561b-9d08-4518-abd9-47200717429b","year":2025},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:3d46ce9ba6eac549a16ade34ca6763ecdcaa85cede50e4c5d51ea830c9c714da","observation_id":"a023374b-a327-458e-af06-df594d51ccac","resolution":{"observed_at":"2026-05-21T00:14:17.958139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"subliminal learning reliably transfers preferences","venue":null,"work_id":"aec51530-5d54-4433-acac-550a3054efca","year":null},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:8a5483e2d5169a1464268b43cba7f17f0c5d31598b1fb0caa406e1709dd23e01","observation_id":"9a8953ca-805f-4264-bd48-68885235d899","resolution":{"observed_at":"2026-05-21T00:14:17.925058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"monitor notice","venue":null,"work_id":"1f25df9e-6786-4511-bce8-9d55206217e0","year":null},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:9efc201c7c90e5d9bd645705509085e8f5c0b1ce6d405e88d1310a6fcabc4b34","observation_id":"0d8ac9a9-1a0b-42a8-9bf1-4fca793a7595","resolution":{"observed_at":"2026-05-21T00:14:18.082602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"lazy training","venue":null,"work_id":"c8573a5f-153b-480b-b8b8-ce9a758837bf","year":null},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:856fc093c3b540bdff067cc5df0008dd7f8dd3d7ab6e89323f010ff5d700ee9a","observation_id":"dc90355b-f53e-4877-b271-f25ba43032f3","resolution":{"observed_at":"2026-05-21T00:14:18.132350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"steering partially recovers deployment behavior","venue":null,"work_id":"23042d27-2b62-4b65-bff8-80ad62a82313","year":null},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:8771b3fea6fd8ce3b233a07388213a81ab693d7541d027918e82711137f9999c","observation_id":"32d8873a-9fb2-4a85-bef9-b954b12bbda2","resolution":{"observed_at":"2026-05-21T00:14:18.222270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"demonstrated","venue":null,"work_id":"aacab249-af47-47ad-82ff-c08dc0ece8e3","year":null},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:85e35b3ca0c299966239d6975ba1af3f381ff048e7253c120c10871c96269e98","observation_id":"d41e52e4-9502-4516-95ab-4cce8e494bfd","resolution":{"observed_at":"2026-05-21T00:14:18.196438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"That is, it suppresses the tendency for LLMs to copy tokens that have already appeared in-context","venue":null,"work_id":"4752594d-15c1-4ccc-8b36-979b712452af","year":null},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:26edda661771a1f9a6bd13a68a52457f5607920da9ce34018566077d2673ffa4","observation_id":"61009a6f-a30c-4e22-9a80-48220ef61cea","resolution":{"observed_at":"2026-05-21T00:14:18.261011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Specifically, theylookat WUWL10H7 QKMLP0(WE)","venue":null,"work_id":"2e01a2ba-aa1d-4db7-93d1-1f0154cdcbbf","year":null},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:505cb7cd2f5b8375e71845b1b15473a1808e9bbf86a5187ac842f83ef45ffd32","observation_id":"1e351684-f079-4a8c-a2ca-9bcd7075d025","resolution":{"observed_at":"2026-05-21T00:14:18.142868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ba8be564-fd5b-4894-bcee-615ad41bda1a","year":null},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:0e072d1052fb360e4a45681dcb1c1a49034abe9c418d59fc524b7cccc96261a7","observation_id":"b2f2ae17-6de0-4898-97fd-b632f24d65cb","resolution":{"observed_at":"2026-05-21T00:14:18.226551Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0391ed14-067f-4a66-9fd4-f8e1e2b77d51","year":null},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:54b04b4b4e7860cf1647da6e3a4989caf86395eb1519190e6718462b099598db","observation_id":"40ff1000-c4fc-4ada-8577-55e26a5ee7d6","resolution":{"observed_at":"2026-05-21T00:14:18.096784Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Without MLP0, the QK rank distribution changed from mostly rank 1 (strong copy signal) to only 6% rank 1 (no copy signal)","venue":null,"work_id":"b6ccfeff-538e-4c42-96f6-1e59aa8a6319","year":null},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:8f6989ec725ccc8b7e3c87df985d20b347b81fa25b4d67e1ab00620ac356d78a","observation_id":"86b7fd22-5284-4b43-90eb-d3123686aadc","resolution":{"observed_at":"2026-05-21T00:14:17.853082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"This still explained 77.5% of the effect (vs 70.2% honest), but removed the evidence that the mechanism is specifically about copying","venue":null,"work_id":"8a8ee964-a5cc-4066-947f-392ea69071af","year":null},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:ee1de3f6aec378740b695e54270f256b18b2a7369b332af970185911cb3a84f3","observation_id":"6d027ee3-4924-4335-9f38-96577d81b6b6","resolution":{"observed_at":"2026-05-21T00:14:17.914660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"L10H7 is a copy suppression head","venue":null,"work_id":"827b7af5-5378-49de-a71d-39d6408fb556","year":null},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:84afadac71e5b5bd8a20a185720b835360c1a58b899904d0a54011adbf9686eb","observation_id":"19a791df-e7b7-4ef6-ab3d-df2b45ef3b7b","resolution":{"observed_at":"2026-05-21T00:14:17.944356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"collusion team","venue":null,"work_id":"dd7f1e6b-4982-4e96-af56-e4f1accf6a7a","year":2023},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:1aeafe1addfb70ef0b1187061df4f6b708f1c034d0fb0396a56c9add051a3a67","observation_id":"c1ae90cb-ca95-4870-805f-f54c9b6ebe00","resolution":{"observed_at":"2026-05-21T00:14:17.907618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"probes detect sandbagging with minimal data","venue":null,"work_id":"f0778042-c4d1-4eb7-a626-7b9943d2294e","year":null},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:931eaf5770b463a5d664d133d69d111cb0ee88c16b5ee2498be2eb23b101ebcf","observation_id":"368d1fdb-8898-4d66-8a70-c31c999b94c1","resolution":{"observed_at":"2026-05-21T00:14:18.128961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"multi-turn has no significant advantage with equivalent retries","venue":null,"work_id":"94b99583-115c-4700-a83a-7b45df25d630","year":2025},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:ed62edacd51d80fbf64c284eb40c14e00af070d0469fa67a10a7508ecedc0ded","observation_id":"c5bf74cb-8ffa-4758-8462-0cabf4f74aa9","resolution":{"observed_at":"2026-05-21T00:14:18.249124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"function_name","venue":null,"work_id":"fa1adf67-ca4f-419a-bfb9-f1a5ac2d3109","year":null},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:9bc42f822915cd18ac4b49dc40aec031b0334bcc30a23ccef6bbdc7297de690c","observation_id":"ee722478-a669-4bb2-9491-d0498092c13f","resolution":{"observed_at":"2026-05-21T00:14:17.947715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3b098ca2-a67a-4090-800e-cc185c5ce38f","year":null},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:7945652333110bedbc10aed51bb305eee19f88a34639a5eb542982144803f6de","observation_id":"bf55d150-3a23-422d-bafa-34d615338a26","resolution":{"observed_at":"2026-05-21T00:14:17.961692Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Full Experiment","venue":null,"work_id":"044bd4f4-9695-496c-b858-6bd4ff8cb1ec","year":null},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:292e0f0bf785eace65e21a11fa41225333b88ac38f186c2941479305b6ff1161","observation_id":"2fba69ea-c036-4188-8eb6-24120c927c25","resolution":{"observed_at":"2026-05-21T00:14:18.114334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b31bcbb7-c57b-488d-8548-b4622222faa7","year":null},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:3d12844eab9034b192295a9fb2183e336884d742a4053a0c2dd48ee47cbd8ea9","observation_id":"8f2d319c-2d50-4cc1-8bbf-fe8eb992d4d8","resolution":{"observed_at":"2026-05-21T00:14:18.237642Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6a2e0f66-4177-44a6-b957-9a6d7c872296","year":null},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:e96e9f2b4b300846b5c616ae183eb1920f92690bc3499eadd3d8328b3266b34c","observation_id":"88a4a91b-e172-40dd-b8b5-f46d991388d9","resolution":{"observed_at":"2026-05-21T00:14:18.013969Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6bc3f6c1-2e3c-4ab7-b57b-e4fa20ba1061","year":null},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:bbc4aaadb2f37b87fe31e40aeae8bf7b89859dded78bf3030f54beed8ed2297d","observation_id":"1231d4c2-70aa-45ff-a2d9-ed9b33f8e22f","resolution":{"observed_at":"2026-05-21T00:14:18.182106Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2a7b0012-7b4d-4713-9df3-57ed91c20f44","year":null},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:323a8dc23e2d0394fc2ddbd977dc2e4428cbc3f789f97501aafe98eb7cf212f9","observation_id":"629f6302-d5d4-4f62-a3a6-e21a1d439631","resolution":{"observed_at":"2026-05-21T00:14:18.061526Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"aa208184-96f8-4dd9-ac41-db8109041525","year":null},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:6ba6b75602f0f7d3c94c3f19e1b5eaea5ffba0c968359e2b38cb305af0b59d92","observation_id":"60f80b60-9d9c-423c-ba20-ccff6749a2bf","resolution":{"observed_at":"2026-05-21T00:14:17.979011Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"abd6dfe3-aaa3-454e-8eb5-67412bcea758","year":null},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:8608baf63efe84ddb6a809f3cc375f6fb4b09a3cc2379bd2d4e36e563387c4cb","observation_id":"6ca9b26c-3084-4683-9e54-e9f85f332cea","resolution":{"observed_at":"2026-05-21T00:14:18.218337Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6dddd66a-6c26-4ebc-b836-10c0dabd7e46","year":null},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:16e4bcd9e64905e953617c7b4139504d7d450b4a17cbaa7eb8fb3e45433bdf44","observation_id":"7934e1bb-d83b-4ace-8d38-91b638175147","resolution":{"observed_at":"2026-05-21T00:14:18.036335Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Not just different from your expectation -- you can explain why it’s wrong","venue":null,"work_id":"9710f60c-b928-45e8-b53d-5e95d68c97ef","year":null},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:485bb0c34b2fdfa3c6aa7941e026d023de16de4798321b298196de2d12af54ef","observation_id":"167830de-49fe-4a53-8c89-71c456b5ce9b","resolution":{"observed_at":"2026-05-21T00:14:17.861427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4c55716b-5cb1-4fe3-a394-ca27d07524a1","year":null},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:f07bbfccfd981462dcf0eb8ca9f7df39d72656d1f363f40bbc2d3b5950aed425","observation_id":"d0429486-0689-4e0b-939d-1003538c27c8","resolution":{"observed_at":"2026-05-21T00:14:18.290355Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"If I could only fix ONE thing to make the results honest, which fix would it be?","venue":null,"work_id":"d21ccbfe-f530-4f06-ace7-e76c99e3f3d4","year":null},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:84fd27c5ebd898652095e153659a8f53fdf231ba37976f713312acb642a25191","observation_id":"0cd4ef86-f1cc-43e8-ac86-457d9f675479","resolution":{"observed_at":"2026-05-21T00:14:18.101687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"253fbd20-f316-4f16-83ff-6df3080679a8","year":null},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:9f86cb2c3fa1870ceae233ff03ead98f1d6182e98b355eaafaf5e1367f4dbb81","observation_id":"79c69459-6c3b-4b3d-9cae-b325b00b165e","resolution":{"observed_at":"2026-05-21T00:14:17.885803Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ab1946ed-7c91-4cdc-8129-3fae163879eb","year":null},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:6c789d51ddfd61a277e5663b53bcd7afe7fb8780c30b3377099c53324b4a37fb","observation_id":"4e230a6a-3e99-4c1b-b320-efb6f2b223b6","resolution":{"observed_at":"2026-05-21T00:14:18.188983Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e15ddf94-224d-4b48-b72b-cc6081acd4f2","year":null},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:62558c43d8554820b205fd4e37387ba07762a0d358f9de5556f0fb80e7f38b9e","observation_id":"a9ab27b5-fd71-4c6d-ab00-8c027485de4f","resolution":{"observed_at":"2026-05-21T00:14:17.876612Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"J.3 LLM Red Team Prompt The following prompt was used to instruct LLMs to generate sabotages of honest codebases","venue":null,"work_id":"d12e14c2-0fd1-4228-8101-50222023299f","year":null},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:c8d0e4bf04c66434cd844f3ffef6689067a41905bd9d48659c07f2afa6e78d62","observation_id":"39df3eaf-1eb6-4cad-88cb-a0b0b39550b8","resolution":{"observed_at":"2026-05-21T00:14:17.857475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Introduction and Methodology sections in the main body of the paper are always honest","venue":null,"work_id":"c058c1ff-75f9-4a6c-b363-afe39d1cc57d","year":null},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:3dbd4ea9a9beed7b51d5a476ca9a335fb78cfda9ca553ef79e6d1046d0a6e87a","observation_id":"fc0ee495-10e0-4671-843b-9332f7c2cdcc","resolution":{"observed_at":"2026-05-21T00:14:17.968750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Your sabotage must be in code (.py, .js, .ts, config files, etc .), not in data files or pre-computed artifacts","venue":null,"work_id":"0ec735db-34ab-4f70-b910-c6901e51cc33","year":null},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:afdecac190923651ea636f4cde8ca34b35360e1dd01cd1d056ddb09e2bc72949","observation_id":"f1e8b5a2-4fcf-41c8-8ead-a8a0280d826f","resolution":{"observed_at":"2026-05-21T00:14:18Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Do NOT add suspicious-looking code that is unrelated to your sabotage","venue":null,"work_id":"0a86cb56-f51c-4a38-a6a9-6766418b734f","year":null},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:68fc7f89b0b488cce22573d18b9356f00440343adfa3c52c7afa0c0ab3c4faea","observation_id":"411ab9f0-b2cb-48c8-bfdd-231def1f85f3","resolution":{"observed_at":"2026-05-21T00:14:17.971973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Do NOT clean up existing bugs, quirks, or messy code in the codebase","venue":null,"work_id":"dd3e1b29-77c0-489c-8142-be218cea5979","year":null},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:b46d388e403514401b0654c29d886ab7fff2ef60b7928a8816c343b99475a04c","observation_id":"48111a0b-46e5-4a5b-833b-bc433383d649","resolution":{"observed_at":"2026-05-21T00:14:17.873020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"You may rerun experiments a few times and pick favorable results, but do not do extensive search","venue":null,"work_id":"9733a368-adda-48ae-83f4-627aa42139ab","year":null},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:a05310dba49f6c70eaf1bca37d52d1ce3c0c0bc2c58fc2f4b19e77a78972e5c3","observation_id":"64ba36de-4ef9-4104-ac21-941b5d064427","resolution":{"observed_at":"2026-05-21T00:14:18.146398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Key Findings subsection in the Conclusion must accurately describe the experimental results your sabotaged code produces","venue":null,"work_id":"10c78438-ddf6-4d9b-9f8e-76aabb4e256c","year":null},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:c740fb2ad57c944985fd9684c8d892f72b30ec5d752617fd8bd2a8882adade3e","observation_id":"39575a7f-dba3-4f0e-ae61-2981b1c022f1","resolution":{"observed_at":"2026-05-21T00:14:18.125222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"test\" to","venue":null,"work_id":"cc03d15d-dc73-4ad5-80e0-93433d6f2f17","year":null},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:97ebba0fea860f6ad27e84bb5c07d7f1e447633d6a5c44b31f63e876174ce5be","observation_id":"75028d5f-b80d-4ed5-af47-7495804e40bd","resolution":{"observed_at":"2026-05-21T00:14:17.921609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"bad choice","venue":null,"work_id":"0c20289f-2558-4412-b385-d40868a180f7","year":null},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:5a0a2e5e3e0d437c67cc81ac8fd6b72b2b0634a4fb08e91e0a70737582ff92d8","observation_id":"90665e87-b0db-427b-b047-5758c33a3ddf","resolution":{"observed_at":"2026-05-21T00:14:18.206983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"These are often just a single number (batch size of 32) or a single phrase (Adam optimizer)","venue":null,"work_id":"12e11074-55db-4e44-a755-2c83ce2f17e1","year":null},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:61d780ccddc7288e33cb9270e438e0e4e9165647932a71dae858f45818c46e5b","observation_id":"f872dc9e-a612-44d1-8037-775c8668cd99","resolution":{"observed_at":"2026-05-21T00:14:18.192944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qualitatively different","venue":null,"work_id":"929dc4fd-66d0-4246-9d61-2ddec9a6c7ab","year":null},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:f71612c7c1d2a49cd90191016e096d07f09b668fcac91d4f08fa0d31ffa42270","observation_id":"d718ee5c-3234-4720-88d6-683e0951f9bc","resolution":{"observed_at":"2026-05-21T00:14:18.294427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2315b7da-6968-4179-a9fe-4eed2cfba3d6","year":null},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:ef0b0fe42920f9b974c6a9fe669bf7fc08f9e27c997cc3653d33742bde7ff3fe","observation_id":"010fb39d-c9cc-4a50-a3b2-a53280cb1feb","resolution":{"observed_at":"2026-05-21T00:14:18.199823Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"83f42116-b7da-4348-87c7-86341d7e77ce","year":null},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:664f292ad845061db03cf2a9964f7022f6975af2112f00083b8d6c2f44c7bb33","observation_id":"f23711e2-dc1e-4763-9591-19dc2183b5f2","resolution":{"observed_at":"2026-05-21T00:14:18.257038Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"856c09ae-8d0a-43c1-b0c9-021804e5fb6c","year":null},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:ba29e337c346062a4252e018eef9bc3d34f5c21cff68c598a5cbb998b99c8338","observation_id":"207b2374-ad79-4d60-9589-d9978c292547","resolution":{"observed_at":"2026-05-21T00:14:18.161055Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Later stages (evaluation, results) are easier to check because they can be rerun quickly","venue":null,"work_id":"8bef7f60-b49f-449a-b2c5-79040427fe0a","year":null},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:4aff7f88a89c3a58a1d534ce84634544bdbdf39d6f2051de4e98d46877627da7","observation_id":"a9891bb8-553f-494a-a473-e63bd44c8116","resolution":{"observed_at":"2026-05-21T00:14:18.178640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Read PAPER.md thoroughly","venue":null,"work_id":"1f5e101f-03f9-40c4-8e96-d3ae4814adda","year":null},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:3027e80f23374753a3b5e0281a32a1684cbfa77ae0eae0d55c7e001ab11db05a","observation_id":"28c4cae5-2ce0-4845-8677-894944a0e592","resolution":{"observed_at":"2026-05-21T00:14:18.230243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Walk through each pipeline stage and list every design choice: hyperparameters, model selections, data processing decisions, evaluation settings, prompts, sampling procedures","venue":null,"work_id":"c0d92da8-868c-40c5-91c0-974fd108807a","year":null},"citing_paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-10T08:31:53.114772Z"},"links":{"citing_paper":"/paper/2604.16286"},"observation_digest":"sha256:7c0647479b8dd005b44441a5b4c11e24efba016a3d59584db90e4e218dc99286","observation_id":"d5925078-e754-46f5-9b73-6c8a0fd8bc79","resolution":{"observed_at":"2026-05-21T00:14:18.214607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.16286","last_updated":"2026-04-26T04:55:57Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:47:32Z","title":"Auditing Sabotage Bench: A Benchmark for Detecting and Fixing Research Sabotage in ML Codebases"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":82},"total_outbound_references":117},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 100 of 117 outbound references and 1 inbound Pith citation observation for arXiv:2604.16286."}