{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:TFMY67THMI5MGUEMD6KSPH56P4","short_pith_number":"pith:TFMY67TH","schema_version":"1.0","canonical_sha256":"99598f7e67623ac3508c1f95279fbe7f18e98221b038d78b30b85e586f1f3b48","source":{"kind":"arxiv","id":"2502.05209","version":4},"attestation_state":"computed","paper":{"title":"Model Tampering Attacks Enable More Rigorous Evaluations of LLM Capabilities","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CR","authors_text":"Aidan Ewart, Anirudh Satheesh, Bilal Chughtai, Domenic Rosati, Dylan Hadfield-Menell, Furong Huang, Lev E McKinney, Robert Kirk, Rohit Gandikota, Stephen Casper, Stewart Slocum, Yarin Gal, Zichu Wu, Zikui Cai, Zora Che","submitted_at":"2025-02-03T18:59:16Z","abstract_excerpt":"Evaluations of large language model (LLM) risks and capabilities are increasingly being incorporated into AI risk management and governance frameworks. Currently, most risk evaluations are conducted by designing inputs that elicit harmful behaviors from the system. However, this approach suffers from two limitations. First, input-output evaluations cannot fully evaluate realistic risks from open-weight models. Second, the behaviors identified during any particular input-output evaluation can only lower-bound the model's worst-possible-case input-output behavior. As a complementary method for e"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2502.05209","kind":"arxiv","version":4},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CR","submitted_at":"2025-02-03T18:59:16Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"fb8033690c36969d91c665f1550be48099af6a96717632b4c7be38ca341a97ad","abstract_canon_sha256":"4a12071bc3dbc226722319445482cd5434f2e11174a9ab0216118899f60ac4ec"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:42:53.368804Z","signature_b64":"Tfm4G77bbi6zSh0P6IA7YOC30VGJ9KETalReTtgf5+9ZCjeJdZdDpWQrt/3y6QfP4TwEGhjSMy3RAsnbhAljCw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"99598f7e67623ac3508c1f95279fbe7f18e98221b038d78b30b85e586f1f3b48","last_reissued_at":"2026-07-05T11:42:53.368235Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:42:53.368235Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Model Tampering Attacks Enable More Rigorous Evaluations of LLM Capabilities","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CR","authors_text":"Aidan Ewart, Anirudh Satheesh, Bilal Chughtai, Domenic Rosati, Dylan Hadfield-Menell, Furong Huang, Lev E McKinney, Robert Kirk, Rohit Gandikota, Stephen Casper, Stewart Slocum, Yarin Gal, Zichu Wu, Zikui Cai, Zora Che","submitted_at":"2025-02-03T18:59:16Z","abstract_excerpt":"Evaluations of large language model (LLM) risks and capabilities are increasingly being incorporated into AI risk management and governance frameworks. Currently, most risk evaluations are conducted by designing inputs that elicit harmful behaviors from the system. However, this approach suffers from two limitations. First, input-output evaluations cannot fully evaluate realistic risks from open-weight models. Second, the behaviors identified during any particular input-output evaluation can only lower-bound the model's worst-possible-case input-output behavior. As a complementary method for e"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2502.05209","kind":"arxiv","version":4},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2502.05209/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2502.05209","created_at":"2026-07-05T11:42:53.368297+00:00"},{"alias_kind":"arxiv_version","alias_value":"2502.05209v4","created_at":"2026-07-05T11:42:53.368297+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2502.05209","created_at":"2026-07-05T11:42:53.368297+00:00"},{"alias_kind":"pith_short_12","alias_value":"TFMY67THMI5M","created_at":"2026-07-05T11:42:53.368297+00:00"},{"alias_kind":"pith_short_16","alias_value":"TFMY67THMI5MGUEM","created_at":"2026-07-05T11:42:53.368297+00:00"},{"alias_kind":"pith_short_8","alias_value":"TFMY67TH","created_at":"2026-07-05T11:42:53.368297+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":3,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2510.00761","citing_title":"Downgrade to Upgrade: Optimizer Simplification Enhances Robustness in LLM Unlearning","ref_index":34,"is_internal_anchor":false},{"citing_arxiv_id":"2604.03121","citing_title":"An Independent Safety Evaluation of Kimi K2.5","ref_index":91,"is_internal_anchor":false},{"citing_arxiv_id":"2604.07962","citing_title":"Is your algorithm unlearning or untraining?","ref_index":6,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/TFMY67THMI5MGUEMD6KSPH56P4","json":"https://pith.science/pith/TFMY67THMI5MGUEMD6KSPH56P4.json","graph_json":"https://pith.science/api/pith-number/TFMY67THMI5MGUEMD6KSPH56P4/graph.json","events_json":"https://pith.science/api/pith-number/TFMY67THMI5MGUEMD6KSPH56P4/events.json","paper":"https://pith.science/paper/TFMY67TH"},"agent_actions":{"view_html":"https://pith.science/pith/TFMY67THMI5MGUEMD6KSPH56P4","download_json":"https://pith.science/pith/TFMY67THMI5MGUEMD6KSPH56P4.json","view_paper":"https://pith.science/paper/TFMY67TH","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2502.05209&json=true","fetch_graph":"https://pith.science/api/pith-number/TFMY67THMI5MGUEMD6KSPH56P4/graph.json","fetch_events":"https://pith.science/api/pith-number/TFMY67THMI5MGUEMD6KSPH56P4/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/TFMY67THMI5MGUEMD6KSPH56P4/action/timestamp_anchor","attest_storage":"https://pith.science/pith/TFMY67THMI5MGUEMD6KSPH56P4/action/storage_attestation","attest_author":"https://pith.science/pith/TFMY67THMI5MGUEMD6KSPH56P4/action/author_attestation","sign_citation":"https://pith.science/pith/TFMY67THMI5MGUEMD6KSPH56P4/action/citation_signature","submit_replication":"https://pith.science/pith/TFMY67THMI5MGUEMD6KSPH56P4/action/replication_record"}},"created_at":"2026-07-05T11:42:53.368297+00:00","updated_at":"2026-07-05T11:42:53.368297+00:00"}