{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:PG6RV7M4FMNWGQM4ZRTBNWTGND","short_pith_number":"pith:PG6RV7M4","schema_version":"1.0","canonical_sha256":"79bd1afd9c2b1b63419ccc6616da6668fa71182c2cd816ca0e061e2c348d3aa1","source":{"kind":"arxiv","id":"2403.13793","version":2},"attestation_state":"computed","paper":{"title":"Evaluating Frontier Models for Dangerous Capabilities","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.LG","authors_text":"Albert Webson, Alexandre Kaskasoli, Allan Dafoe, Anca Dragan, Anian Ruoss, David Lindner, Elliot Catt, Gregoire Deletang, Heidi Howard, Lewis Ho, Marcus Hutter, Maria Abi Raad, Mary Phuong, Matthew Aitchison, Matthew Rahtz, Ramana Kumar, Rohin Shah, Sarah Cogan, Sarah Hodkinson, Sasha Brown, Sebastian Farquhar, Seliem El-Sayed, Sharon Lin, Toby Shevlane, Tom Lieberum, Victoria Krakovna, Yannis Assael","submitted_at":"2024-03-20T17:54:26Z","abstract_excerpt":"To understand the risks posed by a new AI system, we must understand what it can and cannot do. Building on prior work, we introduce a programme of new \"dangerous capability\" evaluations and pilot them on Gemini 1.0 models. Our evaluations cover four areas: (1) persuasion and deception; (2) cyber-security; (3) self-proliferation; and (4) self-reasoning. We do not find evidence of strong dangerous capabilities in the models we evaluated, but we flag early warning signs. Our goal is to help advance a rigorous science of dangerous capability evaluation, in preparation for future models."},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2403.13793","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2024-03-20T17:54:26Z","cross_cats_sorted":[],"title_canon_sha256":"cbd8a2c7100d324295add8f163957ba61c632afcc7dbff6a0cef2d44bcb1c43c","abstract_canon_sha256":"ecdb9f2756753357c712a14c906b604a65549830718fd7a64cf3ca6c7408af60"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:04:38.669537Z","signature_b64":"mNgAvXwbtvzs+4i+/3/jpI6TSeiiLRGHzB0kr327lqvT6KnOtj9lFXUay9ox0aKdGPI+GeoL429LOi4YJqKhAQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"79bd1afd9c2b1b63419ccc6616da6668fa71182c2cd816ca0e061e2c348d3aa1","last_reissued_at":"2026-07-05T08:04:38.669086Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:04:38.669086Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Evaluating Frontier Models for Dangerous Capabilities","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.LG","authors_text":"Albert Webson, Alexandre Kaskasoli, Allan Dafoe, Anca Dragan, Anian Ruoss, David Lindner, Elliot Catt, Gregoire Deletang, Heidi Howard, Lewis Ho, Marcus Hutter, Maria Abi Raad, Mary Phuong, Matthew Aitchison, Matthew Rahtz, Ramana Kumar, Rohin Shah, Sarah Cogan, Sarah Hodkinson, Sasha Brown, Sebastian Farquhar, Seliem El-Sayed, Sharon Lin, Toby Shevlane, Tom Lieberum, Victoria Krakovna, Yannis Assael","submitted_at":"2024-03-20T17:54:26Z","abstract_excerpt":"To understand the risks posed by a new AI system, we must understand what it can and cannot do. Building on prior work, we introduce a programme of new \"dangerous capability\" evaluations and pilot them on Gemini 1.0 models. Our evaluations cover four areas: (1) persuasion and deception; (2) cyber-security; (3) self-proliferation; and (4) self-reasoning. We do not find evidence of strong dangerous capabilities in the models we evaluated, but we flag early warning signs. Our goal is to help advance a rigorous science of dangerous capability evaluation, in preparation for future models."},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2403.13793","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2403.13793/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2403.13793","created_at":"2026-07-05T08:04:38.669144+00:00"},{"alias_kind":"arxiv_version","alias_value":"2403.13793v2","created_at":"2026-07-05T08:04:38.669144+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2403.13793","created_at":"2026-07-05T08:04:38.669144+00:00"},{"alias_kind":"pith_short_12","alias_value":"PG6RV7M4FMNW","created_at":"2026-07-05T08:04:38.669144+00:00"},{"alias_kind":"pith_short_16","alias_value":"PG6RV7M4FMNWGQM4","created_at":"2026-07-05T08:04:38.669144+00:00"},{"alias_kind":"pith_short_8","alias_value":"PG6RV7M4","created_at":"2026-07-05T08:04:38.669144+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":22,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2607.08066","citing_title":"Persuasion Attacks Can Decrease Effectiveness of CoT Monitoring","ref_index":62,"is_internal_anchor":true},{"citing_arxiv_id":"2606.18532","citing_title":"AI Sandboxes: A Threat Model, Taxonomy, and Measurement Framework","ref_index":122,"is_internal_anchor":false},{"citing_arxiv_id":"2606.13079","citing_title":"The Emergence of Autonomous Penetration Capabilities in Large Language Model-Powered AI Systems","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2606.05330","citing_title":"A Model of Multi-turn Human Persuadability Using Probabilistic Belief Tracing","ref_index":103,"is_internal_anchor":false},{"citing_arxiv_id":"2606.03237","citing_title":"Solipsistic Superintelligence is Unlikely to be Cooperative","ref_index":199,"is_internal_anchor":false},{"citing_arxiv_id":"2606.31916","citing_title":"Theory of Mind and Persuasion Beyond Conversation: Assessing the Capacity of LLMs to Induce Belief States via Planning and Action","ref_index":75,"is_internal_anchor":false},{"citing_arxiv_id":"2606.00047","citing_title":"Comprehensive AI governance requires addressing non-model gains","ref_index":76,"is_internal_anchor":false},{"citing_arxiv_id":"2606.13079","citing_title":"The Emergence of Autonomous Penetration Capabilities in Large Language Model-Powered AI Systems","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2412.16720","citing_title":"OpenAI o1 System Card","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2605.19722","citing_title":"Measuring Safety Alignment Effects in Autonomous Security Agents","ref_index":49,"is_internal_anchor":false},{"citing_arxiv_id":"2506.06414","citing_title":"Benchmarking Misuse Mitigation Against Covert Adversaries","ref_index":24,"is_internal_anchor":false},{"citing_arxiv_id":"2507.06261","citing_title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","ref_index":64,"is_internal_anchor":false},{"citing_arxiv_id":"2404.08144","citing_title":"LLM Agents can Autonomously Exploit One-day Vulnerabilities","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2512.10687","citing_title":"Safe for Whom? Rethinking How We Evaluate the Safety of LLMs for Real Users","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2412.04984","citing_title":"Frontier Models are Capable of In-context Scheming","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2602.17753","citing_title":"The 2025 AI Agent Index: Documenting Technical and Safety Features of Deployed Agentic AI Systems","ref_index":103,"is_internal_anchor":false},{"citing_arxiv_id":"2605.12131","citing_title":"Rollout Cards: A Reproducibility Standard for Agent Research","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11086","citing_title":"ExploitGym: Can AI Agents Turn Security Vulnerabilities into Real Attacks?","ref_index":44,"is_internal_anchor":false},{"citing_arxiv_id":"2502.18864","citing_title":"Towards an AI co-scientist","ref_index":38,"is_internal_anchor":false},{"citing_arxiv_id":"2408.00118","citing_title":"Gemma 2: Improving Open Language Models at a Practical Size","ref_index":37,"is_internal_anchor":false},{"citing_arxiv_id":"2604.14070","citing_title":"From Disclosure to Self-Referential Opacity: Six Dimensions of Strain in Current AI Governance","ref_index":69,"is_internal_anchor":false},{"citing_arxiv_id":"2604.20389","citing_title":"CyberCertBench: Evaluating LLMs in Cybersecurity Certification Knowledge","ref_index":18,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/PG6RV7M4FMNWGQM4ZRTBNWTGND","json":"https://pith.science/pith/PG6RV7M4FMNWGQM4ZRTBNWTGND.json","graph_json":"https://pith.science/api/pith-number/PG6RV7M4FMNWGQM4ZRTBNWTGND/graph.json","events_json":"https://pith.science/api/pith-number/PG6RV7M4FMNWGQM4ZRTBNWTGND/events.json","paper":"https://pith.science/paper/PG6RV7M4"},"agent_actions":{"view_html":"https://pith.science/pith/PG6RV7M4FMNWGQM4ZRTBNWTGND","download_json":"https://pith.science/pith/PG6RV7M4FMNWGQM4ZRTBNWTGND.json","view_paper":"https://pith.science/paper/PG6RV7M4","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2403.13793&json=true","fetch_graph":"https://pith.science/api/pith-number/PG6RV7M4FMNWGQM4ZRTBNWTGND/graph.json","fetch_events":"https://pith.science/api/pith-number/PG6RV7M4FMNWGQM4ZRTBNWTGND/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/PG6RV7M4FMNWGQM4ZRTBNWTGND/action/timestamp_anchor","attest_storage":"https://pith.science/pith/PG6RV7M4FMNWGQM4ZRTBNWTGND/action/storage_attestation","attest_author":"https://pith.science/pith/PG6RV7M4FMNWGQM4ZRTBNWTGND/action/author_attestation","sign_citation":"https://pith.science/pith/PG6RV7M4FMNWGQM4ZRTBNWTGND/action/citation_signature","submit_replication":"https://pith.science/pith/PG6RV7M4FMNWGQM4ZRTBNWTGND/action/replication_record"}},"created_at":"2026-07-05T08:04:38.669144+00:00","updated_at":"2026-07-05T08:04:38.669144+00:00"}