{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:TVCQ4CW3L2NL7IV47QAC74THUM","short_pith_number":"pith:TVCQ4CW3","schema_version":"1.0","canonical_sha256":"9d450e0adb5e9abfa2bcfc002ff267a3241bcb2359cab7375a09e645397e3ed4","source":{"kind":"arxiv","id":"2402.06664","version":3},"attestation_state":"computed","paper":{"title":"LLM Agents can Autonomously Hack Websites","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CR","authors_text":"Akul Gupta, Daniel Kang, Qiusi Zhan, Richard Fang, Rohan Bindu","submitted_at":"2024-02-06T14:46:08Z","abstract_excerpt":"In recent years, large language models (LLMs) have become increasingly capable and can now interact with tools (i.e., call functions), read documents, and recursively call themselves. As a result, these LLMs can now function autonomously as agents. With the rise in capabilities of these agents, recent work has speculated on how LLM agents would affect cybersecurity. However, not much is known about the offensive capabilities of LLM agents.\n  In this work, we show that LLM agents can autonomously hack websites, performing tasks as complex as blind database schema extraction and SQL injections w"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2402.06664","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CR","submitted_at":"2024-02-06T14:46:08Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"92da781268af783e35ba8e9057ef2dff1579e6d656e40cc7f01f57f3489d52a3","abstract_canon_sha256":"8c047847329c230e0192481649e3f6d56c1bbd4cb3db6c54badc365a19eb0cc0"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T07:45:52.375269Z","signature_b64":"FT4J6ZahGpG7OoA/FckTP4WQEvJY5qZQ2o/0uC8Z1hrxBEOTOfZtLO3TdvBX2kU5ObCneYFRlQiUclbjO3ZsCw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"9d450e0adb5e9abfa2bcfc002ff267a3241bcb2359cab7375a09e645397e3ed4","last_reissued_at":"2026-07-05T07:45:52.374793Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T07:45:52.374793Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"LLM Agents can Autonomously Hack Websites","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CR","authors_text":"Akul Gupta, Daniel Kang, Qiusi Zhan, Richard Fang, Rohan Bindu","submitted_at":"2024-02-06T14:46:08Z","abstract_excerpt":"In recent years, large language models (LLMs) have become increasingly capable and can now interact with tools (i.e., call functions), read documents, and recursively call themselves. As a result, these LLMs can now function autonomously as agents. With the rise in capabilities of these agents, recent work has speculated on how LLM agents would affect cybersecurity. However, not much is known about the offensive capabilities of LLM agents.\n  In this work, we show that LLM agents can autonomously hack websites, performing tasks as complex as blind database schema extraction and SQL injections w"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2402.06664","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2402.06664/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2402.06664","created_at":"2026-07-05T07:45:52.374852+00:00"},{"alias_kind":"arxiv_version","alias_value":"2402.06664v3","created_at":"2026-07-05T07:45:52.374852+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2402.06664","created_at":"2026-07-05T07:45:52.374852+00:00"},{"alias_kind":"pith_short_12","alias_value":"TVCQ4CW3L2NL","created_at":"2026-07-05T07:45:52.374852+00:00"},{"alias_kind":"pith_short_16","alias_value":"TVCQ4CW3L2NL7IV4","created_at":"2026-07-05T07:45:52.374852+00:00"},{"alias_kind":"pith_short_8","alias_value":"TVCQ4CW3","created_at":"2026-07-05T07:45:52.374852+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":23,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.25332","citing_title":"Decoupling Reconnaissance and Exploitation: Measuring the Capability Boundaries of LLM-Based Web Penetration Testing","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2606.24402","citing_title":"Poisoned Playbooks: Demystifying Knowledge Poisoning Effects on AI Security Agents","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2606.19149","citing_title":"OpenAnt: LLM-Powered Vulnerability Discovery Through Code Decomposition, Adversarial Verification, and Dynamic Testing","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01494","citing_title":"ClawHub Security Signals: When VirusTotal, Static Analysis, and SkillSpector Disagree","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2605.12916","citing_title":"SHM-Agents: A Generalist-Specialist Integrated Agent System for Structural Health Monitoring","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2605.24949","citing_title":"APT-Agent: Automated Penetration Testing using Large Language Models","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2605.24949","citing_title":"APT-Agent: Automated Penetration Testing using Large Language Models","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2605.30096","citing_title":"How Reliable Are AI Attackers Against a Fixed Vulnerable Target? A 400-Run Empirical Study of LLM Penetration Testing Consistency","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2606.10749","citing_title":"Toward Secure LLM Agents: Threat Surfaces, Attacks, Defenses, and Evaluation","ref_index":41,"is_internal_anchor":false},{"citing_arxiv_id":"2501.19202","citing_title":"Improving LLM Unlearning Robustness via Random Perturbations","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2605.17416","citing_title":"Benchmarking Mythos-Linked Bug Rediscovery","ref_index":24,"is_internal_anchor":false},{"citing_arxiv_id":"2605.15228","citing_title":"Verifiable Agentic Infrastructure: Proof-Derived Authorization for Sovereign AI Systems","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2510.23883","citing_title":"Agentic AI Security: Threats, Defenses, Evaluation, and Open Challenges","ref_index":100,"is_internal_anchor":false},{"citing_arxiv_id":"2512.22753","citing_title":"From Rookie to Expert: Manipulating LLMs for Automated Vulnerability Exploitation in Enterprise Software","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2602.17753","citing_title":"The 2025 AI Agent Index: Documenting Technical and Safety Features of Deployed Agentic AI Systems","ref_index":41,"is_internal_anchor":false},{"citing_arxiv_id":"2605.08316","citing_title":"AI-Driven Security Alert Screening and Alert Fatigue Mitigation in Security Operations Centers: A Comprehensive Survey","ref_index":40,"is_internal_anchor":false},{"citing_arxiv_id":"2604.18718","citing_title":"Towards Optimal Agentic Architectures for Offensive Security Tasks","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2604.10250","citing_title":"Organizational Security Resource Estimation via Vulnerability Queueing","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06713","citing_title":"Agentic AI and the Industrialization of Cyber Offense: Forecast, Consequences, and Defensive Priorities for Enterprises and the Mittelstand","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2604.05719","citing_title":"Hackers or Hallucinators? A Comprehensive Analysis of LLM-Based Automated Penetration Testing","ref_index":33,"is_internal_anchor":false},{"citing_arxiv_id":"2604.05440","citing_title":"LanG -- A Governance-Aware Agentic AI Platform for Unified Security Operations","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2604.17159","citing_title":"Systematic Capability Benchmarking of Frontier Large Language Models for Offensive Cyber Tasks","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2604.20801","citing_title":"Synthesizing Multi-Agent Harnesses for Vulnerability Discovery","ref_index":16,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/TVCQ4CW3L2NL7IV47QAC74THUM","json":"https://pith.science/pith/TVCQ4CW3L2NL7IV47QAC74THUM.json","graph_json":"https://pith.science/api/pith-number/TVCQ4CW3L2NL7IV47QAC74THUM/graph.json","events_json":"https://pith.science/api/pith-number/TVCQ4CW3L2NL7IV47QAC74THUM/events.json","paper":"https://pith.science/paper/TVCQ4CW3"},"agent_actions":{"view_html":"https://pith.science/pith/TVCQ4CW3L2NL7IV47QAC74THUM","download_json":"https://pith.science/pith/TVCQ4CW3L2NL7IV47QAC74THUM.json","view_paper":"https://pith.science/paper/TVCQ4CW3","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2402.06664&json=true","fetch_graph":"https://pith.science/api/pith-number/TVCQ4CW3L2NL7IV47QAC74THUM/graph.json","fetch_events":"https://pith.science/api/pith-number/TVCQ4CW3L2NL7IV47QAC74THUM/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/TVCQ4CW3L2NL7IV47QAC74THUM/action/timestamp_anchor","attest_storage":"https://pith.science/pith/TVCQ4CW3L2NL7IV47QAC74THUM/action/storage_attestation","attest_author":"https://pith.science/pith/TVCQ4CW3L2NL7IV47QAC74THUM/action/author_attestation","sign_citation":"https://pith.science/pith/TVCQ4CW3L2NL7IV47QAC74THUM/action/citation_signature","submit_replication":"https://pith.science/pith/TVCQ4CW3L2NL7IV47QAC74THUM/action/replication_record"}},"created_at":"2026-07-05T07:45:52.374852+00:00","updated_at":"2026-07-05T07:45:52.374852+00:00"}