{"as_of":"2026-08-11T07:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4693ba0c5c1787c0b0ca457763775f924ff906e01ed094d8271d98311952aa33","coverage":[{"denominator":145,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T09:10:11.585499Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T04:19:18.909239Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-08T04:19:19.261715Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"cited_work":{"arxiv_id":"2607.02605","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.02605","snapshot_observed_at":"2026-08-08T04:19:19.261715Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","venue":"cs.SE","work_id":"3066a986-d77a-43e6-af3d-0ba1e0df4757","year":2026},"citing_paper":{"arxiv_id":"2608.03009","last_updated":"2026-08-04T01:42:43Z","snapshot_observed_at":"2026-08-09T09:33:23.692118Z","submitted_at":"2026-08-04T01:42:43Z","title":"Tiny Enough to Break In: Agentic Remote Access Trojans Powered by Small Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T04:19:18.909239Z"},"links":{"cited_paper":"/paper/2607.02605","citing_paper":"/paper/2608.03009"},"observation_digest":"sha256:89bd07bf68cc07c9e2c9e5a2e25f8c5ed9a5c08088e28bd79e0da62651382733","observation_id":"4ae7e36f-590f-4925-8495-66c7521dbca7","resolution":{"observed_at":"2026-08-08T04:19:19.265911Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2607.02605/citation-record","integrity":"/paper/2607.02605/integrity","json":"/paper/2607.02605/citation-record.json","paper":"/paper/2607.02605"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Service grid fed- eration architecture for heterogeneous domains,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:1e09480c073dc10eaed2d1439a72e462d4192cde4564200f908c5968dd2a2ca3","observation_id":"210fd98f-ca49-46b3-b294-6e11877e3ae1","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Adaptive energy-aware computation offloading for cloud of things systems,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:ab670782e3000c10c5a554e3f257fc512326098dc78b116db13ff08d614e629e","observation_id":"aa5a10c5-7a25-474a-8a5b-7689c1cd5256","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Dynamic service invocation control in service composition environments,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:88227c3b77375e33fb7d8925d466fa369ae8df46aa17cbb696cc46118f43cbd9","observation_id":"14f8630f-b46a-400b-b917-1aee3ec82fd1","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Fine-grained two- factor access control for web-based cloud computing services,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:c716dc35d0ae9f811d39e1488a793d59345f2ccd881f36d355200c7b6d3ef5bf","observation_id":"746a63a0-06d5-47fe-88ce-73976ae9637c","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Trust-based access control for secure cloud computing,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:efcc8bf7f041510c5ba1d7836a4094ea0b7a0dc470cc6232f4fa791718c2e3e2","observation_id":"6a265dc0-411b-472f-9b50-cae8eec7bc2b","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Weidman,Penetration Testing: A Hands-On Introduction to Hack- ing","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:765f8e59a425cbfab1f38bde0abef91dbd2d714e1180b7ee527850e5c811d2a5","observation_id":"bd9b68e5-cc83-4c24-b65c-d0f83be8eeb5","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Security and privacy challenges in cloud computing environments,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:ebf8dbe39530f8d12030429c5f6baa549a5f331e0c3f5f09fcc6100f984ba663","observation_id":"16791e6a-4846-4c2f-b339-04e653c29a3d","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Dynamic security risk manage- ment using bayesian attack graphs,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:d83b7f821c3e467274afbdabdb169bf5925ea7ad97ec6105dcee88a5b096d4c3","observation_id":"64f4989a-9296-4306-b6d5-5a9ce36d0edf","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Two-factor data security protection mechanism for cloud storage system,","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:c39e82e1d9e213fc04da4939eecf5b22e84a29d5c0f24d4d318289d2006cb658","observation_id":"8bf6ee13-283f-459f-9fac-80d159266c96","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Engebretson,The basics of hacking and penetration testing: ethical hacking and penetration testing made easy","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:f6e74b32ee18ab3d4b671273d8963a51b91ff95fb23ca494d7cf7e8b03fa3401","observation_id":"3b3c516e-d9da-4166-b135-c23ac125a6db","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Examining penetration tester behavior in the collegiate penetration testing competition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:1591c915be80701c7883c0fea9597bc8d65047dc5b879c710f9b48318354082c","observation_id":"75906ac1-11f8-48d5-8c00-97f805433ab6","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Penetration testing–reconnaissance with nmap tool,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:9f25e091753db913d7899cedb974b0d7ae1a0c5964931950d9b8aac859cddc9e","observation_id":"df531fa1-58ae-4872-b057-9d5fee0a8e34","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Toss a fault to your witcher: Applying grey-box coverage-guided mutational fuzzing to detect sql and command injection vulnerabilities,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:c3d7be8b91faa80f7d67d689d37362fc88a25fbfa295ddaa9e08f41ddaed8180","observation_id":"bb35d593-0ab9-41c3-baab-0ef8822002f0","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"{FUGIO}: Automatic exploit generation for{PHP}object injection vulnerabilities,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:fe33afb7c6d303c460ba2494640a407e226d2ae473cd3f8af121e738de20c66e","observation_id":"8da05c22-b554-4a6f-b3e0-ef17449affc6","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"{ChainReactor}: Automated privilege es- calation chain discovery via{AI}planning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:d2d979f7fdc597d880271e7aabf7d8e95135fbefea346f16118274caeec517db","observation_id":"2ad030cb-5c8f-45df-ae90-fe6783ef50cf","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"A comprehensive detection method for the lateral movement stage of apt attacks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:e4ea56dd5c188beb2548c7978606e9268740b6a5221144dda5fd70428b2bbdd4","observation_id":"d748b416-21b0-4f2a-a84e-792d00440a53","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"A comprehensive overview of large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:d8f88bddcbf2ecadaa12ac9be068e8705861e2139e3606ce3dd4e69f53ebf6d0","observation_id":"63d8d5b6-2503-425d-8047-0124bf642b1e","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Large language models for cyber security: A systematic literature review,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:503a22a7a05ac24c3df86b7b7098475099b8a0cb1009c890f5afad5c3bc11e53","observation_id":"f667df0f-4b32-4971-97f7-54be8d515cba","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"{PentestGPT}: Evaluating and harnessing large language models for automated penetration testing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:2d0f890140e590354076f05ac527c4e06ab14ba64b4982fb87bbc95f3d882339","observation_id":"c743e59d-b0ec-478b-a0e3-156f12764254","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Expel: Llm agents are experiential learners,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:0c020bdfa151d4aa7106c84d0973ccfa940738758429e236b425b6383282300c","observation_id":"05906e27-e947-4daf-a7a9-e86e6156c3fd","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Autotool: Efficient tool selection for large language model agents,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:e63d256d4fc8a6cb8f4a3b329a0281a5c1b226d47bcfe3c43870edefa6ceb702","observation_id":"c1c82a77-5e6e-4a14-96c4-9bf0c06497f2","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"A survey on the feedback mechanism of llm- based ai agents,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:b1eb06a99dc31bbfd52896212e282e292879411cac2584dd1222666f05127f56","observation_id":"731d5387-d37a-41dc-a752-606544d8b4ae","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Spaiware: Uncovering a novel artificial intelligence attack vector through persistent memory in llm applications and agents,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:570ba89d57619de3d975069022e00c9921ccbadba63be9e556a7c9898df7acef","observation_id":"a7f54027-a8b6-4368-81df-6fe9368e9ef3","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Exe- cutable code actions elicit better llm agents,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:6009171f1ff459fc0db181d56ff3c4b2665485c9cab7c177a331acf09f6fc8ff","observation_id":"85194bb2-bd3c-4ce1-89f6-ae447e0820fd","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13411","last_updated":"2025-01-23T06:33:05Z","snapshot_observed_at":"2026-08-10T18:31:25.432841Z","submitted_at":"2025-01-23T06:33:05Z","title":"VulnBot: Autonomous Penetration Testing for A Multi-Agent Collaborative Framework","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13411","snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Vulnbot: Autonomous penetration testing for a multi-agent collaborative framework,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"cited_paper":"/paper/2501.13411","citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:45b0246c05ef151bf322e3533ff35d3a19b4e5964e74d4f54ed05ceb400de14c","observation_id":"0d16d82f-9d02-4712-af8c-61a1619fc6e7","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Automated penetration testing with llm agents and classical planning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:546b233d429db3596162aea54dc35cbbb68e2ba95adc6c27549ce02ea0dcb39a","observation_id":"2e3e7b8b-fb0b-4e6b-bf09-efde705691e2","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Pentest-r1: Towards autonomous penetration testing reasoning optimized via two-stage reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:ec513a41e6015c3d927e13a77fa831202ea74ef1430e576efa79bfe876e5256f","observation_id":"af477695-0790-4068-bbbb-98c06d38af12","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Cyber- zero: Training cybersecurity agents without runtime,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:55b3c5385eb96c993176868312a48a78afd6f3d1643064f0aa8b6b91b46c0eab","observation_id":"02c34b39-37b5-4fb7-bfaf-ccfaf52fb370","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Cybench: A framework for evaluating cybersecurity capabilities and risks of language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:c42c553fcfa6f755580ac09729c4cc2de1c91e73ddf105a9c5f94fd8dc074302","observation_id":"5a93a239-8d0c-4381-ad78-5626f6cf1eed","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Autopenbench: A vulnerability testing benchmark for generative agents,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:29e390aa5ce0a95b710eb23681db80536ae5f43b65dff2bc357d35b3f36bf1ce","observation_id":"5f3952f4-5d59-4ede-b3e7-05fa6bf75dd6","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Nyu ctf bench: A scalable open-source benchmark dataset for evaluating llms in offensive security,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:1238d7d5e2dbb1d5aa9ebc6133f7d434e0f1954cc5fb99a170e0a353189dfec7","observation_id":"c3992502-f160-4a23-9de0-28499f2165a9","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Towards effective offensive security llm agents: Hyperparameter tuning, llm as a judge, and a lightweight ctf benchmark,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:ec537c38086cd8908e727c697e79df1a743b52f192aad6efbeefbde07aeb174f","observation_id":"080f2a37-45a0-44bf-860b-630447ce2d8d","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Enigma: Interactive tools substantially assist lm agents in finding security vulnerabilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:fa5b72f93588428b4179ec74b80a2aa33e883af0f23ca12c265374225c269e95","observation_id":"0d9976af-13a6-4820-ac4e-73807e93a6bc","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Chimera: Harnessing multi- agent llms for automatic insider threat simulation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:d6784a727c9d81d6a923c7f416b530fec7e4b72e99941220286648260cf76394","observation_id":"0e72e55a-846a-42f6-bff8-eb744e3cd7d1","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Awe: Adaptive agents for dynamic web penetration testing,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:62c5bbc5cd1357e981e420ee0e27f713ffcea9da344b84ab3a100e2a7f8d3b1f","observation_id":"c351cd2a-c334-45e1-9ece-eb6d29f591d5","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.05719","last_updated":"2026-04-07T11:19:16Z","snapshot_observed_at":"2026-08-11T02:47:15.045919Z","submitted_at":"2026-04-07T11:19:16Z","title":"Hackers or Hallucinators? A Comprehensive Analysis of LLM-Based Automated Penetration Testing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.05719","snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Hackers or hallucinators? a comprehensive analysis of llm-based automated penetration testing,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"cited_paper":"/paper/2604.05719","citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:9e2b08c07a2bd65e2883f7b1cc0221dfaebf6b3ff45d26180725e3a341fa2b75","observation_id":"d27b3552-3f0d-48be-862c-3c013b62a9e5","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10112","last_updated":"2025-06-16T14:07:38Z","snapshot_observed_at":"2026-08-10T15:11:00.837274Z","submitted_at":"2025-04-14T11:21:33Z","title":"Benchmarking Practices in LLM-driven Offensive Security: Testbeds, Metrics, and Experiment Design","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10112","snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Benchmarking practices in llm-driven offensive security: Testbeds, metrics, and experiment design,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"cited_paper":"/paper/2504.10112","citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:c8d3bf10f633a1361d3e4a223e773c78d943ec97ca9112a28cf1bcf161b22013","observation_id":"5371b2c9-2f19-4d1c-b521-5fb7f4011829","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00829","last_updated":"2025-07-01T15:01:18Z","snapshot_observed_at":"2026-08-08T03:47:45.535102Z","submitted_at":"2025-07-01T15:01:18Z","title":"On the Surprising Efficacy of LLMs for Penetration-Testing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.00829","snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"On the surprising efficacy of llms for penetration-testing,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"cited_paper":"/paper/2507.00829","citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:fe87081baa089779eb9f11fb07cf0d8ee066a945f8e4a3340a9049364fff99b6","observation_id":"a471ea7d-910a-43e2-ac91-5381519797e2","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"A unified modeling framework for automated penetration testing,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:0e1b1c490f4aec1ae0fc1dc3040912276e2aa87a9b970713a9a39255c5343087","observation_id":"3100b41b-dfe7-489c-a06d-4ef7dcc5e6c7","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Automated penetration testing: Formal- ization and realization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:d5119f13c644aaf38360082c1a9f6df43b87c935b772bc0cf99bc48b5007b76b","observation_id":"027175b6-5a64-49e2-8404-ea9e96fe8d24","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"{CTF}:{State-of-the-Art}and building the next generation,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:2edbe7343a7b5d7ae9d4e2e7fd735a6a78d6b2aefc28517363b7f28aaa2d70af","observation_id":"db8f7259-7110-4b10-9818-1822490f4a19","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Cve-bench: A benchmark for ai agents’ ability to exploit real-worldweb application vulnerabilities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:d3f90396106fda8fab311eea76e34ee36263fac893c42fec27fe6060285d6edb","observation_id":"b452e875-d806-452f-bec5-9f4c1e7a6a3e","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Guidelines for performing systematic literature reviews in software engineering,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:5dc1f20146bf2ea486f70381076e3151723cf9edcbb2cc5642956cd972c41a4b","observation_id":"c59add8c-1475-4f25-b80e-d9b977a154c6","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Intelligent penetration testing through integrated knowledge graph and historical decision enhancement,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:1c3f57040189c0379e2318724cd9994992a73cf5a271ca4240dc84e2e70e4ebe","observation_id":"adfa7a0f-770b-4e09-af85-092056ae07bb","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Intercode: Stan- dardizing and benchmarking interactive coding with execution feed- back,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:06201085cb5452c33dc2898bbdc184663ea8de6836258e1f4ba4cde75e73c65e","observation_id":"c2543969-2970-403d-b724-85015210bb5d","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08144","last_updated":"2024-04-17T04:34:39Z","snapshot_observed_at":"2026-08-08T10:18:09.304124Z","submitted_at":"2024-04-11T22:07:19Z","title":"LLM Agents can Autonomously Exploit One-day Vulnerabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08144","snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Llm agents can autonomously exploit one-day vulnerabilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"cited_paper":"/paper/2404.08144","citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:0aae9bb08f954d0c89c64ae3a57e88f5a8639a5b717ad043ad9bd0b893323602","observation_id":"5e28fc9a-d73d-478b-a8d2-eb69709113e8","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02106","last_updated":"2024-05-06T10:42:30Z","snapshot_observed_at":"2026-08-11T04:11:27.026415Z","submitted_at":"2024-05-03T14:04:51Z","title":"Got Root? A Linux Priv-Esc Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02106","snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Got root? a linux priv-esc benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"cited_paper":"/paper/2405.02106","citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:086aa713ddbb437d1931f1e0fb62d9da5451fac4a8a34a373374cfd626c274e3","observation_id":"8d49293a-1eb0-41b9-ada0-0ab3a11d48fb","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01778","last_updated":"2024-12-02T18:28:18Z","snapshot_observed_at":"2026-08-10T18:31:21.303059Z","submitted_at":"2024-12-02T18:28:18Z","title":"HackSynth: LLM Agent and Evaluation Framework for Autonomous Penetration Testing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01778","snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Hacksynth: Llm agent and eval- uation framework for autonomous penetration testing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"cited_paper":"/paper/2412.01778","citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:73d6929e34c1241e30b3c452192ea7380a2d2b3ffe842623acc45c7a680c4385","observation_id":"449cdf82-bf1b-40fa-b15d-776a14b71bb5","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11814","last_updated":"2024-02-19T04:08:44Z","snapshot_observed_at":"2026-08-09T21:05:54.403616Z","submitted_at":"2024-02-19T04:08:44Z","title":"An Empirical Evaluation of LLMs for Solving Offensive Security Challenges","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11814","snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"An empirical evaluation of llms for solving offensive security challenges,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"cited_paper":"/paper/2402.11814","citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:b4d07745b565f56bd9d6998480d7e310f0774fc086840838514c22c57d9dd32d","observation_id":"6f3341c2-a8fd-46a0-b129-cf9e57cf8280","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Catastrophic cyber capabilities benchmark (3cb): Robustly evaluating llm agent cyber offense capabilities,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:4146bb3ae0269923b3c5556aa96c31d9efb72c280877e1544fb9138221e2e3b5","observation_id":"2b9ceb88-5530-4cbf-83ce-e80d7511db39","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Towards automated penetration testing: Introducing llm benchmark, analysis, and improve- ments,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:4b76c8916b4119715c62b2a3f3c8b0cb645afc73cedb5ee6dc7b66888d9c3304","observation_id":"4b997c96-2099-4abb-a3d1-0b4b3a37c1cf","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Pen- testeval: Benchmarking llm-based penetration testing with modular and stage-level design,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:04abcbeebfb1dc356e00756365f40b06e54d64cf68bc4873719fd9740786991e","observation_id":"103f6b67-dd11-4fb7-9d37-93627dbd24c4","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Cybergym: Evaluating ai agents’ real-world cybersecurity capabilities at scale,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:90c7ab5fb44279e3628f81daa0c261e19ee056df29e568a96c1f85274865b627","observation_id":"2be6268f-5191-41f5-8aa9-0bf34e110253","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Hackworld: Evaluating computer-use agents on exploit- ing web application vulnerabilities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:08a73009dce27d40c85ae1a3bc272a11f569cf5e09cc61055521a5bc0abf29ae","observation_id":"b7d26508-ee65-49ad-a541-effc16e84bde","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Pacebench: A framework for evaluating practical ai cyber-exploitation capabilities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:9824b3a4d14d9360df9dcd346d42a8b56d10b2ca42c0cd76ab1a56df3dc4bba8","observation_id":"5a47ac48-02bf-4fbe-b5a7-465833cbf79e","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.11504","last_updated":"2026-07-11T11:49:33Z","snapshot_observed_at":"2026-08-01T18:19:17.013044Z","submitted_at":"2026-05-12T04:23:42Z","title":"CTFusion: A CTF-based Benchmark for LLM Agent Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.11504","snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Ctfusion: A ctf-based benchmark for llm agent evaluation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"cited_paper":"/paper/2605.11504","citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:4b716901c916781a9e8b566a0f9184efc7376226f786037c6911f35966d88a5c","observation_id":"29c5fa5b-1d1a-4ee2-a75e-c3f3368c8d93","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.30096","last_updated":"2026-05-28T15:39:43Z","snapshot_observed_at":"2026-08-08T19:27:59.265761Z","submitted_at":"2026-05-28T15:39:43Z","title":"How Reliable Are AI Attackers Against a Fixed Vulnerable Target? A 400-Run Empirical Study of LLM Penetration Testing Consistency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.30096","snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"How reliable are ai attackers against a fixed vulnerable target? a 400-run empirical study of llm penetration testing consis- tency,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"cited_paper":"/paper/2605.30096","citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:73594c701cc945f800891623b887e22ab6f19fc2c8de87ef3673a4aef7cae54d","observation_id":"b4732774-2ba4-49c4-8ca7-af1be4307ff3","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.04460","last_updated":"2026-07-17T23:45:25Z","snapshot_observed_at":"2026-08-09T01:09:09.573814Z","submitted_at":"2026-06-03T05:06:37Z","title":"CyberGym-E2E: Scalable Real-World Benchmark for AI Agents' End-to-End Cybersecurity Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.04460","snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Cybergym-e2e: Scalable real- world benchmark for ai agents’ end-to-end cybersecurity capabilities,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"cited_paper":"/paper/2606.04460","citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:0ab61b05c1f1c21a845c873841de2104cce0b0c5810ffdf4a9288d2637358839","observation_id":"2d5e2d96-e0eb-45df-9ae2-539a51d8200d","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.11086","last_updated":"2026-05-11T18:00:14Z","snapshot_observed_at":"2026-08-10T21:28:59.299113Z","submitted_at":"2026-05-11T18:00:14Z","title":"ExploitGym: Can AI Agents Turn Security Vulnerabilities into Real Attacks?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.11086","snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Exploitgym: Can ai agents turn security vulnerabilities into real attacks?","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"cited_paper":"/paper/2605.11086","citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:634a7fe298dd3456ee86ede1a88a8cdff9ebf6f1cf5524c5f68de7293d6f203b","observation_id":"29e2d4b9-282d-48c0-bdcf-9bd3f2509b6f","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Penheal: A two-stage llm framework for automated pentesting and optimal remediation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:30be9a5074acb8b55b028e27a9630074e2779a63204372ae82220055602bfaa7","observation_id":"9a3eb5c2-626a-43b1-bcf9-1ea1b20f0200","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01038","last_updated":"2024-03-02T00:10:45Z","snapshot_observed_at":"2026-08-10T15:09:48.084292Z","submitted_at":"2024-03-02T00:10:45Z","title":"AutoAttacker: A Large Language Model Guided System to Implement Automatic Cyber-attacks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01038","snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Autoattacker: A large language model guided system to implement automatic cyber-attacks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"cited_paper":"/paper/2403.01038","citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:86253a6213197678c6a5e8520f70b000bfff4433fd381dee911544e35e7bc04a","observation_id":"0f64a90a-baee-4c66-b62c-38515c759812","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Pentest-ai, an llm-powered multi- agents framework for penetration testing automation leveraging mitre attack,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:9151b64de6ba0adbbed8dd63bb49de9a7ca634bb47c630b061b819d010f63e5a","observation_id":"fa369260-2f15-4ff5-a111-5fcccf3e9bec","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Pentestagent: Incorporating llm agents to automated penetration testing,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:474138e5209acd0a8f52bee48aebbfc453b94b28660d7836ce867699d8e075ee","observation_id":"f313c0ce-8f83-47a4-b297-9b721728f5cd","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Autopentester: An llm agent-based framework for automated pentesting,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:0e83ff73b9ab4f656d7f89ac653f1b67c607935e4a556caea1d1b0a52cd0683c","observation_id":"f1d55eba-7b9d-4104-90df-da6d403b2c2f","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09484","last_updated":"2025-02-13T16:46:23Z","snapshot_observed_at":"2026-08-09T21:01:14.187037Z","submitted_at":"2025-02-13T16:46:23Z","title":"PenTest++: Elevating Ethical Hacking with AI and Automation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09484","snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Pentest++: Elevating ethical hacking with ai and automation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"cited_paper":"/paper/2502.09484","citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:ad2b361eb34cce93ece032edded63cdecbf850ca3f22eb4dfd9486158710b7c3","observation_id":"0a3d033b-75d4-471a-87e1-827e61d1b54c","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Rapidpen: Fully automated ip-to-shell penetration testing with llm-based agents,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:ae03bc8534279d87a4ba386066c7384ea9995d2699a646090f26952c5410a600","observation_id":"fa266cf3-5f06-4f6a-ab9a-8ca169bd82c5","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Guided reasoning in llm-driven penetration testing using structured attack trees,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:319c14b9fe47ba4bce3636e27c0161abd102b056dd994bbe8d793b9736dfe6e1","observation_id":"f23085bf-13b3-4e39-bba4-d03b957eb832","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03789","last_updated":"2024-08-31T19:15:38Z","snapshot_observed_at":"2026-08-06T13:32:54.258151Z","submitted_at":"2024-08-31T19:15:38Z","title":"BreachSeek: A Multi-Agent Automated Penetration Tester","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03789","snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Breachseek: A multi-agent automated penetration tester,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"cited_paper":"/paper/2409.03789","citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:aaf8210f9c42a4d772030d83366e842b51bbe2b72fe3c76067d9ab3496963440","observation_id":"3635cbc8-0410-4ede-b126-1e066601d176","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Controller makes pentesting better: An improved multi-agent auto- mated penetration testing framework,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:b06c011b5654dc500969c6605c39114b20c54edcb268ec77ecf4d99b2cb3a19d","observation_id":"2848a064-1259-4149-a7da-c349c96efe7e","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Shell or nothing: Real-world benchmarks and memory- activated agents for automated penetration testing,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:6eaa2c52d304403584c8d9963829bf9b99cf2f70e1cbdae6cc71cb17396231c4","observation_id":"eb4c7851-be73-4bfa-a7f7-a93bb8a540e5","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Refpentester: A knowledge- informed self-reflective penetration testing framework based on large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:22bbc040ea0dcdccecf3925ff31abd405a901e7f4f1eba70c33d705fb2506c31","observation_id":"a529eebf-bae3-4054-8b2d-1225ebe2467f","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Ptfusion: Llm- driven context-aware knowledge fusion for web penetration testing,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:198f29cda2f646e6ae493fea30035ca04f26b755a779596629650b49d6320e7b","observation_id":"3d413c04-9332-4b6d-b902-ee2b6ccb284d","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Pentestmcp: Llm and mcp based multi-agent framework for automated penetration testing,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:24a287e82e11805dcd3a5fe0df9afefda0a913045300c023dfaa7812c88f4029","observation_id":"98b41d4b-c539-4034-a614-b84d265cb790","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"xoffense: An ai-driven autonomous penetration testing framework with offensive knowledge-enhanced llms and multi agent systems,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:b725275746c6f9bab13d387b7c52dbf304347029e6279d4702c17cd2dd50e606","observation_id":"5d800317-7377-490f-af9c-882f2e149a6d","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06017","last_updated":"2025-04-09T13:54:18Z","snapshot_observed_at":"2026-08-09T09:01:44.523329Z","submitted_at":"2025-04-08T13:22:09Z","title":"CAI: An Open, Bug Bounty-Ready Cybersecurity AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06017","snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Cai: An open, bug bounty-ready cybersecurity ai,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"cited_paper":"/paper/2504.06017","citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:5145cb7cd05f53c0d71e5159de99cea227e66c3524e51ff48e71e162866323ca","observation_id":"78960ca3-6a94-40bb-b0aa-baf686c3e03b","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Redteamllm: an agentic ai framework for offensive security,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:844bd61c2ceaeacdf796fd6f23cbc1f3680961a52ce91e99d70409e6c465ffe2","observation_id":"f0b5d879-7476-44fd-b3f0-434a6e37a026","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Red-mirror: Agentic llm-based autonomous penetration testing with reflective verification and knowledge-augmented interac- tion,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:902cf4330d13bad93a2ad804e060755b3c77840e4d0b4105f8ecf1f7514a8c93","observation_id":"91414e80-c0a7-4176-b89a-748a6efd9007","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"What makes a good llm agent for real-world penetration testing?","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:c4cfe1d007d1e7f97490375ae737b08b6bbfdb867b3c7e56328ad5ffc6659634","observation_id":"2c088a8b-63c1-4f2e-b69b-b2d3abe6d00a","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Incalmo: An autonomous llm-assisted system for red teaming multi- host networks,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:7c31dc14c5bc37660cd9b6267d5fa39a3543b1c897868d3d456b8d0d06ee352a","observation_id":"16f0dc1a-57cb-4c6e-8605-560147f5281e","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Cipher: Cybersecurity intelligent penetration- testing helper for ethical researcher,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:820f3704fd24055960c163beebfbdf881e77a4b7edf7a1ce92864012718e9eae","observation_id":"2cf6539a-6cb5-4e4d-90f1-10965943e0b9","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.04499","last_updated":"2026-05-06T05:02:40Z","snapshot_observed_at":"2026-08-02T17:29:05.161054Z","submitted_at":"2026-05-06T05:02:40Z","title":"Pen-Strategist: A Reasoning Framework for Penetration Testing Strategy Formation and Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.04499","snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Pen-strategist: A reasoning framework for penetration testing strategy formation and analysis,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"cited_paper":"/paper/2605.04499","citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:44ad891e9b877088d5fd9c8781718b25f8f257197675afca9317a06ecbf3c1d6","observation_id":"31ecfd0c-d832-4929-8ca0-b4154b6c0e7d","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"From intent to invocation: A reasoning-first framework for natural language to pen- etration testing commands,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:f8928be379fad7a78862cd09d154bbcb32c991b301b16762fd77081301492377","observation_id":"10ff4b56-ac0d-4aa9-ab28-55a72fa44e00","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06664","last_updated":"2024-02-16T04:02:51Z","snapshot_observed_at":"2026-08-07T10:02:21.156103Z","submitted_at":"2024-02-06T14:46:08Z","title":"LLM Agents can Autonomously Hack Websites","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06664","snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Llm agents can autonomously hack websites,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"cited_paper":"/paper/2402.06664","citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:55b35983b696b993c97e4aef975627871cbc8061b7e8f37be2fe78b930fdd547","observation_id":"70ff2b12-b7b1-4391-adcf-f750b30954a5","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10321","last_updated":"2025-05-15T14:06:00Z","snapshot_observed_at":"2026-08-10T15:05:04.824996Z","submitted_at":"2025-05-15T14:06:00Z","title":"AutoPentest: Enhancing Vulnerability Management With Autonomous LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10321","snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Autopentest: Enhancing vulnerability management with autonomous llm agents,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"cited_paper":"/paper/2505.10321","citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:d8d8a1ddaf36f67b38e15984de5f988571b342d98c1a7854bbd433eee314c9c1","observation_id":"2f0d08fa-93a9-4122-93f2-a8d10879c8ca","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Automated tactics planning for cyber attack and defense based on large language model agents,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:a0256b299b7fb77b3d109d0e3361ba6b1080c66a10ac64c88df7bf9fa8696440","observation_id":"96aef585-e1f7-422e-b536-1e18a0396d6e","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"From capabilities to performance: Evaluating key functional properties of llm architectures in penetration testing,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:14286630cfe919afae3cf1c40e89c8e588d9ecf4b750cc2a37172df4f426b0a0","observation_id":"94154dbd-a531-48dc-a0f4-4b7c04a314ab","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Penforge: On-the-fly expert agent construction for automated penetration testing,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:bb300917eb9f059cf250a2269e84b583cc6f3aa57379583e1ccb7c7feca33878","observation_id":"e9a648b7-6a46-4593-b160-55fa59a4ce80","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Perses: Unlocking privilege escalation for small llms via extensible heterogeneity,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:bc28b23077256fa17fdee35f31bd920097ea0df57f19c9925a77668fd1b11176","observation_id":"17035994-6e59-4683-a7e6-65929d33f127","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.17673","last_updated":"2026-07-03T16:10:40Z","snapshot_observed_at":"2026-08-08T05:42:51.837717Z","submitted_at":"2026-03-18T12:52:54Z","title":"Towards Reliable Local Security Agents: Verifiable Post-Training for Linux Privilege Escalation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.17673","snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Post-training local llm agents for linux privilege escalation with verifiable rewards,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"cited_paper":"/paper/2603.17673","citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:cd17c78e3461c37861dc17a747db86dcbc575f5a0461f8d3dd3b701407ec8f93","observation_id":"83ab6bc7-cefc-42bf-8263-7aab9d5039d4","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Can llms hack enterprise networks? autonomous assumed breach penetration-testing active directory networks,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:552a14f5fb1da014c8e56a757e4e483ea46ce90da535fadb94e54530007eb896","observation_id":"f1ba5da7-160d-4928-85cb-99ecc5e676dc","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20816","last_updated":"2025-08-28T14:14:24Z","snapshot_observed_at":"2026-08-05T14:51:04.400228Z","submitted_at":"2025-08-28T14:14:24Z","title":"Multi-Agent Penetration Testing AI for the Web","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.20816","snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Multi-agent penetration testing ai for the web,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"cited_paper":"/paper/2508.20816","citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:673a43023c6b9e1c199aa5310d3bfe865aa1ac1d8ac68d79d8075d740e13dd41","observation_id":"71464fe0-cc6d-41cf-9872-bf253de0b665","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18528","last_updated":"2025-02-24T21:16:31Z","snapshot_observed_at":"2026-08-10T04:00:25.708724Z","submitted_at":"2025-02-24T21:16:31Z","title":"ARACNE: An LLM-Based Autonomous Shell Pentesting Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18528","snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Aracne: An llm-based autonomous shell pentesting agent,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"cited_paper":"/paper/2502.18528","citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:b945362075cde08ecfc4e86ff853fa83454bd1cce2b1686a3ba06354622ab328","observation_id":"5b87ce12-3fcd-4f1c-9c6a-d3c90ea08304","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Wifipentester: Towards governed genai-assisted wireless pentesting,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:4f481701e02a6c2114ac561181f99baf6fa54e7ed930c4dde9280c92d02ef6c2","observation_id":"1bdbd712-9394-4429-aeb9-f7544ec9b9e3","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Ai-driven penetration testing for arm systems: Experimental evaluation and deployment framework across four paradigms,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:8004f33b6366a7bcb95037728db1368c2a5caa409500e88f4079bd9a201588d0","observation_id":"c4d1d695-363c-439a-bd24-acedbda5d58b","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Getting pwn’d by ai: Penetration testing with large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:8aa0c8196b861a4cc92a15e5947390097d53205a04a0a0e5dacd9181f094ae24","observation_id":"d9070392-1f83-4ca8-ba8d-897911781525","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01236","last_updated":"2024-11-02T13:24:30Z","snapshot_observed_at":"2026-08-09T23:20:17.691572Z","submitted_at":"2024-11-02T13:24:30Z","title":"AutoPT: How Far Are We from the End2End Automated Web Penetration Testing?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01236","snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Autopt: How far are we from the end2end automated web penetration testing?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"cited_paper":"/paper/2411.01236","citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:f1cbe180616ce62a1b57f82c23aa7d367714d15e6d2a31222a0d0902d71efa25","observation_id":"d0a70912-4a6c-422a-8326-482f6fa986c6","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Llms as hackers: Autonomous linux privilege escalation attacks,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:bfb8c9e5ac846c1395bc8bb4de0504ba83582d752dcb77b33f34f8cff95a1139","observation_id":"960b9023-4926-4141-9fbf-a86ff7787b6b","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10931","last_updated":"2025-05-11T03:59:37Z","snapshot_observed_at":"2026-08-07T18:15:24.246098Z","submitted_at":"2025-02-15T23:43:18Z","title":"D-CIPHER: Dynamic Collaborative Intelligent Multi-Agent System with Planner and Heterogeneous Executors for Offensive Security","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10931","snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"D-cipher: Dynamic collaborative intelligent multi-agent system with planner and heterogeneous executors for offensive security,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"cited_paper":"/paper/2502.10931","citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:7ab6445d13c6e0f2d4eea8fbb80ba35b3f349368354330a08929bc1dc6315715","observation_id":"85a0061c-b2d1-4985-87a7-df0adff7c83d","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Measuring and augmenting large language models for solving capture-the-flag challenges,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:b682907c9f5707cd217653017ea63df32f6b60c738bdfbd685aa28aec9ee9933","observation_id":"c949ec0a-e045-4586-928f-35b22e340274","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:10:11.585499Z","title":"Ctfagent: An llm-powered agent for ctf challenge solving,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-07-12T09:10:11.585499Z"},"links":{"citing_paper":"/paper/2607.02605"},"observation_digest":"sha256:faeda425d6d454e5295a25a2ee4ad3a1ac95e297b96b1d156045a1d95ca245bd","observation_id":"3602dbb9-74c9-42a7-85ee-00ed9d5398a4","resolution":{"observed_at":"2026-07-12T09:10:11.585499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.02605","last_updated":"2026-07-01T13:24:25Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-07-12T09:10:10.458200Z","submitted_at":"2026-07-01T13:24:25Z","title":"A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":145},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 100 of 145 outbound references and 1 inbound Pith citation observation for arXiv:2607.02605."}