{"as_of":"2026-08-21T17:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9788901963633703ae49cd9dda01a1f4e74777ca8fb10169d9d6e5c3682a45e4","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":30,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:16:52.653903Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T20:16:29.518680Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.17332","last_updated":"2025-06-24T04:10:59Z","snapshot_observed_at":"2026-08-21T16:35:36.541328Z","submitted_at":"2025-03-21T17:32:32Z","title":"CVE-Bench: A Benchmark for AI Agents' Ability to Exploit Real-World Web Application Vulnerabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17332","snapshot_observed_at":"2026-08-15T20:58:10.500385Z","title":"CVE-Bench: A benchmark for AI agents’ ability to exploit real-world web application vulnera- bilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11449","last_updated":"2025-05-16T17:05:25Z","snapshot_observed_at":"2026-08-17T23:22:10.962076Z","submitted_at":"2025-05-16T17:05:25Z","title":"LLMs unlock new paths to monetizing exploits","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:10.500385Z"},"links":{"cited_paper":"/paper/2503.17332","citing_paper":"/paper/2505.11449"},"observation_digest":"sha256:fb88eb11aed9738c7e4e3475fb1a0dea3655f465cda7ad9c1df4a9cfc53b8296","observation_id":"052abd75-c0a6-49bb-93a5-0c77cb9ba8c9","resolution":{"observed_at":"2026-08-15T20:58:10.500385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17332","last_updated":"2025-06-24T04:10:59Z","snapshot_observed_at":"2026-08-21T16:35:36.541328Z","submitted_at":"2025-03-21T17:32:32Z","title":"CVE-Bench: A Benchmark for AI Agents' Ability to Exploit Real-World Web Application Vulnerabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17332","snapshot_observed_at":"2026-08-07T14:01:11.023893Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20186","last_updated":"2025-05-26T16:29:21Z","snapshot_observed_at":"2026-08-18T04:51:06.980379Z","submitted_at":"2025-05-26T16:29:21Z","title":"Eradicating the Unseen: Detecting, Exploiting, and Remediating a Path Traversal Vulnerability across GitHub","version":1},"reference_index":139,"source":"pdf_text","source_observed_at":"2026-08-07T14:01:11.023893Z"},"links":{"cited_paper":"/paper/2503.17332","citing_paper":"/paper/2505.20186"},"observation_digest":"sha256:8b4055e3f582ed1e679805da1fb09126b7c42254d3e6819c06cfb1b680126974","observation_id":"35e5a63f-ecca-4391-9498-c99b2046f1f8","resolution":{"observed_at":"2026-08-07T14:01:11.023893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17332","last_updated":"2025-06-24T04:10:59Z","snapshot_observed_at":"2026-08-21T16:35:36.541328Z","submitted_at":"2025-03-21T17:32:32Z","title":"CVE-Bench: A Benchmark for AI Agents' Ability to Exploit Real-World Web Application Vulnerabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17332","snapshot_observed_at":"2026-08-06T20:24:28.958503Z","title":"Cve-bench: A benchmark for ai agents’ ability to exploit real-world web application vulnerabilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02825","last_updated":"2025-08-07T06:58:08Z","snapshot_observed_at":"2026-08-17T22:49:53.742436Z","submitted_at":"2025-07-03T17:35:31Z","title":"Establishing Best Practices for Building Rigorous Agentic Benchmarks","version":5},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:28.958503Z"},"links":{"cited_paper":"/paper/2503.17332","citing_paper":"/paper/2507.02825"},"observation_digest":"sha256:d22259991b3f3e44451cffc0d33fda801b3f611c7bc2a55542446179b48f0a67","observation_id":"a67a9fdf-6975-4f4b-8497-98a52fbdd8aa","resolution":{"observed_at":"2026-08-06T20:24:28.958503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17332","last_updated":"2025-06-24T04:10:59Z","snapshot_observed_at":"2026-08-21T16:35:36.541328Z","submitted_at":"2025-03-21T17:32:32Z","title":"CVE-Bench: A Benchmark for AI Agents' Ability to Exploit Real-World Web Application Vulnerabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17332","snapshot_observed_at":"2026-08-06T15:43:01.005369Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15241","last_updated":"2025-07-21T04:55:34Z","snapshot_observed_at":"2026-08-13T08:50:28.353701Z","submitted_at":"2025-07-21T04:55:34Z","title":"FaultLine: Automated Proof-of-Vulnerability Generation Using LLM Agents","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T15:43:01.005369Z"},"links":{"cited_paper":"/paper/2503.17332","citing_paper":"/paper/2507.15241"},"observation_digest":"sha256:4414ef170064cd6a33550ca997d1b1c50112a2fa2bed5cb635c3f3d966406916","observation_id":"8fa835e2-666e-4b34-b627-ebd4ee5cfe18","resolution":{"observed_at":"2026-08-06T15:43:01.005369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17332","last_updated":"2025-06-24T04:10:59Z","snapshot_observed_at":"2026-08-21T16:35:36.541328Z","submitted_at":"2025-03-21T17:32:32Z","title":"CVE-Bench: A Benchmark for AI Agents' Ability to Exploit Real-World Web Application Vulnerabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17332","snapshot_observed_at":"2026-08-06T14:57:06.658280Z","title":"Cve-bench: A benchmark for ai agents’ ability to exploit real-world web application vulnerabilities.arXiv preprint arXiv:2503.17332, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17257","last_updated":"2025-07-23T06:56:15Z","snapshot_observed_at":"2026-08-06T18:04:24.113657Z","submitted_at":"2025-07-23T06:56:15Z","title":"Agent Identity Evals: Measuring Agentic Identity","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T14:57:06.658280Z"},"links":{"cited_paper":"/paper/2503.17332","citing_paper":"/paper/2507.17257"},"observation_digest":"sha256:0b8a20720d81b561195f69d844c2f686cfbde3d42754a7d412bb8eb8fb5974f1","observation_id":"3ef074a3-eee1-4112-841a-28577879b915","resolution":{"observed_at":"2026-08-06T14:57:06.658280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17332","last_updated":"2025-06-24T04:10:59Z","snapshot_observed_at":"2026-08-21T16:35:36.541328Z","submitted_at":"2025-03-21T17:32:32Z","title":"CVE-Bench: A Benchmark for AI Agents' Ability to Exploit Real-World Web Application Vulnerabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17332","snapshot_observed_at":"2026-08-06T14:25:15.865587Z","title":"Cve-bench: A benchmark for ai agents' ability to exploit real-world web application vulnerabilities, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19399","last_updated":"2025-07-25T16:06:16Z","snapshot_observed_at":"2026-08-16T16:08:33.634938Z","submitted_at":"2025-07-25T16:06:16Z","title":"Running in CIRCLE? A Simple Benchmark for LLM Code Interpreter Security","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T14:25:15.865587Z"},"links":{"cited_paper":"/paper/2503.17332","citing_paper":"/paper/2507.19399"},"observation_digest":"sha256:388d1e938904e1325ff03badcce2f405b61e1fb54460574056c8489ba76ad750","observation_id":"79a15dea-2645-4b32-a23a-6c305b891379","resolution":{"observed_at":"2026-08-06T14:25:15.865587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17332","last_updated":"2025-06-24T04:10:59Z","snapshot_observed_at":"2026-08-21T16:35:36.541328Z","submitted_at":"2025-03-21T17:32:32Z","title":"CVE-Bench: A Benchmark for AI Agents' Ability to Exploit Real-World Web Application Vulnerabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17332","snapshot_observed_at":"2026-08-05T15:53:56.525194Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.19461","last_updated":"2025-08-26T22:29:31Z","snapshot_observed_at":"2026-08-21T02:47:34.242820Z","submitted_at":"2025-08-26T22:29:31Z","title":"Reliable Weak-to-Strong Monitoring of LLM Agents","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:56.525194Z"},"links":{"cited_paper":"/paper/2503.17332","citing_paper":"/paper/2508.19461"},"observation_digest":"sha256:d562e4f4d102561ce078d9c669c89e2180ffcd39c9a343c914f7982c2a0525f5","observation_id":"beaa2fdd-ee90-4065-92c4-86d51353daac","resolution":{"observed_at":"2026-08-05T15:53:56.525194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17332","last_updated":"2025-06-24T04:10:59Z","snapshot_observed_at":"2026-08-21T16:35:36.541328Z","submitted_at":"2025-03-21T17:32:32Z","title":"CVE-Bench: A Benchmark for AI Agents' Ability to Exploit Real-World Web Application Vulnerabilities","version":4},"cited_work":{"arxiv_id":"2503.17332","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.17332","snapshot_observed_at":"2026-07-09T20:16:29.518680Z","title":"Cve-bench: A benchmark for ai agents’ ability to exploit real- world web application vulnerabilities.arXiv preprint arXiv:2503.17332, Mar 2025","venue":"cs.CR","work_id":"bc94571d-ef7a-4a07-9e77-219782ca02eb","year":2025},"citing_paper":{"arxiv_id":"2509.13021","last_updated":"2026-04-27T11:42:26Z","snapshot_observed_at":"2026-08-14T03:18:31.434407Z","submitted_at":"2025-09-16T12:45:45Z","title":"xOffense: An Autonomous Multi-Agent Framework for Penetration Testing with Domain-Adapted Large Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-18T16:38:45.171505Z"},"links":{"cited_paper":"/paper/2503.17332","citing_paper":"/paper/2509.13021"},"observation_digest":"sha256:cf08198e2d3d15c8a74d854e420bd82cfd6ab727dccc5b6948e7e57cd67e2890","observation_id":"97f5c947-d833-41c0-9eea-6a0424322ccf","resolution":{"observed_at":"2026-05-18T16:41:38.180046Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17332","last_updated":"2025-06-24T04:10:59Z","snapshot_observed_at":"2026-08-21T16:35:36.541328Z","submitted_at":"2025-03-21T17:32:32Z","title":"CVE-Bench: A Benchmark for AI Agents' Ability to Exploit Real-World Web Application Vulnerabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17332","snapshot_observed_at":"2026-08-02T23:18:01.261262Z","title":"Cve-bench: A benchmark for ai agents’ ability to exploit real-world web application vulnerabilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.14345","last_updated":"2026-06-20T15:35:41Z","snapshot_observed_at":"2026-08-15T16:31:54.035953Z","submitted_at":"2026-02-15T23:25:14Z","title":"AXE: Grey-Box Exploitability Confirmation for Localized Vulnerability Reports","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T23:18:01.261262Z"},"links":{"cited_paper":"/paper/2503.17332","citing_paper":"/paper/2602.14345"},"observation_digest":"sha256:9364d911bc087b98ffcacc8a70bd5d79ce840aaf4c6e6276057542d901e8b37b","observation_id":"dc0e303d-5e45-4ea3-8856-20470f1765c2","resolution":{"observed_at":"2026-08-02T23:18:01.261262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17332","last_updated":"2025-06-24T04:10:59Z","snapshot_observed_at":"2026-08-21T16:35:36.541328Z","submitted_at":"2025-03-21T17:32:32Z","title":"CVE-Bench: A Benchmark for AI Agents' Ability to Exploit Real-World Web Application Vulnerabilities","version":4},"cited_work":{"arxiv_id":"2503.17332","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.17332","snapshot_observed_at":"2026-07-09T20:16:29.518680Z","title":"Cve-bench: A benchmark for ai agents’ ability to exploit real- world web application vulnerabilities.arXiv preprint arXiv:2503.17332, Mar 2025","venue":"cs.CR","work_id":"bc94571d-ef7a-4a07-9e77-219782ca02eb","year":2025},"citing_paper":{"arxiv_id":"2604.13764","last_updated":"2026-04-15T11:49:29Z","snapshot_observed_at":"2026-08-14T08:42:11.575927Z","submitted_at":"2026-04-15T11:49:29Z","title":"RealVuln: Benchmarking Rule-Based, General-Purpose LLM, and Security-Specialized Scanners on Real-World Code","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T12:39:37.047074Z"},"links":{"cited_paper":"/paper/2503.17332","citing_paper":"/paper/2604.13764"},"observation_digest":"sha256:51ed127fd9cc3142fc589fc12e5660b80474224d35db3ff5fd73107727d5bf1e","observation_id":"29017f42-d4c8-4293-8c6b-9861a70b95d4","resolution":{"observed_at":"2026-05-10T12:40:23.968189Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17332","last_updated":"2025-06-24T04:10:59Z","snapshot_observed_at":"2026-08-21T16:35:36.541328Z","submitted_at":"2025-03-21T17:32:32Z","title":"CVE-Bench: A Benchmark for AI Agents' Ability to Exploit Real-World Web Application Vulnerabilities","version":4},"cited_work":{"arxiv_id":"2503.17332","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.17332","snapshot_observed_at":"2026-07-09T20:16:29.518680Z","title":"Cve-bench: A benchmark for ai agents’ ability to exploit real- world web application vulnerabilities.arXiv preprint arXiv:2503.17332, Mar 2025","venue":"cs.CR","work_id":"bc94571d-ef7a-4a07-9e77-219782ca02eb","year":2025},"citing_paper":{"arxiv_id":"2605.07830","last_updated":"2026-05-08T14:57:53Z","snapshot_observed_at":"2026-08-13T04:51:01.207142Z","submitted_at":"2026-05-08T14:57:53Z","title":"CyBiasBench: Benchmarking Bias in LLM Agents for Cyber-Attack Scenarios","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-11T01:54:46.391345Z"},"links":{"cited_paper":"/paper/2503.17332","citing_paper":"/paper/2605.07830"},"observation_digest":"sha256:d6632b37dadaf7fbb68f7364b9fa1ffb5bbf86f1ed0f328dc1351cf222d64b5e","observation_id":"c46f35e0-fd53-4d56-89b6-7eac907f5e8c","resolution":{"observed_at":"2026-05-11T04:10:57.379648Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17332","last_updated":"2025-06-24T04:10:59Z","snapshot_observed_at":"2026-08-21T16:35:36.541328Z","submitted_at":"2025-03-21T17:32:32Z","title":"CVE-Bench: A Benchmark for AI Agents' Ability to Exploit Real-World Web Application Vulnerabilities","version":4},"cited_work":{"arxiv_id":"2503.17332","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.17332","snapshot_observed_at":"2026-07-09T20:16:29.518680Z","title":"Cve-bench: A benchmark for ai agents’ ability to exploit real- world web application vulnerabilities.arXiv preprint arXiv:2503.17332, Mar 2025","venue":"cs.CR","work_id":"bc94571d-ef7a-4a07-9e77-219782ca02eb","year":2025},"citing_paper":{"arxiv_id":"2605.10834","last_updated":"2026-07-28T07:30:21Z","snapshot_observed_at":"2026-08-14T09:22:43.918837Z","submitted_at":"2026-05-11T16:50:00Z","title":"From Controlled to the Wild: Evaluation of Pentesting Agents for the Real-World","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-12T03:34:55.538935Z"},"links":{"cited_paper":"/paper/2503.17332","citing_paper":"/paper/2605.10834"},"observation_digest":"sha256:b0d2028bf07e52ed0e21709fba66fedc0deb1f4f1ed6bb6303e30bc965552486","observation_id":"dbd44608-ca5b-447a-a142-76404729d276","resolution":{"observed_at":"2026-05-12T07:16:27.897902Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17332","last_updated":"2025-06-24T04:10:59Z","snapshot_observed_at":"2026-08-21T16:35:36.541328Z","submitted_at":"2025-03-21T17:32:32Z","title":"CVE-Bench: A Benchmark for AI Agents' Ability to Exploit Real-World Web Application Vulnerabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17332","snapshot_observed_at":"2026-08-02T14:22:27.799890Z","title":"Dhir, Sudhit Rao, Kaicheng Yu, Twm Stone, and Daniel Kang","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.10834","last_updated":"2026-07-28T07:30:21Z","snapshot_observed_at":"2026-08-14T09:22:43.918837Z","submitted_at":"2026-05-11T16:50:00Z","title":"From Controlled to the Wild: Evaluation of Pentesting Agents for the Real-World","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T14:22:27.799890Z"},"links":{"cited_paper":"/paper/2503.17332","citing_paper":"/paper/2605.10834"},"observation_digest":"sha256:e946a019a330273992942e3b9fd1c23559891491f709c0475718f131f6b46ee1","observation_id":"6e704e20-3f73-465b-9d9d-bed00b522524","resolution":{"observed_at":"2026-08-02T14:22:27.799890Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17332","last_updated":"2025-06-24T04:10:59Z","snapshot_observed_at":"2026-08-21T16:35:36.541328Z","submitted_at":"2025-03-21T17:32:32Z","title":"CVE-Bench: A Benchmark for AI Agents' Ability to Exploit Real-World Web Application Vulnerabilities","version":4},"cited_work":{"arxiv_id":"2503.17332","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.17332","snapshot_observed_at":"2026-07-09T20:16:29.518680Z","title":"Cve-bench: A benchmark for ai agents’ ability to exploit real- world web application vulnerabilities.arXiv preprint arXiv:2503.17332, Mar 2025","venue":"cs.CR","work_id":"bc94571d-ef7a-4a07-9e77-219782ca02eb","year":2025},"citing_paper":{"arxiv_id":"2605.26195","last_updated":"2026-06-16T16:19:26Z","snapshot_observed_at":"2026-08-02T06:03:12.995535Z","submitted_at":"2026-05-25T16:26:59Z","title":"CyberEvolver: Structured Self-Evolution for Cybersecurity Agents On the Fly","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-06-29T21:19:59.005348Z"},"links":{"cited_paper":"/paper/2503.17332","citing_paper":"/paper/2605.26195"},"observation_digest":"sha256:0ecb99276c16e3e2b15552efc455e63b1a553465a75617699f78fb4735b635aa","observation_id":"2f2d7780-46d2-4354-b85c-44302813bbee","resolution":{"observed_at":"2026-06-29T21:23:58.967193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17332","last_updated":"2025-06-24T04:10:59Z","snapshot_observed_at":"2026-08-21T16:35:36.541328Z","submitted_at":"2025-03-21T17:32:32Z","title":"CVE-Bench: A Benchmark for AI Agents' Ability to Exploit Real-World Web Application Vulnerabilities","version":4},"cited_work":{"arxiv_id":"2503.17332","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.17332","snapshot_observed_at":"2026-07-09T20:16:29.518680Z","title":"Cve-bench: A benchmark for ai agents’ ability to exploit real- world web application vulnerabilities.arXiv preprint arXiv:2503.17332, Mar 2025","venue":"cs.CR","work_id":"bc94571d-ef7a-4a07-9e77-219782ca02eb","year":2025},"citing_paper":{"arxiv_id":"2606.03453","last_updated":"2026-06-02T10:32:28Z","snapshot_observed_at":"2026-08-04T15:31:10.442251Z","submitted_at":"2026-06-02T10:32:28Z","title":"FORGE: Multi-Agent Graduated Exploitation and Detection Engineering","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T09:45:06.217817Z"},"links":{"cited_paper":"/paper/2503.17332","citing_paper":"/paper/2606.03453"},"observation_digest":"sha256:9f311b8d8df8b323523add36f4743020caf66b33b9952a36d39e2857f1df23da","observation_id":"562dc6d0-c2ee-4135-8e6b-d1fa3c1bedb6","resolution":{"observed_at":"2026-07-02T03:46:32.336920Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17332","last_updated":"2025-06-24T04:10:59Z","snapshot_observed_at":"2026-08-21T16:35:36.541328Z","submitted_at":"2025-03-21T17:32:32Z","title":"CVE-Bench: A Benchmark for AI Agents' Ability to Exploit Real-World Web Application Vulnerabilities","version":4},"cited_work":{"arxiv_id":"2503.17332","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.17332","snapshot_observed_at":"2026-07-09T20:16:29.518680Z","title":"Cve-bench: A benchmark for ai agents’ ability to exploit real- world web application vulnerabilities.arXiv preprint arXiv:2503.17332, Mar 2025","venue":"cs.CR","work_id":"bc94571d-ef7a-4a07-9e77-219782ca02eb","year":2025},"citing_paper":{"arxiv_id":"2606.05567","last_updated":"2026-06-04T01:28:36Z","snapshot_observed_at":"2026-08-15T21:30:43.913134Z","submitted_at":"2026-06-04T01:28:36Z","title":"ZERO-APT: A Closed-Loop Adversarial Framework for LLM-Driven Automated Penetration Testing under Intelligent Defense","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-28T01:26:22.434043Z"},"links":{"cited_paper":"/paper/2503.17332","citing_paper":"/paper/2606.05567"},"observation_digest":"sha256:d8c7dbe4d43878024f6a11160ad4f79987b0fbe56895467065b2e6ed22301904","observation_id":"c39a3bd8-9e5f-4367-819e-4106573ee9d1","resolution":{"observed_at":"2026-07-02T13:16:58.745781Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17332","last_updated":"2025-06-24T04:10:59Z","snapshot_observed_at":"2026-08-21T16:35:36.541328Z","submitted_at":"2025-03-21T17:32:32Z","title":"CVE-Bench: A Benchmark for AI Agents' Ability to Exploit Real-World Web Application Vulnerabilities","version":4},"cited_work":{"arxiv_id":"2503.17332","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.17332","snapshot_observed_at":"2026-07-09T20:16:29.518680Z","title":"Cve-bench: A benchmark for ai agents’ ability to exploit real- world web application vulnerabilities.arXiv preprint arXiv:2503.17332, Mar 2025","venue":"cs.CR","work_id":"bc94571d-ef7a-4a07-9e77-219782ca02eb","year":2025},"citing_paper":{"arxiv_id":"2606.13079","last_updated":"2026-06-29T13:15:12Z","snapshot_observed_at":"2026-08-13T01:36:54.597641Z","submitted_at":"2026-06-11T09:02:14Z","title":"The Emergence of Autonomous Penetration Capabilities in Large Language Model-Powered AI Systems","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T06:25:17.298114Z"},"links":{"cited_paper":"/paper/2503.17332","citing_paper":"/paper/2606.13079"},"observation_digest":"sha256:1267977066dfad7f87a7b59ab286abdab735cddaba85693ad054b298babc6ac5","observation_id":"a0c73dcc-c466-4dc4-a6b4-84e6645bdcfe","resolution":{"observed_at":"2026-07-03T15:38:33.539484Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17332","last_updated":"2025-06-24T04:10:59Z","snapshot_observed_at":"2026-08-21T16:35:36.541328Z","submitted_at":"2025-03-21T17:32:32Z","title":"CVE-Bench: A Benchmark for AI Agents' Ability to Exploit Real-World Web Application Vulnerabilities","version":4},"cited_work":{"arxiv_id":"2503.17332","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.17332","snapshot_observed_at":"2026-07-09T20:16:29.518680Z","title":"Cve-bench: A benchmark for ai agents’ ability to exploit real- world web application vulnerabilities.arXiv preprint arXiv:2503.17332, Mar 2025","venue":"cs.CR","work_id":"bc94571d-ef7a-4a07-9e77-219782ca02eb","year":2025},"citing_paper":{"arxiv_id":"2606.13079","last_updated":"2026-06-29T13:15:12Z","snapshot_observed_at":"2026-08-13T01:36:54.597641Z","submitted_at":"2026-06-11T09:02:14Z","title":"The Emergence of Autonomous Penetration Capabilities in Large Language Model-Powered AI Systems","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T11:27:22.436981Z"},"links":{"cited_paper":"/paper/2503.17332","citing_paper":"/paper/2606.13079"},"observation_digest":"sha256:b97fadb0773a6f34e011f195a771e62d98839d1a761ed26848c951cf17e5bb53","observation_id":"d686cf9b-36b1-4420-b43f-00d903c08b40","resolution":{"observed_at":"2026-06-30T11:34:38.128616Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17332","last_updated":"2025-06-24T04:10:59Z","snapshot_observed_at":"2026-08-21T16:35:36.541328Z","submitted_at":"2025-03-21T17:32:32Z","title":"CVE-Bench: A Benchmark for AI Agents' Ability to Exploit Real-World Web Application Vulnerabilities","version":4},"cited_work":{"arxiv_id":"2503.17332","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.17332","snapshot_observed_at":"2026-07-09T20:16:29.518680Z","title":"Cve-bench: A benchmark for ai agents’ ability to exploit real- world web application vulnerabilities.arXiv preprint arXiv:2503.17332, Mar 2025","venue":"cs.CR","work_id":"bc94571d-ef7a-4a07-9e77-219782ca02eb","year":2025},"citing_paper":{"arxiv_id":"2606.14295","last_updated":"2026-06-16T04:20:26Z","snapshot_observed_at":"2026-08-15T02:19:33.177934Z","submitted_at":"2026-06-12T09:29:58Z","title":"AgentCyberRange: Benchmarking Frontier AI Systems in Realistic Cyber Ranges","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-27T04:58:34.360751Z"},"links":{"cited_paper":"/paper/2503.17332","citing_paper":"/paper/2606.14295"},"observation_digest":"sha256:17bfaa16465c08ab251afd0ced2ec1733006a8f2dae8f291f7bcf59946f6d8a4","observation_id":"8299dd19-e561-47ad-b4a6-b5f4f8879a2a","resolution":{"observed_at":"2026-07-03T16:48:40.388696Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17332","last_updated":"2025-06-24T04:10:59Z","snapshot_observed_at":"2026-08-21T16:35:36.541328Z","submitted_at":"2025-03-21T17:32:32Z","title":"CVE-Bench: A Benchmark for AI Agents' Ability to Exploit Real-World Web Application Vulnerabilities","version":4},"cited_work":{"arxiv_id":"2503.17332","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.17332","snapshot_observed_at":"2026-07-09T20:16:29.518680Z","title":"Cve-bench: A benchmark for ai agents’ ability to exploit real- world web application vulnerabilities.arXiv preprint arXiv:2503.17332, Mar 2025","venue":"cs.CR","work_id":"bc94571d-ef7a-4a07-9e77-219782ca02eb","year":2025},"citing_paper":{"arxiv_id":"2607.07109","last_updated":"2026-07-08T07:50:49Z","snapshot_observed_at":"2026-08-20T14:40:00.410782Z","submitted_at":"2026-07-08T07:50:49Z","title":"Certifying Ghosts: How Cybersecurity AI Agents Break the EU Cyber Resilience Act","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-09T20:05:20.263249Z"},"links":{"cited_paper":"/paper/2503.17332","citing_paper":"/paper/2607.07109"},"observation_digest":"sha256:9846ec6a6884ae3a29c1f28776fa24571288aae2b41526ecd8ba8349ba6d3d9a","observation_id":"80398012-910e-4a7d-ad39-d1e97d416618","resolution":{"observed_at":"2026-07-09T20:16:29.520137Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17332","last_updated":"2025-06-24T04:10:59Z","snapshot_observed_at":"2026-08-21T16:35:36.541328Z","submitted_at":"2025-03-21T17:32:32Z","title":"CVE-Bench: A Benchmark for AI Agents' Ability to Exploit Real-World Web Application Vulnerabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17332","snapshot_observed_at":"2026-08-01T23:44:37.460029Z","title":"Appendix A","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15263","last_updated":"2026-07-27T17:42:56Z","snapshot_observed_at":"2026-08-14T19:21:42.926170Z","submitted_at":"2026-07-16T17:54:47Z","title":"Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T23:44:37.460029Z"},"links":{"cited_paper":"/paper/2503.17332","citing_paper":"/paper/2607.15263"},"observation_digest":"sha256:2a601f8fdbad64a69abd6aae96fb5ca44573a7535b37c218b1a186359f00e9e5","observation_id":"00a49258-7ad4-4e0c-8a36-163edbb7f068","resolution":{"observed_at":"2026-08-01T23:44:37.460029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17332","last_updated":"2025-06-24T04:10:59Z","snapshot_observed_at":"2026-08-21T16:35:36.541328Z","submitted_at":"2025-03-21T17:32:32Z","title":"CVE-Bench: A Benchmark for AI Agents' Ability to Exploit Real-World Web Application Vulnerabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17332","snapshot_observed_at":"2026-08-15T15:36:02.680411Z","title":"CVE-Bench: A benchmark for AI agents’ ability to exploit real-world web application vulnerabilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20911","last_updated":"2026-07-23T04:34:06Z","snapshot_observed_at":"2026-08-19T00:13:57.498299Z","submitted_at":"2026-07-23T04:34:06Z","title":"Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T15:36:02.680411Z"},"links":{"cited_paper":"/paper/2503.17332","citing_paper":"/paper/2607.20911"},"observation_digest":"sha256:b20a789521ef6f3acf6e5fd79c5c41fb7b8a7d36eaffc22a2190029d8d6c9f38","observation_id":"27b9270f-cf53-42fd-96ab-6c1e058371f5","resolution":{"observed_at":"2026-08-15T15:36:02.680411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17332","last_updated":"2025-06-24T04:10:59Z","snapshot_observed_at":"2026-08-21T16:35:36.541328Z","submitted_at":"2025-03-21T17:32:32Z","title":"CVE-Bench: A Benchmark for AI Agents' Ability to Exploit Real-World Web Application Vulnerabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17332","snapshot_observed_at":"2026-08-01T02:40:29.390089Z","title":"Cve-bench: A benchmark for ai agents’ ability to exploit real-world web application vulnerabilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25379","last_updated":"2026-08-01T10:03:47Z","snapshot_observed_at":"2026-08-19T00:44:48.503034Z","submitted_at":"2026-07-28T07:34:37Z","title":"Cyber-Capable AI Agents: Vulnerabilities, Evaluation Containment, and Defensive Response","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-01T02:40:29.390089Z"},"links":{"cited_paper":"/paper/2503.17332","citing_paper":"/paper/2607.25379"},"observation_digest":"sha256:b9f7d6db77c96dea2c45f4df3b00a6e972bf70ff718fd255d32aad8c2bc06280","observation_id":"3091db84-ccdc-430a-9224-a1055915bee6","resolution":{"observed_at":"2026-08-01T02:40:29.390089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17332","last_updated":"2025-06-24T04:10:59Z","snapshot_observed_at":"2026-08-21T16:35:36.541328Z","submitted_at":"2025-03-21T17:32:32Z","title":"CVE-Bench: A Benchmark for AI Agents' Ability to Exploit Real-World Web Application Vulnerabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17332","snapshot_observed_at":"2026-08-04T01:33:20.873642Z","title":"Cve-bench: A benchmark for ai agents’ ability to exploit real-world web application vulnerabilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25379","last_updated":"2026-08-01T10:03:47Z","snapshot_observed_at":"2026-08-19T00:44:48.503034Z","submitted_at":"2026-07-28T07:34:37Z","title":"Cyber-Capable AI Agents: Vulnerabilities, Evaluation Containment, and Defensive Response","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-04T01:33:20.873642Z"},"links":{"cited_paper":"/paper/2503.17332","citing_paper":"/paper/2607.25379"},"observation_digest":"sha256:3384397a46b831cc40b52cc6c18a5cead2c7acd9c24c46a541c4de6ca5c9be83","observation_id":"77fa3257-b6a1-4c4b-96ae-57bdf59e429c","resolution":{"observed_at":"2026-08-04T01:33:20.873642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17332","last_updated":"2025-06-24T04:10:59Z","snapshot_observed_at":"2026-08-21T16:35:36.541328Z","submitted_at":"2025-03-21T17:32:32Z","title":"CVE-Bench: A Benchmark for AI Agents' Ability to Exploit Real-World Web Application Vulnerabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17332","snapshot_observed_at":"2026-07-30T21:00:41.529969Z","title":"arXiv preprint arXiv:2503.17332 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26791","last_updated":"2026-07-29T11:32:23Z","snapshot_observed_at":"2026-08-17T12:47:47.881588Z","submitted_at":"2026-07-29T11:32:23Z","title":"SecRespond: Benchmarking AI Agents for Real-World Post-Compromise Incident Response","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-30T21:00:41.529969Z"},"links":{"cited_paper":"/paper/2503.17332","citing_paper":"/paper/2607.26791"},"observation_digest":"sha256:b637b5420e76e9df437fee2683f5ec6d2dffacb3586c78976b5f93a99e863641","observation_id":"da23d235-37b0-4ae6-87df-18657f435f7c","resolution":{"observed_at":"2026-07-30T21:00:41.529969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17332","last_updated":"2025-06-24T04:10:59Z","snapshot_observed_at":"2026-08-21T16:35:36.541328Z","submitted_at":"2025-03-21T17:32:32Z","title":"CVE-Bench: A Benchmark for AI Agents' Ability to Exploit Real-World Web Application Vulnerabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17332","snapshot_observed_at":"2026-07-30T14:30:12.522679Z","title":"arXiv preprint arXiv:2503.17332 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26998","last_updated":"2026-08-11T08:16:44Z","snapshot_observed_at":"2026-08-18T02:24:37.301839Z","submitted_at":"2026-07-29T14:56:31Z","title":"AgentSnare: Learning to Delay, Divert, and Defuse Autonomous Penetration Agents","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-30T14:30:12.522679Z"},"links":{"cited_paper":"/paper/2503.17332","citing_paper":"/paper/2607.26998"},"observation_digest":"sha256:3781222dab0491125e9a1ee1448ccb2891c0208299b8fa0fb85da4e7c4a877df","observation_id":"6064daf8-660e-4d84-9fa8-952968d17caa","resolution":{"observed_at":"2026-07-30T14:30:12.522679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17332","last_updated":"2025-06-24T04:10:59Z","snapshot_observed_at":"2026-08-21T16:35:36.541328Z","submitted_at":"2025-03-21T17:32:32Z","title":"CVE-Bench: A Benchmark for AI Agents' Ability to Exploit Real-World Web Application Vulnerabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17332","snapshot_observed_at":"2026-08-05T04:29:02.210995Z","title":"arXiv preprint arXiv:2503.17332 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26998","last_updated":"2026-08-11T08:16:44Z","snapshot_observed_at":"2026-08-18T02:24:37.301839Z","submitted_at":"2026-07-29T14:56:31Z","title":"AgentSnare: Learning to Delay, Divert, and Defuse Autonomous Penetration Agents","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T04:29:02.210995Z"},"links":{"cited_paper":"/paper/2503.17332","citing_paper":"/paper/2607.26998"},"observation_digest":"sha256:af67fac0e5676ab114d660be5a37d50e9612996628e133815feeafaee33a7bcb","observation_id":"00732459-9b20-4e58-b20b-5bfeefefedea","resolution":{"observed_at":"2026-08-05T04:29:02.210995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17332","last_updated":"2025-06-24T04:10:59Z","snapshot_observed_at":"2026-08-21T16:35:36.541328Z","submitted_at":"2025-03-21T17:32:32Z","title":"CVE-Bench: A Benchmark for AI Agents' Ability to Exploit Real-World Web Application Vulnerabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17332","snapshot_observed_at":"2026-08-11T14:59:21.169998Z","title":"CVE-Bench: A benchmark for AI agents’ ability to exploit real-world web application vulnerabilities, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09567","last_updated":"2026-08-10T13:05:02Z","snapshot_observed_at":"2026-08-17T15:19:40.317397Z","submitted_at":"2026-08-10T13:05:02Z","title":"From Runnable to Verifiable: An Independent Reproducibility Study of LLM/Agent-Driven Vulnerability Validation Artifacts","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:21.169998Z"},"links":{"cited_paper":"/paper/2503.17332","citing_paper":"/paper/2608.09567"},"observation_digest":"sha256:d3d9a338e649cead6ea039cd7421687f38f4de000b362ea6857f8cbb5bfea7e8","observation_id":"93a5464a-3e34-4fb2-80e2-97f2de3efcc9","resolution":{"observed_at":"2026-08-11T14:59:21.169998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17332","last_updated":"2025-06-24T04:10:59Z","snapshot_observed_at":"2026-08-21T16:35:36.541328Z","submitted_at":"2025-03-21T17:32:32Z","title":"CVE-Bench: A Benchmark for AI Agents' Ability to Exploit Real-World Web Application Vulnerabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17332","snapshot_observed_at":"2026-08-15T14:19:09.549877Z","title":"Cve-bench: a benchmark for ai agents’ ability to exploit real-world web application vulnerabilities.arXiv preprint arXiv:2503.17332,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11469","last_updated":"2026-08-11T22:14:57Z","snapshot_observed_at":"2026-08-18T22:13:32.845752Z","submitted_at":"2026-08-11T22:14:57Z","title":"The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T14:19:09.549877Z"},"links":{"cited_paper":"/paper/2503.17332","citing_paper":"/paper/2608.11469"},"observation_digest":"sha256:75f9e59ed17b5c80cd8b70281801f9410e105a0c8cd17cadb301be38adfd84dd","observation_id":"868f2da6-28b3-4df1-bd39-6bb51e0ea382","resolution":{"observed_at":"2026-08-15T14:19:09.549877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17332","last_updated":"2025-06-24T04:10:59Z","snapshot_observed_at":"2026-08-21T16:35:36.541328Z","submitted_at":"2025-03-21T17:32:32Z","title":"CVE-Bench: A Benchmark for AI Agents' Ability to Exploit Real-World Web Application Vulnerabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17332","snapshot_observed_at":"2026-08-16T00:16:52.653903Z","title":"Cve-bench: a benchmark for ai agents’ ability to exploit real-world web application vulnerabilities.arXiv preprint arXiv:2503.17332, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12172","last_updated":"2026-08-12T15:29:51Z","snapshot_observed_at":"2026-08-20T04:46:24.279130Z","submitted_at":"2026-08-12T15:29:51Z","title":"Rethinking Agent Security as a Networking Problem","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-16T00:16:52.653903Z"},"links":{"cited_paper":"/paper/2503.17332","citing_paper":"/paper/2608.12172"},"observation_digest":"sha256:d6c7b7fbbc483b5751c5bd8901deebda76b8b85d1f4c73d737d7064ca5b3fbe1","observation_id":"97d3c3fa-887f-4d8e-bf85-d9d2c3c98277","resolution":{"observed_at":"2026-08-16T00:16:52.653903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2503.17332/citation-record","integrity":"/paper/2503.17332/integrity","json":"/paper/2503.17332/citation-record.json","paper":"/paper/2503.17332"},"outbound":[],"paper":{"arxiv_id":"2503.17332","last_updated":"2025-06-24T04:10:59Z","latest_version":4,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-21T16:35:36.541328Z","submitted_at":"2025-03-21T17:32:32Z","title":"CVE-Bench: A Benchmark for AI Agents' Ability to Exploit Real-World Web Application Vulnerabilities"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 30 inbound Pith citation observations for arXiv:2503.17332."}