{"as_of":"2026-08-09T20:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fb09206178c6a722768b5098c2da45d87cb9e69d9dcdf8b3511daa3f315ddb94","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":17,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T23:10:11.091917Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":3,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.05590","last_updated":"2025-02-18T12:26:33Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T22:21:42Z","title":"NYU CTF Bench: A Scalable Open-Source Benchmark Dataset for Evaluating LLMs in Offensive Security","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05590","snapshot_observed_at":"2026-08-08T23:10:11.091917Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04227","last_updated":"2025-09-11T12:26:33Z","snapshot_observed_at":"2026-08-08T23:03:11.306261Z","submitted_at":"2025-02-06T17:12:43Z","title":"Can LLMs Hack Enterprise Networks? Autonomous Assumed Breach Penetration-Testing Active Directory Networks","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T23:10:11.091917Z"},"links":{"cited_paper":"/paper/2406.05590","citing_paper":"/paper/2502.04227"},"observation_digest":"sha256:ee1c5fb5ac8549873157d1f12a963bb1fd99f15a0d97a3c592d041f829553b96","observation_id":"95d04523-eaaf-47c8-9261-b400cd3c580f","resolution":{"observed_at":"2026-08-08T23:10:11.091917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05590","last_updated":"2025-02-18T12:26:33Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T22:21:42Z","title":"NYU CTF Bench: A Scalable Open-Source Benchmark Dataset for Evaluating LLMs in Offensive Security","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05590","snapshot_observed_at":"2026-08-07T12:02:35.404055Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02048","last_updated":"2025-08-17T22:28:50Z","snapshot_observed_at":"2026-08-07T16:47:30.118976Z","submitted_at":"2025-06-01T01:59:52Z","title":"Improving LLM Agents with Reinforcement Learning on Cryptographic CTF Challenges","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:35.404055Z"},"links":{"cited_paper":"/paper/2406.05590","citing_paper":"/paper/2506.02048"},"observation_digest":"sha256:d3041a37728ed291678ed66d94fb5e9ec73cbffc5bcc647110b94c8311eb5810","observation_id":"d163595e-7ebc-4faf-a91d-e25a6264d473","resolution":{"observed_at":"2026-08-07T12:02:35.404055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05590","last_updated":"2025-02-18T12:26:33Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T22:21:42Z","title":"NYU CTF Bench: A Scalable Open-Source Benchmark Dataset for Evaluating LLMs in Offensive Security","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05590","snapshot_observed_at":"2026-08-06T23:35:05.819135Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17644","last_updated":"2025-06-21T08:56:20Z","snapshot_observed_at":"2026-08-07T23:27:30.726322Z","submitted_at":"2025-06-21T08:56:20Z","title":"Measuring and Augmenting Large Language Models for Solving Capture-the-Flag Challenges","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:05.819135Z"},"links":{"cited_paper":"/paper/2406.05590","citing_paper":"/paper/2506.17644"},"observation_digest":"sha256:38ce29b0fb45c3efda75630c48e19375668ad0e117da44d48858b82fbc43ccb2","observation_id":"425b3577-9f55-4a6f-9635-ccaf8025aa32","resolution":{"observed_at":"2026-08-06T23:35:05.819135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05590","last_updated":"2025-02-18T12:26:33Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T22:21:42Z","title":"NYU CTF Bench: A Scalable Open-Source Benchmark Dataset for Evaluating LLMs in Offensive Security","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05590","snapshot_observed_at":"2026-08-06T14:25:15.835767Z","title":"Nyu ctf bench: A scalable open-source benchmark dataset for evaluating llms in offensive security, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19399","last_updated":"2025-07-25T16:06:16Z","snapshot_observed_at":"2026-08-07T13:02:25.826266Z","submitted_at":"2025-07-25T16:06:16Z","title":"Running in CIRCLE? A Simple Benchmark for LLM Code Interpreter Security","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T14:25:15.835767Z"},"links":{"cited_paper":"/paper/2406.05590","citing_paper":"/paper/2507.19399"},"observation_digest":"sha256:c7f0ec38dd741152a4db6186736095df81d7661cbee362ca9039ae6bef3ca4a5","observation_id":"2c5271e7-fee5-4224-bf41-1af1cef21a82","resolution":{"observed_at":"2026-08-06T14:25:15.835767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05590","last_updated":"2025-02-18T12:26:33Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T22:21:42Z","title":"NYU CTF Bench: A Scalable Open-Source Benchmark Dataset for Evaluating LLMs in Offensive Security","version":3},"cited_work":{"arxiv_id":"2406.05590","doi":"10.48550/arxiv.2406.05590","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.05590","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nyu ctf bench: A scalable open-source benchmark dataset for evaluating llms in offensive security","venue":"arXiv (Cornell University)","work_id":"a0a8db29-57c1-4f53-817f-6f166bc22588","year":2024},"citing_paper":{"arxiv_id":"2604.17159","last_updated":"2026-04-18T22:13:23Z","snapshot_observed_at":"2026-08-03T22:57:17.276813Z","submitted_at":"2026-04-18T22:13:23Z","title":"Systematic Capability Benchmarking of Frontier Large Language Models for Offensive Cyber Tasks","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T06:02:32.399075Z"},"links":{"cited_paper":"/paper/2406.05590","citing_paper":"/paper/2604.17159"},"observation_digest":"sha256:ae19436555b2e7ab0b3c01fce5398a22e13486cd76b15d812c5e73161cc8438d","observation_id":"465b323a-806e-4e04-8059-d42cec2a3e14","resolution":{"observed_at":"2026-05-10T06:06:19.098028Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05590","last_updated":"2025-02-18T12:26:33Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T22:21:42Z","title":"NYU CTF Bench: A Scalable Open-Source Benchmark Dataset for Evaluating LLMs in Offensive Security","version":3},"cited_work":{"arxiv_id":"2406.05590","doi":"10.48550/arxiv.2406.05590","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.05590","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nyu ctf bench: A scalable open-source benchmark dataset for evaluating llms in offensive security","venue":"arXiv (Cornell University)","work_id":"a0a8db29-57c1-4f53-817f-6f166bc22588","year":2024},"citing_paper":{"arxiv_id":"2604.19533","last_updated":"2026-04-23T17:59:02Z","snapshot_observed_at":"2026-08-02T14:56:41.255829Z","submitted_at":"2026-04-21T14:53:23Z","title":"Cyber Defense Benchmark: Agentic Threat Hunting Evaluation for LLMs in SecOps","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T02:23:56.777888Z"},"links":{"cited_paper":"/paper/2406.05590","citing_paper":"/paper/2604.19533"},"observation_digest":"sha256:044951e81e3c5408130106ebef85a5c2f0d1d9205358464d070db980cc0dc0bc","observation_id":"d0e9112a-cc10-45ad-9357-1898e1e3df85","resolution":{"observed_at":"2026-05-11T13:06:02.871221Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05590","last_updated":"2025-02-18T12:26:33Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T22:21:42Z","title":"NYU CTF Bench: A Scalable Open-Source Benchmark Dataset for Evaluating LLMs in Offensive Security","version":3},"cited_work":{"arxiv_id":"2406.05590","doi":"10.48550/arxiv.2406.05590","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.05590","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nyu ctf bench: A scalable open-source benchmark dataset for evaluating llms in offensive security","venue":"arXiv (Cornell University)","work_id":"a0a8db29-57c1-4f53-817f-6f166bc22588","year":2024},"citing_paper":{"arxiv_id":"2604.20801","last_updated":"2026-04-22T17:27:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-22T17:27:40Z","title":"Synthesizing Multi-Agent Harnesses for Vulnerability Discovery","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T00:17:26.218561Z"},"links":{"cited_paper":"/paper/2406.05590","citing_paper":"/paper/2604.20801"},"observation_digest":"sha256:7ae2d5db69f3f8554dabf42855c682e5cc5aa90e10e7400df2076ceccf22d5b4","observation_id":"495deee8-79ee-4084-8dc3-77be9f21d781","resolution":{"observed_at":"2026-05-10T00:19:46.433919Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05590","last_updated":"2025-02-18T12:26:33Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T22:21:42Z","title":"NYU CTF Bench: A Scalable Open-Source Benchmark Dataset for Evaluating LLMs in Offensive Security","version":3},"cited_work":{"arxiv_id":"2406.05590","doi":"10.48550/arxiv.2406.05590","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.05590","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nyu ctf bench: A scalable open-source benchmark dataset for evaluating llms in offensive security","venue":"arXiv (Cornell University)","work_id":"a0a8db29-57c1-4f53-817f-6f166bc22588","year":2024},"citing_paper":{"arxiv_id":"2604.24184","last_updated":"2026-04-27T08:44:30Z","snapshot_observed_at":"2026-08-05T23:07:15.910495Z","submitted_at":"2026-04-27T08:44:30Z","title":"Dynamic Cyber Ranges","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-08T03:04:03.611481Z"},"links":{"cited_paper":"/paper/2406.05590","citing_paper":"/paper/2604.24184"},"observation_digest":"sha256:f23815e1d3cf77bf130bf1154f5e91f8db893ff26b06d6a4dfecfc03a2b262bd","observation_id":"96ce393e-2f4d-4192-a244-09cc28ad4275","resolution":{"observed_at":"2026-05-11T22:16:52.890773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05590","last_updated":"2025-02-18T12:26:33Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T22:21:42Z","title":"NYU CTF Bench: A Scalable Open-Source Benchmark Dataset for Evaluating LLMs in Offensive Security","version":3},"cited_work":{"arxiv_id":"2406.05590","doi":"10.48550/arxiv.2406.05590","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.05590","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nyu ctf bench: A scalable open-source benchmark dataset for evaluating llms in offensive security","venue":"arXiv (Cornell University)","work_id":"a0a8db29-57c1-4f53-817f-6f166bc22588","year":2024},"citing_paper":{"arxiv_id":"2605.23243","last_updated":"2026-06-26T18:27:24Z","snapshot_observed_at":"2026-08-05T20:10:56.993835Z","submitted_at":"2026-05-22T05:24:43Z","title":"Are Frontier LLMs Ready for Cybersecurity? Evidence for Vertical Foundation Models from Dual-Mode Vulnerability Benchmarks","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-25T04:27:57.881555Z"},"links":{"cited_paper":"/paper/2406.05590","citing_paper":"/paper/2605.23243"},"observation_digest":"sha256:4123d7f8ae02ca3931a959eea2604986b773673a4438debabc363efcee1bf45e","observation_id":"fd25a401-3a2c-4e9a-8080-d2b893e40381","resolution":{"observed_at":"2026-05-25T04:30:20.213891Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05590","last_updated":"2025-02-18T12:26:33Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T22:21:42Z","title":"NYU CTF Bench: A Scalable Open-Source Benchmark Dataset for Evaluating LLMs in Offensive Security","version":3},"cited_work":{"arxiv_id":"2406.05590","doi":"10.48550/arxiv.2406.05590","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.05590","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nyu ctf bench: A scalable open-source benchmark dataset for evaluating llms in offensive security","venue":"arXiv (Cornell University)","work_id":"a0a8db29-57c1-4f53-817f-6f166bc22588","year":2024},"citing_paper":{"arxiv_id":"2605.23243","last_updated":"2026-06-26T18:27:24Z","snapshot_observed_at":"2026-08-05T20:10:56.993835Z","submitted_at":"2026-05-22T05:24:43Z","title":"Are Frontier LLMs Ready for Cybersecurity? Evidence for Vertical Foundation Models from Dual-Mode Vulnerability Benchmarks","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T16:25:47.480189Z"},"links":{"cited_paper":"/paper/2406.05590","citing_paper":"/paper/2605.23243"},"observation_digest":"sha256:6eb0b44d3dd69828d52d57c11be9e2b184b2cd92e1246f1fb60aff4575ac4b6a","observation_id":"5d93b70a-bdf3-4a88-b9f4-25f4fbb1f84f","resolution":{"observed_at":"2026-06-30T16:35:12.937455Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05590","last_updated":"2025-02-18T12:26:33Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T22:21:42Z","title":"NYU CTF Bench: A Scalable Open-Source Benchmark Dataset for Evaluating LLMs in Offensive Security","version":3},"cited_work":{"arxiv_id":"2406.05590","doi":"10.48550/arxiv.2406.05590","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.05590","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nyu ctf bench: A scalable open-source benchmark dataset for evaluating llms in offensive security","venue":"arXiv (Cornell University)","work_id":"a0a8db29-57c1-4f53-817f-6f166bc22588","year":2024},"citing_paper":{"arxiv_id":"2605.26195","last_updated":"2026-06-16T16:19:26Z","snapshot_observed_at":"2026-08-02T06:03:12.995535Z","submitted_at":"2026-05-25T16:26:59Z","title":"CyberEvolver: Structured Self-Evolution for Cybersecurity Agents On the Fly","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-29T21:19:59.005348Z"},"links":{"cited_paper":"/paper/2406.05590","citing_paper":"/paper/2605.26195"},"observation_digest":"sha256:0c7f6ef8873e0892bd8dbbdf86a239c94dbedaa391e2b597be6a465605b8b1c5","observation_id":"916b8740-ad9a-4ba6-8d4b-655ba5d65ae2","resolution":{"observed_at":"2026-06-29T21:23:58.993128Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05590","last_updated":"2025-02-18T12:26:33Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T22:21:42Z","title":"NYU CTF Bench: A Scalable Open-Source Benchmark Dataset for Evaluating LLMs in Offensive Security","version":3},"cited_work":{"arxiv_id":"2406.05590","doi":"10.48550/arxiv.2406.05590","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.05590","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nyu ctf bench: A scalable open-source benchmark dataset for evaluating llms in offensive security","venue":"arXiv (Cornell University)","work_id":"a0a8db29-57c1-4f53-817f-6f166bc22588","year":2024},"citing_paper":{"arxiv_id":"2605.29115","last_updated":"2026-05-27T21:23:00Z","snapshot_observed_at":"2026-08-01T21:39:08.620495Z","submitted_at":"2026-05-27T21:23:00Z","title":"unix-ctf: Procedural Environments for Unix-Competence Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T11:19:38.959705Z"},"links":{"cited_paper":"/paper/2406.05590","citing_paper":"/paper/2605.29115"},"observation_digest":"sha256:5e46640fdfb41c751f08172de5c8d925b596ef5adcaf7afd7afe28f90a5c2954","observation_id":"38612fa6-7e8f-427d-859d-f1d3a5b99f5f","resolution":{"observed_at":"2026-06-29T11:23:20.894545Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05590","last_updated":"2025-02-18T12:26:33Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T22:21:42Z","title":"NYU CTF Bench: A Scalable Open-Source Benchmark Dataset for Evaluating LLMs in Offensive Security","version":3},"cited_work":{"arxiv_id":"2406.05590","doi":"10.48550/arxiv.2406.05590","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.05590","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nyu ctf bench: A scalable open-source benchmark dataset for evaluating llms in offensive security","venue":"arXiv (Cornell University)","work_id":"a0a8db29-57c1-4f53-817f-6f166bc22588","year":2024},"citing_paper":{"arxiv_id":"2607.01764","last_updated":"2026-07-02T06:27:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-07-02T06:27:27Z","title":"Mastermind: Strategy-grounded Learning for Repository-Scale Vulnerability Reproduction","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-03T14:02:06.173081Z"},"links":{"cited_paper":"/paper/2406.05590","citing_paper":"/paper/2607.01764"},"observation_digest":"sha256:ca22fb82345dd4705e4f35a8e0a8e3da0dc6a5d9967ed29bce97e46c885e3a97","observation_id":"58921728-1b32-4b4e-a8a8-94aedc70557c","resolution":{"observed_at":"2026-07-03T14:08:21.515900Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05590","last_updated":"2025-02-18T12:26:33Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T22:21:42Z","title":"NYU CTF Bench: A Scalable Open-Source Benchmark Dataset for Evaluating LLMs in Offensive Security","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05590","snapshot_observed_at":"2026-08-01T23:44:36.919216Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15263","last_updated":"2026-07-27T17:42:56Z","snapshot_observed_at":"2026-08-06T19:56:12.997652Z","submitted_at":"2026-07-16T17:54:47Z","title":"Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T23:44:36.919216Z"},"links":{"cited_paper":"/paper/2406.05590","citing_paper":"/paper/2607.15263"},"observation_digest":"sha256:bfb3145642fba7e33b3fd02cc4aa442581ecb1e6bf2cfdcc34d88368dea26d69","observation_id":"8d20a8c4-390a-4650-a315-0bcba00456e7","resolution":{"observed_at":"2026-08-01T23:44:36.919216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05590","last_updated":"2025-02-18T12:26:33Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T22:21:42Z","title":"NYU CTF Bench: A Scalable Open-Source Benchmark Dataset for Evaluating LLMs in Offensive Security","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05590","snapshot_observed_at":"2026-08-01T02:31:25.876707Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25425","last_updated":"2026-07-28T08:21:41Z","snapshot_observed_at":"2026-08-06T12:23:00.828390Z","submitted_at":"2026-07-28T08:21:41Z","title":"The Disruptive Impact of Large Language Models on Capture the Flag Competitions and the Path Toward Fair Play","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T02:31:25.876707Z"},"links":{"cited_paper":"/paper/2406.05590","citing_paper":"/paper/2607.25425"},"observation_digest":"sha256:b6a03010050e993a6310665d3bc47c3c7abfd56f6cbb44206a329f3b191af1a5","observation_id":"56e77957-a8b6-4938-9fce-98f4ecdf0eee","resolution":{"observed_at":"2026-08-01T02:31:25.876707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05590","last_updated":"2025-02-18T12:26:33Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T22:21:42Z","title":"NYU CTF Bench: A Scalable Open-Source Benchmark Dataset for Evaluating LLMs in Offensive Security","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05590","snapshot_observed_at":"2026-08-01T10:23:19.237266Z","title":"Nyu ctf bench: A scalable open-source benchmark dataset for evaluating llms in offensive security.arXiv preprint arXiv:2406.05590, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27288","last_updated":"2026-07-29T14:46:04Z","snapshot_observed_at":"2026-08-09T01:23:09.622579Z","submitted_at":"2026-07-29T14:46:04Z","title":"Open Security Benchmark: Towards Autonomous Enterprise Cyber Defense","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:19.237266Z"},"links":{"cited_paper":"/paper/2406.05590","citing_paper":"/paper/2607.27288"},"observation_digest":"sha256:096f98fa309684426b438912bd54643a24d3190f024acb44a4995ae22b0753c4","observation_id":"ff095c14-b3bc-4ac3-910d-20329497c5a8","resolution":{"observed_at":"2026-08-01T10:23:19.237266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05590","last_updated":"2025-02-18T12:26:33Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T22:21:42Z","title":"NYU CTF Bench: A Scalable Open-Source Benchmark Dataset for Evaluating LLMs in Offensive Security","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05590","snapshot_observed_at":"2026-08-04T07:50:50.682477Z","title":"Nyu ctf bench: A scalable open-source benchmark dataset for evaluating llms in offensive security, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02407","last_updated":"2026-08-03T15:49:14Z","snapshot_observed_at":"2026-08-07T11:36:44.216473Z","submitted_at":"2026-08-03T15:49:14Z","title":"Antares: Foundation Models for Agentic Vulnerability Localization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T07:50:50.682477Z"},"links":{"cited_paper":"/paper/2406.05590","citing_paper":"/paper/2608.02407"},"observation_digest":"sha256:71803a82ac19778aee9772a0da3a7bcc948d811a2f64cbf7e2256b24946f8707","observation_id":"b62f91e6-9de3-4e1c-8460-edc37fea8a3c","resolution":{"observed_at":"2026-08-04T07:50:50.682477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.05590/citation-record","integrity":"/paper/2406.05590/integrity","json":"/paper/2406.05590/citation-record.json","paper":"/paper/2406.05590"},"outbound":[],"paper":{"arxiv_id":"2406.05590","last_updated":"2025-02-18T12:26:33Z","latest_version":3,"primary_category":"cs.CR","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T22:21:42Z","title":"NYU CTF Bench: A Scalable Open-Source Benchmark Dataset for Evaluating LLMs in Offensive Security"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 17 inbound Pith citation observations for arXiv:2406.05590."}