{"as_of":"2026-08-12T05:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4761594ad98de3888728de6433b21047b9521c81ed3429e9200948ad7be5b3b8","coverage":[{"denominator":19,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T23:44:37.460029Z","state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.15263/citation-record","integrity":"/paper/2607.15263/integrity","json":"/paper/2607.15263/citation-record.json","paper":"/paper/2607.15263"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.13161","last_updated":"2024-04-19T20:11:12Z","snapshot_observed_at":"2026-08-07T13:01:36.699787Z","submitted_at":"2024-04-19T20:11:12Z","title":"CyberSecEval 2: A Wide-Ranging Cybersecurity Evaluation Suite for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13161","snapshot_observed_at":"2026-08-01T23:44:36.305552Z","title":"org/abs/2404.13161","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15263","last_updated":"2026-07-27T17:42:56Z","snapshot_observed_at":"2026-08-06T19:56:12.997652Z","submitted_at":"2026-07-16T17:54:47Z","title":"Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T23:44:36.305552Z"},"links":{"cited_paper":"/paper/2404.13161","citing_paper":"/paper/2607.15263"},"observation_digest":"sha256:dcc83b4f605ec36eacd35977bb1a41c22864d1c07f4f1933406223f1917ab091","observation_id":"0f9b988f-390e-488a-9a40-9ffbc46839e1","resolution":{"observed_at":"2026-08-01T23:44:36.305552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09247","last_updated":"2024-10-11T20:46:56Z","snapshot_observed_at":"2026-08-11T02:59:59.749070Z","submitted_at":"2024-10-11T20:46:56Z","title":"Benchmark Inflation: Revealing LLM Performance Gaps Using Retro-Holdouts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09247","snapshot_observed_at":"2026-08-01T23:44:36.414433Z","title":"Alon Jacovi, Avi Caciularu, Omer Goldman, and Yoav Goldberg","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15263","last_updated":"2026-07-27T17:42:56Z","snapshot_observed_at":"2026-08-06T19:56:12.997652Z","submitted_at":"2026-07-16T17:54:47Z","title":"Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T23:44:36.414433Z"},"links":{"cited_paper":"/paper/2410.09247","citing_paper":"/paper/2607.15263"},"observation_digest":"sha256:3353b22223b974554c011e939b9c4affaa7a361cabf6d39d4df8411b43b13d12","observation_id":"bb4687d3-3666-4250-ba48-4b349a2448f5","resolution":{"observed_at":"2026-08-01T23:44:36.414433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04244","last_updated":"2024-06-06T16:41:39Z","snapshot_observed_at":"2026-07-30T15:43:06.151242Z","submitted_at":"2024-06-06T16:41:39Z","title":"Benchmark Data Contamination of Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04244","snapshot_observed_at":"2026-08-01T23:44:36.694280Z","title":"Xiaoqun Liu et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15263","last_updated":"2026-07-27T17:42:56Z","snapshot_observed_at":"2026-08-06T19:56:12.997652Z","submitted_at":"2026-07-16T17:54:47Z","title":"Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T23:44:36.694280Z"},"links":{"cited_paper":"/paper/2406.04244","citing_paper":"/paper/2607.15263"},"observation_digest":"sha256:ad2ec000e36ed0c914a9498fd06948e472a7137cdaa5c3d4b93c729fb54ea785","observation_id":"6f15dcdf-788d-4a8e-916d-c88dd10634d8","resolution":{"observed_at":"2026-08-01T23:44:36.694280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11901","last_updated":"2025-05-17T08:33:50Z","snapshot_observed_at":"2026-08-09T11:33:52.387566Z","submitted_at":"2025-05-17T08:33:50Z","title":"Benchmarking LLMs in an Embodied Environment for Blue Team Threat Hunting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11901","snapshot_observed_at":"2026-08-01T23:44:36.754442Z","title":"Suryadipta Majumdar et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15263","last_updated":"2026-07-27T17:42:56Z","snapshot_observed_at":"2026-08-06T19:56:12.997652Z","submitted_at":"2026-07-16T17:54:47Z","title":"Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T23:44:36.754442Z"},"links":{"cited_paper":"/paper/2505.11901","citing_paper":"/paper/2607.15263"},"observation_digest":"sha256:f685175fcbbeef1415a345a042c33696f952da65fa45a11586863df381e912b8","observation_id":"633f3a86-5e26-45a0-b68f-5367c8e1bbfb","resolution":{"observed_at":"2026-08-01T23:44:36.754442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:44:36.833647Z","title":"Paul Mockapetris","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15263","last_updated":"2026-07-27T17:42:56Z","snapshot_observed_at":"2026-08-06T19:56:12.997652Z","submitted_at":"2026-07-16T17:54:47Z","title":"Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T23:44:36.833647Z"},"links":{"citing_paper":"/paper/2607.15263"},"observation_digest":"sha256:26d1783449fd695310cba20119c69cf58663be8a67b79a738d99c0c9e3e38a05","observation_id":"11c482a4-d7cf-4797-b409-3391f45c000e","resolution":{"observed_at":"2026-08-01T23:44:36.833647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05590","last_updated":"2025-02-18T12:26:33Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T22:21:42Z","title":"NYU CTF Bench: A Scalable Open-Source Benchmark Dataset for Evaluating LLMs in Offensive Security","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05590","snapshot_observed_at":"2026-08-01T23:44:36.919216Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15263","last_updated":"2026-07-27T17:42:56Z","snapshot_observed_at":"2026-08-06T19:56:12.997652Z","submitted_at":"2026-07-16T17:54:47Z","title":"Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T23:44:36.919216Z"},"links":{"cited_paper":"/paper/2406.05590","citing_paper":"/paper/2607.15263"},"observation_digest":"sha256:bfb3145642fba7e33b3fd02cc4aa442581ecb1e6bf2cfdcc34d88368dea26d69","observation_id":"8d20a8c4-390a-4650-a315-0bcba00456e7","resolution":{"observed_at":"2026-08-01T23:44:36.919216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02776","last_updated":"2024-12-03T19:17:45Z","snapshot_observed_at":"2026-08-11T23:05:07.005186Z","submitted_at":"2024-12-03T19:17:45Z","title":"Hacking CTFs with Plain Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02776","snapshot_observed_at":"2026-08-01T23:44:36.985500Z","title":"UK AI Security Institute","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15263","last_updated":"2026-07-27T17:42:56Z","snapshot_observed_at":"2026-08-06T19:56:12.997652Z","submitted_at":"2026-07-16T17:54:47Z","title":"Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T23:44:36.985500Z"},"links":{"cited_paper":"/paper/2412.02776","citing_paper":"/paper/2607.15263"},"observation_digest":"sha256:82068eaf493e294720c8b9aa42db80c345fea0fbf151f901c1aa3ba25fda71d6","observation_id":"46ea5393-03e2-4810-abf8-8a73dd5fbedc","resolution":{"observed_at":"2026-08-01T23:44:36.985500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01605","last_updated":"2024-09-06T18:17:07Z","snapshot_observed_at":"2026-08-09T15:49:58.734883Z","submitted_at":"2024-08-02T23:47:27Z","title":"CYBERSECEVAL 3: Advancing the Evaluation of Cybersecurity Risks and Capabilities in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01605","snapshot_observed_at":"2026-08-01T23:44:37.044681Z","title":"Zengzhi Wang et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15263","last_updated":"2026-07-27T17:42:56Z","snapshot_observed_at":"2026-08-06T19:56:12.997652Z","submitted_at":"2026-07-16T17:54:47Z","title":"Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T23:44:37.044681Z"},"links":{"cited_paper":"/paper/2408.01605","citing_paper":"/paper/2607.15263"},"observation_digest":"sha256:09a3240552c9ebddb04f76ec4e9bec5516ab9874ab2444d9932a95eb2bb8f961","observation_id":"a28e5a39-caff-46fe-bdd2-8c5025751ff8","resolution":{"observed_at":"2026-08-01T23:44:37.044681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-09T17:21:02.287748Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-01T23:44:37.126253Z","title":"WhoisXML API","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15263","last_updated":"2026-07-27T17:42:56Z","snapshot_observed_at":"2026-08-06T19:56:12.997652Z","submitted_at":"2026-07-16T17:54:47Z","title":"Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T23:44:37.126253Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2607.15263"},"observation_digest":"sha256:f8a73b2368777723d378c71b9bf362f4709d7c1a8ba296ee7f7bfc964ca0f544","observation_id":"f42e648e-7f65-4ff9-8770-9e6a013df65d","resolution":{"observed_at":"2026-08-01T23:44:37.126253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.14201","last_updated":"2026-05-01T04:31:46Z","snapshot_observed_at":"2026-08-11T04:21:18.267564Z","submitted_at":"2025-07-14T17:06:26Z","title":"ExCyTIn-Bench: Evaluating LLM agents on Cyber Threat Investigation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.14201","snapshot_observed_at":"2026-08-01T23:44:37.200360Z","title":"John Yang, Akshara Prabhakar, Karthik Narasimhan, and Shunyu Yao","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15263","last_updated":"2026-07-27T17:42:56Z","snapshot_observed_at":"2026-08-06T19:56:12.997652Z","submitted_at":"2026-07-16T17:54:47Z","title":"Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T23:44:37.200360Z"},"links":{"cited_paper":"/paper/2507.14201","citing_paper":"/paper/2607.15263"},"observation_digest":"sha256:abc5dc968f07586da131f32b9e88a7c6431c478ebe89e16477b61f9df26f500b","observation_id":"be40b139-ad95-49c7-ad4b-9990fcec6388","resolution":{"observed_at":"2026-08-01T23:44:37.200360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-01T23:44:37.248320Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15263","last_updated":"2026-07-27T17:42:56Z","snapshot_observed_at":"2026-08-06T19:56:12.997652Z","submitted_at":"2026-07-16T17:54:47Z","title":"Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T23:44:37.248320Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2607.15263"},"observation_digest":"sha256:f7130f6ee1a083a61850dcda4f73d0565d0deda5c76387b59a41f6ba3fd4f572","observation_id":"873331ca-5b6c-450b-b430-feab0bd94684","resolution":{"observed_at":"2026-08-01T23:44:37.248320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-08-01T23:44:37.323064Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15263","last_updated":"2026-07-27T17:42:56Z","snapshot_observed_at":"2026-08-06T19:56:12.997652Z","submitted_at":"2026-07-16T17:54:47Z","title":"Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T23:44:37.323064Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2607.15263"},"observation_digest":"sha256:0d47d3ad9c1c90d97701e770f959e554b70f95223e8da4d9b99f8db6a8127205","observation_id":"e5ec7e9b-7c8e-48ae-9d35-a983f0fcfb48","resolution":{"observed_at":"2026-08-01T23:44:37.323064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:44:37.402394Z","title":"Yuxuan Zhu, Antony Kellermann, Dylan Bowman, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15263","last_updated":"2026-07-27T17:42:56Z","snapshot_observed_at":"2026-08-06T19:56:12.997652Z","submitted_at":"2026-07-16T17:54:47Z","title":"Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T23:44:37.402394Z"},"links":{"citing_paper":"/paper/2607.15263"},"observation_digest":"sha256:36cd615b0193e3d6707d3a3f80884561ec9c976c0ed538edc617efb08f53be59","observation_id":"17b90d1e-5d53-4080-9e58-8f1b0e0cae06","resolution":{"observed_at":"2026-08-01T23:44:37.402394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17332","last_updated":"2025-06-24T04:10:59Z","snapshot_observed_at":"2026-08-07T16:45:53.188074Z","submitted_at":"2025-03-21T17:32:32Z","title":"CVE-Bench: A Benchmark for AI Agents' Ability to Exploit Real-World Web Application Vulnerabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17332","snapshot_observed_at":"2026-08-01T23:44:37.460029Z","title":"Appendix A","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15263","last_updated":"2026-07-27T17:42:56Z","snapshot_observed_at":"2026-08-06T19:56:12.997652Z","submitted_at":"2026-07-16T17:54:47Z","title":"Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T23:44:37.460029Z"},"links":{"cited_paper":"/paper/2503.17332","citing_paper":"/paper/2607.15263"},"observation_digest":"sha256:51267a8c319dedbcaaee82448d5432839d04e61e15e2100f75bafd66e71d596a","observation_id":"00a49258-7ad4-4e0c-8a36-163edbb7f068","resolution":{"observed_at":"2026-08-01T23:44:37.460029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:44:36.359957Z","title":"rfc-editor.org/rfc/rfc3912","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15263","last_updated":"2026-07-27T17:42:56Z","snapshot_observed_at":"2026-08-06T19:56:12.997652Z","submitted_at":"2026-07-16T17:54:47Z","title":"Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents","version":3},"reference_index":2004,"source":"pdf_text","source_observed_at":"2026-08-01T23:44:36.359957Z"},"links":{"citing_paper":"/paper/2607.15263"},"observation_digest":"sha256:964821f88379acea0acf56d210a9b266f4eab52b0a505cd210fbc5f4ff408fec","observation_id":"a183dcca-28ed-4f5b-9a6e-bebc856ba4c5","resolution":{"observed_at":"2026-08-01T23:44:36.359957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:44:36.487351Z","title":"URL https://aclanthology.org/2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15263","last_updated":"2026-07-27T17:42:56Z","snapshot_observed_at":"2026-08-06T19:56:12.997652Z","submitted_at":"2026-07-16T17:54:47Z","title":"Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-01T23:44:36.487351Z"},"links":{"citing_paper":"/paper/2607.15263"},"observation_digest":"sha256:adc2b90fc3af794aa3204583a96a304c84f6fce18dc99052eedffb819652bb1e","observation_id":"f6781fd7-ad21-4b2c-9022-04703038ec8a","resolution":{"observed_at":"2026-08-01T23:44:36.487351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:44:36.222177Z","title":"URLhttps://aclanthology.org/2024.eacl-long.5/","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15263","last_updated":"2026-07-27T17:42:56Z","snapshot_observed_at":"2026-08-06T19:56:12.997652Z","submitted_at":"2026-07-16T17:54:47Z","title":"Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T23:44:36.222177Z"},"links":{"citing_paper":"/paper/2607.15263"},"observation_digest":"sha256:fef36aad77c5660004d126ee0987c4542c68c1c605416e88441c061e18d503b9","observation_id":"9ef3975f-3be5-422f-bde5-452fd7a31623","resolution":{"observed_at":"2026-08-01T23:44:36.222177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20787","last_updated":"2025-01-06T07:22:50Z","snapshot_observed_at":"2026-08-10T23:08:48.164917Z","submitted_at":"2024-12-30T08:11:54Z","title":"SecBench: A Comprehensive Multi-Dimensional Benchmarking Dataset for LLMs in Cybersecurity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20787","snapshot_observed_at":"2026-08-01T23:44:36.537877Z","title":"15 Kassianik Nelson Singer Ambuj Kumar et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15263","last_updated":"2026-07-27T17:42:56Z","snapshot_observed_at":"2026-08-06T19:56:12.997652Z","submitted_at":"2026-07-16T17:54:47Z","title":"Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T23:44:36.537877Z"},"links":{"cited_paper":"/paper/2412.20787","citing_paper":"/paper/2607.15263"},"observation_digest":"sha256:56d48719e4895ed5d96f4909ae9d753cbb1dcb4cabc88f8815aa25dd8861cc7e","observation_id":"bb12d759-4240-4c45-9150-1a714929e72c","resolution":{"observed_at":"2026-08-01T23:44:36.537877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.19533","last_updated":"2026-04-23T17:59:02Z","snapshot_observed_at":"2026-08-11T21:06:41.904480Z","submitted_at":"2026-04-21T14:53:23Z","title":"Cyber Defense Benchmark: Agentic Threat Hunting Evaluation for LLMs in SecOps","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.19533","snapshot_observed_at":"2026-08-01T23:44:36.622992Z","title":"Yucheng Li et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15263","last_updated":"2026-07-27T17:42:56Z","snapshot_observed_at":"2026-08-06T19:56:12.997652Z","submitted_at":"2026-07-16T17:54:47Z","title":"Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents","version":3},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-01T23:44:36.622992Z"},"links":{"cited_paper":"/paper/2604.19533","citing_paper":"/paper/2607.15263"},"observation_digest":"sha256:38f513f8fc4468f7c07d802dfdf0c1d725eb6402f7bbd8dfd87135ca90e0e701","observation_id":"1066791f-c241-420e-8b08-88f33fc59dee","resolution":{"observed_at":"2026-08-01T23:44:36.622992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.15263","last_updated":"2026-07-27T17:42:56Z","latest_version":3,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-06T19:56:12.997652Z","submitted_at":"2026-07-16T17:54:47Z","title":"Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents"},"reference_resolution":{"displayed":19,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":19},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 0 inbound Pith citation observations for arXiv:2607.15263."}