{"as_of":"2026-08-04T06:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:092826c8867c1f22738eccac17afd77bd7e4424ca3a95b47954e60bb636b9a6e","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":41,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T06:01:01.313606Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T18:37:31.168670Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-07-06T19:01:41.274385Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2410.09024","last_updated":"2025-04-18T14:30:31Z","snapshot_observed_at":"2026-08-02T12:38:54.249632Z","submitted_at":"2024-10-11T17:39:22Z","title":"AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-14T01:35:50.992477Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2410.09024"},"observation_digest":"sha256:2f61a94d1b068e400a3f9d527b6626c48bce585f1b0973e80c90dea283e7efef","observation_id":"0feb9130-5989-413f-818a-86b3d31b83ba","resolution":{"observed_at":"2026-05-14T01:35:51.135418Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-07-06T19:01:41.274385Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2412.04984","last_updated":"2025-01-14T20:16:01Z","snapshot_observed_at":"2026-07-29T23:20:20.918596Z","submitted_at":"2024-12-06T12:09:50Z","title":"Frontier Models are Capable of In-context Scheming","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-16T14:22:01.616448Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2412.04984"},"observation_digest":"sha256:83f3d7075d8090edef18f5df294f0180909e3804f83c403daa7b3c8453dae8f7","observation_id":"936f24ff-bbee-4b68-afa7-b98308ff62ee","resolution":{"observed_at":"2026-05-16T14:22:01.635191Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-07-06T19:01:41.274385Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-10T18:40:50.139345Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2501.14249"},"observation_digest":"sha256:bf5f18a9a4dbf37ab95f8ad6489d4a4ab60a9c59b4de607cdfd994c46e44370d","observation_id":"be75ed09-53c6-4815-a5d7-86f23bc03ac8","resolution":{"observed_at":"2026-05-10T18:40:50.350304Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-07-06T19:01:41.274385Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2507.14201","last_updated":"2026-05-01T04:31:46Z","snapshot_observed_at":"2026-08-03T00:52:00.145580Z","submitted_at":"2025-07-14T17:06:26Z","title":"ExCyTIn-Bench: Evaluating LLM agents on Cyber Threat Investigation","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-19T04:37:33.942379Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2507.14201"},"observation_digest":"sha256:b53a7b38fcc03f6c29ca8e74863792958834c5a379fa63c595b081895897dc1d","observation_id":"00418eaf-ba6c-4c13-b005-b4182b51cdd1","resolution":{"observed_at":"2026-05-19T04:42:04.771929Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-07-06T19:01:41.274385Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-08-04T00:09:36.085164Z","title":"Cybench: A framework for evaluating cybersecurity capa- bilities and risks of language models.arXiv preprint arXiv:2408.08926, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.02780","last_updated":"2026-02-23T13:17:25Z","snapshot_observed_at":"2026-08-04T00:09:31.249464Z","submitted_at":"2025-11-04T18:03:12Z","title":"PoCo: Agentic Proof-of-Concept Exploit Generation for Smart Contracts","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T00:09:36.085164Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2511.02780"},"observation_digest":"sha256:f9210e50d627fd6a2bc35e31379406432675aa7815b8630bcaa22b44106d22ce","observation_id":"99d6da7f-8a57-4eda-a3e2-58af7100db2c","resolution":{"observed_at":"2026-08-04T00:09:36.085164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-07-06T19:01:41.274385Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-08-02T19:43:40.853518Z","title":"white-hat","venue":null,"work_id":null,"year":2049},"citing_paper":{"arxiv_id":"2603.02277","last_updated":"2026-08-01T15:05:15Z","snapshot_observed_at":"2026-08-04T06:01:00.100443Z","submitted_at":"2026-03-01T22:47:39Z","title":"Quantifying Frontier LLM Capabilities for Container Sandbox Escape","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-02T19:43:40.853518Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2603.02277"},"observation_digest":"sha256:755b7d36ac7b9582ec81b5752bd0e623e0ba3019c6d60657be2d2aaaf7bc9819","observation_id":"d5932e34-fc2d-4149-bfda-417ff6e36dd9","resolution":{"observed_at":"2026-08-02T19:43:40.853518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-07-06T19:01:41.274385Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-08-04T06:01:01.313606Z","title":"white-hat","venue":null,"work_id":null,"year":2049},"citing_paper":{"arxiv_id":"2603.02277","last_updated":"2026-08-01T15:05:15Z","snapshot_observed_at":"2026-08-04T06:01:00.100443Z","submitted_at":"2026-03-01T22:47:39Z","title":"Quantifying Frontier LLM Capabilities for Container Sandbox Escape","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-04T06:01:01.313606Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2603.02277"},"observation_digest":"sha256:9662b56cc0ce60547ed4fdc57677bd162fa30ace58319eed0947e3d6c3f6c5f3","observation_id":"8ffd15fe-f1cb-47df-870a-e1f7d5365307","resolution":{"observed_at":"2026-08-04T06:01:01.313606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-07-06T19:01:41.274385Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2604.05719","last_updated":"2026-04-07T11:19:16Z","snapshot_observed_at":"2026-08-02T08:12:46.257370Z","submitted_at":"2026-04-07T11:19:16Z","title":"Hackers or Hallucinators? A Comprehensive Analysis of LLM-Based Automated Penetration Testing","version":1},"reference_index":132,"source":"pdf_text","source_observed_at":"2026-05-10T18:52:57.225878Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2604.05719"},"observation_digest":"sha256:f75d487e7fa21d65afda5a98d5fde32ad07dec4fe8068c506d65711f15a96960","observation_id":"d0189277-b3d4-40eb-b3dc-9def2a74622a","resolution":{"observed_at":"2026-05-10T23:45:52.939979Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-07-06T19:01:41.274385Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-08-02T16:40:51.515451Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models.arXiv:2408.08926, August 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.06550","last_updated":"2026-07-27T11:35:54Z","snapshot_observed_at":"2026-08-02T16:40:49.970902Z","submitted_at":"2026-04-08T00:58:48Z","title":"SkillSieve: A Hierarchical Triage Framework for Detecting Malicious AI Agent Skills","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T16:40:51.515451Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2604.06550"},"observation_digest":"sha256:2c86e08317b80d64619960d86cd51e8e46ab3a7492ad366c067a53458703a009","observation_id":"3c7fb686-9676-4ddb-b92a-76b5e3a3191a","resolution":{"observed_at":"2026-08-02T16:40:51.515451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-07-06T19:01:41.274385Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2604.12162","last_updated":"2026-04-14T00:43:20Z","snapshot_observed_at":"2026-07-31T20:58:59.645474Z","submitted_at":"2026-04-14T00:43:20Z","title":"AlphaEval: Evaluating Agents in Production","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T16:30:51.886471Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2604.12162"},"observation_digest":"sha256:d20a466276c16f65a4d2119ee9356e017146983c0a0ca0f5a1c511002f622ba6","observation_id":"58f31584-7ea9-41de-ab10-7890120d3c43","resolution":{"observed_at":"2026-05-11T08:45:58.817569Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-07-06T19:01:41.274385Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2604.17159","last_updated":"2026-04-18T22:13:23Z","snapshot_observed_at":"2026-08-03T22:57:17.276813Z","submitted_at":"2026-04-18T22:13:23Z","title":"Systematic Capability Benchmarking of Frontier Large Language Models for Offensive Cyber Tasks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T06:02:32.399075Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2604.17159"},"observation_digest":"sha256:f5a2d9158f3552ec3e3dc2476b9c6a1e427eb69236b072ebb531a1c8db792f96","observation_id":"670e3a77-f49b-4e6a-b904-6acda6aaf242","resolution":{"observed_at":"2026-05-10T06:06:19.087529Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-07-06T19:01:41.274385Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2604.23340","last_updated":"2026-04-25T15:00:14Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T15:00:14Z","title":"Can LLMs be Effective Code Contributors? A Study on Open-source Projects","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-08T08:09:33.211692Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2604.23340"},"observation_digest":"sha256:ff162fd5324705914af219061da5e2f0cad3adbfc1c11c6c32f6f355536e645a","observation_id":"98a4d09b-b3c1-483c-8fd2-b68f5d949d6f","resolution":{"observed_at":"2026-05-11T20:46:10.852344Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-07-06T19:01:41.274385Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2604.24184","last_updated":"2026-04-27T08:44:30Z","snapshot_observed_at":"2026-07-06T23:10:16.426836Z","submitted_at":"2026-04-27T08:44:30Z","title":"Dynamic Cyber Ranges","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T03:04:03.611481Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2604.24184"},"observation_digest":"sha256:c3068ba97ea6bf319560f5ef18e2e3e595cb79ca16cb2d92ead80af0d798ba30","observation_id":"af10d1ef-b6f1-4213-8cdb-52e0b21494d8","resolution":{"observed_at":"2026-05-11T22:16:53.348658Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-07-06T19:01:41.274385Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2604.24966","last_updated":"2026-04-27T20:07:09Z","snapshot_observed_at":"2026-07-06T23:10:52.763251Z","submitted_at":"2026-04-27T20:07:09Z","title":"Risk Reporting for Developers' Internal AI Model Use","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-07T17:47:21.321820Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2604.24966"},"observation_digest":"sha256:1ef49d2efa8dbf5b6eabe8a98cb7381a44691675266fd4306ee60393ce46458f","observation_id":"901fe0bd-f957-4028-ad60-c19de5e945c4","resolution":{"observed_at":"2026-05-11T23:16:16.399595Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-07-06T19:01:41.274385Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2605.00072","last_updated":"2026-04-30T11:50:32Z","snapshot_observed_at":"2026-07-06T23:13:33.799847Z","submitted_at":"2026-04-30T11:50:32Z","title":"XekRung Technical Report","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-09T20:55:10.400291Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2605.00072"},"observation_digest":"sha256:095b33d9b6ac47a85f68bfcb2ee40142d68bde6107fcdedb255bc36f89219f23","observation_id":"f3479441-714c-411a-b0ed-5fb2f8e5e57e","resolution":{"observed_at":"2026-05-11T14:51:14.588143Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-07-06T19:01:41.274385Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2605.01186","last_updated":"2026-05-02T01:27:20Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-02T01:27:20Z","title":"Trace: Unmasking AI Attack Agents Through Terminal Behavior Fingerprinting","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-09T15:18:43.426681Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2605.01186"},"observation_digest":"sha256:ad400d7546df593cd65550a9f411e20b2f39577b6e103d4776a5271e4b9efd14","observation_id":"6f2e4b70-ed75-4997-8ad4-4ded7d60ee4d","resolution":{"observed_at":"2026-05-11T16:41:18.994757Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-07-06T19:01:41.274385Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2605.06486","last_updated":"2026-05-07T16:07:41Z","snapshot_observed_at":"2026-08-02T21:44:55.115745Z","submitted_at":"2026-05-07T16:07:41Z","title":"Autonomous Adversary: Red-Teaming in the age of LLM","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T09:09:58.566171Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2605.06486"},"observation_digest":"sha256:15867dfb0be9efec854084a91108e5e7bcb9b57e0a4b1d9aa072e6751ed8b0a0","observation_id":"8c487224-e811-4da9-89bd-d92904e4ba7f","resolution":{"observed_at":"2026-05-11T20:26:10.508553Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-07-06T19:01:41.274385Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2605.06601","last_updated":"2026-05-07T17:22:22Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:22Z","title":"Patch2Vuln: Agentic Reconstruction of Vulnerabilities from Linux Distribution Binary Patches","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-08T08:51:33.112454Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2605.06601"},"observation_digest":"sha256:dfc8e0b2cbbd82cc103a5f2a21f82338e80bc875ec6a7a59232bb541a5be2239","observation_id":"fb629ce5-673b-4c01-a4d6-b413708b2c71","resolution":{"observed_at":"2026-05-11T20:31:11.685007Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-07-06T19:01:41.274385Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2605.07830","last_updated":"2026-05-08T14:57:53Z","snapshot_observed_at":"2026-07-06T23:20:11.042952Z","submitted_at":"2026-05-08T14:57:53Z","title":"CyBiasBench: Benchmarking Bias in LLM Agents for Cyber-Attack Scenarios","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-11T01:54:46.391345Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2605.07830"},"observation_digest":"sha256:56d02e91c10025ecb74f2d37d0f754087c784b7d202cdbd43c084b4a76960ad2","observation_id":"056324e2-fb99-4104-b553-afcf4b86cac3","resolution":{"observed_at":"2026-05-11T04:10:57.348437Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-07-06T19:01:41.274385Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2605.10834","last_updated":"2026-07-28T07:30:21Z","snapshot_observed_at":"2026-08-02T14:32:21.223586Z","submitted_at":"2026-05-11T16:50:00Z","title":"From Controlled to the Wild: Evaluation of Pentesting Agents for the Real-World","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-12T03:34:55.538935Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2605.10834"},"observation_digest":"sha256:77690033159acfdd6cd4a7db02e08810c82d1ba772a76ce950b4a16f183598fe","observation_id":"f204818c-98b3-493f-ab84-07171811d024","resolution":{"observed_at":"2026-05-12T07:16:27.972213Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-07-06T19:01:41.274385Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-08-02T14:22:27.655588Z","title":"Zhang, Neil Perry, Riya Dulepet, Joey Ji, Celeste Menders, Justin W","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.10834","last_updated":"2026-07-28T07:30:21Z","snapshot_observed_at":"2026-08-02T14:32:21.223586Z","submitted_at":"2026-05-11T16:50:00Z","title":"From Controlled to the Wild: Evaluation of Pentesting Agents for the Real-World","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T14:22:27.655588Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2605.10834"},"observation_digest":"sha256:8319a5126e361f1434b23c1a0ec306da4826d8d21a7f7bca5b4b7528d6c76378","observation_id":"24ac8b9d-0e14-4b24-9694-01757c5bc2be","resolution":{"observed_at":"2026-08-02T14:22:27.655588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-07-06T19:01:41.274385Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:fe44d16b4715a8665d740947b6f44baed025c16883d1041e6f86f824eeb8da24","observation_id":"83f64bae-f5e2-4773-88c2-c67e3df1b3d2","resolution":{"observed_at":"2026-05-19T23:32:52.563721Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-07-06T19:01:41.274385Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2605.17416","last_updated":"2026-05-17T12:24:11Z","snapshot_observed_at":"2026-07-31T18:23:27.214396Z","submitted_at":"2026-05-17T12:24:11Z","title":"Benchmarking Mythos-Linked Bug Rediscovery","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-19T23:14:34.164854Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2605.17416"},"observation_digest":"sha256:88b0fd9c70191c99581dfe490e9ba077832f450f322cbdd4c007001bdb0a1327","observation_id":"33d9d0cc-241a-4c13-8df6-342a25d52c98","resolution":{"observed_at":"2026-05-19T23:17:57.552731Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-07-06T19:01:41.274385Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2605.19099","last_updated":"2026-05-18T20:37:14Z","snapshot_observed_at":"2026-07-31T05:54:44.970755Z","submitted_at":"2026-05-18T20:37:14Z","title":"DecisionBench: A Benchmark for Emergent Delegation in Long-Horizon Agentic Workflows","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-20T10:16:38.920528Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2605.19099"},"observation_digest":"sha256:6c882915c4f9a90712448a726b1362ae1b6c67f415c6d0f2755900e153ce81aa","observation_id":"8584ade9-95b6-446c-bf9e-18902bde487f","resolution":{"observed_at":"2026-05-20T10:18:11.749362Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-07-06T19:01:41.274385Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2605.21773","last_updated":"2026-05-20T22:07:12Z","snapshot_observed_at":"2026-07-06T23:32:10.472558Z","submitted_at":"2026-05-20T22:07:12Z","title":"HIDBench: Benchmarking Large Language Models for Host-Based Intrusion Detection","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T08:52:34.079804Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2605.21773"},"observation_digest":"sha256:9d229c0cdeb5526fba0fa9dcca33461dc285b4a17dabee9f888b13beb752b618","observation_id":"305c9254-29ad-43f3-8569-8b25cfa8cddf","resolution":{"observed_at":"2026-05-22T08:54:45.823514Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-07-06T19:01:41.274385Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2605.22643","last_updated":"2026-05-22T14:53:30Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T15:50:18Z","title":"Boiling the Frog: A Multi-Turn Benchmark for Agentic Safety","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-22T05:50:28.114140Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2605.22643"},"observation_digest":"sha256:ba9deda5e04ef18a4c35a12531a4a43152f3511d10064f25c357053d7c3e8af1","observation_id":"7e042dcc-a9f5-4faf-8701-a82bb982bb3f","resolution":{"observed_at":"2026-05-22T05:51:07.929199Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-07-06T19:01:41.274385Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2605.22643","last_updated":"2026-05-22T14:53:30Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T15:50:18Z","title":"Boiling the Frog: A Multi-Turn Benchmark for Agentic Safety","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-25T06:05:27.736494Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2605.22643"},"observation_digest":"sha256:1f2b6270471a708789f012ff08c783660df6dbca8c37605c43a4c757c29874eb","observation_id":"001041d1-9921-45e9-9866-f3db5b16d6ed","resolution":{"observed_at":"2026-05-25T06:06:43.185520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-07-06T19:01:41.274385Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2605.28146","last_updated":"2026-05-27T08:29:28Z","snapshot_observed_at":"2026-07-06T23:37:45.223562Z","submitted_at":"2026-05-27T08:29:28Z","title":"Cybersecurity AI (CAI) Dataset","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T12:07:49.656453Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2605.28146"},"observation_digest":"sha256:9508f24efcf28b2d956626033ff86bc15bf661f32f589a6490e75da56aea2b1d","observation_id":"0e1e3c4c-a3a3-4fc0-85fc-a7b7e84f2e31","resolution":{"observed_at":"2026-06-29T12:13:26.856759Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-07-06T19:01:41.274385Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2605.31593","last_updated":"2026-05-29T17:57:00Z","snapshot_observed_at":"2026-07-06T23:40:46.825645Z","submitted_at":"2026-05-29T17:57:00Z","title":"Stateful Online Monitoring Catches Distributed Agent Attacks","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-28T21:54:44.072929Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2605.31593"},"observation_digest":"sha256:1db27b3c49ef029664cdb95c04cb1dbe3dfe67a0d6083a2575e207260896cc5d","observation_id":"ab106e19-42cb-47ed-b501-4f3b97b30ebf","resolution":{"observed_at":"2026-07-01T19:56:11.064697Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-07-06T19:01:41.274385Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2606.17114","last_updated":"2026-06-15T09:16:38Z","snapshot_observed_at":"2026-08-02T23:25:19.283217Z","submitted_at":"2026-06-15T09:16:38Z","title":"An Evaluation of Data Leakage Risks in Tool-Using LLM Agents in Realistic Scenarios","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T03:39:36.657903Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2606.17114"},"observation_digest":"sha256:c1012b4d8c4989b39743d8ab3bf7949be088f322da4dbd359b031a0a79ed2f58","observation_id":"d56a6cf9-90bf-410a-b13a-6f3bd59e972b","resolution":{"observed_at":"2026-07-03T17:48:46.344299Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-07-06T19:01:41.274385Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2606.24402","last_updated":"2026-06-23T10:37:34Z","snapshot_observed_at":"2026-08-03T12:40:07.880667Z","submitted_at":"2026-06-23T10:37:34Z","title":"Poisoned Playbooks: Demystifying Knowledge Poisoning Effects on AI Security Agents","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-25T23:27:14.610097Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2606.24402"},"observation_digest":"sha256:1877fa546ff6bfa035e49c918202527f1a1c77d91ff7a307b6cfd0b857d360e4","observation_id":"99c16f9a-1b02-49bb-b4e3-14ce6bf99e4a","resolution":{"observed_at":"2026-07-04T17:40:01.102907Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-07-06T19:01:41.274385Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2606.29175","last_updated":"2026-06-28T03:43:30Z","snapshot_observed_at":"2026-07-07T00:03:12.330608Z","submitted_at":"2026-06-28T03:43:30Z","title":"Direct Causation in International Humanitarian Law and the Challenge of AI-Mediated Civilian Cyber Operations","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T07:49:28.819402Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2606.29175"},"observation_digest":"sha256:9bfe62304e69fb989738a746ac828a68ffee3afc4623a71454ebb2bbe1ac7bc7","observation_id":"f1e2d4fa-4aef-4e74-9e82-9d19555f84d9","resolution":{"observed_at":"2026-06-30T07:54:22.125038Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-07-06T19:01:41.274385Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2607.01764","last_updated":"2026-07-02T06:27:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-07-02T06:27:27Z","title":"Mastermind: Strategy-grounded Learning for Repository-Scale Vulnerability Reproduction","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-03T14:02:06.173081Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2607.01764"},"observation_digest":"sha256:d67a50628133eef8c9af74ca0541bdbcdbffc4591b84324d5804f7f269209988","observation_id":"b35eadfd-1caa-44b8-a2e7-2eb5d55a9303","resolution":{"observed_at":"2026-07-03T14:08:21.502047Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-07-06T19:01:41.274385Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2607.07774","last_updated":"2026-07-30T19:01:17Z","snapshot_observed_at":"2026-08-04T06:28:43.044139Z","submitted_at":"2026-07-08T16:46:06Z","title":"ScopeJudge: Cost-Aware Pre-Execution Gating for Offensive Security Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-10T18:29:50.731038Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2607.07774"},"observation_digest":"sha256:2e3151cab7aded42f9d9bb2e974c8cf6ec0cb93032bdc777a270e61b2318cf90","observation_id":"ef5f186d-bd5e-4b54-b7d1-5f3115183312","resolution":{"observed_at":"2026-07-10T18:37:31.169937Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-07-06T19:01:41.274385Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-08-03T00:49:47.662275Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.07774","last_updated":"2026-07-30T19:01:17Z","snapshot_observed_at":"2026-08-04T06:28:43.044139Z","submitted_at":"2026-07-08T16:46:06Z","title":"ScopeJudge: Cost-Aware Pre-Execution Gating for Offensive Security Agents","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T00:49:47.662275Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2607.07774"},"observation_digest":"sha256:17c25bc1301bb162a1ef23ecdf34a23f1e63a0e7dbc4a79e8dbaa611220cbc65","observation_id":"65c92e11-d7bc-443a-8ac8-4bfc8b6376c6","resolution":{"observed_at":"2026-08-03T00:49:47.662275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-07-06T19:01:41.274385Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-08-01T23:44:37.323064Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15263","last_updated":"2026-07-27T17:42:56Z","snapshot_observed_at":"2026-08-03T06:20:53.502876Z","submitted_at":"2026-07-16T17:54:47Z","title":"Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T23:44:37.323064Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2607.15263"},"observation_digest":"sha256:6ac72fd5fbf8320572588d8c9faed8afc1ce10c0dfaa15bfbef1d57e84cace6e","observation_id":"e5ec7e9b-7c8e-48ae-9d35-a983f0fcfb48","resolution":{"observed_at":"2026-08-01T23:44:37.323064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-07-06T19:01:41.274385Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-08-01T21:24:15.880141Z","title":"and others , title =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16112","last_updated":"2026-07-17T16:45:30Z","snapshot_observed_at":"2026-08-03T09:25:20.687179Z","submitted_at":"2026-07-17T16:45:30Z","title":"Harmonizing AI Safety Thresholds","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-01T21:24:15.880141Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2607.16112"},"observation_digest":"sha256:4bf358950a28e713ffed8d284aa355a2686c12e2dba11b8c9a1825434d8bf148","observation_id":"ceff4a75-aac0-40df-b438-27b6d540f7d0","resolution":{"observed_at":"2026-08-01T21:24:15.880141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-07-06T19:01:41.274385Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-08-01T15:04:09.259606Z","title":"Cybench: A framework for evaluating cybersecurity capabilities and risks of language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18575","last_updated":"2026-07-20T23:16:16Z","snapshot_observed_at":"2026-08-04T04:19:36.239195Z","submitted_at":"2026-07-20T23:16:16Z","title":"RECEIPT: Deterministic, Reward-Hacking-Resistant Verification for White-Box Agentic XSS Discovery","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T15:04:09.259606Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2607.18575"},"observation_digest":"sha256:8c81f840a161f3f43292548c66b9aad54d1975f6f05f2b1adf1d3500654ced44","observation_id":"23646153-646d-483d-acfc-45130e22460a","resolution":{"observed_at":"2026-08-01T15:04:09.259606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-07-06T19:01:41.274385Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-08-01T06:49:26.953693Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21763","last_updated":"2026-07-23T19:26:25Z","snapshot_observed_at":"2026-08-03T12:11:45.848727Z","submitted_at":"2026-07-23T19:26:25Z","title":"Every Model Cheats: Prompt-Level Mitigation of Cheating on Offensive Cyber Tasks","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T06:49:26.953693Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2607.21763"},"observation_digest":"sha256:41440ae734b21c760d3a944c88af37cf665daa3f51516767be0062b173a592b0","observation_id":"911f64eb-a401-452b-86ca-d0fc8217fff4","resolution":{"observed_at":"2026-08-01T06:49:26.953693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-07-06T19:01:41.274385Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-08-01T02:31:26.073853Z","title":"Zhang, Neil Perry, Riya Dulepet, Joey Ji, Celeste Menders, Justin W","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25425","last_updated":"2026-07-28T08:21:41Z","snapshot_observed_at":"2026-08-01T02:31:24.701350Z","submitted_at":"2026-07-28T08:21:41Z","title":"The Disruptive Impact of Large Language Models on Capture the Flag Competitions and the Path Toward Fair Play","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T02:31:26.073853Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2607.25425"},"observation_digest":"sha256:5fa5eef3b748c17b759222ae9ec4f7da38bd1b1f4c08a9aa1e77acf5263ce18f","observation_id":"579da816-ab2d-4ffb-98f7-0939b6df73a4","resolution":{"observed_at":"2026-08-01T02:31:26.073853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-07-06T19:01:41.274385Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-08-01T00:13:37.291705Z","title":"Zhang, Neil Perry, Riya Dulepet, Joey Ji, Celeste Menders, Justin W","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26314","last_updated":"2026-07-28T22:23:34Z","snapshot_observed_at":"2026-08-02T10:13:32.027860Z","submitted_at":"2026-07-28T22:23:34Z","title":"StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T00:13:37.291705Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2607.26314"},"observation_digest":"sha256:deea31812072e58ce6bb48163b4cd55ddedde558d289a393e49d3732f61af0d3","observation_id":"8c75942d-277b-4329-a925-2a8d7343f2de","resolution":{"observed_at":"2026-08-01T00:13:37.291705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2408.08926/citation-record","integrity":"/paper/2408.08926/integrity","json":"/paper/2408.08926/citation-record.json","paper":"/paper/2408.08926"},"outbound":[],"paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","latest_version":4,"primary_category":"cs.CR","snapshot_observed_at":"2026-07-06T19:01:41.274385Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 41 inbound Pith citation observations for arXiv:2408.08926."}