{"as_of":"2026-08-13T13:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:143d2cc2b4218801d09a675eac1c418241eb36e8f692800ad102430aa742710e","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T13:10:41.870343Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.26548/citation-record","integrity":"/paper/2605.26548/integrity","json":"/paper/2605.26548/citation-record.json","paper":"/paper/2605.26548"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.16941","last_updated":"2025-11-14T22:00:03Z","snapshot_observed_at":"2026-08-10T12:32:55.999823Z","submitted_at":"2025-09-21T06:28:17Z","title":"SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.16941","snapshot_observed_at":"2026-08-02T13:10:39.062654Z","title":"SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?arXiv preprint arXiv:2509.16941,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26548","last_updated":"2026-07-20T16:24:12Z","snapshot_observed_at":"2026-08-12T04:25:35.881558Z","submitted_at":"2026-05-26T04:59:49Z","title":"SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks?","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T13:10:39.062654Z"},"links":{"cited_paper":"/paper/2509.16941","citing_paper":"/paper/2605.26548"},"observation_digest":"sha256:ee6d2883d893b343fe80da3fda9216bf4c5acd37aeea2e6da3d5831a71ca1b25","observation_id":"6cd2488a-f694-4ced-898c-f6f4d4c8cbf8","resolution":{"observed_at":"2026-08-02T13:10:39.062654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T13:10:41.870343Z","title":"not on target page","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.26548","last_updated":"2026-07-20T16:24:12Z","snapshot_observed_at":"2026-08-12T04:25:35.881558Z","submitted_at":"2026-05-26T04:59:49Z","title":"SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks?","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T13:10:41.870343Z"},"links":{"citing_paper":"/paper/2605.26548"},"observation_digest":"sha256:6247527011b8202cf8553273c551a38b97f7487ee09caf08b7fed9b776b7adb0","observation_id":"57c6980f-9f27-46d7-b3e5-6fb1eb5cb49b","resolution":{"observed_at":"2026-08-02T13:10:41.870343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T13:10:39.332264Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26548","last_updated":"2026-07-20T16:24:12Z","snapshot_observed_at":"2026-08-12T04:25:35.881558Z","submitted_at":"2026-05-26T04:59:49Z","title":"SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks?","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T13:10:39.332264Z"},"links":{"citing_paper":"/paper/2605.26548"},"observation_digest":"sha256:5218d8c0c078768bc5c4f65ec9c6e75380d091fe4ab9ab0731544ae3534e0660","observation_id":"bedb53be-0590-4fac-ab8d-c6e1fd5599ad","resolution":{"observed_at":"2026-08-02T13:10:39.332264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T13:10:39.556798Z","title":"Haoyu Li, Xijia Che, Yanhao Wang, Xiaojing Liao, and Luyi Xing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26548","last_updated":"2026-07-20T16:24:12Z","snapshot_observed_at":"2026-08-12T04:25:35.881558Z","submitted_at":"2026-05-26T04:59:49Z","title":"SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks?","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T13:10:39.556798Z"},"links":{"citing_paper":"/paper/2605.26548"},"observation_digest":"sha256:b89de8c48b6421f7d8552262903645a2de47312bed1e6e35356244f1d7a993ad","observation_id":"7b050198-709c-47a4-aef4-f42089960311","resolution":{"observed_at":"2026-08-02T13:10:39.556798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T13:10:39.720845Z","title":"A Dual-Loop Agent Framework for Automated Vulnerability Reproduction.arXiv preprint arXiv:2602.05721,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26548","last_updated":"2026-07-20T16:24:12Z","snapshot_observed_at":"2026-08-12T04:25:35.881558Z","submitted_at":"2026-05-26T04:59:49Z","title":"SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks?","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T13:10:39.720845Z"},"links":{"citing_paper":"/paper/2605.26548"},"observation_digest":"sha256:c2ec261bc13c9bb1807eaad9c3f999051a612b2256272a4b481e88e571fcedcb","observation_id":"6ecd2d0d-a224-486d-a18a-db12c78eb25f","resolution":{"observed_at":"2026-08-02T13:10:39.720845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T13:10:39.806055Z","title":"Automated Vulnerability Validation and Verification: A Large Language Model Approach.arXiv preprint arXiv:2509.24037,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26548","last_updated":"2026-07-20T16:24:12Z","snapshot_observed_at":"2026-08-12T04:25:35.881558Z","submitted_at":"2026-05-26T04:59:49Z","title":"SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks?","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T13:10:39.806055Z"},"links":{"citing_paper":"/paper/2605.26548"},"observation_digest":"sha256:acd25751ca7a8c7e704eefc17bd924d416a9f8f7499b49245e4af77662ece588","observation_id":"e5277e74-807e-4536-a468-587eb7e192b3","resolution":{"observed_at":"2026-08-02T13:10:39.806055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02153","last_updated":"2026-06-19T00:49:28Z","snapshot_observed_at":"2026-08-12T23:08:48.049738Z","submitted_at":"2024-08-04T22:13:14Z","title":"ARVO: Atlas of Reproducible Vulnerabilities for Open-Source Software","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02153","snapshot_observed_at":"2026-08-02T13:10:39.908889Z","title":"ARVO: Atlas of Reproducible Vulnerabilities for Open Source Software.arXiv preprint arXiv:2408.02153,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26548","last_updated":"2026-07-20T16:24:12Z","snapshot_observed_at":"2026-08-12T04:25:35.881558Z","submitted_at":"2026-05-26T04:59:49Z","title":"SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks?","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T13:10:39.908889Z"},"links":{"cited_paper":"/paper/2408.02153","citing_paper":"/paper/2605.26548"},"observation_digest":"sha256:314963a79432b78383590c3fdea5e5834c913e6d52efcb24fc97d9542c336a7d","observation_id":"0a148fe4-ec80-4b6a-9cba-682de91936f7","resolution":{"observed_at":"2026-08-02T13:10:39.908889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T13:10:40.144901Z","title":"Codex Security.https://help.openai.com/articles/20001107, 2026a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26548","last_updated":"2026-07-20T16:24:12Z","snapshot_observed_at":"2026-08-12T04:25:35.881558Z","submitted_at":"2026-05-26T04:59:49Z","title":"SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks?","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T13:10:40.144901Z"},"links":{"citing_paper":"/paper/2605.26548"},"observation_digest":"sha256:62097dd6e249ed411ed6c695fa54b9768071787bd89865ffc9b9d7ecff978bb6","observation_id":"b97b4a4f-fc81-439c-b441-46569dc84bd0","resolution":{"observed_at":"2026-08-02T13:10:40.144901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T13:10:40.242592Z","title":"Patch-to-PoC: A Systematic Study of Agentic LLM Systems for Linux Kernel N-Day Reproduction.arXiv preprint arXiv:2602.07287,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26548","last_updated":"2026-07-20T16:24:12Z","snapshot_observed_at":"2026-08-12T04:25:35.881558Z","submitted_at":"2026-05-26T04:59:49Z","title":"SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks?","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T13:10:40.242592Z"},"links":{"citing_paper":"/paper/2605.26548"},"observation_digest":"sha256:5454604ddf1bc3659c2ce204d68d3610e6ae338c08a7609def153ba1cb78f517","observation_id":"8314cb41-31ea-4907-946f-eb1ec8b816b6","resolution":{"observed_at":"2026-08-02T13:10:40.242592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17218","last_updated":"2025-01-07T21:57:38Z","snapshot_observed_at":"2026-08-13T04:35:25.795590Z","submitted_at":"2024-03-25T21:47:36Z","title":"To Err is Machine: Vulnerability Detection Challenges LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17218","snapshot_observed_at":"2026-08-02T13:10:40.467725Z","title":"To Err is Machine: Vulnerability Detection Challenges LLM Reasoning.arXiv preprint arXiv:2403.17218,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26548","last_updated":"2026-07-20T16:24:12Z","snapshot_observed_at":"2026-08-12T04:25:35.881558Z","submitted_at":"2026-05-26T04:59:49Z","title":"SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks?","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T13:10:40.467725Z"},"links":{"cited_paper":"/paper/2403.17218","citing_paper":"/paper/2605.26548"},"observation_digest":"sha256:066368ea3ac44a787d5e0ae6c984c7e19f16b0ca4c60088ff56bfbc3f537a5e4","observation_id":"ca79777c-087b-4274-9059-94f8acdc096b","resolution":{"observed_at":"2026-08-02T13:10:40.467725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T13:10:40.602706Z","title":"From Naptime to Big Sleep: Using Large Language Models To Catch Vulnerabilities In Real-World Code.https://googleprojectzero.blogspot.com/2024/ 10/from-naptime-to-big-sleep.html,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26548","last_updated":"2026-07-20T16:24:12Z","snapshot_observed_at":"2026-08-12T04:25:35.881558Z","submitted_at":"2026-05-26T04:59:49Z","title":"SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks?","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T13:10:40.602706Z"},"links":{"citing_paper":"/paper/2605.26548"},"observation_digest":"sha256:d7106d679f62fdc33c607d71bab0860bd73f668aff09071a65831a2091f2d4a9","observation_id":"4dbca145-14d2-462f-976e-139eadd99315","resolution":{"observed_at":"2026-08-02T13:10:40.602706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T13:10:40.822958Z","title":"Coskun, and Gianluca Stringhini","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26548","last_updated":"2026-07-20T16:24:12Z","snapshot_observed_at":"2026-08-12T04:25:35.881558Z","submitted_at":"2026-05-26T04:59:49Z","title":"SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks?","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T13:10:40.822958Z"},"links":{"citing_paper":"/paper/2605.26548"},"observation_digest":"sha256:60399e644f68a71825bff9155f29bb2469c16b1534e113653859eda30127b2df","observation_id":"d49d6713-073a-4bee-8f1a-bf369c216c04","resolution":{"observed_at":"2026-08-02T13:10:40.822958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T13:10:40.977062Z","title":"From CVE Entries to Verifiable Exploits: An Automated Multi-Agent Framework for Reproducing CVEs.arXiv preprint arXiv:2509.01835,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26548","last_updated":"2026-07-20T16:24:12Z","snapshot_observed_at":"2026-08-12T04:25:35.881558Z","submitted_at":"2026-05-26T04:59:49Z","title":"SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks?","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T13:10:40.977062Z"},"links":{"citing_paper":"/paper/2605.26548"},"observation_digest":"sha256:ef20cd5415e7c4b37651050ce6765e940855c5b71af2056eb302e8e99b1a465a","observation_id":"11ee100e-dcd4-4f1c-8d52-2f76fa6c5f7f","resolution":{"observed_at":"2026-08-02T13:10:40.977062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T13:10:41.130975Z","title":"Zichao Wei, Jun Zeng, Ming Wen, Zeliang Yu, Kai Cheng, Yiding Zhu, Jingyi Guo, Shiqi Zhou, Le Yin, Xiaodong Su, and Zhechao Ma","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26548","last_updated":"2026-07-20T16:24:12Z","snapshot_observed_at":"2026-08-12T04:25:35.881558Z","submitted_at":"2026-05-26T04:59:49Z","title":"SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks?","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T13:10:41.130975Z"},"links":{"citing_paper":"/paper/2605.26548"},"observation_digest":"sha256:5ea77ebe1d67c77031258125c33914432bcddd153a4251f492cf2aa0220ae07c","observation_id":"f6040990-466e-48c2-9882-f4293c255258","resolution":{"observed_at":"2026-08-02T13:10:41.130975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T13:10:41.278384Z","title":"Why Is CSP Failing? Trends and Challenges in CSP Adoption","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2605.26548","last_updated":"2026-07-20T16:24:12Z","snapshot_observed_at":"2026-08-12T04:25:35.881558Z","submitted_at":"2026-05-26T04:59:49Z","title":"SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks?","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T13:10:41.278384Z"},"links":{"citing_paper":"/paper/2605.26548"},"observation_digest":"sha256:1c3cb2be59640fb160cc856a1c08827b79e4b0abd220938bf6b9ddac3b100c32","observation_id":"4101701b-1883-46c1-ab19-33749dc1f3b6","resolution":{"observed_at":"2026-08-02T13:10:41.278384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-07-29T17:17:07.530182Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.03546","snapshot_observed_at":"2026-08-02T13:10:41.424053Z","title":"URL https://doi.org/ 10.1007/978-3-319-11379-1_11","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26548","last_updated":"2026-07-20T16:24:12Z","snapshot_observed_at":"2026-08-12T04:25:35.881558Z","submitted_at":"2026-05-26T04:59:49Z","title":"SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks?","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T13:10:41.424053Z"},"links":{"cited_paper":"/paper/2605.03546","citing_paper":"/paper/2605.26548"},"observation_digest":"sha256:48ee57befd84e560396398a70f0e2e6f26609a60ea7293bf280cbcf4cedf1264","observation_id":"8877253a-ba49-450b-be39-ee7688061346","resolution":{"observed_at":"2026-08-02T13:10:41.424053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T13:10:41.589836Z","title":"Bhatia, Vikram Sivashankar, Yuxuan Bao, Dawn Song, Dan Boneh, Daniel Ho, and Percy Liang","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26548","last_updated":"2026-07-20T16:24:12Z","snapshot_observed_at":"2026-08-12T04:25:35.881558Z","submitted_at":"2026-05-26T04:59:49Z","title":"SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks?","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T13:10:41.589836Z"},"links":{"citing_paper":"/paper/2605.26548"},"observation_digest":"sha256:6c324794623f872fdd1148074e1524d933e368e7064a344e9e9cb0181d440b54","observation_id":"5df73039-f2a9-4449-9229-9451da11a600","resolution":{"observed_at":"2026-08-02T13:10:41.589836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T13:10:41.698626Z","title":"A Systematic Study on Generating Web Vulnerability Proof-of-Concepts Using Large Language Models.arXiv preprint arXiv:2510.10148,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26548","last_updated":"2026-07-20T16:24:12Z","snapshot_observed_at":"2026-08-12T04:25:35.881558Z","submitted_at":"2026-05-26T04:59:49Z","title":"SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks?","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T13:10:41.698626Z"},"links":{"citing_paper":"/paper/2605.26548"},"observation_digest":"sha256:2eaa1284ec37fbd473e5b44f4bbb150961749838f2398270e2a4315089d2fd53","observation_id":"11cfe1db-ee4d-4bb6-ac90-edee42727ef3","resolution":{"observed_at":"2026-08-02T13:10:41.698626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.11950","last_updated":"2026-07-08T17:49:21Z","snapshot_observed_at":"2026-08-11T06:54:34.293774Z","submitted_at":"2026-04-13T18:44:02Z","title":"AnyPoC: Universal Proof-of-Concept Test Generation for Scalable LLM-Based Bug Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.11950","snapshot_observed_at":"2026-08-02T13:10:41.788247Z","title":"AnyPoC: Universal Proof-of-Concept Test Generation for Scalable LLM-Based Bug Detec- tion.arXiv preprint arXiv:2604.11950,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26548","last_updated":"2026-07-20T16:24:12Z","snapshot_observed_at":"2026-08-12T04:25:35.881558Z","submitted_at":"2026-05-26T04:59:49Z","title":"SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks?","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T13:10:41.788247Z"},"links":{"cited_paper":"/paper/2604.11950","citing_paper":"/paper/2605.26548"},"observation_digest":"sha256:8196b67c86a085d97afa24580a1b6c3a6d837d747d55011474d254428ddbe6c7","observation_id":"a058625f-3062-4926-af18-8be7bda83573","resolution":{"observed_at":"2026-08-02T13:10:41.788247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15241","last_updated":"2025-07-21T04:55:34Z","snapshot_observed_at":"2026-08-13T08:50:28.353701Z","submitted_at":"2025-07-21T04:55:34Z","title":"FaultLine: Automated Proof-of-Vulnerability Generation Using LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15241","snapshot_observed_at":"2026-08-02T13:10:40.014171Z","title":"FaultLine: Automated Proof-of-Vulnerability Generation Using LLM Agents.arXiv preprint arXiv:2507.15241,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26548","last_updated":"2026-07-20T16:24:12Z","snapshot_observed_at":"2026-08-12T04:25:35.881558Z","submitted_at":"2026-05-26T04:59:49Z","title":"SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks?","version":2},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-02T13:10:40.014171Z"},"links":{"cited_paper":"/paper/2507.15241","citing_paper":"/paper/2605.26548"},"observation_digest":"sha256:e18e3b9375a0c4278576c365ad7be7a54ce09755683bf1cb1792d940a72a2a8b","observation_id":"5f986cd1-df99-4d0d-b9d3-14d0fac539bd","resolution":{"observed_at":"2026-08-02T13:10:40.014171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T13:10:39.440957Z","title":"ZeroDayBench: Evalu- ating LLM Agents on Unseen Zero-Day Vulnerabilities for Cyberdefense.arXiv preprint arXiv:2603.02297,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26548","last_updated":"2026-07-20T16:24:12Z","snapshot_observed_at":"2026-08-12T04:25:35.881558Z","submitted_at":"2026-05-26T04:59:49Z","title":"SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks?","version":2},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-02T13:10:39.440957Z"},"links":{"citing_paper":"/paper/2605.26548"},"observation_digest":"sha256:be61cff2e75a0140b78f867a6eea3ef33a38a8ff44d8159ec991027769eb3ce5","observation_id":"94eda813-e819-4078-9c09-76ab404abcdb","resolution":{"observed_at":"2026-08-02T13:10:39.440957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04962","last_updated":"2026-06-28T09:23:55Z","snapshot_observed_at":"2026-08-07T10:27:10.848359Z","submitted_at":"2025-06-05T12:37:33Z","title":"PoCGen: Generating Proof-of-Concept Exploits for Vulnerabilities in Npm Packages","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04962","snapshot_observed_at":"2026-08-02T13:10:40.346309Z","title":"Deniz Simsek, Aryaz Eghbali, and Michael Pradel","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26548","last_updated":"2026-07-20T16:24:12Z","snapshot_observed_at":"2026-08-12T04:25:35.881558Z","submitted_at":"2026-05-26T04:59:49Z","title":"SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks?","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T13:10:40.346309Z"},"links":{"cited_paper":"/paper/2506.04962","citing_paper":"/paper/2605.26548"},"observation_digest":"sha256:971f5f445aeff6b54dc29029158c4c4d2b069b2bd7cfab614b160ac14a43231e","observation_id":"4dfba7bd-f1fb-4ba8-ba56-651694406fa0","resolution":{"observed_at":"2026-08-02T13:10:40.346309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T13:10:39.179091Z","title":"Context Length Alone Hurts LLM Performance Despite Perfect Retrieval","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26548","last_updated":"2026-07-20T16:24:12Z","snapshot_observed_at":"2026-08-12T04:25:35.881558Z","submitted_at":"2026-05-26T04:59:49Z","title":"SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks?","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T13:10:39.179091Z"},"links":{"citing_paper":"/paper/2605.26548"},"observation_digest":"sha256:e8d6784c0d9b4a792c6444756a7c4a04356ae964457c1407547067f8723f3e54","observation_id":"41e5fc11-617f-4f8b-b02b-316fb5fafc8a","resolution":{"observed_at":"2026-08-02T13:10:39.179091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T13:10:38.958167Z","title":"Introducing Claude Opus 4.6","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.26548","last_updated":"2026-07-20T16:24:12Z","snapshot_observed_at":"2026-08-12T04:25:35.881558Z","submitted_at":"2026-05-26T04:59:49Z","title":"SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks?","version":2},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-02T13:10:38.958167Z"},"links":{"citing_paper":"/paper/2605.26548"},"observation_digest":"sha256:bd952049c5f39ac9022ab3769e57dbdac533a19d6024d2e7879eaa244f38ce0e","observation_id":"a7d3e999-f2db-44ae-b16f-49e938e61a34","resolution":{"observed_at":"2026-08-02T13:10:38.958167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.26548","last_updated":"2026-07-20T16:24:12Z","latest_version":2,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-12T04:25:35.881558Z","submitted_at":"2026-05-26T04:59:49Z","title":"SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks?"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2605.26548."}