{"as_of":"2026-08-19T08:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f67d6b1c04177c2d28061cedd52f2cb7afd4ad0d6e64e4093b29dcf06f15a4fa","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T21:23:33.680086Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:08:52.579973Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-16T11:08:54.189638Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-18T23:13:36.904126Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"cited_work":{"arxiv_id":"2411.08813","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.08813","snapshot_observed_at":"2026-08-16T11:08:54.189638Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","venue":"cs.AI","work_id":"1ba01e47-fc47-40ea-b531-2d36e36fdf8b","year":2024},"citing_paper":{"arxiv_id":"2504.16429","last_updated":"2025-04-23T05:27:27Z","snapshot_observed_at":"2026-08-18T23:13:13.740494Z","submitted_at":"2025-04-23T05:27:27Z","title":"Give LLMs a Security Course: Securing Retrieval-Augmented Code Generation via Knowledge Injection","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:52.579973Z"},"links":{"cited_paper":"/paper/2411.08813","citing_paper":"/paper/2504.16429"},"observation_digest":"sha256:dd4f38c7a79a8d98b8d8ec68d2054b33fca51dbff20eae4775308687f08b04e3","observation_id":"3c598cbb-952b-4a90-8b7c-c2fb276ad48b","resolution":{"observed_at":"2026-08-16T11:08:54.264098Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-18T23:13:36.904126Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08813","snapshot_observed_at":"2026-08-03T23:50:49.232342Z","title":"Rethinking cyberseceval: An llm-aided approach to evaluation critique,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.03898","last_updated":"2025-11-05T22:46:24Z","snapshot_observed_at":"2026-08-17T23:08:03.289536Z","submitted_at":"2025-11-05T22:46:24Z","title":"Secure Code Generation at Scale with Reflexion","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T23:50:49.232342Z"},"links":{"cited_paper":"/paper/2411.08813","citing_paper":"/paper/2511.03898"},"observation_digest":"sha256:e90c21a2599f37cad3ae1d31b64b0f72e1f73e03cfd78c9bdbec4a1ec6aee7a0","observation_id":"d5e2da5e-bbbe-4567-a33b-8b8711e59f40","resolution":{"observed_at":"2026-08-03T23:50:49.232342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.08813/citation-record","integrity":"/paper/2411.08813/integrity","json":"/paper/2411.08813/citation-record.json","paper":"/paper/2411.08813"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.04724","last_updated":"2023-12-07T22:07:54Z","snapshot_observed_at":"2026-08-16T14:36:40.398299Z","submitted_at":"2023-12-07T22:07:54Z","title":"Purple Llama CyberSecEval: A Secure Coding Benchmark for Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04724","snapshot_observed_at":"2026-08-12T21:23:33.424186Z","title":"Purple llama cyberseceval: A secure coding benchmark for language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-18T23:13:36.904126Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T21:23:33.424186Z"},"links":{"cited_paper":"/paper/2312.04724","citing_paper":"/paper/2411.08813"},"observation_digest":"sha256:72d6e5c06f927e47182411a737754e11d3edbfb274a80b40932d3d7003ea9a4d","observation_id":"dc0008f8-dfc7-45ed-827f-313574a9c126","resolution":{"observed_at":"2026-08-12T21:23:33.424186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13161","last_updated":"2024-04-19T20:11:12Z","snapshot_observed_at":"2026-08-16T13:59:21.695627Z","submitted_at":"2024-04-19T20:11:12Z","title":"CyberSecEval 2: A Wide-Ranging Cybersecurity Evaluation Suite for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13161","snapshot_observed_at":"2026-08-12T21:23:33.471691Z","title":"Cyberseceval 2: A wide-ranging cybersecurity evaluation suite for large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-18T23:13:36.904126Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T21:23:33.471691Z"},"links":{"cited_paper":"/paper/2404.13161","citing_paper":"/paper/2411.08813"},"observation_digest":"sha256:6bf0fe0758349510776f4d7ca5d3a750e1d158b54238a028544cc37c593b881c","observation_id":"e17d0dc0-e8d4-46e3-8385-da6f85a08d9d","resolution":{"observed_at":"2026-08-12T21:23:33.471691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:23:34.728497Z","title":"Common Weakness Enumeration","venue":null,"work_id":"ac0fb5a4-15bd-4cef-a26c-0ea7d73b30d4","year":2023},"citing_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-18T23:13:36.904126Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T21:23:33.522370Z"},"links":{"citing_paper":"/paper/2411.08813"},"observation_digest":"sha256:654d795a6cc4a38223cd12dc2f5361eeab0ce46f9a1b1d04816cea47f87ad4bf","observation_id":"9e79be6e-43be-41a1-a73e-32c480cb72f8","resolution":{"observed_at":"2026-08-12T21:23:34.733229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:23:34.712159Z","title":"Common Weakness Enumeration","venue":null,"work_id":"707d46b5-d635-41c9-9995-6c42467c6408","year":2023},"citing_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-18T23:13:36.904126Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T21:23:33.560177Z"},"links":{"citing_paper":"/paper/2411.08813"},"observation_digest":"sha256:b8f3728d477d559d019270d24486b0e23eb8265436c97b95249f9f92ecad55e8","observation_id":"b65cbe64-8059-4091-841f-d6abdafbfcbc","resolution":{"observed_at":"2026-08-12T21:23:34.717042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:23:34.697194Z","title":"Semgrep: Lightweight static analysis for many languages","venue":null,"work_id":"277bf4dd-834e-48a4-9a64-55d49e140b6f","year":2024},"citing_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-18T23:13:36.904126Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T21:23:33.565662Z"},"links":{"citing_paper":"/paper/2411.08813"},"observation_digest":"sha256:708a61ade38a95a99079e91b2abc233a284b1173c2581804b856b523ace13200","observation_id":"55b76bea-45fc-40fc-b74f-055aa0a4f28a","resolution":{"observed_at":"2026-08-12T21:23:34.701977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:23:34.597237Z","title":"Cyberseceval 3: Advancing the evaluation of cybersecurity risks and capabilities in large language models,","venue":null,"work_id":"53d3327c-b003-42d8-93df-20653745e72a","year":null},"citing_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-18T23:13:36.904126Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T21:23:33.570960Z"},"links":{"citing_paper":"/paper/2411.08813"},"observation_digest":"sha256:8193042a1cc45d2b55ee22f72e387978419357fdfb7b547ef426fe00bf2f7487","observation_id":"7233fb6d-c203-4310-beb1-4f0023c08e30","resolution":{"observed_at":"2026-08-12T21:23:34.649360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:23:34.295714Z","title":"Our goal was to demonstrate statistical variability between our work and Meta’s previous work, we demonstrate this by highlighting percentage point residuals in Section 2","venue":null,"work_id":"d7e86c91-a649-4969-aec0-e72daa3fcc9f","year":null},"citing_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-18T23:13:36.904126Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T21:23:33.615314Z"},"links":{"citing_paper":"/paper/2411.08813"},"observation_digest":"sha256:bceb19b1b5a64fb01e371a9fe9c49f389782a2831817ac578e10d1bb5ea5f401","observation_id":"c56cd304-26ef-4b64-b7e7-229c15a6fa3b","resolution":{"observed_at":"2026-08-12T21:23:34.405324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:23:34.527169Z","title":"This is reflected in our experiments and results","venue":null,"work_id":"9eb61138-83d6-4772-b5e3-8f5c4f7964a8","year":null},"citing_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-18T23:13:36.904126Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T21:23:33.581798Z"},"links":{"citing_paper":"/paper/2411.08813"},"observation_digest":"sha256:38d7a08416b4b7c556f3f13012b8e14561cc64fa81addd8dbf9e7dca2d7e4889","observation_id":"13311f67-440b-4466-941f-f69621516aa6","resolution":{"observed_at":"2026-08-12T21:23:34.532247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:23:34.512303Z","title":"Limitations","venue":null,"work_id":"59d2914d-a708-42f7-a8d5-16bf11cf275b","year":null},"citing_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-18T23:13:36.904126Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T21:23:33.587192Z"},"links":{"citing_paper":"/paper/2411.08813"},"observation_digest":"sha256:3a9004513605ccd1e82dde567c477c9f2c44f72dbeb4a9dacf924806bcdf658b","observation_id":"34352644-6cb7-427a-b988-8f1c1d5e729e","resolution":{"observed_at":"2026-08-12T21:23:34.517128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:23:34.496302Z","title":"Guidelines: • The answer NA means that the paper does not include theoretical results","venue":null,"work_id":"d03b8c9a-ade8-46a0-b213-cf8502e2d94a","year":null},"citing_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-18T23:13:36.904126Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T21:23:33.592485Z"},"links":{"citing_paper":"/paper/2411.08813"},"observation_digest":"sha256:a12e63443fde37f5ab785d4437705010d0a5d155cc89467fde5f727ecd25009b","observation_id":"efffe38e-06bd-4e1e-953f-ea0581de270a","resolution":{"observed_at":"2026-08-12T21:23:34.502045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:23:34.481811Z","title":"Code and data is present in our linked repository","venue":null,"work_id":"bbeb5e41-2af9-44af-a3c8-93633df0f678","year":null},"citing_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-18T23:13:36.904126Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T21:23:33.597606Z"},"links":{"citing_paper":"/paper/2411.08813"},"observation_digest":"sha256:02c66d2c0b310f72a0743a10d6d48e3056ce353b0eb40dd262f031f3f0666bed","observation_id":"fe63cb25-5d50-4d1e-880f-e079edf0d9ab","resolution":{"observed_at":"2026-08-12T21:23:34.486508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:23:34.466504Z","title":"Guidelines: • The answer NA means that paper does not include experiments requiring code","venue":null,"work_id":"0c2cc43c-5c40-4756-9636-32e947cfa3b4","year":null},"citing_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-18T23:13:36.904126Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T21:23:33.603534Z"},"links":{"citing_paper":"/paper/2411.08813"},"observation_digest":"sha256:c0574df6e91c782e968d81eede8090089c8e640f52169300ee7c3e5601ab0030","observation_id":"b8ac6a2f-bdb0-472d-816e-3ae1135398da","resolution":{"observed_at":"2026-08-12T21:23:34.470950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:23:34.451344Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"28152b19-3b07-460c-972e-476e0d61dcd2","year":null},"citing_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-18T23:13:36.904126Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T21:23:33.610311Z"},"links":{"citing_paper":"/paper/2411.08813"},"observation_digest":"sha256:091d09662739e2c42a482c19e255e0985da909f646800830224b8d49561661f5","observation_id":"a152e23e-d69a-41e6-8e47-768e07e15d6c","resolution":{"observed_at":"2026-08-12T21:23:34.456399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:23:33.920776Z","title":"Guidelines: • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"52a86da7-3c05-41e4-8b1d-83899fc5f58d","year":null},"citing_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-18T23:13:36.904126Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T21:23:33.652249Z"},"links":{"citing_paper":"/paper/2411.08813"},"observation_digest":"sha256:1f0a8164deb73ab71ada7277cd6959019b8657ddfb4ff5a87b11140af6ec9d5f","observation_id":"e02a0739-a668-4693-90db-59c44f080336","resolution":{"observed_at":"2026-08-12T21:23:33.926506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:23:34.193363Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"5548b31e-a38b-4c89-a924-2fb676f336bb","year":null},"citing_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-18T23:13:36.904126Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T21:23:33.620665Z"},"links":{"citing_paper":"/paper/2411.08813"},"observation_digest":"sha256:a1093f891b2018b55b28a017a98968c2bb57d133d6db04a5760eb2d0f9825dac","observation_id":"7dcc8101-474b-4cbb-85ce-b15e954feade","resolution":{"observed_at":"2026-08-12T21:23:34.206401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:23:34.177767Z","title":"Guidelines: • The answer NA means that the authors have not reviewed the NeurIPS Code of Ethics","venue":null,"work_id":"873ac2ad-c91f-4194-b875-b09d069e8c33","year":null},"citing_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-18T23:13:36.904126Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T21:23:33.625977Z"},"links":{"citing_paper":"/paper/2411.08813"},"observation_digest":"sha256:a651be676873eb50214f89d1bede86d6f5aa17a13aea1c5e8ca29448e4ea5cfc","observation_id":"d6079ee3-1e2a-477d-9799-39935b3bf0c3","resolution":{"observed_at":"2026-08-12T21:23:34.182711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:23:34.160216Z","title":"Guidelines: • The answer NA means that there is no societal impact of the work performed","venue":null,"work_id":"fe01bf76-8ea4-4068-9f7a-52abf8cce64d","year":null},"citing_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-18T23:13:36.904126Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T21:23:33.630343Z"},"links":{"citing_paper":"/paper/2411.08813"},"observation_digest":"sha256:a5f6690960278484254e07eb6b6eac1a345fc772d3096c8aa17b2999bceff7e9","observation_id":"7562f6e1-7dae-45c4-b6b6-6258205171fd","resolution":{"observed_at":"2026-08-12T21:23:34.166596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:23:33.972628Z","title":"Justification: Our research rests on a critique of a previously formulated benchmark, rather than the release of a model or data that can pose risks","venue":null,"work_id":"a8f8cea9-c276-4075-bb42-442b137c24da","year":null},"citing_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-18T23:13:36.904126Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T21:23:33.635289Z"},"links":{"citing_paper":"/paper/2411.08813"},"observation_digest":"sha256:66706f858599a7a07a5c2269a171f7e4875fc4603821acd5885b5008dc40e311","observation_id":"5911e6ff-5788-4f03-9150-d3607f18e3d8","resolution":{"observed_at":"2026-08-12T21:23:34.055207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:23:33.955280Z","title":"Any past research that has informed our own work is explicitly referenced","venue":null,"work_id":"118c1d8f-6a2f-4d8f-a099-f9c764b93220","year":null},"citing_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-18T23:13:36.904126Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T21:23:33.641021Z"},"links":{"citing_paper":"/paper/2411.08813"},"observation_digest":"sha256:eea6493fba7a17cce98c5ae5cb66348785e882cf0b5a05aefa10edd845690fa7","observation_id":"14ba8f22-f47f-4f6d-8903-ba40c4382788","resolution":{"observed_at":"2026-08-12T21:23:33.961039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:23:33.937875Z","title":"Guidelines: • The answer NA means that the paper does not release new assets","venue":null,"work_id":"fe5b2183-91e8-4651-aea7-a78c6b33c704","year":null},"citing_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-18T23:13:36.904126Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T21:23:33.646336Z"},"links":{"citing_paper":"/paper/2411.08813"},"observation_digest":"sha256:f33093341419f158a8380e38d5e23e07a3c496f5e03c76ba60fd1988dae9c72b","observation_id":"063c1870-8160-4271-b491-bbf733e2ce6b","resolution":{"observed_at":"2026-08-12T21:23:33.943599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:23:33.811457Z","title":"Guidelines: • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"ea21f742-178d-4642-939c-35277b6f1cec","year":null},"citing_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-18T23:13:36.904126Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T21:23:33.680086Z"},"links":{"citing_paper":"/paper/2411.08813"},"observation_digest":"sha256:98139063141521208d3f0337d870faaf213163f6c5da546d727fd014b5ba5d81","observation_id":"dda8eebc-4db9-46ce-9527-b203d7261e30","resolution":{"observed_at":"2026-08-12T21:23:33.873318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01605","last_updated":"2024-09-06T18:17:07Z","snapshot_observed_at":"2026-08-17T13:38:26.821590Z","submitted_at":"2024-08-02T23:47:27Z","title":"CYBERSECEVAL 3: Advancing the Evaluation of Cybersecurity Risks and Capabilities in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01605","snapshot_observed_at":"2026-08-12T21:23:33.576348Z","title":"Using rand() for random number generation is insecure due to the weakness of the underlying algorithm","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-18T23:13:36.904126Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T21:23:33.576348Z"},"links":{"cited_paper":"/paper/2408.01605","citing_paper":"/paper/2411.08813"},"observation_digest":"sha256:78c3ae39c6d87efb78b58e8824da2849cb30a134e1583819b427503ccd311800","observation_id":"6c8c340b-eab1-4714-b014-f49eaefd3efe","resolution":{"observed_at":"2026-08-12T21:23:33.576348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-18T23:13:36.904126Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":0,"verified_fuzzy":19},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 2 inbound Pith citation observations for arXiv:2411.08813."}