{"as_of":"2026-08-17T00:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5619f9f2ca71ffcf3378671256f18b8c6843574f80de0bf050feb1ba9d981cd9","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:53:33.486755Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:25:15.771731Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T23:51:45.015967Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14682","snapshot_observed_at":"2026-08-06T14:25:15.771731Z","title":"Airtbench: Measuring autonomous ai red teaming capabilities in language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19399","last_updated":"2025-07-25T16:06:16Z","snapshot_observed_at":"2026-08-16T16:08:33.634938Z","submitted_at":"2025-07-25T16:06:16Z","title":"Running in CIRCLE? A Simple Benchmark for LLM Code Interpreter Security","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T14:25:15.771731Z"},"links":{"cited_paper":"/paper/2506.14682","citing_paper":"/paper/2507.19399"},"observation_digest":"sha256:c8af7a7c47944ae61b582b045299ce4a26e0428fb84a189015a81da7abe7ac7b","observation_id":"d2a4ce5b-b37f-44f8-b429-c30af3ddcabc","resolution":{"observed_at":"2026-08-06T14:25:15.771731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14682","snapshot_observed_at":"2026-08-04T00:09:33.025834Z","title":"Airtbench: Measuring autonomous ai red teaming capabilities in language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02780","last_updated":"2026-02-23T13:17:25Z","snapshot_observed_at":"2026-08-15T00:24:37.042566Z","submitted_at":"2025-11-04T18:03:12Z","title":"PoCo: Agentic Proof-of-Concept Exploit Generation for Smart Contracts","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T00:09:33.025834Z"},"links":{"cited_paper":"/paper/2506.14682","citing_paper":"/paper/2511.02780"},"observation_digest":"sha256:805ff945262682675ef2f60a0c8fc56fc89f20402c5ca40e1ae53103f7512e5a","observation_id":"3dff4f9f-4458-46a4-955f-7c6083e29f80","resolution":{"observed_at":"2026-08-04T00:09:33.025834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"cited_work":{"arxiv_id":"2506.14682","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.14682","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models.arXiv preprint arXiv:2506.14682","venue":null,"work_id":"d0eb801c-02e0-4911-a89d-2a84867e01f4","year":null},"citing_paper":{"arxiv_id":"2605.04019","last_updated":"2026-05-05T17:43:52Z","snapshot_observed_at":"2026-08-14T01:28:50.207494Z","submitted_at":"2026-05-05T17:43:52Z","title":"Redefining AI Red Teaming in the Agentic Era: From Weeks to Hours","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-07T16:06:18.057868Z"},"links":{"cited_paper":"/paper/2506.14682","citing_paper":"/paper/2605.04019"},"observation_digest":"sha256:6022173cc62b9f6d6cdfa8376d6145b41a5738eaac5abe85af604d6155d4cd1b","observation_id":"898cf871-8391-4070-931f-3fb691354ef7","resolution":{"observed_at":"2026-05-11T23:51:45.056581Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.14682/citation-record","integrity":"/paper/2506.14682/integrity","json":"/paper/2506.14682/citation-record.json","paper":"/paper/2506.14682"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.17238","last_updated":"2025-04-06T23:46:59Z","snapshot_observed_at":"2026-08-16T13:49:00.723459Z","submitted_at":"2024-05-27T14:53:35Z","title":"IRIS: LLM-Assisted Static Analysis for Detecting Security Vulnerabilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17238","snapshot_observed_at":"2026-08-15T19:53:32.591918Z","title":"Llm-assisted static analysis for detecting security vulnerabilities, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.591918Z"},"links":{"cited_paper":"/paper/2405.17238","citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:ecd86b71900b77a01baf375b1ac9f268374bd3deb8105628a568b8df579e02cf","observation_id":"5786a459-44e7-455b-ae16-95ad0238f8f1","resolution":{"observed_at":"2026-08-15T19:53:32.591918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07049","last_updated":"2025-02-12T23:19:23Z","snapshot_observed_at":"2026-08-16T07:59:02.968423Z","submitted_at":"2025-02-10T21:33:38Z","title":"LLMs in Software Security: A Survey of Vulnerability Detection Techniques and Insights","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07049","snapshot_observed_at":"2026-08-15T19:53:32.622526Z","title":"Llms in software security: A survey of vulnerability detection techniques and insights, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.622526Z"},"links":{"cited_paper":"/paper/2502.07049","citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:5dd4bf2ef19540712cc443bc62edc93a7698a7add2fd0f111bf7ae5cdfce6f8c","observation_id":"d6d8958e-1ec8-4462-9ae4-d15fa45b3c4b","resolution":{"observed_at":"2026-08-15T19:53:32.622526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11814","last_updated":"2024-02-19T04:08:44Z","snapshot_observed_at":"2026-08-16T14:17:30.139500Z","submitted_at":"2024-02-19T04:08:44Z","title":"An Empirical Evaluation of LLMs for Solving Offensive Security Challenges","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11814","snapshot_observed_at":"2026-08-15T19:53:32.627164Z","title":"An empirical evaluation of llms for solving offensive security chal- lenges, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.627164Z"},"links":{"cited_paper":"/paper/2402.11814","citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:0bc4d240fb00be417661f2dbbfdf676efe76d05411a159c0548676606fef90a7","observation_id":"a2bdf34d-1c59-44e8-ba29-1d6dd7929034","resolution":{"observed_at":"2026-08-15T19:53:32.627164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06664","last_updated":"2024-02-16T04:02:51Z","snapshot_observed_at":"2026-08-16T14:20:59.361566Z","submitted_at":"2024-02-06T14:46:08Z","title":"LLM Agents can Autonomously Hack Websites","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06664","snapshot_observed_at":"2026-08-15T19:53:32.631740Z","title":"Llm agents can autonomously hack websites, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.631740Z"},"links":{"cited_paper":"/paper/2402.06664","citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:d6d0d7c2ed73e5ea8ce1e2c523621f2d1d4c4feb2a350296306bc6ef2e533e32","observation_id":"8cdf4899-13d1-4341-9b92-d3897291a8c3","resolution":{"observed_at":"2026-08-15T19:53:32.631740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:53:34.294456Z","title":"Llm4decompile: Decompilingbinarycodewithlargelanguagemodels,","venue":null,"work_id":"9c19f258-a6b9-4965-bc5a-ff47ba6b2ccd","year":null},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.637031Z"},"links":{"citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:c193523c7f092eb87734fcc829b593fe3e4bbd42d01d29acd495e7f1802b762a","observation_id":"b8956961-49fd-4354-b263-91394b2e0055","resolution":{"observed_at":"2026-08-15T19:53:34.298021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-15T19:53:32.644504Z","title":"Evaluating large language models trained on code, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.644504Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:c0d37c13b263dd6cc4a340f5b7c8ced5be43a96c93b6acff183c081f257f5fa8","observation_id":"f6cc0e37-7723-497a-a17c-3d861bd3a300","resolution":{"observed_at":"2026-08-15T19:53:32.644504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:53:34.284290Z","title":"ATLAS - Adversarial Threat Landscape for Artificial-Intelligence Systems","venue":null,"work_id":"f56a9084-3028-4d19-a484-555c5237e2d8","year":2024},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.674375Z"},"links":{"citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:aa3d817f392ed2415d76661daf24aeb9b82bc7eaa0d64c2a008ca44e2ef85a22","observation_id":"b17f629e-780e-4ca8-b4e4-0430f937be60","resolution":{"observed_at":"2026-08-15T19:53:34.287871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:53:34.269183Z","title":"OWASP Top Ten for Large Language Model Applications","venue":null,"work_id":"bcf97634-7922-4b03-906a-116a08d1c9ca","year":2024},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.679927Z"},"links":{"citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:1277ff180b097d565de169a8acbabb9db30c283ec05e3b1fb7299c1f30d0d481","observation_id":"a10781cf-654c-441a-ac0e-f37410e03917","resolution":{"observed_at":"2026-08-15T19:53:34.276513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-15T19:53:32.684251Z","title":"Measuring massive multitask language understanding, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.684251Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:f2ebc3d75cba9a1e46b2b931e0dba36291e01b97228f81a0cffcc979d4ed9ff5","observation_id":"cd5fef5e-240c-472a-953b-0c62d239a656","resolution":{"observed_at":"2026-08-15T19:53:32.684251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-15T19:53:32.689085Z","title":"Training verifiers to solve math word problems, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.689085Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:336c84c3ce8e0cb7c7d9d936970eb5fd3063114ec06fc18f5390bab23ee9be90","observation_id":"ee12daaa-f90a-435c-a0a1-70b9f18a4511","resolution":{"observed_at":"2026-08-15T19:53:32.689085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T19:53:32.693437Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforce- ment learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.693437Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:1e5f8ca9e8a3b6f4fcd0dd8a3607cf62c9d8b73fdc3522cf9154e1eb9b4c5e8c","observation_id":"786fffbf-ad22-4c29-9c6b-fc7f941845ed","resolution":{"observed_at":"2026-08-15T19:53:32.693437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:53:34.257233Z","title":"OpenAI o1 System Card","venue":null,"work_id":"c5989ed0-3e73-4381-a935-1e4730790d0f","year":2024},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.697337Z"},"links":{"citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:7bdd58e74d8f79cda842f8ac7c0ba7c53ccb6342f801597eccf33d111f704dae","observation_id":"1aec31e9-929e-4d0b-91d4-37a68ad00980","resolution":{"observed_at":"2026-08-15T19:53:34.262382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14963","last_updated":"2025-03-27T07:08:33Z","snapshot_observed_at":"2026-08-16T13:58:33.568799Z","submitted_at":"2024-04-23T12:16:05Z","title":"Achieving >97% on GSM8K: Deeply Understanding the Problems Makes LLMs Better Solvers for Math Word Problems","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14963","snapshot_observed_at":"2026-08-15T19:53:32.701223Z","title":"Achieving >97better solvers for math word problems, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.701223Z"},"links":{"cited_paper":"/paper/2404.14963","citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:a32507a5d2c1566fb2476ab2e9b1ef07ccb49e25010c439c973498398d0ed16d","observation_id":"648e0d2c-4834-4711-b100-5d48e8b50c1e","resolution":{"observed_at":"2026-08-15T19:53:32.701223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12644","last_updated":"2025-07-21T01:47:18Z","snapshot_observed_at":"2026-08-16T13:41:48.765760Z","submitted_at":"2024-06-18T14:12:27Z","title":"Hierarchical Prompting Taxonomy: A Universal Evaluation Framework for Large Language Models Aligned with Human Cognitive Principles","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12644","snapshot_observed_at":"2026-08-15T19:53:32.705945Z","title":"Hierarchical prompting taxonomy: A universal evaluation framework for large language models aligned with human cognitive principles, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.705945Z"},"links":{"cited_paper":"/paper/2406.12644","citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:f536ac61bd1de35f03311290b448f3c094e87e3d9784582e7f275b26a861b837","observation_id":"37b18dbc-7422-4518-9dc3-0f954283512b","resolution":{"observed_at":"2026-08-15T19:53:32.705945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-08-12T14:56:35.025839Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-08-15T19:53:32.725506Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.725506Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:ed281a8c52de3256810809366d39e616a270d783bc444cb4c091e07be7e9bde5","observation_id":"415e0e21-ec74-46e4-b7a1-af7ae258fcce","resolution":{"observed_at":"2026-08-15T19:53:32.725506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:53:34.209420Z","title":"Jimenez, John Yang, Kai Liu, and Aleksander Madry","venue":null,"work_id":"03b59187-5d4c-4b7d-9a45-962033314789","year":2024},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.756599Z"},"links":{"citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:502181377a543a5a6528add8f033f758eb5aa423392e5e0600ed47a4ec282b5c","observation_id":"08056cae-2d1e-4ed9-962f-f7d42c40eb71","resolution":{"observed_at":"2026-08-15T19:53:34.249705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-14T22:26:00.902198Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-15T19:53:32.783357Z","title":"Osworld: Benchmarking multimodal agents for open-ended tasks in real computer environments, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.783357Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:f2e2b7039b048bbe0174d28229b87bea54d5308a5cf196e7d89b9631d8998c51","observation_id":"113acd9c-9a00-4443-9b82-41d4088c02d2","resolution":{"observed_at":"2026-08-15T19:53:32.783357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03688","last_updated":"2025-10-04T03:54:18Z","snapshot_observed_at":"2026-08-16T00:51:32.846970Z","submitted_at":"2023-08-07T16:08:11Z","title":"AgentBench: Evaluating LLMs as Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03688","snapshot_observed_at":"2026-08-15T19:53:32.791730Z","title":"Agentbench: Evaluating llms as agents, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.791730Z"},"links":{"cited_paper":"/paper/2308.03688","citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:d4de3db68b67d76e90a6ea5240dfce623c0af3639702e48eb85e61fac2e45bd5","observation_id":"a39166fe-2e49-45b5-96c4-593488160ad8","resolution":{"observed_at":"2026-08-15T19:53:32.791730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13854","last_updated":"2024-04-16T15:13:18Z","snapshot_observed_at":"2026-08-14T11:14:55.351653Z","submitted_at":"2023-07-25T22:59:32Z","title":"WebArena: A Realistic Web Environment for Building Autonomous Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13854","snapshot_observed_at":"2026-08-15T19:53:32.795634Z","title":"Webarena: A realistic web environment for building autonomous agents, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.795634Z"},"links":{"cited_paper":"/paper/2307.13854","citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:72dff3314f85ee58a3226e1aceafcbdf06772be695928632b29420dbcc1f542f","observation_id":"1ac4ff36-5be3-4839-8875-091815b144b3","resolution":{"observed_at":"2026-08-15T19:53:32.795634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.06070","last_updated":"2023-12-09T05:57:46Z","snapshot_observed_at":"2026-08-14T08:19:18.935225Z","submitted_at":"2023-06-09T17:44:31Z","title":"Mind2Web: Towards a Generalist Agent for the Web","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.06070","snapshot_observed_at":"2026-08-15T19:53:32.803200Z","title":"Mind2web: Towards a generalist agent for the web, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.803200Z"},"links":{"cited_paper":"/paper/2306.06070","citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:8beb5778a6c6508f73dfe6ad7a3429f518f2d7e98f3b58da99a72fe1296f968a","observation_id":"b8383111-e426-45e0-b10a-14028c21132d","resolution":{"observed_at":"2026-08-15T19:53:32.803200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15793","last_updated":"2024-11-11T20:01:15Z","snapshot_observed_at":"2026-07-06T18:19:29.996982Z","submitted_at":"2024-05-06T17:41:33Z","title":"SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15793","snapshot_observed_at":"2026-08-15T19:53:32.807624Z","title":"Swe-agent: Agent-computer interfaces enable automated software en- gineering, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.807624Z"},"links":{"cited_paper":"/paper/2405.15793","citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:867797cbcef5c3acd375f7ab485f6b9626afb4345569876f12ecf2fbbd56cd61","observation_id":"1608e2a3-8a37-42b2-9663-684db5f7e669","resolution":{"observed_at":"2026-08-15T19:53:32.807624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:53:34.107486Z","title":null,"venue":null,"work_id":"1197e51d-89e8-4c26-9395-42328557a4d8","year":2024},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.814010Z"},"links":{"citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:f72fe6031447eb32b71b64e186bd52f9faebf467d83bece57b3d95e259830db9","observation_id":"dd6e4679-7a17-4487-8954-34b71f13326a","resolution":{"observed_at":"2026-08-15T19:53:34.149152Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14898","last_updated":"2023-10-30T17:52:18Z","snapshot_observed_at":"2026-08-16T15:20:59.876100Z","submitted_at":"2023-06-26T17:59:50Z","title":"InterCode: Standardizing and Benchmarking Interactive Coding with Execution Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14898","snapshot_observed_at":"2026-08-15T19:53:32.840618Z","title":"Intercode: Standardizing and benchmarking interactive coding with execution feedback, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.840618Z"},"links":{"cited_paper":"/paper/2306.14898","citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:95265f18471a481a366e6192c2dfb2e3fe154ed63aeeeca7ad50de980404c50b","observation_id":"0a2b9505-3ecd-448a-985a-de94353d94c7","resolution":{"observed_at":"2026-08-15T19:53:32.840618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05590","last_updated":"2025-02-18T12:26:33Z","snapshot_observed_at":"2026-08-16T20:14:18.570887Z","submitted_at":"2024-06-08T22:21:42Z","title":"NYU CTF Bench: A Scalable Open-Source Benchmark Dataset for Evaluating LLMs in Offensive Security","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05590","snapshot_observed_at":"2026-08-15T19:53:32.863240Z","title":"Nyu ctf bench: A scalable open-source benchmark dataset for evaluating llms in offensive security, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.863240Z"},"links":{"cited_paper":"/paper/2406.05590","citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:44f55e3d2e4aead15226013e656f77e548cebe3cc9451f81777949bc2aeb16cb","observation_id":"ef0eb5b6-ae4b-416e-a836-0b3f445ab6ca","resolution":{"observed_at":"2026-08-15T19:53:32.863240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16165","last_updated":"2025-06-05T10:58:02Z","snapshot_observed_at":"2026-08-16T13:15:49.041854Z","submitted_at":"2024-09-24T15:06:01Z","title":"EnIGMA: Interactive Tools Substantially Assist LM Agents in Finding Security Vulnerabilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16165","snapshot_observed_at":"2026-08-15T19:53:32.885270Z","title":"Interactive tools substantially assist lm agents in finding security vulnerabilities, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.885270Z"},"links":{"cited_paper":"/paper/2409.16165","citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:d32b2b4a82d4c058510de2cbba6e70c05c10db360f6d1f03715e543479fc30ca","observation_id":"8cbe8746-024a-480d-8048-9548adcda81f","resolution":{"observed_at":"2026-08-15T19:53:32.885270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01811","last_updated":"2025-03-03T18:39:48Z","snapshot_observed_at":"2026-08-16T12:53:29.210088Z","submitted_at":"2025-03-03T18:39:48Z","title":"AutoAdvExBench: Benchmarking autonomous exploitation of adversarial example defenses","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01811","snapshot_observed_at":"2026-08-15T19:53:32.995201Z","title":"Autoadvexbench: Benchmarking autonomous exploitation of ad- versarial example defenses, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.995201Z"},"links":{"cited_paper":"/paper/2503.01811","citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:6f1467f30e4b919ed3fb30d0dfd1f097ed5353e42a917c93e24fd17a031ab8fd","observation_id":"24625837-5955-4a37-a26f-c90c28372f39","resolution":{"observed_at":"2026-08-15T19:53:32.995201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:53:34.052921Z","title":"Picoctf learning.https://www.picoctf.org/, 2024","venue":null,"work_id":"d28a705d-d190-4ed6-8471-e6b8a4c113de","year":2024},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:33.103438Z"},"links":{"citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:655040bd6dfcf1418406abecaf498a838283a050441cc38f5507659f8938c854","observation_id":"38c7678a-0a84-41de-9196-0ece445f7681","resolution":{"observed_at":"2026-08-15T19:53:34.077377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:53:34.022961Z","title":"Ai village capture the flag @ defcon31.https://kaggle.com/ competitions/ai-village-capture-the-flag-defcon31, 2023","venue":null,"work_id":"2b2cbb29-3d06-42f0-b042-7f9b22a4c974","year":2023},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:33.122420Z"},"links":{"citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:c69b36351bdd8619c74ccfed1c4e48dbb28816dc3fd2f1bd586ca62ab4db7c75","observation_id":"54ec6960-1b49-4018-b144-1c0b1af26992","resolution":{"observed_at":"2026-08-15T19:53:34.026552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:53:34.011696Z","title":"Jupyter datascience notebook docker image, 2025","venue":null,"work_id":"d63488c5-f111-4883-a6c0-b060a9864bfb","year":2025},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:33.131197Z"},"links":{"citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:3ae9f1082c774a6ce0375bd7e6efb7647d160995497d510b328427b5e25ce4bb","observation_id":"d877e2e1-e64c-4c89-8521-0132a06329a0","resolution":{"observed_at":"2026-08-15T19:53:34.016063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10577","last_updated":"2024-08-20T06:32:57Z","snapshot_observed_at":"2026-08-16T13:25:19.106888Z","submitted_at":"2024-08-20T06:32:57Z","title":"Optimizing Large Language Model Hyperparameters for Code Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10577","snapshot_observed_at":"2026-08-15T19:53:33.154793Z","title":"Optimizing large language model hyperparameters for code genera- tion, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:33.154793Z"},"links":{"cited_paper":"/paper/2408.10577","citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:620d9da536b22ca13e61d2342c6084a24e0c30a9ce785ec4a919d1e713c7129d","observation_id":"72825d09-5f60-42c1-8844-985a27434988","resolution":{"observed_at":"2026-08-15T19:53:33.154793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19855","last_updated":"2025-04-29T02:52:54Z","snapshot_observed_at":"2026-08-16T05:39:34.343492Z","submitted_at":"2025-04-28T14:48:00Z","title":"The Automation Advantage in AI Red Teaming","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19855","snapshot_observed_at":"2026-08-15T19:53:33.168800Z","title":"< platform - api - key >","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:33.168800Z"},"links":{"cited_paper":"/paper/2504.19855","citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:066e1d10dc30f48c88a3a345a8bcd6490412d27c2bde5da3ceeb2d768c3cac8c","observation_id":"dbdd6fc6-cfb3-4bf4-9e40-81635bd17218","resolution":{"observed_at":"2026-08-15T19:53:33.168800Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:53:33.978159Z","title":"For example : ‘t = turtle","venue":null,"work_id":"27df0b07-00ca-462c-995b-36e668be3651","year":null},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:33.281100Z"},"links":{"citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:51c3e959fcead87874e18d923e8d54f0b436ab6c201be1314a6bb52be3318f91","observation_id":"4d833146-c9cd-4247-aa55-ccfec3df252c","resolution":{"observed_at":"2026-08-15T19:53:33.981683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:53:33.967647Z","title":"S Y S T E M _ C O M M A N D _ E X E C U T E D _ V I A _ E X E C","venue":null,"work_id":"9f0da288-9d47-4ced-8abb-843aedd80a37","year":null},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:33.295834Z"},"links":{"citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:3807ff889f76eb4460d32be1a7b548755e5a5af3ddbc6bc200b6cb19a264a3a1","observation_id":"69d706f8-82b6-4039-bad0-b471a24bdfc3","resolution":{"observed_at":"2026-08-15T19:53:33.970997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:53:33.956831Z","title":null,"venue":null,"work_id":"b6219e2d-2a67-4b6b-a70c-80986b577fd6","year":null},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:33.306754Z"},"links":{"citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:d468c9d9e5f7a7c8ac2a5d813cc074d642bf40142915a47de00e136ce6da3948","observation_id":"ec659ead-6b3c-40ff-8c8f-0b0fbabd57e1","resolution":{"observed_at":"2026-08-15T19:53:33.959915Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:53:33.945054Z","title":"For example : ‘t","venue":null,"work_id":"7ccedfad-6885-4fc6-b4cd-76f5fe995918","year":null},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:33.310734Z"},"links":{"citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:aeba1cededd732a94099fd939b9ec22c8a4533dda96cbb2973b938480fdfcc77","observation_id":"d19cd96b-6aff-4075-9e4c-415cf88b77b7","resolution":{"observed_at":"2026-08-15T19:53:33.949128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:53:33.866461Z","title":"\" \" response = query ( prompt ) print ( response ) </ execute - code > <result idx=0 success=True> ’output’:","venue":null,"work_id":"e9643692-7cb7-4b03-b57b-693fe7d12f59","year":null},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:33.314088Z"},"links":{"citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:b9b01ab72074789bb93dec9b00e140d9b8fdb541d747e735fed39deadc85db9b","observation_id":"1953971f-4bdf-445d-a1dc-cdb47053335a","resolution":{"observed_at":"2026-08-15T19:53:33.911454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:53:34.000617Z","title":null,"venue":null,"work_id":"14b676a4-3a76-44a7-874f-90e2fcc0e7d4","year":null},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:33.325454Z"},"links":{"citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:c6d54372c79c7227a62fdb282d3aca8dc93e030217ffda2818e7f617f1d2fc3a","observation_id":"54452e34-cca5-47bf-84db-6e10008c0787","resolution":{"observed_at":"2026-08-15T19:53:34.004403Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:53:33.988570Z","title":null,"venue":null,"work_id":"14e6d801-db58-465e-b89a-9e0877ba2ae2","year":null},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:33.353697Z"},"links":{"citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:fec43710d9f9dcc6f5ea8da707832ae0a1a51a83b140bc08b7aba03615e0279b","observation_id":"26208294-c958-4518-9989-3308f74bc1ef","resolution":{"observed_at":"2026-08-15T19:53:33.992721Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:53:33.821202Z","title":"Example : ‘t = turtle","venue":null,"work_id":"be94e923-1d18-473c-af91-4d0cbeb027ce","year":null},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:33.388384Z"},"links":{"citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:a23bd063eee65d1609575159d490efffd1ebd48e9c89bce88fa1f28c34b9063a","observation_id":"a264a8e2-edc5-4510-bf98-42b4c350f91e","resolution":{"observed_at":"2026-08-15T19:53:33.840388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:53:33.790761Z","title":"echo J A G A _ L L M _ G E N E R A T E D _ O S _ C O M M A N D","venue":null,"work_id":"013957b2-ca06-40f7-8ed6-53bda7859f29","year":null},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:33.430804Z"},"links":{"citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:1c729b64a04a525df2bb23cce70820c4a730bf5a011e602adf48f5b24e0533e4","observation_id":"f768c676-7a52-4781-8769-fc5bad636043","resolution":{"observed_at":"2026-08-15T19:53:33.794439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:53:33.778965Z","title":"system () ‘ call , make the turtle ‘t ‘ draw a square of side 10","venue":null,"work_id":"2d5bf9cb-68e0-4b5e-b746-4d612c46b454","year":null},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:33.465619Z"},"links":{"citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:61fe909335e6342f82520d413953208d9232496000985dabc7d65bd324717d88","observation_id":"46ed088a-d71e-42bc-a856-3b11fd256ca3","resolution":{"observed_at":"2026-08-15T19:53:33.783066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:53:33.765796Z","title":"\" \" response = requests . post ( f","venue":null,"work_id":"9a8dec62-22b1-49e8-b5f9-3d063bb154aa","year":null},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:33.486755Z"},"links":{"citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:c37b51324e34c10536953b6160e9ded879c75d0a19ea6a5d046a1b5ba9875e83","observation_id":"ef0f6acf-4d21-45a9-ba3c-2e6328803dec","resolution":{"observed_at":"2026-08-15T19:53:33.770156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05286","last_updated":"2024-10-22T03:58:20Z","snapshot_observed_at":"2026-08-16T14:11:37.942836Z","submitted_at":"2024-03-08T13:10:59Z","title":"LLM4Decompile: Decompiling Binary Code with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05286","snapshot_observed_at":"2026-08-15T19:53:32.640743Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T19:53:32.640743Z"},"links":{"cited_paper":"/paper/2403.05286","citing_paper":"/paper/2506.14682"},"observation_digest":"sha256:a17bec6437b800cf5f25bc45a485e2c99f75cb2bdb9fddcf57a998954e59a1fa","observation_id":"c505c07d-fa71-48f9-a6f4-360ef26a4f7d","resolution":{"observed_at":"2026-08-15T19:53:32.640743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.14682","last_updated":"2025-06-17T16:19:06Z","latest_version":1,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-15T19:46:29.665967Z","submitted_at":"2025-06-17T16:19:06Z","title":"AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":25,"verified_exact":0,"verified_fuzzy":16},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 3 inbound Pith citation observations for arXiv:2506.14682."}