{"as_of":"2026-08-08T10:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2b8f4494ac9cc5db93844c7dae4abf2c2322ab6ccd2cb008bb07c95266b86607","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T01:04:40.936182Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03070/citation-record","integrity":"/paper/2608.03070/integrity","json":"/paper/2608.03070/citation-record.json","paper":"/paper/2608.03070"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.10925","last_updated":"2025-08-08T19:24:38Z","snapshot_observed_at":"2026-08-01T16:27:35.664983Z","submitted_at":"2025-08-08T19:24:38Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10925","snapshot_observed_at":"2026-08-08T01:04:40.800351Z","title":"gpt-oss-120b & gpt-oss-20b model card","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-08T10:13:36.328058Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.800351Z"},"links":{"cited_paper":"/paper/2508.10925","citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:3c5984689403ead5f333744f0c6093952ff6bb8d47437b4aae7e89012d0d902f","observation_id":"486f349b-b9d2-42d9-8d97-0c6bd8f05cbd","resolution":{"observed_at":"2026-08-08T01:04:40.800351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.714488Z","title":"Our evaluation of OpenAI’s GPT-5.5 cyber capabilities, 2026","venue":null,"work_id":"74949b73-69e9-444e-ba6e-f744957be97a","year":2026},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-08T10:13:36.328058Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.804895Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:ab70d0c41aad7fc237dadd0997f28b2973647fb1cf3fdde0a20caa41d29db370","observation_id":"00822f6b-9cd3-486a-a667-1ad9952ecd6b","resolution":{"observed_at":"2026-08-08T01:04:41.717747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.704863Z","title":"Our evaluation of Claude Mythos Preview’s cyber capabilities, 2026","venue":null,"work_id":"cbab213d-f8f6-49e8-b32c-1d1e9b84fcca","year":2026},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-08T10:13:36.328058Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.808590Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:9553865ad9efb704ce7d22822d52870a4dd40c14ae44614edbca6f18fa629f7c","observation_id":"921e6ce0-e3b2-4dbe-9683-f8857cdb3622","resolution":{"observed_at":"2026-08-08T01:04:41.708262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.695815Z","title":"Constitutional Classifiers: Defending against universal jailbreaks, February 2025","venue":null,"work_id":"927f740d-9370-4596-a362-a541fe03ed3d","year":2025},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-08T10:13:36.328058Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.812066Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:39d86a596c302b09776c6ed5bc6808bfcaefaae18ab2e52322fd5bb1be88dcc1","observation_id":"68433ac3-357a-459b-b927-30ab800cbf9e","resolution":{"observed_at":"2026-08-08T01:04:41.699247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.686217Z","title":"Disrupting the first reported ai-orchestrated cyber espionage campaign, 2025","venue":null,"work_id":"fad77d1e-d43a-438f-8459-3bade0771867","year":2025},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-08T10:13:36.328058Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.815425Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:63035d5bd8d2fdc9e91088676936fd07373db599376d46dbf456aae32a802644","observation_id":"5e9af83b-b20c-4971-8b95-8ac4c98bfb4e","resolution":{"observed_at":"2026-08-08T01:04:41.689793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11926","last_updated":"2025-03-14T23:50:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-14T23:50:34Z","title":"Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11926","snapshot_observed_at":"2026-08-08T01:04:40.818991Z","title":"Monitoring reasoning models for misbehavior and the risks of promoting obfuscation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-08T10:13:36.328058Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.818991Z"},"links":{"cited_paper":"/paper/2503.11926","citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:853f01fc4cf1145b0f07133a2caef37e42d660bac5d953203c2f32bfe660078b","observation_id":"8ebe1614-0dac-47a8-b3d5-f23ef00d43fd","resolution":{"observed_at":"2026-08-08T01:04:40.818991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:40.822825Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-08T10:13:36.328058Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.822825Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:c09d18797eb78bea7e8f7de3ee5093bc0106e7ce1fd763bd8ae7a69f40eb7f26","observation_id":"dbe28a52-b414-451e-999a-f397cc2723b0","resolution":{"observed_at":"2026-08-08T01:04:40.822825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:40.825990Z","title":"Constitutional classifiers++: Eﬀicient production-grade defenses against universal jailbreaks","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-08T10:13:36.328058Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.825990Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:051d00ddd47165cc2d836b0a69f21cfda5e0e05b85450d08488b3763b082c5f5","observation_id":"bd399f56-0609-4170-915b-3919fcb5cd6c","resolution":{"observed_at":"2026-08-08T01:04:40.825990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:40.829056Z","title":"Boundary point jailbreaking of black-box llms, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-08T10:13:36.328058Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.829056Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:8a78ee21122347fe6ce11123f05b0f74f0939b2244f800e07d0c17e71bcfb270","observation_id":"d4c42b4f-2a40-4877-8248-ec8866a67713","resolution":{"observed_at":"2026-08-08T01:04:40.829056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.676038Z","title":"Deepseek-v4: Towards highly eﬀicient million-token context intelligence, 2026","venue":null,"work_id":"d18ca757-909a-49cf-a160-6d56b1c49936","year":2026},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-08T10:13:36.328058Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.832135Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:6a430f09b3fa1a44eb5f26691fd812e822ea10a35fc2985a3760df048d2d2ab1","observation_id":"8e302ba0-1a01-4499-8b35-d7db3113287f","resolution":{"observed_at":"2026-08-08T01:04:41.679664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.666407Z","title":"The safety gap toolkit: Evaluating hidden dangers of open-source models","venue":null,"work_id":"e605ec40-c306-4d3f-9988-c5a1a8b84b57","year":2025},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-08T10:13:36.328058Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.835276Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:592726186fb29690f198810a04897d7d774df6d63174fa43fe10e6be4f8f790a","observation_id":"974e515b-6c36-4a76-b531-59b2b6b748e1","resolution":{"observed_at":"2026-08-08T01:04:41.669906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.656757Z","title":null,"venue":null,"work_id":"9094ca99-bedf-4f6a-acac-d69be9a8519f","year":2026},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-08T10:13:36.328058Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.838399Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:abff556bb995807713f5368cc5e0ca2e056be8a9c46b52e12717ccdaf3eeee65","observation_id":"c2cc9033-fcb5-404e-b5bc-6a51103e706d","resolution":{"observed_at":"2026-08-08T01:04:41.660329Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-08T01:04:40.841373Z","title":"Deliberative alignment: Reasoning enables safer language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-08T10:13:36.328058Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.841373Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:2d23249f35f4b7ce0333de216adf0c1533292d27c8fda7c4ff1ebe049247489e","observation_id":"50f5ab3b-2cb7-4d9f-b6dd-cb0e3db16493","resolution":{"observed_at":"2026-08-08T01:04:40.841373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16137","last_updated":"2025-04-29T15:14:35Z","snapshot_observed_at":"2026-08-07T16:00:27.124745Z","submitted_at":"2025-04-21T21:04:01Z","title":"Virology Capabilities Test (VCT): A Multimodal Virology Q&A Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16137","snapshot_observed_at":"2026-08-08T01:04:40.844948Z","title":"Virology Capabilities Test (VCT): A multimodal virology q&a benchmark, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-08T10:13:36.328058Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.844948Z"},"links":{"cited_paper":"/paper/2504.16137","citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:46f0ea089a6105c729b43ab6aa98eb50fbd9352eee436948fdfe555a4bdd387e","observation_id":"5dac27c1-ce00-407f-b11b-92a491cf6dca","resolution":{"observed_at":"2026-08-08T01:04:40.844948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.646954Z","title":"Openai let chatgpt aid and abet mass shooters, florida lawsuit claims, 2026","venue":null,"work_id":"c8719948-c454-4307-8916-a0790a51c57f","year":2026},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-08T10:13:36.328058Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.848365Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:87b0dbeda75da483371709741cc73981f82ba5af3e9aa6661efcc08a3621de6a","observation_id":"774cb533-c83e-4232-9a8b-840c9f9bfdc6","resolution":{"observed_at":"2026-08-08T01:04:41.650799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.637504Z","title":"God Has Helped Us, and So Will AI","venue":null,"work_id":"162059ef-7817-41ea-a11b-5de7746ed5b1","year":2026},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-08T10:13:36.328058Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.851461Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:c698a137d2a495c33c9f6aa0907e58a4f1dc273c07c3aa9a15fe794156988ab9","observation_id":"ac7b7765-dcc5-4c5c-a68d-0f42c6539bd1","resolution":{"observed_at":"2026-08-08T01:04:41.641029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:40.854468Z","title":"McKenzie, Oskar J","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-08T10:13:36.328058Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.854468Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:32e088d94d6f11996b5dff60e1e355c6cf288934aff79949f74bffd99ecce29e","observation_id":"5c60ab4c-7a46-4812-8b03-d95718c6c93e","resolution":{"observed_at":"2026-08-08T01:04:40.854468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.627535Z","title":"Common elements of frontier AI safety policies, 2025","venue":null,"work_id":"4c19ab01-ab0e-4601-b72a-c666e8280ae9","year":2025},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-08T10:13:36.328058Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.857439Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:bbf1686fefc1938e0dd67840a10a8c154d21626119d2e555fd79aac3b4708a18","observation_id":"5352fe49-0ae7-4ba0-be5b-86492d0ddb08","resolution":{"observed_at":"2026-08-08T01:04:41.631341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10694","last_updated":"2025-04-14T20:30:41Z","snapshot_observed_at":"2026-08-08T01:18:50.154912Z","submitted_at":"2025-04-14T20:30:41Z","title":"The Jailbreak Tax: How Useful are Your Jailbreak Outputs?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10694","snapshot_observed_at":"2026-08-08T01:04:40.860705Z","title":"The jailbreak tax: How useful are your jailbreak outputs? arXiv preprint arXiv:2504.10694, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-08T10:13:36.328058Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.860705Z"},"links":{"cited_paper":"/paper/2504.10694","citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:3396f3359ada8ce890219fcf66280790ada8a032458a0a824b95f39067a5bf7d","observation_id":"b1277843-1da5-4094-9db4-f6d75e1bfed1","resolution":{"observed_at":"2026-08-08T01:04:40.860705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.618026Z","title":"ChatGPT Agent System Card, July 2025","venue":null,"work_id":"7108c8d3-49ac-4b99-9059-1e961ab1f9a8","year":2025},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-08T10:13:36.328058Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.864122Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:ba217c2bdca805b705e6aa461cb678fe3bb7ac0daddfeb305847dbb83f92fa6d","observation_id":"46d6afd3-527e-4ea0-bb38-de08a31a3502","resolution":{"observed_at":"2026-08-08T01:04:41.621501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18837","last_updated":"2025-01-31T01:09:32Z","snapshot_observed_at":"2026-07-06T20:28:47.519113Z","submitted_at":"2025-01-31T01:09:32Z","title":"Constitutional Classifiers: Defending against Universal Jailbreaks across Thousands of Hours of Red Teaming","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18837","snapshot_observed_at":"2026-08-08T01:04:40.867237Z","title":"Constitutional classifiers: Defending against universal jailbreaks across thousands of hours of red teaming","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-08T10:13:36.328058Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.867237Z"},"links":{"cited_paper":"/paper/2501.18837","citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:770f1a6a6283ed823a005292c07b19c54a5372a78e77ae48e1e89631fdf57a93","observation_id":"67ef4c4d-23e3-4bdf-9a3c-4d8d35ffc6a5","resolution":{"observed_at":"2026-08-08T01:04:40.867237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:40.871031Z","title":"Exposing the systematic vulnerability of open-weight models to prefill attacks","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-08T10:13:36.328058Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.871031Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:13c96bcabac37ebec634ee8979a4ee0e09ac10fbc6be9601b81c71b347f7c270","observation_id":"94c2008a-fb9e-4f1a-a5e5-861605ed6319","resolution":{"observed_at":"2026-08-08T01:04:40.871031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.608402Z","title":"Qwen3.5: Towards native multimodal agents, 2026","venue":null,"work_id":"877ce4cd-c91e-4604-b083-9e13e7445bc1","year":2026},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-08T10:13:36.328058Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.874332Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:ebb2069cdcf5ee43af3ce56c079f3ec32464ff2dc76cf7b8b88507ef7b4b0282","observation_id":"b8ef9201-8fba-4294-bb23-4a0ac23f70e8","resolution":{"observed_at":"2026-08-08T01:04:41.612012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.598380Z","title":"Green beret who exploded cybertruck in las vegas used ai to plan blast, 2025","venue":null,"work_id":"36f993e9-6ccf-4666-8b34-d3eb7ff1e839","year":2025},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-08T10:13:36.328058Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.877689Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:8a35655111beb88bae8ea16a69035dda161a079e03c77317e0ea3482182521bd","observation_id":"ffed2393-7a4e-41ac-aa69-45d8c2381186","resolution":{"observed_at":"2026-08-08T01:04:41.602321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13208","last_updated":"2024-04-19T22:55:23Z","snapshot_observed_at":"2026-08-02T11:48:17.206729Z","submitted_at":"2024-04-19T22:55:23Z","title":"The Instruction Hierarchy: Training LLMs to Prioritize Privileged Instructions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13208","snapshot_observed_at":"2026-08-08T01:04:40.880760Z","title":"The instruction hierarchy: Training llms to prioritize privileged instructions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-08T10:13:36.328058Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.880760Z"},"links":{"cited_paper":"/paper/2404.13208","citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:a55d88f8372903dc0400f3b36a6b96ccb97d7ccd31e58e50ac8c347536a67be8","observation_id":"8fe0585a-8534-4ddd-82f2-fbb94be7e2b4","resolution":{"observed_at":"2026-08-08T01:04:40.880760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:40.884319Z","title":"Cybergym: Evaluating ai agents’ real-world cybersecurity capabilities at scale, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-08T10:13:36.328058Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.884319Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:e382047734fe094e4511de2a0cce7630181801f62565525190d199e9c7cc9e9a","observation_id":"d3f94878-4a23-4e07-b4ef-da0b4d1def24","resolution":{"observed_at":"2026-08-08T01:04:40.884319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.00267","last_updated":"2026-05-04T18:25:35Z","snapshot_observed_at":"2026-08-02T06:06:01.489460Z","submitted_at":"2026-04-30T22:04:10Z","title":"Jailbroken Frontier Models Retain Their Capabilities","version":2},"cited_work":{"arxiv_id":"2605.00267","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.00267","snapshot_observed_at":"2026-08-08T01:04:40.973708Z","title":"Jailbroken Frontier Models Retain Their Capabilities","venue":"cs.LG","work_id":"840f9179-2867-4cd3-89e7-f82702897312","year":2026},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-08T10:13:36.328058Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.887782Z"},"links":{"cited_paper":"/paper/2605.00267","citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:82e5cf1183f91d0444364998051739f512b43385ee6528215b966e8d9ecc63ce","observation_id":"89692e7a-d5e4-4df7-8875-d5e7e26c8edc","resolution":{"observed_at":"2026-08-08T01:04:40.979412Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-08T01:04:40.891362Z","title":"jailbroken","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-08T10:13:36.328058Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.891362Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:0efd0bb61d2f17e0bc23cee9487d41834ed5f931ed069a3e0cdf8351ec346e10","observation_id":"677b28d0-f0f8-4248-88f9-255d12d54f4b","resolution":{"observed_at":"2026-08-08T01:04:40.891362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.588186Z","title":"Sorry,” “I can’t help with that, but…","venue":null,"work_id":"8e410aee-3e93-4efe-822b-cb42a33c1790","year":null},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-08T10:13:36.328058Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.895326Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:6eec31f28fc9b5951ef4d200371d038e562a55d9731fb08023b9a989f5318692","observation_id":"407c913d-b43a-4987-b53d-247c77fac7eb","resolution":{"observed_at":"2026-08-08T01:04:41.591935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.579470Z","title":"not jailbroken","venue":null,"work_id":"b8d74f4b-3a0c-48f9-a0ad-1033a9cefb58","year":null},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-08T10:13:36.328058Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.898975Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:e24bc7eb0e2cc1892e4b4f3c10c2cd4869f94457b88882376eb820c3d2709ea7","observation_id":"273bbf32-5b57-4029-9f26-a0ffb085e131","resolution":{"observed_at":"2026-08-08T01:04:41.582787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.570964Z","title":"jailbroken (1)","venue":null,"work_id":"c5bca4d6-7fff-485b-a916-e9f69ea72119","year":null},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-08T10:13:36.328058Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.902515Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:b3c1b927774728a090af97f8532ae3b66dbb8324df14fc6675f56ce0a2253be4","observation_id":"01daf259-7b40-443d-a04f-4bc89046a70b","resolution":{"observed_at":"2026-08-08T01:04:41.574059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.562154Z","title":null,"venue":null,"work_id":"601fc39a-79a5-4528-99b1-792fcb06a969","year":null},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-08T10:13:36.328058Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.906031Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:a029e42101de62e48874871d22f7540e083a4b30c0e318575510d3fdfc206df9","observation_id":"b3de8b6a-0ba0-4112-a24b-acb5836644cc","resolution":{"observed_at":"2026-08-08T01:04:41.565345Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.552009Z","title":null,"venue":null,"work_id":"4fe96d06-fea4-4825-b8b8-78ef05b8ea59","year":null},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-08T10:13:36.328058Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.909296Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:c4dda8020c46c50ba29e0b3e7e8b3cea63fa5c1cfba81431d1dda9ea9da36f68","observation_id":"e870fbac-2b7d-433c-99c5-f8fe535c39f4","resolution":{"observed_at":"2026-08-08T01:04:41.555538Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.541837Z","title":"the jailbreak technique involves simplifying the attacker goal too much, label as ”not jailbroken” (0)","venue":null,"work_id":"389b96c0-75a1-4724-9867-46c532bfaa62","year":null},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-08T10:13:36.328058Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.912861Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:facfe00486425667e8af9d0125128a572e0d5ea1d6e58948c5892b5f276a2401","observation_id":"ce5d3ada-f4f9-4bef-a33a-18668093c0ff","resolution":{"observed_at":"2026-08-08T01:04:41.545319Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.531680Z","title":"The cost of one query used to test whether a jailbreak works, from its token usage and the model’s API price","venue":null,"work_id":"c0de5f40-3d86-4bc6-a150-97ad23da9bb7","year":null},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-08T10:13:36.328058Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.917008Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:1465a5664a63b8ec91e3d3e5080a5482583714899aa34b9b5a521e26f5479013","observation_id":"051e85b6-83a9-447b-a859-cf1d9c650a1f","resolution":{"observed_at":"2026-08-08T01:04:41.535433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.521300Z","title":"If working jailbreaks are common in the pool, the attacker finds a universal one sooner, so the cost drops","venue":null,"work_id":"93b4b2e7-e81c-43f1-8ad3-fec7236d3827","year":null},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-08T10:13:36.328058Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.920005Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:36527cc83b498f4d4013641c413edce772c02c89552573b74cd878120a55a1ed","observation_id":"f4cf8811-900f-4081-9503-7d1530ef92f7","resolution":{"observed_at":"2026-08-08T01:04:41.525030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.510957Z","title":"Suppose we find ten working jailbreaks against each of two models","venue":null,"work_id":"bc272765-8507-4f21-ad17-19010c619711","year":null},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-08T10:13:36.328058Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.923218Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:a70df3c11ae8e1568acf5f7efed8272cd0acfdd3fb15fc9134399b0f0d7da449","observation_id":"b63ec2b0-961e-4470-96ae-ee7e7d6f1cf7","resolution":{"observed_at":"2026-08-08T01:04:41.514526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.500875Z","title":"Finding a jailbreak that works once is easy; proving it works reliably is expensive","venue":null,"work_id":"9c0b586e-d348-49f4-889f-d617f622b886","year":null},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-08T10:13:36.328058Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.926614Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:9f173b1580f3127a65ee88451a97107cd0e3f29d835b5a71caf7f4804861c2fc","observation_id":"e1511973-57fb-4595-a23c-3e1d34c46a7b","resolution":{"observed_at":"2026-08-08T01:04:41.504661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.490750Z","title":"A smart attacker does not run every candidate over the full sample","venue":null,"work_id":"0c32b5e4-64f0-49c7-afb2-8b0f2fb2f793","year":null},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-08T10:13:36.328058Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.929731Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:3855e89155f4bf983f0077764f6a66374528eb44b251c53556a954a2bf0d3ad1","observation_id":"b7a4f3f6-6596-4d57-830c-85d2addbc8f7","resolution":{"observed_at":"2026-08-08T01:04:41.494329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.480378Z","title":"Test the candidate on a small number of samples (e.g., in our testing, we use 8 per domain)","venue":null,"work_id":"fe3088d2-38d5-40d9-aa11-161c0209edce","year":null},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-08T10:13:36.328058Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.932922Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:66efd58908faa74683a267237aeb43ff6d5d98097c5e2738268aead02677a169","observation_id":"33117418-4b40-46b2-92dc-61512cbe38de","resolution":{"observed_at":"2026-08-08T01:04:41.484182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:04:41.469276Z","title":"Run each surviving candidate on many more samples, e.g., on the order of a hundred to confirm it is universal (in our testing, it jailbreaks at least 75%)","venue":null,"work_id":"01469b94-f0bd-40a2-9400-4bceee94beda","year":null},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-08T10:13:36.328058Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.936182Z"},"links":{"citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:b417303d6889a556caec2c3ba4e78861a64bc26fdaf42e14983a74d04ec5ec9b","observation_id":"16677385-b223-4e30-bbce-beb5e9ad92c4","resolution":{"observed_at":"2026-08-08T01:04:41.473005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","latest_version":2,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-08T10:13:36.328058Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":1,"verified_fuzzy":22},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2608.03070."}