{"as_of":"2026-08-07T16:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:375dbcff8368f0c44a08f5754da555ab8952226fb58ed0f66ad65e25fe388748","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T06:54:48.503377Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.21735/citation-record","integrity":"/paper/2607.21735/integrity","json":"/paper/2607.21735/citation-record.json","paper":"/paper/2607.21735"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:54:48.292789Z","title":"Hudson, Ehsan Adeli, et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21735","last_updated":"2026-07-30T16:46:31Z","snapshot_observed_at":"2026-08-07T01:31:05.960858Z","submitted_at":"2026-07-23T18:34:12Z","title":"What AI Red-Team Evaluations Can and Cannot Prove","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T06:54:48.292789Z"},"links":{"citing_paper":"/paper/2607.21735"},"observation_digest":"sha256:522dc54df0d7229d4e67b5ac0fa86d057581b99748d8baf575bd5d258007d9f8","observation_id":"d88d1232-5dec-4a04-984b-c4b5a8e0ff33","resolution":{"observed_at":"2026-08-01T06:54:48.292789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:54:48.298076Z","title":"Model cards for model reporting","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.21735","last_updated":"2026-07-30T16:46:31Z","snapshot_observed_at":"2026-08-07T01:31:05.960858Z","submitted_at":"2026-07-23T18:34:12Z","title":"What AI Red-Team Evaluations Can and Cannot Prove","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T06:54:48.298076Z"},"links":{"citing_paper":"/paper/2607.21735"},"observation_digest":"sha256:03e5bc8e7478abf24d863d641842ebc6b85d969467b533ffc0d8c9e01a298388","observation_id":"373d399f-b1e6-43d5-8093-c4405b0438c2","resolution":{"observed_at":"2026-08-01T06:54:48.298076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:54:48.302790Z","title":"Holistic evaluation of language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21735","last_updated":"2026-07-30T16:46:31Z","snapshot_observed_at":"2026-08-07T01:31:05.960858Z","submitted_at":"2026-07-23T18:34:12Z","title":"What AI Red-Team Evaluations Can and Cannot Prove","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T06:54:48.302790Z"},"links":{"citing_paper":"/paper/2607.21735"},"observation_digest":"sha256:06b12e442a53799d8490a6148bfb6aed561f6d2107d43760eb3b25dab51efba6","observation_id":"1dc17684-f994-410b-aa15-0a01343edefb","resolution":{"observed_at":"2026-08-01T06:54:48.302790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:54:48.307997Z","title":"Gritsenko, et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21735","last_updated":"2026-07-30T16:46:31Z","snapshot_observed_at":"2026-08-07T01:31:05.960858Z","submitted_at":"2026-07-23T18:34:12Z","title":"What AI Red-Team Evaluations Can and Cannot Prove","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T06:54:48.307997Z"},"links":{"citing_paper":"/paper/2607.21735"},"observation_digest":"sha256:71e25870de1e0a477e149fc5c5865deccd7ce1fc1064a8157b5770992ace72c3","observation_id":"77c09251-4538-47c7-85cf-fdae96f89c24","resolution":{"observed_at":"2026-08-01T06:54:48.307997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:54:48.312735Z","title":"Feder Cooper, Solon Barocas, Abhinav Palia, Dan Vann, and Hanna Wallach","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21735","last_updated":"2026-07-30T16:46:31Z","snapshot_observed_at":"2026-08-07T01:31:05.960858Z","submitted_at":"2026-07-23T18:34:12Z","title":"What AI Red-Team Evaluations Can and Cannot Prove","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T06:54:48.312735Z"},"links":{"citing_paper":"/paper/2607.21735"},"observation_digest":"sha256:2d1fcfab9dfe5bba40fc8b4689099af9a6ab3aac42618b07b36825e6e4c2496d","observation_id":"dbb6170d-e3d4-476f-b6a1-7d3af53b54bb","resolution":{"observed_at":"2026-08-01T06:54:48.312735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:54:48.317460Z","title":"The structural safety gener- alization problem, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21735","last_updated":"2026-07-30T16:46:31Z","snapshot_observed_at":"2026-08-07T01:31:05.960858Z","submitted_at":"2026-07-23T18:34:12Z","title":"What AI Red-Team Evaluations Can and Cannot Prove","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T06:54:48.317460Z"},"links":{"citing_paper":"/paper/2607.21735"},"observation_digest":"sha256:5c04da7b54ec1684d362d550ff8ebb1e5e6c8f61b44f3d8402634a0363db7930","observation_id":"bfbf40ef-b0e4-49f6-8f4b-3b6555b6659d","resolution":{"observed_at":"2026-08-01T06:54:48.317460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:54:48.322834Z","title":"Adding error bars to evals: A statistical approach to language model evaluations, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21735","last_updated":"2026-07-30T16:46:31Z","snapshot_observed_at":"2026-08-07T01:31:05.960858Z","submitted_at":"2026-07-23T18:34:12Z","title":"What AI Red-Team Evaluations Can and Cannot Prove","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T06:54:48.322834Z"},"links":{"citing_paper":"/paper/2607.21735"},"observation_digest":"sha256:c9fd54ce2a4bf99967da838cedbc9de7564548b7c18f594ddf22f919d652edcb","observation_id":"a2c47ca0-2d57-47cc-a63b-e132dcfd7056","resolution":{"observed_at":"2026-08-01T06:54:48.322834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:54:48.327008Z","title":"Kim and Anthony R","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.21735","last_updated":"2026-07-30T16:46:31Z","snapshot_observed_at":"2026-08-07T01:31:05.960858Z","submitted_at":"2026-07-23T18:34:12Z","title":"What AI Red-Team Evaluations Can and Cannot Prove","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T06:54:48.327008Z"},"links":{"citing_paper":"/paper/2607.21735"},"observation_digest":"sha256:3fe561107c12433d4143cc328803f2bebbd3787e45df122e25f67dc18f6e841f","observation_id":"3d11f44d-a56b-4035-84e3-33a05813ffa2","resolution":{"observed_at":"2026-08-01T06:54:48.327008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:54:48.331485Z","title":"Prentice","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2607.21735","last_updated":"2026-07-30T16:46:31Z","snapshot_observed_at":"2026-08-07T01:31:05.960858Z","submitted_at":"2026-07-23T18:34:12Z","title":"What AI Red-Team Evaluations Can and Cannot Prove","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T06:54:48.331485Z"},"links":{"citing_paper":"/paper/2607.21735"},"observation_digest":"sha256:5a7d13a531f1618cf4beca29bf32da661816bc93be1b5e8733be69829eb2a07b","observation_id":"57a5a564-44a7-4132-ae28-c6dccd5a2e43","resolution":{"observed_at":"2026-08-01T06:54:48.331485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:54:48.336192Z","title":"Safety cases: How to justify the safety of advanced AI systems, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21735","last_updated":"2026-07-30T16:46:31Z","snapshot_observed_at":"2026-08-07T01:31:05.960858Z","submitted_at":"2026-07-23T18:34:12Z","title":"What AI Red-Team Evaluations Can and Cannot Prove","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T06:54:48.336192Z"},"links":{"citing_paper":"/paper/2607.21735"},"observation_digest":"sha256:703dcf28ee8458836dcdeed86f840489aa1d87f2cd58fc6db91e09e78487dbc8","observation_id":"15d7eebd-aa13-47ce-b215-3e3b5db064f5","resolution":{"observed_at":"2026-08-01T06:54:48.336192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:54:48.340824Z","title":"A sketch of an AI control safety case, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21735","last_updated":"2026-07-30T16:46:31Z","snapshot_observed_at":"2026-08-07T01:31:05.960858Z","submitted_at":"2026-07-23T18:34:12Z","title":"What AI Red-Team Evaluations Can and Cannot Prove","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T06:54:48.340824Z"},"links":{"citing_paper":"/paper/2607.21735"},"observation_digest":"sha256:0dfe55508982f651d4d6c4a57e198f0161356dc5b0105f4fdddb997de53bac5d","observation_id":"d1c28ae5-00a6-4d28-bbc5-9371f24a0edf","resolution":{"observed_at":"2026-08-01T06:54:48.340824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:54:48.346205Z","title":"Shadish, Thomas D","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.21735","last_updated":"2026-07-30T16:46:31Z","snapshot_observed_at":"2026-08-07T01:31:05.960858Z","submitted_at":"2026-07-23T18:34:12Z","title":"What AI Red-Team Evaluations Can and Cannot Prove","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T06:54:48.346205Z"},"links":{"citing_paper":"/paper/2607.21735"},"observation_digest":"sha256:d972275dae1de9a8e719289c3c4a3ea085afcfaa941e18fdca35a2a5c29920a0","observation_id":"bd78ca10-2ea9-4e4b-8876-96ee4677661b","resolution":{"observed_at":"2026-08-01T06:54:48.346205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:54:48.351912Z","title":"Dulberg, and George A","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2607.21735","last_updated":"2026-07-30T16:46:31Z","snapshot_observed_at":"2026-08-07T01:31:05.960858Z","submitted_at":"2026-07-23T18:34:12Z","title":"What AI Red-Team Evaluations Can and Cannot Prove","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T06:54:48.351912Z"},"links":{"citing_paper":"/paper/2607.21735"},"observation_digest":"sha256:7383826d028592f7efd9788897bcf57df8c7fe5fb2f451ba796f6f5925cf0cc8","observation_id":"8fd1b70a-b96a-4904-8310-6ff63f2a110d","resolution":{"observed_at":"2026-08-01T06:54:48.351912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:54:48.356405Z","title":"Hanley and Abby Lippman-Hand","venue":null,"work_id":null,"year":1983},"citing_paper":{"arxiv_id":"2607.21735","last_updated":"2026-07-30T16:46:31Z","snapshot_observed_at":"2026-08-07T01:31:05.960858Z","submitted_at":"2026-07-23T18:34:12Z","title":"What AI Red-Team Evaluations Can and Cannot Prove","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T06:54:48.356405Z"},"links":{"citing_paper":"/paper/2607.21735"},"observation_digest":"sha256:33c44d6848e93e4244d7375c7db56a0f355f2dd7f73f229d5ce34c9612109aa1","observation_id":"b985ad45-8b24-404f-bd54-efc7efda56bd","resolution":{"observed_at":"2026-08-01T06:54:48.356405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:54:48.360716Z","title":"Brown, and Francis R","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21735","last_updated":"2026-07-30T16:46:31Z","snapshot_observed_at":"2026-08-07T01:31:05.960858Z","submitted_at":"2026-07-23T18:34:12Z","title":"What AI Red-Team Evaluations Can and Cannot Prove","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T06:54:48.360716Z"},"links":{"citing_paper":"/paper/2607.21735"},"observation_digest":"sha256:2c6eb04cd36c074bbe301211cc917c5be87f6756f5087733301f9d291f5c7011","observation_id":"80f097a5-e73e-4c79-8be4-89db9febbe71","resolution":{"observed_at":"2026-08-01T06:54:48.360716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:54:48.365061Z","title":"XSTest: A test suite for identifying exaggerated safety behaviours in large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21735","last_updated":"2026-07-30T16:46:31Z","snapshot_observed_at":"2026-08-07T01:31:05.960858Z","submitted_at":"2026-07-23T18:34:12Z","title":"What AI Red-Team Evaluations Can and Cannot Prove","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T06:54:48.365061Z"},"links":{"citing_paper":"/paper/2607.21735"},"observation_digest":"sha256:3555a9911e224fa07c251914f82335b244a8e0e03be2f24ab2e2b729b00f677a","observation_id":"3eef9d01-3c9f-4227-ba1f-356c9a457061","resolution":{"observed_at":"2026-08-01T06:54:48.365061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07045","last_updated":"2024-06-24T04:04:21Z","snapshot_observed_at":"2026-08-06T09:15:44.308151Z","submitted_at":"2023-09-13T15:56:50Z","title":"SafetyBench: Evaluating the Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07045","snapshot_observed_at":"2026-08-01T06:54:48.369854Z","title":"SafetyBench: Evaluating the safety of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21735","last_updated":"2026-07-30T16:46:31Z","snapshot_observed_at":"2026-08-07T01:31:05.960858Z","submitted_at":"2026-07-23T18:34:12Z","title":"What AI Red-Team Evaluations Can and Cannot Prove","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T06:54:48.369854Z"},"links":{"cited_paper":"/paper/2309.07045","citing_paper":"/paper/2607.21735"},"observation_digest":"sha256:b4aaf16622d2d572e820e82b3d3dd78453b006a1a2b462ae9761be9e32f249e0","observation_id":"35546b27-3658-41db-ad14-ecb340c7aaee","resolution":{"observed_at":"2026-08-01T06:54:48.369854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:54:48.374594Z","title":"Zico Kolter, and Matt Fredrikson","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21735","last_updated":"2026-07-30T16:46:31Z","snapshot_observed_at":"2026-08-07T01:31:05.960858Z","submitted_at":"2026-07-23T18:34:12Z","title":"What AI Red-Team Evaluations Can and Cannot Prove","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T06:54:48.374594Z"},"links":{"citing_paper":"/paper/2607.21735"},"observation_digest":"sha256:177d5b3f9441480e392d3f6f0c0c1aa9f493b222b643f8369b604734cdf3438a","observation_id":"9876aa84-411b-4b94-828d-1e58b0411666","resolution":{"observed_at":"2026-08-01T06:54:48.374594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:54:48.378992Z","title":"HarmBench: A standardized evaluation framework for automated red teaming and robust refusal, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21735","last_updated":"2026-07-30T16:46:31Z","snapshot_observed_at":"2026-08-07T01:31:05.960858Z","submitted_at":"2026-07-23T18:34:12Z","title":"What AI Red-Team Evaluations Can and Cannot Prove","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T06:54:48.378992Z"},"links":{"citing_paper":"/paper/2607.21735"},"observation_digest":"sha256:33401bc32aed439ea29c0f2ed674ee888e18f769337f52b69033b4ad72364f3c","observation_id":"672f8c41-867c-4c87-b89a-54f65793a14c","resolution":{"observed_at":"2026-08-01T06:54:48.378992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:54:48.383131Z","title":"A StrongREJECT for empty jailbreaks, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21735","last_updated":"2026-07-30T16:46:31Z","snapshot_observed_at":"2026-08-07T01:31:05.960858Z","submitted_at":"2026-07-23T18:34:12Z","title":"What AI Red-Team Evaluations Can and Cannot Prove","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T06:54:48.383131Z"},"links":{"citing_paper":"/paper/2607.21735"},"observation_digest":"sha256:4a803e27f27136323235a37b2d7bba18a0d2ec716a0d0594a79307d7ec6e0e46","observation_id":"5b2fab8a-2f47-4b04-9ebd-f839dc927756","resolution":{"observed_at":"2026-08-01T06:54:48.383131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:54:48.387331Z","title":null,"venue":null,"work_id":null,"year":1934},"citing_paper":{"arxiv_id":"2607.21735","last_updated":"2026-07-30T16:46:31Z","snapshot_observed_at":"2026-08-07T01:31:05.960858Z","submitted_at":"2026-07-23T18:34:12Z","title":"What AI Red-Team Evaluations Can and Cannot Prove","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T06:54:48.387331Z"},"links":{"citing_paper":"/paper/2607.21735"},"observation_digest":"sha256:d78fc303630c017140170930abe7009eacfb66f13e18612338cca2c07a5e7aa1","observation_id":"2d6737ef-b31b-4d9d-8da0-0885059f99a3","resolution":{"observed_at":"2026-08-01T06:54:48.387331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:54:48.391557Z","title":"John Wiley and Sons, New York, 1965","venue":null,"work_id":null,"year":1965},"citing_paper":{"arxiv_id":"2607.21735","last_updated":"2026-07-30T16:46:31Z","snapshot_observed_at":"2026-08-07T01:31:05.960858Z","submitted_at":"2026-07-23T18:34:12Z","title":"What AI Red-Team Evaluations Can and Cannot Prove","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T06:54:48.391557Z"},"links":{"citing_paper":"/paper/2607.21735"},"observation_digest":"sha256:52d9ec905a6d55f501f7f8303eae155fba65afce9d74f7fd18a82a8f5d96e843","observation_id":"f37e2ad5-f7d1-4f60-bcc3-33ae49081e2d","resolution":{"observed_at":"2026-08-01T06:54:48.391557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:54:48.395950Z","title":null,"venue":null,"work_id":null,"year":1975},"citing_paper":{"arxiv_id":"2607.21735","last_updated":"2026-07-30T16:46:31Z","snapshot_observed_at":"2026-08-07T01:31:05.960858Z","submitted_at":"2026-07-23T18:34:12Z","title":"What AI Red-Team Evaluations Can and Cannot Prove","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T06:54:48.395950Z"},"links":{"citing_paper":"/paper/2607.21735"},"observation_digest":"sha256:dec51caef1eee9155d223ad2eda3789fb79926df901cf2513ceeac1efcff3c73","observation_id":"6467b702-3a36-4728-acd7-6519488f324e","resolution":{"observed_at":"2026-08-01T06:54:48.395950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:54:48.400904Z","title":"Model card and evaluations for claude models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21735","last_updated":"2026-07-30T16:46:31Z","snapshot_observed_at":"2026-08-07T01:31:05.960858Z","submitted_at":"2026-07-23T18:34:12Z","title":"What AI Red-Team Evaluations Can and Cannot Prove","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T06:54:48.400904Z"},"links":{"citing_paper":"/paper/2607.21735"},"observation_digest":"sha256:d7541f362784781d17114db429cd58f2153f1ad0c2241fbb57473007d6fbc0d2","observation_id":"ec26b57d-c8a9-40b2-a2eb-5fbf0aad3434","resolution":{"observed_at":"2026-08-01T06:54:48.400904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:54:48.406066Z","title":"Sentence-BERT: Sentence embeddings using siamese BERT-networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.21735","last_updated":"2026-07-30T16:46:31Z","snapshot_observed_at":"2026-08-07T01:31:05.960858Z","submitted_at":"2026-07-23T18:34:12Z","title":"What AI Red-Team Evaluations Can and Cannot Prove","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T06:54:48.406066Z"},"links":{"citing_paper":"/paper/2607.21735"},"observation_digest":"sha256:cc4facc174700ab02b023786cf316fac929bd5a6ce88c4a8705a9adf36b14939","observation_id":"2743c202-13bb-48ad-9ec3-9d6c206cc841","resolution":{"observed_at":"2026-08-01T06:54:48.406066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:54:48.410572Z","title":"LMSYS-Chat-1M: A large-scale real-world LLM conversation dataset, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21735","last_updated":"2026-07-30T16:46:31Z","snapshot_observed_at":"2026-08-07T01:31:05.960858Z","submitted_at":"2026-07-23T18:34:12Z","title":"What AI Red-Team Evaluations Can and Cannot Prove","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T06:54:48.410572Z"},"links":{"citing_paper":"/paper/2607.21735"},"observation_digest":"sha256:19b2b9249086ebcefab7a585120625b6d06848f72d7ea0af28d1622319457b1c","observation_id":"9382bd33-680a-4971-a2c4-76cec48fe29c","resolution":{"observed_at":"2026-08-01T06:54:48.410572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:54:48.415116Z","title":"Borgwardt, Malte J","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.21735","last_updated":"2026-07-30T16:46:31Z","snapshot_observed_at":"2026-08-07T01:31:05.960858Z","submitted_at":"2026-07-23T18:34:12Z","title":"What AI Red-Team Evaluations Can and Cannot Prove","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T06:54:48.415116Z"},"links":{"citing_paper":"/paper/2607.21735"},"observation_digest":"sha256:e6e7cd843269275d73fafb2d8fd38add468375d3d6a4df834908dbbe3d418d1e","observation_id":"211ea424-422f-4e2d-b5a6-6eaec1d95e12","resolution":{"observed_at":"2026-08-01T06:54:48.415116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:54:48.420308Z","title":"UMAP: Uniform manifold ap- proximation and projection for dimension reduction, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21735","last_updated":"2026-07-30T16:46:31Z","snapshot_observed_at":"2026-08-07T01:31:05.960858Z","submitted_at":"2026-07-23T18:34:12Z","title":"What AI Red-Team Evaluations Can and Cannot Prove","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T06:54:48.420308Z"},"links":{"citing_paper":"/paper/2607.21735"},"observation_digest":"sha256:fb0b3ed061c87e6ec82fc04c50343fef7a9224ff1e2a3318844f2ea7172a19b1","observation_id":"d26b55e6-5b01-46cc-9a5f-dc8f24d4fc7a","resolution":{"observed_at":"2026-08-01T06:54:48.420308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:54:48.426517Z","title":"Choquette-Choo, et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21735","last_updated":"2026-07-30T16:46:31Z","snapshot_observed_at":"2026-08-07T01:31:05.960858Z","submitted_at":"2026-07-23T18:34:12Z","title":"What AI Red-Team Evaluations Can and Cannot Prove","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T06:54:48.426517Z"},"links":{"citing_paper":"/paper/2607.21735"},"observation_digest":"sha256:9e303270d7233d66e88cf977765e3822c7300fa90e9adbc49046e32112c47878","observation_id":"942aafff-26e4-42eb-bb8c-7f19f5c9ef46","resolution":{"observed_at":"2026-08-01T06:54:48.426517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:54:48.434251Z","title":"AutoDAN: Generating stealthy jailbreak prompts on aligned large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21735","last_updated":"2026-07-30T16:46:31Z","snapshot_observed_at":"2026-08-07T01:31:05.960858Z","submitted_at":"2026-07-23T18:34:12Z","title":"What AI Red-Team Evaluations Can and Cannot Prove","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T06:54:48.434251Z"},"links":{"citing_paper":"/paper/2607.21735"},"observation_digest":"sha256:118731b361320c0bcf6673f63d098d02df12b3f46f311d2e9bf5862d39d23025","observation_id":"1a80966c-fb58-438f-9e1b-4b4c63f0615c","resolution":{"observed_at":"2026-08-01T06:54:48.434251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:54:48.440217Z","title":"Does refusal training in LLMs generalize to the past tense?, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21735","last_updated":"2026-07-30T16:46:31Z","snapshot_observed_at":"2026-08-07T01:31:05.960858Z","submitted_at":"2026-07-23T18:34:12Z","title":"What AI Red-Team Evaluations Can and Cannot Prove","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T06:54:48.440217Z"},"links":{"citing_paper":"/paper/2607.21735"},"observation_digest":"sha256:94fa4dd67b2fe780c18ed5c28c84394063114e5faa48fcccf379cf5f99bc08d5","observation_id":"7130a205-44c7-4b3b-a148-c24277ff8fe8","resolution":{"observed_at":"2026-08-01T06:54:48.440217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:54:48.446386Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21735","last_updated":"2026-07-30T16:46:31Z","snapshot_observed_at":"2026-08-07T01:31:05.960858Z","submitted_at":"2026-07-23T18:34:12Z","title":"What AI Red-Team Evaluations Can and Cannot Prove","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T06:54:48.446386Z"},"links":{"citing_paper":"/paper/2607.21735"},"observation_digest":"sha256:f2abe3994b1a05ac8f36ac3d7b7c349315efce500651e42006ea80cc8de10809","observation_id":"40a1a1e4-0715-4b4e-9a2d-87dba58c35be","resolution":{"observed_at":"2026-08-01T06:54:48.446386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:54:48.451336Z","title":"Tree of attacks: Jail- breaking black-box LLMs automatically, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21735","last_updated":"2026-07-30T16:46:31Z","snapshot_observed_at":"2026-08-07T01:31:05.960858Z","submitted_at":"2026-07-23T18:34:12Z","title":"What AI Red-Team Evaluations Can and Cannot Prove","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T06:54:48.451336Z"},"links":{"citing_paper":"/paper/2607.21735"},"observation_digest":"sha256:3cdbb1fc2ace03a429db260449b89401b85ff054f6f51f6fb71dbbaf431ce314","observation_id":"0eb41bd9-2072-4694-a6f9-e520ee816c51","resolution":{"observed_at":"2026-08-01T06:54:48.451336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:54:48.455476Z","title":"Ignore previous prompt: Attack techniques for lan- guage models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21735","last_updated":"2026-07-30T16:46:31Z","snapshot_observed_at":"2026-08-07T01:31:05.960858Z","submitted_at":"2026-07-23T18:34:12Z","title":"What AI Red-Team Evaluations Can and Cannot Prove","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T06:54:48.455476Z"},"links":{"citing_paper":"/paper/2607.21735"},"observation_digest":"sha256:a1b1b1d46868fa887b4e1604d6eab5d3e9e3d5c370cba2788135a73953e3fbc6","observation_id":"652b69c2-d087-4678-bab5-18eb0e197c1d","resolution":{"observed_at":"2026-08-01T06:54:48.455476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:54:48.460464Z","title":"GPT-4 technical report, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21735","last_updated":"2026-07-30T16:46:31Z","snapshot_observed_at":"2026-08-07T01:31:05.960858Z","submitted_at":"2026-07-23T18:34:12Z","title":"What AI Red-Team Evaluations Can and Cannot Prove","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T06:54:48.460464Z"},"links":{"citing_paper":"/paper/2607.21735"},"observation_digest":"sha256:15179ffd40341b0588627c21daae83637f6f81ead20a2879456126ed525703dd","observation_id":"66ea6870-7599-4e90-8976-8d8e4930c06f","resolution":{"observed_at":"2026-08-01T06:54:48.460464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:54:48.464794Z","title":"GPT-4o system card, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21735","last_updated":"2026-07-30T16:46:31Z","snapshot_observed_at":"2026-08-07T01:31:05.960858Z","submitted_at":"2026-07-23T18:34:12Z","title":"What AI Red-Team Evaluations Can and Cannot Prove","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T06:54:48.464794Z"},"links":{"citing_paper":"/paper/2607.21735"},"observation_digest":"sha256:3c4830fccb4518b7d30d29bbd11016f092b5cfead451d88c6778121e544cc7ee","observation_id":"d73ba15e-e881-40ee-a011-21c5730c57e0","resolution":{"observed_at":"2026-08-01T06:54:48.464794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:54:48.469031Z","title":"The claude 3 model family: Opus, sonnet, haiku","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21735","last_updated":"2026-07-30T16:46:31Z","snapshot_observed_at":"2026-08-07T01:31:05.960858Z","submitted_at":"2026-07-23T18:34:12Z","title":"What AI Red-Team Evaluations Can and Cannot Prove","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T06:54:48.469031Z"},"links":{"citing_paper":"/paper/2607.21735"},"observation_digest":"sha256:fbe0c07c4d5eb946661afd16063034388602041f63a38aec49a4a31ff313c6c0","observation_id":"6aeced3a-b254-4c43-9259-387270fb29bd","resolution":{"observed_at":"2026-08-01T06:54:48.469031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:54:48.473574Z","title":"System card: Claude opus 4 and claude sonnet 4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21735","last_updated":"2026-07-30T16:46:31Z","snapshot_observed_at":"2026-08-07T01:31:05.960858Z","submitted_at":"2026-07-23T18:34:12Z","title":"What AI Red-Team Evaluations Can and Cannot Prove","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T06:54:48.473574Z"},"links":{"citing_paper":"/paper/2607.21735"},"observation_digest":"sha256:e373c2faa9a6732d7066c20bbad1ed9ec4061d5eda1a8c9c85eb55b41796b3cc","observation_id":"b8d0024a-c2f1-4657-910c-c039b8fdf02f","resolution":{"observed_at":"2026-08-01T06:54:48.473574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:54:48.478226Z","title":"Gemini: A family of highly capable multimodal models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21735","last_updated":"2026-07-30T16:46:31Z","snapshot_observed_at":"2026-08-07T01:31:05.960858Z","submitted_at":"2026-07-23T18:34:12Z","title":"What AI Red-Team Evaluations Can and Cannot Prove","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T06:54:48.478226Z"},"links":{"citing_paper":"/paper/2607.21735"},"observation_digest":"sha256:856b7a1b8d01247c5ff79f5b5194952bbc4d6beb2e6434c96d5c2fb01d73b9ae","observation_id":"9a976dac-022b-4d95-a2b6-79f8b8d1df37","resolution":{"observed_at":"2026-08-01T06:54:48.478226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:54:48.482631Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21735","last_updated":"2026-07-30T16:46:31Z","snapshot_observed_at":"2026-08-07T01:31:05.960858Z","submitted_at":"2026-07-23T18:34:12Z","title":"What AI Red-Team Evaluations Can and Cannot Prove","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T06:54:48.482631Z"},"links":{"citing_paper":"/paper/2607.21735"},"observation_digest":"sha256:216faad3de5eae1b129fdaf8f7896cef3f16f423aa0c18bbc1e5f1af12b6f7c8","observation_id":"43d610c4-3c39-4a56-b54c-3403433df20b","resolution":{"observed_at":"2026-08-01T06:54:48.482631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:54:48.486674Z","title":"Llama 2: Open foundation and fine-tuned chat models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21735","last_updated":"2026-07-30T16:46:31Z","snapshot_observed_at":"2026-08-07T01:31:05.960858Z","submitted_at":"2026-07-23T18:34:12Z","title":"What AI Red-Team Evaluations Can and Cannot Prove","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T06:54:48.486674Z"},"links":{"citing_paper":"/paper/2607.21735"},"observation_digest":"sha256:0596b9faca6f1031be8194615b3436ce4649c1233486179b398545e3ba1f8eb8","observation_id":"4954885d-4486-4200-a812-e363906d50eb","resolution":{"observed_at":"2026-08-01T06:54:48.486674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:54:48.490984Z","title":"The llama 3 herd of models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21735","last_updated":"2026-07-30T16:46:31Z","snapshot_observed_at":"2026-08-07T01:31:05.960858Z","submitted_at":"2026-07-23T18:34:12Z","title":"What AI Red-Team Evaluations Can and Cannot Prove","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T06:54:48.490984Z"},"links":{"citing_paper":"/paper/2607.21735"},"observation_digest":"sha256:4775c3d10ef1c5e39672cdf39ebc65d6ed2833175fdafb14d49d302eabd24f74","observation_id":"edfa1227-57cf-4042-8c31-f4869976d8f4","resolution":{"observed_at":"2026-08-01T06:54:48.490984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:54:48.495168Z","title":"Responsible scaling policy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21735","last_updated":"2026-07-30T16:46:31Z","snapshot_observed_at":"2026-08-07T01:31:05.960858Z","submitted_at":"2026-07-23T18:34:12Z","title":"What AI Red-Team Evaluations Can and Cannot Prove","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T06:54:48.495168Z"},"links":{"citing_paper":"/paper/2607.21735"},"observation_digest":"sha256:7907c823439dd55d0a0d8b0ce1e3c9c019a4d6efed2e92371446440d79fede81","observation_id":"56e9109f-1aee-4983-9afd-fa36d97d3de9","resolution":{"observed_at":"2026-08-01T06:54:48.495168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:54:48.499159Z","title":"Red teaming language models to reduce harms: Methods, scaling behaviors, and lessons learned, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21735","last_updated":"2026-07-30T16:46:31Z","snapshot_observed_at":"2026-08-07T01:31:05.960858Z","submitted_at":"2026-07-23T18:34:12Z","title":"What AI Red-Team Evaluations Can and Cannot Prove","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T06:54:48.499159Z"},"links":{"citing_paper":"/paper/2607.21735"},"observation_digest":"sha256:895716e33a3dcba896eea0e79e88be2e5caf6ecdff9c5daf33f9c77226b1e25f","observation_id":"2bacd9a9-bb05-4f97-a16d-74edf5a71c39","resolution":{"observed_at":"2026-08-01T06:54:48.499159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:54:48.503377Z","title":"Red teaming language models with language models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21735","last_updated":"2026-07-30T16:46:31Z","snapshot_observed_at":"2026-08-07T01:31:05.960858Z","submitted_at":"2026-07-23T18:34:12Z","title":"What AI Red-Team Evaluations Can and Cannot Prove","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T06:54:48.503377Z"},"links":{"citing_paper":"/paper/2607.21735"},"observation_digest":"sha256:47e79e0ba831e0960460905e2e780eda5f22cf54de8e3300b6940d71aa0d2656","observation_id":"8811b220-1865-4f65-acbe-2ba4172ec09b","resolution":{"observed_at":"2026-08-01T06:54:48.503377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.21735","last_updated":"2026-07-30T16:46:31Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T01:31:05.960858Z","submitted_at":"2026-07-23T18:34:12Z","title":"What AI Red-Team Evaluations Can and Cannot Prove"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2607.21735."}