Pith. sign in

Paper Citation Record · LEDGER

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests

As of 20 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 2 inbound Pith citation observations for arXiv:2502.06867.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2502.06867 v1

Coverage vector

measured 62 of 62 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-08T19:21:19.261269Z

measured 64 of 64 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-20T06:33:59.587034+00:00

measured 2 of 2 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-01T14:45:42.876760Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-22T01:20:51.933250Z

Reference resolution

62 of 62 outbound references displayed

  • verified exact2
  • verified fuzzy15
  • unresolved44
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation dbe955ae-1107-4c8a-bacb-47a8f4ae682b · outbound

This paper cites Benchmark Early and Red Team Often: A Framework for Assessing and Managing Dual-Use Hazards of AI Foundation Models.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests Benchmark Early and Red Team Often: A Framework for Assessing and Managing Dual-Use Hazards of AI Foundation Models

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-08T19:21:18.977393Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:21:18.977393Z digest=sha256:0e035be080e970a5705e77c4fdca77e52ee05782e611a48513f85c75e655d055

Observation 9ed0c418-1c4c-44b4-946b-b29d5bc43789 · outbound

This paper cites Adversaries Can Misuse Combinations of Safe Models.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests Adversaries Can Misuse Combinations of Safe Models

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-08T19:21:18.980851Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:21:18.980851Z digest=sha256:6039ad22f0a313fca140907ba1f643ef50362ad22862ea74eac8cf96dfd439e4

Observation 039ac423-8e6e-4165-a7eb-c26dca054a9e · outbound

This paper cites Hazards from Increasingly Accessible Fine-Tuning of Downloadable Foundation Models.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests Hazards from Increasingly Accessible Fine-Tuning of Downloadable Foundation Models

Reference 3

Resolution
verified exact
local_arxiv, observed 2026-08-08T19:21:19.435175Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-08T19:21:18.983898Z digest=sha256:c600c8cdcb1ef25421d69ce9b119e643b8c5e732f4db0ffaacc54594663480fc

Observation 8d03ed14-e472-4add-a81e-40852ce8cfd0 · outbound

This paper cites Defense Priorities in the Open-Source AI Debate: A Preliminary Assessment.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests Defense Priorities in the Open-Source AI Debate: A Preliminary Assessment

Reference 4

Resolution
verified exact
local_arxiv, observed 2026-08-08T19:21:19.424997Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-08T19:21:18.986908Z digest=sha256:84f1f7e8ac1a95f0eb17067c9baecef6439adb7e8efd1937086114bebe01926c

Observation de131ff2-0e55-4cdb-bd0f-12581a6b08dc · outbound

This paper cites Control Risk for Potential Misuse of Artificial Intelligence in Science.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests Control Risk for Potential Misuse of Artificial Intelligence in Science

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-08T19:21:18.989739Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:21:18.989739Z digest=sha256:51d866952d18048ab9dd8a0c857e101f34fa8a136b8712aced5aaf6dfe1c7d7b

Observation e4e6a693-7264-4b03-92ed-67716ab05ef7 · outbound

This paper cites HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-08T19:21:18.992928Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:21:18.992928Z digest=sha256:e5975e3aa1f23dc2c38658e6908f9840624c0f02c6f0d2270e8202342a11c417

Observation 733f9edd-a103-4b37-b22e-631eacf22603 · outbound

This paper cites An Overview of Catastrophic AI Risks.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests An Overview of Catastrophic AI Risks

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-08T19:21:18.996829Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:21:18.996829Z digest=sha256:268ca7aeaebc0c682e52d10b54d18e951c7fdf7d2fe779ccb0d871b9b66d291b

Observation b4b1312c-51f3-43cb-b750-05173ca6efc2 · outbound

This paper cites Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-08T19:21:19.000586Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:21:19.000586Z digest=sha256:c5c99f077aaa22f7149affac45b62394fb9adf9ed9b0ea86cda8f51d5035cafd

Observation 2684cff5-a8d2-41ca-b436-99accad025da · outbound

This paper cites an unresolved cited work.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests Unresolved cited work

Reference 9

Resolution
unresolved
raw_fallback, observed 2026-08-08T19:21:19.742322Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-08T19:21:19.003963Z digest=sha256:32261a823d053a8fa7ec0ffdb28dc04f72a5c943a95b0c74d0d0958ab553db6c

Observation f617b400-b5a7-4967-a481-894f907de102 · outbound

This paper cites Emergent autonomous scientific research capabilities of large language models.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests Emergent autonomous scientific research capabilities of large language models

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-08T19:21:19.007290Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:21:19.007290Z digest=sha256:3e4c63709c90d5168cb983df61efef0048ab21d85bd25f857d1816a2c8427293

Observation 39427626-96cd-45f7-b29e-4926c68eb168 · outbound

This paper cites Emergent Language: A Survey and Taxonomy.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests Emergent Language: A Survey and Taxonomy

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-08T19:21:19.103143Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:21:19.103143Z digest=sha256:721cf0ac1c6945650164f6bcf64c0d763d8374d12b882191ffe1dfbb4af9a8a0

Observation ff05affc-bf86-4205-a8b7-80620f1f1db2 · outbound

This paper cites A., Caliskan, A., Liyanage, S., & Banaji, M.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests A., Caliskan, A., Liyanage, S., & Banaji, M

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:21:19.734559Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-08T19:21:19.106974Z digest=sha256:694421ec75d64c28d8a254a65ad83d941570ce45f3f3ad0213213bcd6937f7ef

Observation e5039700-dae9-4cc0-926f-3404a875901c · outbound

This paper cites J., Kaplan, D., Ren, Z., Hsu, C.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests J., Kaplan, D., Ren, Z., Hsu, C

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:21:19.726864Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-08T19:21:19.110567Z digest=sha256:6d09c20c8f0671812bac21581c927e7de039e3058a534915e61cf6d47aafe837

Observation b74659b5-d7e7-420b-83d1-f12092732622 · outbound

This paper cites an unresolved cited work.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests Unresolved cited work

Reference 14

Resolution
unresolved
raw_fallback, observed 2026-08-08T19:21:19.719005Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-08T19:21:19.113931Z digest=sha256:75075b3e0df73de1782e6dcbde946712c1eba19812540bcc3a8d4bee5ec3e996

Observation f9932c7e-a28c-401f-9fe9-64218e7754a1 · outbound

This paper cites an unresolved cited work.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests Unresolved cited work

Reference 15

Resolution
unresolved
raw_fallback, observed 2026-08-08T19:21:19.711338Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-08T19:21:19.117101Z digest=sha256:19f888de09374388bcbdb978ffc1bcbbe0c983ab2598bfa4240dd944dc599930

Observation d1db077f-503e-4eae-9c25-24f001ecb6a0 · outbound

This paper cites an unresolved cited work.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests Unresolved cited work

Reference 16

Resolution
unresolved
raw_fallback, observed 2026-08-08T19:21:19.703674Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-08T19:21:19.120535Z digest=sha256:934f2be88e1ec337f96ddfb104792ad5469936890b8787d899294a5554f840b7

Observation 434fe21e-5040-42c6-87bc-a6b898ddc71f · outbound

This paper cites an unresolved cited work.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests Unresolved cited work

Reference 17

Resolution
unresolved
raw_fallback, observed 2026-08-08T19:21:19.695182Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-08T19:21:19.123823Z digest=sha256:cfd9602b9bbd085012b4cc7ddf2f21e80b9e57aa0749320c91782be62e6878fd

Observation e67b5b15-8613-41b6-8f52-7b5cf9eaefc6 · outbound

This paper cites OR-Bench: An Over-Refusal Benchmark for Large Language Models.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-08T19:21:19.126985Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:21:19.126985Z digest=sha256:a50b575de7d879e6689865cf545e5a7eaf390b63fd868b0a95818cd5d74fd69f

Observation 4edab477-976c-45f3-aabe-a4cfe1f36a36 · outbound

This paper cites an unresolved cited work.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests Unresolved cited work

Reference 19

Resolution
unresolved
raw_fallback, observed 2026-08-08T19:21:19.687582Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-08T19:21:19.130787Z digest=sha256:0966711f3067cd2b952e8a4566f168888504db4bbce329b7d4d58bbc884fb9d7

Observation 99e748b6-a813-4ae1-bd9b-7daf04612e88 · outbound

This paper cites an unresolved cited work.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests Unresolved cited work

Reference 20

Resolution
unresolved
raw_fallback, observed 2026-08-08T19:21:19.680956Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-08T19:21:19.133963Z digest=sha256:9375be166e7772f8b1bb5431b65de6f2efa5dda236b9c570ab71e471f13e3a07

Observation 97659b8a-d5bd-486d-83fd-10fb7c270555 · outbound

This paper cites Refusal Tokens: A Simple Way to Calibrate Refusals in Large Language Models.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests Refusal Tokens: A Simple Way to Calibrate Refusals in Large Language Models

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-08T19:21:19.137233Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:21:19.137233Z digest=sha256:5129e68b1d048791aee3e62ca1aa554d716f3f3aaeacb4c06efbb2fc6cecd97d

Observation edfd4c34-154b-4fac-9aec-73ecd36b53cc · outbound

This paper cites J., & Wick, M.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests J., & Wick, M

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:21:19.674298Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-08T19:21:19.140410Z digest=sha256:49d366f7dc9da05468504f996182cb158a324747ffb6b4888935fc7df0bbe5f4

Observation 3beb04eb-39ec-44cf-bd17-2bac03f6d8c1 · outbound

This paper cites POROver: Improving Safety and Reducing Overrefusal in Large Language Models with Overgeneration and Preference Optimization.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests POROver: Improving Safety and Reducing Overrefusal in Large Language Models with Overgeneration and Preference Optimization

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-08T19:21:19.143563Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:21:19.143563Z digest=sha256:416a29033f6bbeef5eb494ee74a28fd4fa4fa61c901b0a2a5fc307c3fb4a810f

Observation 0503e350-69ab-4040-9474-d413bfc24ec8 · outbound

This paper cites Automatic Pseudo-Harmful Prompt Generation for Evaluating False Refusals in Large Language Models.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests Automatic Pseudo-Harmful Prompt Generation for Evaluating False Refusals in Large Language Models

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-08T19:21:19.146827Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:21:19.146827Z digest=sha256:ec443547b611c82e16a76c309d98d4a28db88f9e0f807190ddc763a1c05ed95a

Observation 3087a14e-c766-4a59-b8b0-d9a0e8a861d2 · outbound

This paper cites an unresolved cited work.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests Unresolved cited work

Reference 25

Resolution
unresolved
raw_fallback, observed 2026-08-08T19:21:19.667729Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-08T19:21:19.150334Z digest=sha256:6cdc35bf65536f8819d0d0eab82b74aa1d3ba501acca9502cde50ed1c9e48dea

Observation cc75fb0e-a32f-46d6-bedf-0ae9e2acca5e · outbound

This paper cites Can large language models democratize access to dual-use biotechnology?.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests Can large language models democratize access to dual-use biotechnology?

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-08T19:21:19.153433Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:21:19.153433Z digest=sha256:a4f7174186192afe171bddb827c2a16ccba1fc01da60cb314217f4dce7e218cd

Observation 5e4ce984-71d0-4a24-8fc2-354289a40960 · outbound

This paper cites The Reality of AI and Biorisk.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests The Reality of AI and Biorisk

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-08T19:21:19.157071Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:21:19.157071Z digest=sha256:04ba42e8b059fb70ffba677b9d13ca42715a4de896fe5c3c8e04e2b15d7a3c10

Observation 9f98ae51-7924-4007-ae1b-9f5ec35e1d84 · outbound

This paper cites an unresolved cited work.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests Unresolved cited work

Reference 28

Resolution
malformed identifier
no resolver link, observed 2026-08-08T19:21:19.160347Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:21:19.160347Z digest=sha256:80516cc5b2725f38b3f4d7f0bae38fd3e6ed62cdf944f64f4e509afeffd439b0

Observation 20c8e7c3-5664-4860-ba33-0cdb2596ac2e · outbound

This paper cites H., Rocha, R., Cordova, K., Specter, M., & Esvelt, K.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests H., Rocha, R., Cordova, K., Specter, M., & Esvelt, K

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:21:19.659994Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-08T19:21:19.163061Z digest=sha256:30f67e0c3a27d4c4dc2aa4ace2db3070c098a126cd63fcdd9c32ace5254afc69

Observation 534a0b96-fa5f-46af-8d1b-5d2c769967a5 · outbound

This paper cites an unresolved cited work.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests Unresolved cited work

Reference 30

Resolution
unresolved
raw_fallback, observed 2026-08-08T19:21:19.652162Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-08T19:21:19.165474Z digest=sha256:19ecafcfe6522c8c4fca6e59d96ae6b2e23792e4fb58d26fd7cd8481ff18d5e5

Observation db6dd4e7-ed62-4e45-9684-f88c32225e1a · outbound

This paper cites Will releasing the weights of future large language models grant widespread access to pandemic agents?.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests Will releasing the weights of future large language models grant widespread access to pandemic agents?

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-08T19:21:19.167805Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:21:19.167805Z digest=sha256:b24596d4c5c428508d1453ff53dff2105421a73db7a215a399876a71a01268f0

Observation 847b202b-b044-492c-8ded-eb0f5cdf655b · outbound

This paper cites Prioritizing High-Consequence Biological Capabilities in Evaluations of Artificial Intelligence Models.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests Prioritizing High-Consequence Biological Capabilities in Evaluations of Artificial Intelligence Models

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-08T19:21:19.170579Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:21:19.170579Z digest=sha256:f523411e4d200c0c042db5bf4ab04a8addbaaa4b3459ee768afee2998a447ad6

Observation c55da87b-582f-40a9-b76c-57885508d326 · outbound

This paper cites Towards Responsible Governance of Biological Design Tools.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests Towards Responsible Governance of Biological Design Tools

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-08T19:21:19.173371Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:21:19.173371Z digest=sha256:26c8768772fa911e9520af869a3312198a72768b69e414129a61e5fdf82006f1

Observation e6dc54b5-35a0-4c2a-b428-bdb0d36abb73 · outbound

This paper cites an unresolved cited work.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests Unresolved cited work

Reference 34

Resolution
unresolved
raw_fallback, observed 2026-08-08T19:21:19.644747Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-08T19:21:19.175928Z digest=sha256:5886da78ae52d6aa7668f7b66c664e258e5c9d8a75c7d3bd78e8f67c4f7f983e

Observation 7e635a9a-e18e-4af6-af7f-45a4222334c0 · outbound

This paper cites LAB-Bench: Measuring Capabilities of Language Models for Biology Research.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests LAB-Bench: Measuring Capabilities of Language Models for Biology Research

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-08T19:21:19.179354Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:21:19.179354Z digest=sha256:8e7f1d6bcd01a23eb6aa6745add2977e6060f8aafca71103fac80ddd81689266

Observation 02a83956-c979-4585-aca1-ed9482a10ff6 · outbound

This paper cites T., Martin, F.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests T., Martin, F

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:21:19.637172Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-08T19:21:19.182660Z digest=sha256:6ff6316c0cd98e3b1daec3c5919c0da03368e1a3eaf9b677466754d08b7362b0

Observation 87873364-4b4c-49f2-bda4-3e645e0bd11b · outbound

This paper cites Are large language models superhuman chemists?.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests Are large language models superhuman chemists?

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-08T19:21:19.185989Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:21:19.185989Z digest=sha256:d76f19d153f4ec98aa7373a7d23de9b4ed66246f82314f29e847dc5a10c0d316

Observation f7cc2bbf-a230-4360-93f0-a9c784beb9aa · outbound

This paper cites M., Ai, Q., Al-Feghali, A., Badhwar, S., Bocarsly, J.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests M., Ai, Q., Al-Feghali, A., Badhwar, S., Bocarsly, J

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:21:19.629717Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-08T19:21:19.189391Z digest=sha256:dd5fde3b0551bda179d2b67aecdd78673b77e2b7c4ba44c3ec954f634e3dd77e

Observation 8e9c0b36-8504-423d-8708-66dbd787a183 · outbound

This paper cites an unresolved cited work.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests Unresolved cited work

Reference 39

Resolution
unresolved
raw_fallback, observed 2026-08-08T19:21:19.622247Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-08T19:21:19.192470Z digest=sha256:d68f3d958b24038a21250b38942d4517f81bc96887662b2b50fd8203c548adeb

Observation 8f4b8a26-4641-4beb-8258-e0c66b8b89ee · outbound

This paper cites ChemCrow: Augmenting large-language models with chemistry tools.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests ChemCrow: Augmenting large-language models with chemistry tools

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-08T19:21:19.195323Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:21:19.195323Z digest=sha256:7b8110233c694c45f74cd5b1e478813ae7b0f59889c54b42f0d46388fcf4207c

Observation 970bf2c9-c02f-4707-b79a-bb651f488530 · outbound

This paper cites an unresolved cited work.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests Unresolved cited work

Reference 41

Resolution
unresolved
raw_fallback, observed 2026-08-08T19:21:19.614699Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-08T19:21:19.198606Z digest=sha256:28d7b17a60d82064ac3911d5a7ee117bcf0a8d8adc11990ce7e3e7c1da6e4eb2

Observation c50aa7a0-fd55-4340-af73-2d043dbf4898 · outbound

This paper cites an unresolved cited work.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests Unresolved cited work

Reference 42

Resolution
unresolved
raw_fallback, observed 2026-08-08T19:21:19.607066Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-08T19:21:19.201482Z digest=sha256:5c2d08335a93aed4bad4b1b3c387b0b10421baa52df408c2dadccd127a515168

Observation 410d2cc5-dc9e-4377-875b-e3aac538351f · outbound

This paper cites Catastrophic Cyber Capabilities Benchmark (3CB): Robustly Evaluating LLM Agent Cyber Offense Capabilities.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests Catastrophic Cyber Capabilities Benchmark (3CB): Robustly Evaluating LLM Agent Cyber Offense Capabilities

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-08T19:21:19.204591Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:21:19.204591Z digest=sha256:40a2e46ab63176418cd99b01cf09352bda24b027791ac2b5b5ec0d402ce25870

Observation 4096174b-5367-48b0-a3dc-560a7180a7d2 · outbound

This paper cites (2016), https://slate.com/technology/2016/06/microsoft -ceo-satya-nadella-humans-and-a-i-can- work-together-to-solve-societys-challenges.html.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests (2016), https://slate.com/technology/2016/06/microsoft -ceo-satya-nadella-humans-and-a-i-can- work-together-to-solve-societys-challenges.html

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:21:19.599157Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-08T19:21:19.208004Z digest=sha256:8339297ea5a0eef7c6c4d3ec13c05baae27095f58f8dd04671efae884e618388

Observation ee28cb60-0e07-47f9-951a-632e13099398 · outbound

This paper cites an unresolved cited work.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests Unresolved cited work

Reference 45

Resolution
unresolved
raw_fallback, observed 2026-08-08T19:21:19.591174Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-08T19:21:19.210919Z digest=sha256:308b5e7c391da55c5c7387feb4124004259b57547f0bfabc37aafc91a692cebe

Observation d3e404db-8051-498b-a8a4-b4f31fb0a9d8 · outbound

This paper cites https://github.com/reveondivad/forbidden.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests https://github.com/reveondivad/forbidden

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:21:19.583410Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-08T19:21:19.213946Z digest=sha256:64077e99e42a72da4f9936f85fcad30f6c0f248e1584f70dd1ce37529bc1b887

Observation b1294d24-0ae1-4d6b-9790-f9f90d24c02d · outbound

This paper cites (2024), China's Military Is Using Meta's AI.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests (2024), China's Military Is Using Meta's AI

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:21:19.575094Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-08T19:21:19.217051Z digest=sha256:d70fc4e73814590f93c5012513d1ad2c625b756ecefbeb06904a1bc6f38b1466

Observation c763211d-21f8-4648-9691-53339c23064f · outbound

This paper cites M., Grisham, A.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests M., Grisham, A

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:21:19.568010Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-08T19:21:19.220023Z digest=sha256:b1144312468e3c4f421ad516ec6a7fb15bdb35a09c854547df922c33e779b353

Observation a7867bbe-4b5b-4f54-97a9-97293fedabba · outbound

This paper cites W., Luo, J.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests W., Luo, J

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:21:19.561483Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-08T19:21:19.222933Z digest=sha256:68409ce8dbe0a5037fe64a867f2038c94c40b18d5e56ea3e66ebdd97945e7fc4

Observation 7957d511-c3c9-4acd-8455-7148767490a6 · outbound

This paper cites How may entropy be reversed?.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests How may entropy be reversed?

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:21:19.554726Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-08T19:21:19.225942Z digest=sha256:d9b3a2706e3da47e7e2e682f3e74449e63ba4938ac0636e5b71d316c2de86ed6

Observation ca951867-4bdc-432b-914f-d9d579d2e622 · outbound

This paper cites an unresolved cited work.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests Unresolved cited work

Reference 51

Resolution
unresolved
raw_fallback, observed 2026-08-08T19:21:19.548237Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-08T19:21:19.229313Z digest=sha256:b2e5764878f15b5100543496f401e91682f8282b1347c31c8ecb8ae541190080

Observation ba98d859-e8b1-4630-8c59-2fc2657e13a5 · outbound

This paper cites an unresolved cited work.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests Unresolved cited work

Reference 52

Resolution
unresolved
raw_fallback, observed 2026-08-08T19:21:19.540506Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-08T19:21:19.232314Z digest=sha256:48b19932c12102209fd0ee4c26199b86ae71953daeff2238cfbb863d684756c4

Observation 22ed6eb6-5f4d-4ceb-a81a-1d26be0c6e32 · outbound

This paper cites an unresolved cited work.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests Unresolved cited work

Reference 53

Resolution
unresolved
raw_fallback, observed 2026-08-08T19:21:19.532528Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-08T19:21:19.235399Z digest=sha256:cd931d0dd5d65cbbf5f5a6cceb8927e20b1abc19a1b54fd2513656c316198fd3

Observation f3d3b6e7-f00d-495c-94b6-8582353aa1a2 · outbound

This paper cites Grok-2-1212 Chain of Thought: The question is asking for modifications to China White, a form of fentanyl, to make it safer or more effective for medical use.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests Grok-2-1212 Chain of Thought: The question is asking for modifications to China White, a form of fentanyl, to make it safer or more effective for medical use

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:21:19.524688Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-08T19:21:19.238643Z digest=sha256:3d0310230658e5834929bfde1edd26dd136018ccbe8d9404e54248aeecfa1a5f

Observation 05ecdad3-1588-47a6-9308-e3c359fb9d71 · outbound

This paper cites an unresolved cited work.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests Unresolved cited work

Reference 55

Resolution
unresolved
raw_fallback, observed 2026-08-08T19:21:19.516238Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-08T19:21:19.241783Z digest=sha256:fcf374add8b24d7d578fcfa440c8f8020dd6d7521dd33b9691026f7d099b67ec

Observation 6dc391a4-eca2-40e9-ba79-d0e3beea9781 · outbound

This paper cites an unresolved cited work.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests Unresolved cited work

Reference 56

Resolution
unresolved
raw_fallback, observed 2026-08-08T19:21:19.508377Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-08T19:21:19.244792Z digest=sha256:36619e16ef2fdc9e05c93cb27edcea53004bdd011f07a2e405b17bad24213c6b

Observation bd81421e-1a44-4f9b-9646-fdef5315b2be · outbound

This paper cites GPT-3.5 Chain of Thought: To explain the step-by-step chemical synthesis process for (Positional Isomer: MDMB), focusing on reagents and conditions.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests GPT-3.5 Chain of Thought: To explain the step-by-step chemical synthesis process for (Positional Isomer: MDMB), focusing on reagents and conditions

Reference 57

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:21:19.500188Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-08T19:21:19.247813Z digest=sha256:d6d44831d7e49aeaf9794eadef0965ee74f99fa7925bbf04d0c76c6e1b9f11e6

Observation e7407f3a-8cf5-46db-ac18-471aca8631fc · outbound

This paper cites an unresolved cited work.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests Unresolved cited work

Reference 58

Resolution
unresolved
raw_fallback, observed 2026-08-08T19:21:19.491195Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-08T19:21:19.250838Z digest=sha256:6391e7fdaae5892e2770f8d471bbba2ee297c95d16f617bea12a4c0b37963a7e

Observation 62ee6f23-a05c-460e-9731-a38c824af56a · outbound

This paper cites an unresolved cited work.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests Unresolved cited work

Reference 59

Resolution
unresolved
raw_fallback, observed 2026-08-08T19:21:19.482763Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-08T19:21:19.253854Z digest=sha256:262a5143fccf86bdbbe67a291d518dc327a645cd2c426fcfa0dd7f3c02e89f57

Observation a368cb24-c5da-496f-997d-0f24afb7a843 · outbound

This paper cites an unresolved cited work.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests Unresolved cited work

Reference 60

Resolution
unresolved
raw_fallback, observed 2026-08-08T19:21:19.474166Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-08T19:21:19.256732Z digest=sha256:6ccf9c15ad0663c765b7cfe49477e7a906d85e8074f3b0bd5ef398b853a95e95

Observation a4924e17-31b2-4d3a-a57f-e51684eab829 · outbound

This paper cites an unresolved cited work.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests Unresolved cited work

Reference 61

Resolution
unresolved
raw_fallback, observed 2026-08-08T19:21:19.466011Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-08T19:21:19.259007Z digest=sha256:bb46807471604479e85aa26685535bb292ac1364c8b8ec1b2face8d750ef2c55

Observation f4a5649c-a534-467d-a5f4-ca636ad6cb54 · outbound

This paper cites It was primarily developed for medical purposes but never achieved widespread use.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests It was primarily developed for medical purposes but never achieved widespread use

Reference 62

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:21:19.457691Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-08T19:21:19.261269Z digest=sha256:03572054572c67e73bf7f5b63d4cc3b9af346ca1a5610dd90ff73bee5b6fb54f

Pith citing papers

Observation 701f45cb-5f99-4851-b73d-42b3d9100d30 · inbound

RefusalBench: Why Refusal Rate Misranks Frontier LLMs on Biological Research Prompts cites this paper.

RefusalBench: Why Refusal Rate Misranks Frontier LLMs on Biological Research Prompts Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests

Reference 17

Resolution
verified exact
arxiv_id, observed 2026-05-22T01:20:51.936763Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-05-22T01:19:00.268857Z digest=sha256:5262f8b0b77c32818508bfdfb15b7a50e03fc78456e97f0276235b7bf544ce6a

Observation 91d7766a-eb62-46cc-ad99-16ce7dc6da29 · inbound

SciHazard: A Benchmark for Measuring Scientific Safety Risks with Decomposed Harm Scoring cites this paper.

SciHazard: A Benchmark for Measuring Scientific Safety Risks with Decomposed Harm Scoring Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-01T14:45:42.876760Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T14:45:42.876760Z digest=sha256:f8b94dfc6460e72d120d302fd47f4217f91ca7126c2f02690a93eb4e97a58a2b