Pith. sign in

Paper Citation Record · LEDGER

OR-Bench: An Over-Refusal Benchmark for Large Language Models

As of 21 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 84 inbound Pith citation observations for arXiv:2405.20947.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2405.20947 v5

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 84 of 84 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-21T06:32:19.484+00:00

measured 84 of 84 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-16T12:10:30.948693Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-08-05T02:28:24.338817Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

9
pith, observed 2026-08-05T02:28:24.338817Z

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation f5fbc348-805f-4b93-a464-09b387ca7d86 · inbound

Probing the limitations of multimodal language models for chemistry and materials research cites this paper.

Probing the limitations of multimodal language models for chemistry and materials research OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-12T12:45:35.737949Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T12:45:35.737949Z digest=sha256:c84ee3d8f6e1b9fd5d8b6515914e8d784f47deb16ac4eb8b63bab9b46cc24c23

Observation 942dcb84-786d-4c22-bd38-cb4889430a4b · inbound

Refusal Tokens: A Simple Way to Calibrate Refusals in Large Language Models cites this paper.

Refusal Tokens: A Simple Way to Calibrate Refusals in Large Language Models OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-11T19:25:04.775042Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T19:25:04.775042Z digest=sha256:7d62a7cd723f33161f52b13750b153fef773449614a67744d5f1649e698372b8

Observation 7490d506-06b8-4faf-97c7-129aafd999db · inbound

Semantic Loss Guided Data Efficient Supervised Fine Tuning for Safe Responses in LLMs cites this paper.

Semantic Loss Guided Data Efficient Supervised Fine Tuning for Safe Responses in LLMs OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 2021

Resolution
unresolved
no resolver link, observed 2026-08-11T20:33:59.615309Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T20:33:59.615309Z digest=sha256:f9f62b1ec8addd760e19d7c920e3534c8fe1f3bc4307f1c6e26f8834a695088f

Observation 56584722-6f9e-41f6-9f3f-90cb256a0fd9 · inbound

Open Problems in Machine Unlearning for AI Safety cites this paper.

Open Problems in Machine Unlearning for AI Safety OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-10T21:24:10.025794Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T21:24:10.025794Z digest=sha256:44a0fb1c3be3745ab217b06eda7f46eeef7b65d75148e4213e276f3ee359047a

Observation c3d2d205-09e5-4a0b-97cd-8aebf7d70fa7 · inbound

FairCoder: Probing LLM Bias in High-Stakes Decision Making via Coding Tasks cites this paper.

FairCoder: Probing LLM Bias in High-Stakes Decision Making via Coding Tasks OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-10T21:18:01.315075Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T21:18:01.315075Z digest=sha256:620e2733bb30aa10b1d7a4137085d1eec6690b673d786ff3ad41e018cef2a39b

Observation c530ab1e-d492-41e7-8627-266a1c0dfe3b · inbound

Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks cites this paper.

Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-10T19:08:01.608940Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T19:08:01.608940Z digest=sha256:3f01c689943c4c94acb001cffcaae9a747a21ebc6f1f4516600059cdec11dea7

Observation 2c8e0039-a1d6-498f-ac5e-f3b0c5d995c2 · inbound

CASE-Bench: Context-Aware SafEty Benchmark for Large Language Models cites this paper.

CASE-Bench: Context-Aware SafEty Benchmark for Large Language Models OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 2013

Resolution
unresolved
no resolver link, observed 2026-08-10T14:51:58.746774Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:51:58.746774Z digest=sha256:7a90a464ca68f2df5e0aca27e79ee872cc77992c58e9ad1f5b36a06d319768f9

Observation a6962c30-7769-4013-9981-9a9c3537f56b · inbound

Position: Adversarial ML for LLMs Is Not Making Any Progress cites this paper.

Position: Adversarial ML for LLMs Is Not Making Any Progress OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-09T12:47:21.642807Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T12:47:21.642807Z digest=sha256:df9b4daadde871e8deedf4dfc2f29ed8cfec2bd31d6b4a457a44c1206a8b2ba2

Observation e67b5b15-8613-41b6-8f52-7b5cf9eaefc6 · inbound

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests cites this paper.

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-08T19:21:19.126985Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:21:19.126985Z digest=sha256:a50b575de7d879e6689865cf545e5a7eaf390b63fd868b0a95818cd5d74fd69f

Observation 1700476e-fa02-4fb5-b33e-7ea86dd76dd5 · inbound

JBShield: Defending Large Language Models from Jailbreak Attacks through Activated Concept Analysis and Manipulation cites this paper.

JBShield: Defending Large Language Models from Jailbreak Attacks through Activated Concept Analysis and Manipulation OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-08T12:25:30.547187Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T12:25:30.547187Z digest=sha256:64f2bc9dcf2bec2aea3aa0eb8ffdc59f09dc5de892908995ea7b978acd794785

Observation 9b20750b-9e2c-47e2-ad85-3430e0d371e9 · inbound

The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions cites this paper.

The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T23:08:02.240706Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T23:08:02.240706Z digest=sha256:67edf5887e4d191798985d213622652b2a2617554188dda2bb9123fd6865e4bb

Observation b55a4152-bee3-447d-aa84-fe646c1e8a6b · inbound

LLM-Safety Evaluations Lack Robustness cites this paper.

LLM-Safety Evaluations Lack Robustness OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 19

Resolution
verified exact
arxiv_id, observed 2026-05-23T01:27:21.424406Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-05-23T01:26:45.402983Z digest=sha256:1e20d207225d43d5af18c8c608a029e17396f2accd50912779e2af3147ba1c9a

Observation a90b09ef-8ac4-4e71-876e-b7d460e28410 · inbound

DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification cites this paper.

DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-16T12:10:30.948693Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-16T12:10:30.948693Z digest=sha256:afe3a813dc2e04f0dfd12acbbcbdfe5a082a640656f0d01fb3f12b96c6267e4c

Observation a6fd153e-26cb-405d-a1e7-45419fbf37a7 · inbound

aiXamine: Simplified LLM Safety and Security cites this paper.

aiXamine: Simplified LLM Safety and Security OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-16T11:39:10.716090Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:39:10.716090Z digest=sha256:504b24e96c57adb132c07d911ecc3d09defd867106aa4ba2441c9e2ab6e9e357

Observation 0fa683eb-bdc3-41b1-8e9d-19f464270ddd · inbound

FalseReject: A Resource for Improving Contextual Safety and Mitigating Over-Refusals in LLMs via Structured Reasoning cites this paper.

FalseReject: A Resource for Improving Contextual Safety and Mitigating Over-Refusals in LLMs via Structured Reasoning OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-15T22:10:09.270342Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:10:09.270342Z digest=sha256:1c8c4bb3aaf239ab44b6410c8b4c2782b31492a070687b98ffbb97797de36ddd

Observation 0758b737-4732-4884-9924-d4b18d25fad9 · inbound

Relative Bias: A Comparative Framework for Quantifying Bias in LLMs cites this paper.

Relative Bias: A Comparative Framework for Quantifying Bias in LLMs OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T15:12:19.066466Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:12:19.066466Z digest=sha256:be399b39073a205563539e97da55f5edd738ba081cd5eafa63771d75695e1363

Observation 3ada40e2-6b9b-427a-82a7-f2956c25f27c · inbound

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models cites this paper.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:52.566860Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:52.566860Z digest=sha256:12b20cfa3adc446d1f572ddcca1823319c6cce042d5c4aa78a3b6964d2043fca

Observation 85030306-0453-4f53-ba6c-4f12428412b5 · inbound

VSCBench: Bridging the Gap in Vision-Language Model Safety Calibration cites this paper.

VSCBench: Bridging the Gap in Vision-Language Model Safety Calibration OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:10.702663Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:13:10.702663Z digest=sha256:0d6942e4fe501d40a02f39d1805531a3fbdd169bf889ba3704d130ac9329668c

Observation 2af4f3a5-2938-40c3-be36-2ef53c711183 · inbound

Multi-objective Large Language Model Alignment with Hierarchical Experts cites this paper.

Multi-objective Large Language Model Alignment with Hierarchical Experts OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T13:52:09.068357Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:52:09.068357Z digest=sha256:2e7d59c1752a2ebb9568fcb2ede4bbd053855b543f29712c0751351cab2becbe

Observation bd4cb0c8-2ab2-4de2-ac79-4773c7df3b74 · inbound

ReGA: Model-Based Safeguard for LLMs via Representation-Guided Abstraction cites this paper.

ReGA: Model-Based Safeguard for LLMs via Representation-Guided Abstraction OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 56

Resolution
verified exact
arxiv_id, observed 2026-05-19T11:37:15.914531Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-05-19T11:34:09.428653Z digest=sha256:e143faf342603bc0123a174a0e91c8099e11bcbccd3df10a45980f2506cc3a50

Observation f366d40f-8412-423a-8efd-6d89fba3a5ef · inbound

MidPO: Dual Preference Optimization for Safety and Helpfulness in Large Language Models via a Mixture of Experts Framework cites this paper.

MidPO: Dual Preference Optimization for Safety and Helpfulness in Large Language Models via a Mixture of Experts Framework OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-07T11:29:01.068351Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:29:01.068351Z digest=sha256:19050d3879a8a85b4fbf72abc6ab9feb5c335d05db26820b7830fbc235600e06

Observation 14de37fd-3c28-4821-adbe-efc2d4d0a818 · inbound

From Rogue to Safe AI: The Role of Explicit Refusals in Aligning LLMs with International Humanitarian Law cites this paper.

From Rogue to Safe AI: The Role of Explicit Refusals in Aligning LLMs with International Humanitarian Law OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T10:28:54.986950Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T10:28:54.986950Z digest=sha256:56c88de1222faaad0233738d780c0692b153b65e27709c6390d44a00d6787c41

Observation d3887f60-c7e8-49ca-b717-bf18f935a22d · inbound

SafeCoT: Improving VLM Safety with Minimal Reasoning cites this paper.

SafeCoT: Improving VLM Safety with Minimal Reasoning OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T05:18:59.574137Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:18:59.574137Z digest=sha256:1201952a6f022e4cbcc39b7169101bdea0db6d8b382b65e3bd48ecf61896e994

Observation 245fc8a6-5db8-4ccb-8ce6-e13192ca047c · inbound

Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning cites this paper.

Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-06T19:57:43.629886Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T19:57:43.629886Z digest=sha256:d39e52c5e195f04ba17f6f82d5f36744ed4c5ff6dbfc46639120ac5185ab8655

Observation cae4b572-6abc-48c8-bd49-80ef44374df2 · inbound

LLMs Encode Harmfulness and Refusal Separately cites this paper.

LLMs Encode Harmfulness and Refusal Separately OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-06T17:03:15.633680Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:03:15.633680Z digest=sha256:e7490a96a9e194973a6f76358a9b364873f87268e7505cd57dbdb732c4ea0f3c

Observation 553347cf-8323-4ce0-8d54-573938d47ef4 · inbound

Beyond Surface-Level Detection: Towards Cognitive-Driven Defense Against Jailbreak Attacks via Meta-Operations Reasoning cites this paper.

Beyond Surface-Level Detection: Towards Cognitive-Driven Defense Against Jailbreak Attacks via Meta-Operations Reasoning OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 149

Resolution
unresolved
no resolver link, observed 2026-08-06T04:47:25.517815Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T04:47:25.517815Z digest=sha256:fc7fc51c70b3fdefa8611cf2c7370e025520447d3bc6bec5f04adb48e80ebc2f

Observation 2a28ee14-ff1e-4212-a162-936697886bee · inbound

ORFuzz: Fuzzing the "Other Side" of LLM Safety -- Testing Over-Refusal cites this paper.

ORFuzz: Fuzzing the "Other Side" of LLM Safety -- Testing Over-Refusal OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 8

Resolution
verified exact
arxiv_id, observed 2026-05-18T23:31:54.602048Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-05-18T23:27:52.438709Z digest=sha256:c20b8a8982062a71a56339ae6ab84fee84049912d97aae1017514a2a42a990e8

Observation 6dc443b8-3a12-41f1-addc-a74c324002bf · inbound

No for Some, Yes for Others: Persona Prompts and Other Sources of False Refusal in Language Models cites this paper.

No for Some, Yes for Others: Persona Prompts and Other Sources of False Refusal in Language Models OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-04T21:22:14.290904Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T21:22:14.290904Z digest=sha256:b98b9edfd4b384baea5d55011adbc1eb2d5d4456dfb6ac5f6be52e4807891334

Observation 93cf701d-1912-4476-9664-f2189ee9d5b2 · inbound

Not All Needles Are Found: How Fact Distribution and Don't Make It Up Prompts Shape Retrieval, Reasoning, and Hallucination in Long-Context LLMs cites this paper.

Not All Needles Are Found: How Fact Distribution and Don't Make It Up Prompts Shape Retrieval, Reasoning, and Hallucination in Long-Context LLMs OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 89

Resolution
unresolved
no resolver link, observed 2026-08-03T12:42:38.838889Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:42:38.838889Z digest=sha256:7b7395db1c454520957979c1699669ba3a14f310bc1f3dfd893d6e93a3d84270

Observation 871570c7-db20-4069-af6f-8f8071b41550 · inbound

Analysing Differences in Persuasive Language in LLM-Generated Text: Uncovering Stereotypical Gender Patterns cites this paper.

Analysing Differences in Persuasive Language in LLM-Generated Text: Uncovering Stereotypical Gender Patterns OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-03T11:35:39.627069Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T11:35:39.627069Z digest=sha256:3c24ff097047d3418151900cacc066270743ac70f843d7afe1f0050b24e9d891

Observation 7750d229-a914-4ecf-96d5-e216c4dfecc0 · inbound

RACC: Representation-Aware Coverage Criteria for LLM Safety Testing cites this paper.

RACC: Representation-Aware Coverage Criteria for LLM Safety Testing OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 16

Resolution
verified exact
arxiv_id, observed 2026-05-16T08:17:36.646432Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-05-16T08:12:55.296932Z digest=sha256:3063a85f11d67bd6c7a2f6690e9c55597092bb766c8f60e4e34e7109a54f287d

Observation 1c22e9c0-1e31-49c9-85d9-05b0b27cb9f3 · inbound

Robust Policy Optimization to Prevent Catastrophic Forgetting cites this paper.

Robust Policy Optimization to Prevent Catastrophic Forgetting OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 13

Resolution
verified exact
arxiv_id, observed 2026-05-16T05:37:24.313558Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-05-16T05:33:42.965249Z digest=sha256:38cfeeead80f91614f63399b211c11da48c2d772b6851f8deb85872cbe1853fc

Observation cf3358a2-13d2-4260-a988-dfd0c2063134 · inbound

Power and Limitations of Aggregation in Compound AI Systems cites this paper.

Power and Limitations of Aggregation in Compound AI Systems OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-02T21:09:49.563604Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T21:09:49.563604Z digest=sha256:7aad65db9a6b85bb09c81966162ec83370b09827fcc808c0198ceb86d5d36744

Observation 02b49cf3-1707-4c19-a26b-164617b8a9ef · inbound

SelfGrader: LLM Jailbreak Detection via Anchored Token-Level Logits cites this paper.

SelfGrader: LLM Jailbreak Detection via Anchored Token-Level Logits OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-05-13T21:48:19.437868Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-05-13T21:43:46.728512Z digest=sha256:f3819e0b1d92a0d6033f0f14da135dc5748b9de6deb944a5668a28f04125887f

Observation c62b8c9d-7145-4eb7-a75e-aa14cfe5e50e · inbound

Blind Refusal: Language Models Refuse to Help Users Evade Unjust, Absurd, and Illegitimate Rules cites this paper.

Blind Refusal: Language Models Refuse to Help Users Evade Unjust, Absurd, and Illegitimate Rules OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 7

Resolution
verified exact
arxiv_id, observed 2026-05-13T19:28:09.938746Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-05-13T19:24:54.381722Z digest=sha256:8593658aee433825ecf19794f354c2a568892cdd7a9ba404e674ed1f6b23c652

Observation 76979c98-1866-4261-ad43-e1aa012fc0f1 · inbound

IatroBench: Pre-Registered Evidence of Iatrogenic Harm from AI Safety Measures cites this paper.

IatroBench: Pre-Registered Evidence of Iatrogenic Harm from AI Safety Measures OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 10

Resolution
verified exact
arxiv_id, observed 2026-05-11T00:35:52.516530Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-05-10T18:25:53.037936Z digest=sha256:0f8ad9f99c55edff125625fbde53cc2c61d8c185505ab996304378d152ee0447

Observation fac9a0e5-6f66-49ac-8b5b-ccb6562af93c · inbound

IatroBench: Pre-Registered Evidence of Iatrogenic Harm from AI Safety Measures cites this paper.

IatroBench: Pre-Registered Evidence of Iatrogenic Harm from AI Safety Measures OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 10

Resolution
unresolved
no resolver link, observed 2026-07-13T00:19:33.861692Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-07-13T00:19:33.861692Z digest=sha256:d467857a89c140c690f229d35b9afad4d61e30209593e61cdf0b41ddda93ac32

Observation bb565363-ccb2-4e0f-be8f-cf4d6bcbb223 · inbound

Refute-or-Promote: An Adversarial Stage-Gated Multi-Agent Review Methodology for High-Precision LLM-Assisted Defect Discovery cites this paper.

Refute-or-Promote: An Adversarial Stage-Gated Multi-Agent Review Methodology for High-Precision LLM-Assisted Defect Discovery OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 32

Resolution
verified exact
arxiv_id, observed 2026-05-10T03:14:08.024390Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-05-10T03:11:26.513954Z digest=sha256:69d0df816b9044aa2060184cc031e79b4727b764ecc2ce15e1ff15a81b9a94e7

Observation cc58d492-46c4-4f46-9699-b298b3cc5160 · inbound

Knowledge Distillation Must Account for What It Loses cites this paper.

Knowledge Distillation Must Account for What It Loses OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 41

Resolution
verified exact
arxiv_id, observed 2026-05-11T23:26:18.660235Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-05-07T16:58:41.449172Z digest=sha256:d597a215f859b8930a3b39fd2d2f157e04f3b3edd8b5e37b1435f686e9b964d1

Observation a0c6fad7-ca75-4fce-9784-7c3450e92ee2 · inbound

Knowledge Distillation Must Account for What It Loses cites this paper.

Knowledge Distillation Must Account for What It Loses OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 41

Resolution
verified exact
arxiv_id, observed 2026-05-11T22:01:13.526306Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-05-08T03:31:56.787201Z digest=sha256:8e16415392b75109b55f044038616ec5f340186d78fca313e96dc73b65ba8f3f

Observation 5f9105b3-2973-49d7-abaa-e88601ad6349 · inbound

Disentangling Intent from Role: Adversarial Self-Play for Persona-Invariant Safety Alignment cites this paper.

Disentangling Intent from Role: Adversarial Self-Play for Persona-Invariant Safety Alignment OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 49

Resolution
verified exact
arxiv_id, observed 2026-05-11T16:21:07.419924Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-05-09T17:24:54.796037Z digest=sha256:99fad877ae7aa7ea5cccda2ce8f4dd0c10646d4146024606b965b6d3daaf150c

Observation 7a09cf8e-8d6d-4c43-ac3a-5df817ba9e1f · inbound

Latent Personality Alignment: Improving Harmlessness Without Mentioning Harms cites this paper.

Latent Personality Alignment: Improving Harmlessness Without Mentioning Harms OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 4

Resolution
verified exact
arxiv_id, observed 2026-05-12T07:51:43.562457Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-05-12T01:46:49.586630Z digest=sha256:95b8e924a12a34a53c8295c335830127a31309f4ea5ee9c5eaa40d47da035b18

Observation 89801801-ac87-427f-9977-2cfc2f76e90a · inbound

EquiMem: Calibrating Shared Memory in Multi-Agent Debate via Game-Theoretic Equilibrium cites this paper.

EquiMem: Calibrating Shared Memory in Multi-Agent Debate via Game-Theoretic Equilibrium OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 14

Resolution
verified exact
arxiv_id, observed 2026-05-12T05:56:26.309530Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-05-12T04:47:29.903343Z digest=sha256:85812b296c86e174cb8728aa49b56eef1d38a43c11798c1fb8b92919e6ddd189

Observation 2cbda156-ec48-46de-92e9-fed450dadf5a · inbound

Taxonomy and Consistency Analysis of Safety Benchmarks for AI Agents cites this paper.

Taxonomy and Consistency Analysis of Safety Benchmarks for AI Agents OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 8

Resolution
verified exact
arxiv_id, observed 2026-05-21T01:43:56.924885Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-05-21T01:42:55.693115Z digest=sha256:93d7dfa7ee2541e9c52384621107cdda298ed2f09b2672efe2ffc14f4ee7929b

Observation 757b7704-4f27-4c1d-9dd3-cfca173d462b · inbound

RefusalBench: Why Refusal Rate Misranks Frontier LLMs on Biological Research Prompts cites this paper.

RefusalBench: Why Refusal Rate Misranks Frontier LLMs on Biological Research Prompts OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 14

Resolution
verified exact
arxiv_id, observed 2026-05-22T01:20:51.889010Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-05-22T01:19:00.268857Z digest=sha256:2b3f69a25d47de488493e4dab6a4841936f32a09859ba9b4f02744d75e2825e9

Observation 5af05fa0-c542-49d7-9279-4c1efac0af7e · inbound

Palette: A Modular, Controllable, and Efficient Framework for On-demand Authorized Safety Alignment Relaxation in LLMs cites this paper.

Palette: A Modular, Controllable, and Efficient Framework for On-demand Authorized Safety Alignment Relaxation in LLMs OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 51

Resolution
verified exact
arxiv_id, observed 2026-06-30T16:04:52.628366Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-06-30T16:03:12.728352Z digest=sha256:ae83f57c6754baeab874e3680a3cade0456a792ed8b87090d98bfcd761199d7d

Observation 5c988fe2-ee8a-4724-ac32-bb8ab070abe3 · inbound

Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling cites this paper.

Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 15

Resolution
verified exact
arxiv_id, observed 2026-06-30T13:14:40.779901Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-06-30T13:10:44.728498Z digest=sha256:5a3c4c0d97b8d9b60d6514313ce52168cb285974f3048fe6ca4cf9944befe3a7

Observation 416ab8e3-2843-41ef-b8fb-b57381d80de1 · inbound

The Ethics of LLM Sandbox and Persona Dynamics cites this paper.

The Ethics of LLM Sandbox and Persona Dynamics OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 4

Resolution
metadata mismatch
arxiv_id, observed 2026-06-29T12:43:25.126621Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-06-29T12:42:48.734781Z digest=sha256:5aa111769f43f1af156941b3a001622912bd65921a7b725d71443644ea5a0dee

Observation bb8d5d0a-b010-4562-95f8-aef7057d4e39 · inbound

Opir: Efficient Multi-Task Safety Classification for Toxicity, Jailbreaks, Hate Speech, and Harmful Content cites this paper.

Opir: Efficient Multi-Task Safety Classification for Toxicity, Jailbreaks, Hate Speech, and Harmful Content OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 6

Resolution
verified exact
arxiv_id, observed 2026-06-29T09:13:15.991497Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-06-29T09:11:58.843585Z digest=sha256:8f9e62fd314d19f07fbb0e363a9cda8bc3d56fa25ac5849725cef47c8df05fae

Observation bb7074f5-398f-4098-bd1a-22c6caf3c5ac · inbound

Triaging Threats to Specialized Guardrails cites this paper.

Triaging Threats to Specialized Guardrails OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-06-28T22:32:44.346641Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-06-28T22:27:44.703466Z digest=sha256:b165a38732c9636a28e88ab504724b74c4f65ca60975541b4003798b8af50d60

Observation 48e132d9-c9a1-4161-b6c8-3f39f5c8e78b · inbound

Understanding the Self-Reflection Mechanisms of LLMs through Biased Attitude Associations cites this paper.

Understanding the Self-Reflection Mechanisms of LLMs through Biased Attitude Associations OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 31

Resolution
metadata mismatch
arxiv_id, observed 2026-07-01T20:36:12.167986Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-06-28T18:17:18.706689Z digest=sha256:340ccd2c9a8f80307c3a40be1b23f89fe674c6ea875caf2ce0656c419541c841

Observation ab1d4848-967d-44de-8620-232ccbf4e0c7 · inbound

Dialectics of Alignment: Harnessing Unsafe Knowledge for Dynamic Safety Routing cites this paper.

Dialectics of Alignment: Harnessing Unsafe Knowledge for Dynamic Safety Routing OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 15

Resolution
verified exact
arxiv_id, observed 2026-06-28T19:32:34.575384Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-06-28T19:23:10.275977Z digest=sha256:a20b46a884152eb088061ee5a72a9f326a72293c1dbb3e9e63995a5c151a6479

Observation f8aebd10-570b-44a8-9058-8b3904623bdf · inbound

Designing for Doubt: The Case for Informed Abstention in Autonomous Agents cites this paper.

Designing for Doubt: The Case for Informed Abstention in Autonomous Agents OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 4

Resolution
verified exact
arxiv_id, observed 2026-07-01T23:46:23.700019Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-06-28T14:03:02.703499Z digest=sha256:22002ec870c034ed9a8ef7f0978956d49f69678a45842d07cfab2e7e41e6dbc3

Observation f98cd193-7c9e-47f8-aa79-a8edcb84d1bf · inbound

FLIPS: Instance-Fingerprinting for LLMs via Pseudo-random Sequences cites this paper.

FLIPS: Instance-Fingerprinting for LLMs via Pseudo-random Sequences OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 52

Resolution
metadata mismatch
arxiv_id, observed 2026-07-02T01:56:27.942088Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-06-28T11:24:01.547119Z digest=sha256:6e926dde81136db5959bce7fb3d27bd780a4a953651d70863b3157a255d0c775

Observation ad9524b8-ea57-4769-8479-65d9d013ab76 · inbound

CHASE: Adversarial Red-Blue Teaming for Improving LLM Safety using Reinforcement Learning cites this paper.

CHASE: Adversarial Red-Blue Teaming for Improving LLM Safety using Reinforcement Learning OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 45

Resolution
metadata mismatch
arxiv_id, observed 2026-07-02T12:06:55.639498Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-06-28T02:34:26.334078Z digest=sha256:50952e08d2666200e935b5b7c958c0b9c9d525b5de9ad2eb331839963725f47e

Observation 4246cc48-4cb6-4ab8-93a2-1fba21e54237 · inbound

Auditing Proprietary Alignment in Large Language Models: A Comparative Framework Without a Ground-Truth Standard cites this paper.

Auditing Proprietary Alignment in Large Language Models: A Comparative Framework Without a Ground-Truth Standard OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 5

Resolution
metadata mismatch
arxiv_id, observed 2026-07-02T22:17:26.020107Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-06-27T19:04:07.735560Z digest=sha256:627b063733f52946df9c4899bdf74ac5b53a15e5582e6b6351f026d48f9e9eca

Observation d3931b56-9828-4521-9892-854c1e7ed77b · inbound

PsychoSafe: Eliciting Psychologically-Informed Refusals in Large Language Models cites this paper.

PsychoSafe: Eliciting Psychologically-Informed Refusals in Large Language Models OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 2

Resolution
verified exact
arxiv_id, observed 2026-07-03T01:27:31.228542Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-06-27T16:31:33.520989Z digest=sha256:676d4d4f419d93c476a87bdc29be20977bf93536ecafe35177ef794b1f9db3b9

Observation 128ae228-7814-421e-95c1-653d2b133968 · inbound

An LLM-Native Psychometric Instrument Reveals a Self-Report--Behavior Gap Across 25 Models cites this paper.

An LLM-Native Psychometric Instrument Reveals a Self-Report--Behavior Gap Across 25 Models OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-07-04T19:50:09.966245Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-07-04T19:46:24.142611Z digest=sha256:e4f32760e6f31a0fabdd78fe0c1d284f08eb75cc4853933e1c39cac1b5cc072b

Observation 02c3ae61-49c3-4c53-967b-73e436e652e1 · inbound

Sch\"utzen: Evaluating LLM Safety in Bulgarian and German Contexts cites this paper.

Sch\"utzen: Evaluating LLM Safety in Bulgarian and German Contexts OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 16

Resolution
verified exact
arxiv_id, observed 2026-07-03T04:57:38.390307Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-06-27T13:32:18.368158Z digest=sha256:4cfd1ffa4e6bc16cfd80b70280f93c2c680aa226df39ac75c63d7f8a2851b04b

Observation 829039a5-9561-4f0f-8276-604a52c9b12d · inbound

Muse Spark Safety & Preparedness Report cites this paper.

Muse Spark Safety & Preparedness Report OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 73

Resolution
metadata mismatch
arxiv_id, observed 2026-06-30T19:55:01.558009Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-06-30T19:49:14.463992Z digest=sha256:7b0643975436bf497c2c2a22cbd3efcb4cafdd43e845fe16b52ef22d82abeaee

Observation 8e0ad023-5950-4a2d-9d13-8aaed034aadb · inbound

From Refusal Geometry to Safety Geometry: Harmfulness--Refusal Coupling under Dynamic Adversarial Fine-Tuning cites this paper.

From Refusal Geometry to Safety Geometry: Harmfulness--Refusal Coupling under Dynamic Adversarial Fine-Tuning OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 15

Resolution
unresolved
no resolver link, observed 2026-07-12T13:51:23.302296Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T13:51:23.302296Z digest=sha256:f5776052eda1e97760b01c19d140acf3b224fb7823c2312fec2e23035d3b5564

Observation 9af1926e-30cb-4dd5-ac00-53824bc8a398 · inbound

Discriminatory Compliance: How LLMs Answer Queries from Protected Groups cites this paper.

Discriminatory Compliance: How LLMs Answer Queries from Protected Groups OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 104

Resolution
metadata mismatch
arxiv_id, observed 2026-06-26T12:59:29.372405Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-06-26T12:58:09.227648Z digest=sha256:7bb1e78479a8f6f9cc0b44c6e76fdde2d59e2d588cf842bfbb89855957f508cd

Observation 5b5acc47-0346-407d-8bf6-be5966ab85d1 · inbound

At the Edge of Understanding: Sparse Autoencoders Trace The Limits of Transformer Generalization cites this paper.

At the Edge of Understanding: Sparse Autoencoders Trace The Limits of Transformer Generalization OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 2

Resolution
metadata mismatch
arxiv_id, observed 2026-07-04T15:49:56.284738Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-06-26T01:27:39.812228Z digest=sha256:e9e47835256d1019659114bd2fbd357f0fdee62da5852adb59ece79ec1852ddb

Observation 92957cf9-1ae4-4cc4-b834-f68eedbeaf05 · inbound

Addressing Over-Refusal in LLMs with Competing Rewards cites this paper.

Addressing Over-Refusal in LLMs with Competing Rewards OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 36

Resolution
metadata mismatch
arxiv_id, observed 2026-07-01T08:55:35.559051Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-07-01T06:59:12.695984Z digest=sha256:aa3d1be79f363dc5de06a3511d13a70b76ced348504e8141e992392fd3d25197

Observation 2dff7a81-6bd7-42df-a1c0-b554c3131951 · inbound

OpenSafeIntent: Evaluating Intent-Calibrated Safe Completion Across Dual-Use Prompt Sets cites this paper.

OpenSafeIntent: Evaluating Intent-Calibrated Safe Completion Across Dual-Use Prompt Sets OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 38

Resolution
metadata mismatch
arxiv_id, observed 2026-07-03T14:48:32.499370Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-07-03T14:44:57.205766Z digest=sha256:b4cf31905cd41ac6997658e1c28c1782a04695143c62b1586a73559642a1aede

Observation b951f89c-121b-4456-b48b-850bf11e9d12 · inbound

Faithfulness to Refusal: A Causal Audit of Neuron Selectors cites this paper.

Faithfulness to Refusal: A Causal Audit of Neuron Selectors OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 8

Resolution
verified exact
local_arxiv, observed 2026-07-07T15:43:53.889765Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-07-07T15:35:54.665268Z digest=sha256:640db42a1881bc6ad2cb9d889fb959770724f902b19782bb19bb86e2fda967c2

Observation b1e0bd40-6d38-48f1-b9a5-2a90a79377b5 · inbound

BioSecBench-Refusal: A paired metric for performance and alignment in agentic biosecurity risk assessment cites this paper.

BioSecBench-Refusal: A paired metric for performance and alignment in agentic biosecurity risk assessment OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 11

Resolution
unresolved
no resolver link, observed 2026-07-11T16:42:49.284801Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:42:49.284801Z digest=sha256:a8b3f0f54cd241b7b8dc05b76508b3265e82d2e3dd42a84cb34cc50d6b5f7107

Observation 22a13f1a-389d-48ae-8847-14d41dbd3c08 · inbound

BioSecBench-Refusal: A paired metric for performance and alignment in agentic biosecurity risk assessment cites this paper.

BioSecBench-Refusal: A paired metric for performance and alignment in agentic biosecurity risk assessment OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-02T08:40:01.376681Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T08:40:01.376681Z digest=sha256:ff1dfb6b09e67f676d4ad1907ed70658b4b4c2a4b1a1a6ce5cdbb8712921af09

Observation 207ba283-9daa-4759-b969-cd7ae44ab2bb · inbound

Beyond Refusal: A Same-Lineage Study of Aligned and Abliterated LLMs for Vulnerability Analysis cites this paper.

Beyond Refusal: A Same-Lineage Study of Aligned and Abliterated LLMs for Vulnerability Analysis OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 48

Resolution
verified exact
local_arxiv, observed 2026-07-08T23:05:44.269506Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-07-08T23:00:45.841744Z digest=sha256:d7db6b7e836a2a48d5689de5c320db4482f3a126fe6180b77670cf08694d189e

Observation 7dfadebb-76e8-40ed-b95f-16bce40796b8 · inbound

Efficient Safety Alignment of Language Models via Latent Personality Traits cites this paper.

Efficient Safety Alignment of Language Models via Latent Personality Traits OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 9

Resolution
verified exact
local_arxiv, observed 2026-07-10T15:27:20.069606Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-07-10T15:26:23.290009Z digest=sha256:4248962cdd659560ccbe3d882f07cd2bf3e910f22d37c5d1dc30806c18ad0719

Observation 7878eb1a-ca62-4cfa-b872-3e92ccb11110 · inbound

The Entanglement Wall: Activation-Space Probes as Risk Detectors, Not Context Adjudicators cites this paper.

The Entanglement Wall: Activation-Space Probes as Risk Detectors, Not Context Adjudicators OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-02T07:09:30.211340Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:09:30.211340Z digest=sha256:435a8440b0e43c314c3a9c22a2ac73c6008e203758fc9dbedad1b13a64ea87f7

Observation af5421f9-5c79-4bd3-909e-28d7a610d778 · inbound

Phantom Guardrails: When Self-Improving Agent Harnesses Fix Failures That Never Happened cites this paper.

Phantom Guardrails: When Self-Improving Agent Harnesses Fix Failures That Never Happened OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-02T07:01:19.315752Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:01:19.315752Z digest=sha256:bfc469307385c801e1b548ad61f3e1549f742bf0990aef2b06c2b9c5f8731f41

Observation 0563645b-47ff-484d-8501-2a3c15a323ca · inbound

BioTIER: A Refusal Benchmark for Targeted Biological Risk Mitigation cites this paper.

BioTIER: A Refusal Benchmark for Targeted Biological Risk Mitigation OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-02T02:00:44.107363Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T02:00:44.107363Z digest=sha256:0e863bab9e7b1429d9bbd7ba39eaa11dad19ca14323a843e86dc4c0f3e16d9c1

Observation f3c78e28-65a4-4ac9-bba3-b905b48479f0 · inbound

BioSecBench-Surveillance: A Verifiable Benchmark for AI Agents in Pathogen Genomic Surveillance cites this paper.

BioSecBench-Surveillance: A Verifiable Benchmark for AI Agents in Pathogen Genomic Surveillance OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-01T12:58:37.815384Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-01T12:58:37.815384Z digest=sha256:f30250f6c83207f1a94c81b058b51fb83bb2a97b1f0b6521c713f8e9175279d4

Observation f0ff384a-1a37-40d2-8b34-08f71e9c1d02 · inbound

Robust Critics: Defending LLMs Against Multi-Turn Attacks cites this paper.

Robust Critics: Defending LLMs Against Multi-Turn Attacks OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-02T13:17:49.660643Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T13:17:49.660643Z digest=sha256:49b6dcc6f1ead7419201666ec17ca6b50aa2027c2c6ae1f2c67f23c6fa53ff59

Observation 0ff948cf-d26d-4f60-a12e-a822a37046d2 · inbound

Test-Time Scaling via Error Localization cites this paper.

Test-Time Scaling via Error Localization OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 124

Resolution
unresolved
no resolver link, observed 2026-08-01T07:28:30.527305Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-01T07:28:30.527305Z digest=sha256:9906ac3b754c099ddfb71f69c12b6dbaad5bd660428f66846385fa30f0aabed6

Observation 75a6e83e-7179-488d-8857-cf1a5ded795f · inbound

When LLM Defenses Backfire: Characterizing Safety, Performance, and Cost Trade-offs cites this paper.

When LLM Defenses Backfire: Characterizing Safety, Performance, and Cost Trade-offs OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 7

Resolution
unresolved
no resolver link, observed 2026-07-31T16:06:04.281114Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T16:06:04.281114Z digest=sha256:11985d1689f982be09d7cb93d20bc685e60e7ed60ae988c49418896352b5c40b

Observation 3a627b25-8f8e-4132-9e5c-bf5bdcaa04f8 · inbound

RoCo-ACE: Rollout-Conditioned Online Distillation for Retention-Aware Knowledge Injection cites this paper.

RoCo-ACE: Rollout-Conditioned Online Distillation for Retention-Aware Knowledge Injection OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-02T11:50:16.270164Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T11:50:16.270164Z digest=sha256:a30fb35d27e84bb255e7954dabe4b36e280838c11760240ad6389f1f884ee59c

Observation 0514d179-cc17-43db-a904-b8f65dc95d1f · inbound

MMOOC: A Comprehensive Benchmark for Out-of-Context Evaluation in Multimodal Large Language Models cites this paper.

MMOOC: A Comprehensive Benchmark for Out-of-Context Evaluation in Multimodal Large Language Models OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-04T01:23:34.580270Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T01:23:34.580270Z digest=sha256:4e5b5a62db06344a1546638c06792d685566bd16a78dfb918062ac0b602b24a8

Observation e455945e-cebc-4316-9511-2d374ae73313 · inbound

Safety, or Just Capability? A Validity Audit of Agent-Safety Benchmarks cites this paper.

Safety, or Just Capability? A Validity Audit of Agent-Safety Benchmarks OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-03T00:45:59.446555Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T00:45:59.446555Z digest=sha256:dc84dcc99957e6f7fdd3a29dba2530a38e77c6821e83a22079042a1f456d8edd

Observation 58f0fcc2-0fb7-4eac-9743-37fcf82efc48 · inbound

Single Canonical Prompts Underestimate LLM Safety's Surface-Form Sensitivity cites this paper.

Single Canonical Prompts Underestimate LLM Safety's Surface-Form Sensitivity OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-05T00:48:47.873645Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T00:48:47.873645Z digest=sha256:a270f418ce82f1b50748b941054edd46405130252b2c253cfbba9e86b1be8475

Observation 1bce99af-8df6-4e4b-99a9-dc0a3aba4e36 · inbound

Item Response Theory for AI Safety cites this paper.

Item Response Theory for AI Safety OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 1981

Resolution
unresolved
no resolver link, observed 2026-08-06T05:39:49.404749Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:39:49.404749Z digest=sha256:e13b317f05a2512a9c55e454a68dea07cc242aab5b07a221fdfc234a20be57fe

Observation c4e08202-2970-4b86-b433-629d5dcce9ea · inbound

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots cites this paper.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-10T18:49:33.723144Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:49:33.723144Z digest=sha256:6e5d84cb8fc7ee1a989bb9bbf9586095e207e7373f59133d07546742e4aabae9

Observation 1732f4de-e3f7-48e6-a487-20841a7b14d7 · inbound

Refusing Intent, Not Form: Wrapper-Based Intent-Group Supervision for LLM Safety cites this paper.

Refusing Intent, Not Form: Wrapper-Based Intent-Group Supervision for LLM Safety OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-14T14:12:28.356256Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-14T14:12:28.356256Z digest=sha256:c54cbf801eb27f5b69761be8d9da86898ae420da5ed163a609fe1633ea24047f