Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links
Paper Citation Record · LEDGER
As of 21 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 84 inbound Pith citation observations for arXiv:2405.20947.
A citation records a reference. It does not transfer a finding from one paper to another.
Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links
One-hop event checks from named stored sources.
Source: scholarly_work_events, retraction_status_cache, observed 2026-08-21T06:32:19.484+00:00
Pith citing papers itemized under the disclosed page cap.
Source: paper_references, paper_reference_links, observed 2026-08-16T12:10:30.948693Z
A source-named dated measurement, never combined with another source.
Source: pith, observed 2026-08-05T02:28:24.338817Z
0 of 0 outbound references displayed
External citation measurements
9
pith, observed 2026-08-05T02:28:24.338817Z
No outbound reference observations are available for this paper version.
Observation f5fbc348-805f-4b93-a464-09b387ca7d86 · inbound
Probing the limitations of multimodal language models for chemistry and materials research OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 24
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 942dcb84-786d-4c22-bd38-cb4889430a4b · inbound
Refusal Tokens: A Simple Way to Calibrate Refusals in Large Language Models OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 11
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7490d506-06b8-4faf-97c7-129aafd999db · inbound
Semantic Loss Guided Data Efficient Supervised Fine Tuning for Safe Responses in LLMs OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 2021
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 56584722-6f9e-41f6-9f3f-90cb256a0fd9 · inbound
Open Problems in Machine Unlearning for AI Safety OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 22
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c3d2d205-09e5-4a0b-97cd-8aebf7d70fa7 · inbound
FairCoder: Probing LLM Bias in High-Stakes Decision Making via Coding Tasks OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 8
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c530ab1e-d492-41e7-8627-266a1c0dfe3b · inbound
Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 9
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 2c8e0039-a1d6-498f-ac5e-f3b0c5d995c2 · inbound
CASE-Bench: Context-Aware SafEty Benchmark for Large Language Models OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 2013
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a6962c30-7769-4013-9981-9a9c3537f56b · inbound
Position: Adversarial ML for LLMs Is Not Making Any Progress OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 15
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e67b5b15-8613-41b6-8f52-7b5cf9eaefc6 · inbound
Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 18
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1700476e-fa02-4fb5-b33e-7ea86dd76dd5 · inbound
JBShield: Defending Large Language Models from Jailbreak Attacks through Activated Concept Analysis and Manipulation OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 15
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9b20750b-9e2c-47e2-ad85-3430e0d371e9 · inbound
The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 13
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b55a4152-bee3-447d-aa84-fe646c1e8a6b · inbound
LLM-Safety Evaluations Lack Robustness OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 19
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.
Observation a90b09ef-8ac4-4e71-876e-b7d460e28410 · inbound
DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 11
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a6fd153e-26cb-405d-a1e7-45419fbf37a7 · inbound
aiXamine: Simplified LLM Safety and Security OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 17
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 0fa683eb-bdc3-41b1-8e9d-19f464270ddd · inbound
FalseReject: A Resource for Improving Contextual Safety and Mitigating Over-Refusals in LLMs via Structured Reasoning OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 2
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 0758b737-4732-4884-9924-d4b18d25fad9 · inbound
Relative Bias: A Comparative Framework for Quantifying Bias in LLMs OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 12
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 3ada40e2-6b9b-427a-82a7-f2956c25f27c · inbound
Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 32
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 85030306-0453-4f53-ba6c-4f12428412b5 · inbound
VSCBench: Bridging the Gap in Vision-Language Model Safety Calibration OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 6
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 2af4f3a5-2938-40c3-be36-2ef53c711183 · inbound
Multi-objective Large Language Model Alignment with Hierarchical Experts OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 7
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation bd4cb0c8-2ab2-4de2-ac79-4773c7df3b74 · inbound
ReGA: Model-Based Safeguard for LLMs via Representation-Guided Abstraction OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 56
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.
Observation f366d40f-8412-423a-8efd-6d89fba3a5ef · inbound
MidPO: Dual Preference Optimization for Safety and Helpfulness in Large Language Models via a Mixture of Experts Framework OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 2024
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 14de37fd-3c28-4821-adbe-efc2d4d0a818 · inbound
From Rogue to Safe AI: The Role of Explicit Refusals in Aligning LLMs with International Humanitarian Law OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 31
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d3887f60-c7e8-49ca-b717-bf18f935a22d · inbound
SafeCoT: Improving VLM Safety with Minimal Reasoning OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 8
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 245fc8a6-5db8-4ccb-8ce6-e13192ca047c · inbound
Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 5
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation cae4b572-6abc-48c8-bd49-80ef44374df2 · inbound
LLMs Encode Harmfulness and Refusal Separately OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 7
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 553347cf-8323-4ce0-8d54-573938d47ef4 · inbound
Beyond Surface-Level Detection: Towards Cognitive-Driven Defense Against Jailbreak Attacks via Meta-Operations Reasoning OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 149
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 2a28ee14-ff1e-4212-a162-936697886bee · inbound
ORFuzz: Fuzzing the "Other Side" of LLM Safety -- Testing Over-Refusal OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 8
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.
Observation 6dc443b8-3a12-41f1-addc-a74c324002bf · inbound
No for Some, Yes for Others: Persona Prompts and Other Sources of False Refusal in Language Models OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 10
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 93cf701d-1912-4476-9664-f2189ee9d5b2 · inbound
Not All Needles Are Found: How Fact Distribution and Don't Make It Up Prompts Shape Retrieval, Reasoning, and Hallucination in Long-Context LLMs OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 89
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 871570c7-db20-4069-af6f-8f8071b41550 · inbound
Analysing Differences in Persuasive Language in LLM-Generated Text: Uncovering Stereotypical Gender Patterns OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 21
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7750d229-a914-4ecf-96d5-e216c4dfecc0 · inbound
RACC: Representation-Aware Coverage Criteria for LLM Safety Testing OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 16
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.
Observation 1c22e9c0-1e31-49c9-85d9-05b0b27cb9f3 · inbound
Robust Policy Optimization to Prevent Catastrophic Forgetting OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 13
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.
Observation cf3358a2-13d2-4260-a988-dfd0c2063134 · inbound
Power and Limitations of Aggregation in Compound AI Systems OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 14
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 02b49cf3-1707-4c19-a26b-164617b8a9ef · inbound
SelfGrader: LLM Jailbreak Detection via Anchored Token-Level Logits OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 5
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.
Observation c62b8c9d-7145-4eb7-a75e-aa14cfe5e50e · inbound
Blind Refusal: Language Models Refuse to Help Users Evade Unjust, Absurd, and Illegitimate Rules OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 7
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.
Observation 76979c98-1866-4261-ad43-e1aa012fc0f1 · inbound
IatroBench: Pre-Registered Evidence of Iatrogenic Harm from AI Safety Measures OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 10
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.
Observation fac9a0e5-6f66-49ac-8b5b-ccb6562af93c · inbound
IatroBench: Pre-Registered Evidence of Iatrogenic Harm from AI Safety Measures OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 10
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation bb565363-ccb2-4e0f-be8f-cf4d6bcbb223 · inbound
Refute-or-Promote: An Adversarial Stage-Gated Multi-Agent Review Methodology for High-Precision LLM-Assisted Defect Discovery OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 32
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.
Observation cc58d492-46c4-4f46-9699-b298b3cc5160 · inbound
Knowledge Distillation Must Account for What It Loses OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 41
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.
Observation a0c6fad7-ca75-4fce-9784-7c3450e92ee2 · inbound
Knowledge Distillation Must Account for What It Loses OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 41
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.
Observation 5f9105b3-2973-49d7-abaa-e88601ad6349 · inbound
Disentangling Intent from Role: Adversarial Self-Play for Persona-Invariant Safety Alignment OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 49
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.
Observation 7a09cf8e-8d6d-4c43-ac3a-5df817ba9e1f · inbound
Latent Personality Alignment: Improving Harmlessness Without Mentioning Harms OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 4
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.
Observation 89801801-ac87-427f-9977-2cfc2f76e90a · inbound
EquiMem: Calibrating Shared Memory in Multi-Agent Debate via Game-Theoretic Equilibrium OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 14
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.
Observation 2cbda156-ec48-46de-92e9-fed450dadf5a · inbound
Taxonomy and Consistency Analysis of Safety Benchmarks for AI Agents OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 8
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.
Observation 757b7704-4f27-4c1d-9dd3-cfca173d462b · inbound
RefusalBench: Why Refusal Rate Misranks Frontier LLMs on Biological Research Prompts OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 14
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.
Observation 5af05fa0-c542-49d7-9279-4c1efac0af7e · inbound
Palette: A Modular, Controllable, and Efficient Framework for On-demand Authorized Safety Alignment Relaxation in LLMs OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 51
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.
Observation 5c988fe2-ee8a-4724-ac32-bb8ab070abe3 · inbound
Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 15
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.
Observation 416ab8e3-2843-41ef-b8fb-b57381d80de1 · inbound
The Ethics of LLM Sandbox and Persona Dynamics OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 4
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.
Observation bb8d5d0a-b010-4562-95f8-aef7057d4e39 · inbound
Opir: Efficient Multi-Task Safety Classification for Toxicity, Jailbreaks, Hate Speech, and Harmful Content OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 6
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.
Observation bb7074f5-398f-4098-bd1a-22c6caf3c5ac · inbound
Triaging Threats to Specialized Guardrails OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 5
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.
Observation 48e132d9-c9a1-4161-b6c8-3f39f5c8e78b · inbound
Understanding the Self-Reflection Mechanisms of LLMs through Biased Attitude Associations OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 31
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.
Observation ab1d4848-967d-44de-8620-232ccbf4e0c7 · inbound
Dialectics of Alignment: Harnessing Unsafe Knowledge for Dynamic Safety Routing OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 15
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.
Observation f8aebd10-570b-44a8-9058-8b3904623bdf · inbound
Designing for Doubt: The Case for Informed Abstention in Autonomous Agents OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 4
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.
Observation f98cd193-7c9e-47f8-aa79-a8edcb84d1bf · inbound
FLIPS: Instance-Fingerprinting for LLMs via Pseudo-random Sequences OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 52
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.
Observation ad9524b8-ea57-4769-8479-65d9d013ab76 · inbound
CHASE: Adversarial Red-Blue Teaming for Improving LLM Safety using Reinforcement Learning OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 45
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.
Observation 4246cc48-4cb6-4ab8-93a2-1fba21e54237 · inbound
Auditing Proprietary Alignment in Large Language Models: A Comparative Framework Without a Ground-Truth Standard OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 5
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.
Observation d3931b56-9828-4521-9892-854c1e7ed77b · inbound
PsychoSafe: Eliciting Psychologically-Informed Refusals in Large Language Models OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 2
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.
Observation 128ae228-7814-421e-95c1-653d2b133968 · inbound
An LLM-Native Psychometric Instrument Reveals a Self-Report--Behavior Gap Across 25 Models OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 5
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.
Observation 02c3ae61-49c3-4c53-967b-73e436e652e1 · inbound
Sch\"utzen: Evaluating LLM Safety in Bulgarian and German Contexts OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 16
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.
Observation 829039a5-9561-4f0f-8276-604a52c9b12d · inbound
Muse Spark Safety & Preparedness Report OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 73
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.
Observation 8e0ad023-5950-4a2d-9d13-8aaed034aadb · inbound
From Refusal Geometry to Safety Geometry: Harmfulness--Refusal Coupling under Dynamic Adversarial Fine-Tuning OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 15
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9af1926e-30cb-4dd5-ac00-53824bc8a398 · inbound
Discriminatory Compliance: How LLMs Answer Queries from Protected Groups OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 104
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.
Observation 5b5acc47-0346-407d-8bf6-be5966ab85d1 · inbound
At the Edge of Understanding: Sparse Autoencoders Trace The Limits of Transformer Generalization OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 2
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.
Observation 92957cf9-1ae4-4cc4-b834-f68eedbeaf05 · inbound
Addressing Over-Refusal in LLMs with Competing Rewards OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 36
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.
Observation 2dff7a81-6bd7-42df-a1c0-b554c3131951 · inbound
OpenSafeIntent: Evaluating Intent-Calibrated Safe Completion Across Dual-Use Prompt Sets OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 38
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.
Observation b951f89c-121b-4456-b48b-850bf11e9d12 · inbound
Faithfulness to Refusal: A Causal Audit of Neuron Selectors OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 8
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.
Observation b1e0bd40-6d38-48f1-b9a5-2a90a79377b5 · inbound
BioSecBench-Refusal: A paired metric for performance and alignment in agentic biosecurity risk assessment OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 11
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 22a13f1a-389d-48ae-8847-14d41dbd3c08 · inbound
BioSecBench-Refusal: A paired metric for performance and alignment in agentic biosecurity risk assessment OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 11
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 207ba283-9daa-4759-b969-cd7ae44ab2bb · inbound
Beyond Refusal: A Same-Lineage Study of Aligned and Abliterated LLMs for Vulnerability Analysis OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 48
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.
Observation 7dfadebb-76e8-40ed-b95f-16bce40796b8 · inbound
Efficient Safety Alignment of Language Models via Latent Personality Traits OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 9
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.
Observation 7878eb1a-ca62-4cfa-b872-3e92ccb11110 · inbound
The Entanglement Wall: Activation-Space Probes as Risk Detectors, Not Context Adjudicators OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 6
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation af5421f9-5c79-4bd3-909e-28d7a610d778 · inbound
Phantom Guardrails: When Self-Improving Agent Harnesses Fix Failures That Never Happened OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 1
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 0563645b-47ff-484d-8501-2a3c15a323ca · inbound
BioTIER: A Refusal Benchmark for Targeted Biological Risk Mitigation OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 4
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation f3c78e28-65a4-4ac9-bba3-b905b48479f0 · inbound
BioSecBench-Surveillance: A Verifiable Benchmark for AI Agents in Pathogen Genomic Surveillance OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 16
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation f0ff384a-1a37-40d2-8b34-08f71e9c1d02 · inbound
Robust Critics: Defending LLMs Against Multi-Turn Attacks OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 10
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 0ff948cf-d26d-4f60-a12e-a822a37046d2 · inbound
Test-Time Scaling via Error Localization OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 124
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 75a6e83e-7179-488d-8857-cf1a5ded795f · inbound
When LLM Defenses Backfire: Characterizing Safety, Performance, and Cost Trade-offs OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 7
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 3a627b25-8f8e-4132-9e5c-bf5bdcaa04f8 · inbound
RoCo-ACE: Rollout-Conditioned Online Distillation for Retention-Aware Knowledge Injection OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 50
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 0514d179-cc17-43db-a904-b8f65dc95d1f · inbound
MMOOC: A Comprehensive Benchmark for Out-of-Context Evaluation in Multimodal Large Language Models OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 40
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e455945e-cebc-4316-9511-2d374ae73313 · inbound
Safety, or Just Capability? A Validity Audit of Agent-Safety Benchmarks OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 18
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 58f0fcc2-0fb7-4eac-9743-37fcf82efc48 · inbound
Single Canonical Prompts Underestimate LLM Safety's Surface-Form Sensitivity OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 3
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1bce99af-8df6-4e4b-99a9-dc0a3aba4e36 · inbound
Item Response Theory for AI Safety OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 1981
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c4e08202-2970-4b86-b433-629d5dcce9ea · inbound
How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 21
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1732f4de-e3f7-48e6-a487-20841a7b14d7 · inbound
Refusing Intent, Not Form: Wrapper-Based Intent-Group Supervision for LLM Safety OR-Bench: An Over-Refusal Benchmark for Large Language Models
Reference 9
Source-reported events for the cited work
Unavailable: canonical work link unavailable.