Introduces an agentic benchmark of unsolved biomedical questions to probe citation faithfulness and tool-use collapse in frontier models.
arXiv preprint arXiv:2401.14493 , year=
2 Pith papers cite this work. Polarity classification is still indexing.
2
Pith papers citing it
years
2026 2verdicts
UNVERDICTED 2representative citing papers
ProMedical builds a 50k preference dataset with fine-grained rubrics and a multi-dimensional reward model that disentangles safety from proficiency, yielding 22.3% accuracy and 21.7% safety gains on Qwen3-8B via GRPO while generalizing to UltraMedical.
citing papers explorer
-
OpenBioRQ: Unsolved Biomedical Research Questions for Agents
Introduces an agentic benchmark of unsolved biomedical questions to probe citation faithfulness and tool-use collapse in frontier models.
-
ProMedical: Hierarchical Fine-Grained Criteria Modeling for Medical LLM Alignment via Explicit Injection
ProMedical builds a 50k preference dataset with fine-grained rubrics and a multi-dimensional reward model that disentangles safety from proficiency, yielding 22.3% accuracy and 21.7% safety gains on Qwen3-8B via GRPO while generalizing to UltraMedical.