CLAIM-BENCH evaluates six LLMs on claim-evidence extraction from 100 AI/ML papers, finding that iterative prompting improves recall at high computational cost.
Title resolution pending
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CL 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Can AI Validate Science? Benchmarking LLMs for Accurate Scientific Claim $\rightarrow$ Evidence Reasoning
CLAIM-BENCH evaluates six LLMs on claim-evidence extraction from 100 AI/ML papers, finding that iterative prompting improves recall at high computational cost.