A deterministic n-gram benchmark for Japanese open-ended QA, built from LLM-generated reference answer sets, that reports a 0.9896 correlation with GPT-4o judge scores.
Title resolution pending
1 Pith paper cite this work, alongside 1 external citations. Polarity classification is still indexing.
1
Pith paper citing it
1
external citations · OpenAlex
fields
cs.CL 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
A Judge-free LLM Open-ended Generation Benchmark Based on the Distributional Hypothesis
A deterministic n-gram benchmark for Japanese open-ended QA, built from LLM-generated reference answer sets, that reports a 0.9896 correlation with GPT-4o judge scores.