A weighted training scheme with adaptive reward scaling improves cloze-test distractor ranking, reaching 37.84% P@1 on MCQ versus 31.66% for the strongest baseline.
dream, idea, way
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CL 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
DualReward: A Dynamic Reinforcement Learning Framework for Cloze Tests Distractor Generation
A weighted training scheme with adaptive reward scaling improves cloze-test distractor ranking, reaching 37.84% P@1 on MCQ versus 31.66% for the strongest baseline.