CoLoTa rewrites StrategyQA and CREAK questions to replace famous entities with obscure Wikidata entities and shows that LLMs, including OpenAI-o1, drop sharply in accuracy and reason less reliably on the long-tail versions.
Title resolution pending
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CL 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
CoLoTa: A Dataset for Entity-based Commonsense Reasoning over Long-Tail Knowledge
CoLoTa rewrites StrategyQA and CREAK questions to replace famous entities with obscure Wikidata entities and shows that LLMs, including OpenAI-o1, drop sharply in accuracy and reason less reliably on the long-tail versions.