CETBench reveals that LLMs' code-equivalence accuracy drops sharply on program pairs modified by simple transformations, and fine-tuning on such pairs partly restores accuracy.
Title resolution pending
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.SE 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
CETBench: A Novel Dataset constructed via Transformations over Programs for Benchmarking LLMs for Code-Equivalence Checking
CETBench reveals that LLMs' code-equivalence accuracy drops sharply on program pairs modified by simple transformations, and fine-tuning on such pairs partly restores accuracy.