Neural metrics for evaluating code comments are unreliable for multilingual output, often scoring random noise as high as real generated comments.
Title resolution pending
1 Pith paper cite this work, alongside 210 external citations. Polarity classification is still indexing.
1
Pith paper citing it
210
external citations · OpenAlex
citation-role summary
background 1
citation-polarity summary
fields
cs.SE 1years
2025 1verdicts
CONDITIONAL 1roles
background 1polarities
background 1representative citing papers
citing papers explorer
-
A Qualitative Investigation into LLM-Generated Multilingual Code Comments and Automatic Evaluation Metrics
Neural metrics for evaluating code comments are unreliable for multilingual output, often scoring random noise as high as real generated comments.