Across 504 configurations on five-year ADRD prediction, rationale-based supervised fine-tuning consistently degrades performance relative to label-only fine-tuning, despite high-quality rationales validated by experts.
InFindings of the Association for Computational Linguistics: ACL 2025, Wanxiang Che, Joyce Nabende, Ekaterina Shutova, and Mohammad Taher Pilehvar (Eds.)
2 Pith papers cite this work. Polarity classification is still indexing.
years
2026 2representative citing papers
Symptom Induction compresses labeled data into interpretable guidelines that improve LLM classification of depression symptoms in text, outperforming zero-shot, in-context, and fine-tuning approaches with gains on rare symptoms and cross-disease generalization.
citing papers explorer
-
Supervised Fine-tuning with Synthetic Rationale Data Hurts Real-World Disease Prediction
Across 504 configurations on five-year ADRD prediction, rationale-based supervised fine-tuning consistently degrades performance relative to label-only fine-tuning, despite high-quality rationales validated by experts.
-
Learning Evidence of Depression Symptoms via Prompt Induction
Symptom Induction compresses labeled data into interpretable guidelines that improve LLM classification of depression symptoms in text, outperforming zero-shot, in-context, and fine-tuning approaches with gains on rare symptoms and cross-disease generalization.