Dataset-level metrics in diffusion language models mask substantial sample-level non-determinism that varies with model and system factors, which a new Factor Variance Attribution metric can decompose.
Assessing consistency and reproducibility in the outputs of large language models: Evidence across diverse finance and accounting tasks
4 Pith papers cite this work. Polarity classification is still indexing.
4
Pith papers citing it
representative citing papers
Entropy minimization on self-generated outputs elicits strong reasoning in pretrained LLMs, matching or exceeding supervised RL methods on benchmarks.
Shapley values for LLM explanations in financial text are shown via theory and experiments to produce attributions consistent with financial reasoning.