Stochastic Order Learning associates each instance with multiple plausible ranks and trains embeddings via complementary discriminative and stochastic-order losses that remain robust to ordinal label noise.
ICLR , year=
2 Pith papers cite this work. Polarity classification is still indexing.
fields
cs.LG 2years
2026 2representative citing papers
SelectiveRM applies optimal transport with a joint consistency discrepancy and partial mass relaxation to produce reward models that optimize a tighter upper bound on clean risk while autonomously dropping noisy preference samples.
citing papers explorer
-
Stochastic Order Learning: An Approach to Rank Estimation Using Noisy Data
Stochastic Order Learning associates each instance with multiple plausible ranks and trains embeddings via complementary discriminative and stochastic-order losses that remain robust to ordinal label noise.
-
Optimal Transport for LLM Reward Modeling from Noisy Preference
SelectiveRM applies optimal transport with a joint consistency discrepancy and partial mass relaxation to produce reward models that optimize a tighter upper bound on clean risk while autonomously dropping noisy preference samples.