Policy learning with a language bottleneck.arXiv preprint arXiv:2405.04118, 2024

Megha Srivastava, Cédric Colas, Dorsa Sadigh, Jacob Andreas · 2024 · arXiv 2405.04118

1 Pith paper cite this work. Polarity classification is still indexing.

1 Pith paper citing it

representative citing papers

ECHO: Learning Epistemically Adaptive Language Agents with Turn-Level Credit

cs.MA · 2026-06-29 · unverdicted · novelty 7.0

ECHO is a clipped policy-gradient method that uses posterior-sensitive rewards to give turn-level epistemic credit in multi-turn information-seeking tasks, outperforming trajectory-level GRPO on a new Clue Selector Game benchmark.

citing papers explorer

Showing 1 of 1 citing paper after filters.

ECHO: Learning Epistemically Adaptive Language Agents with Turn-Level Credit cs.MA · 2026-06-29 · unverdicted · none · ref 67
ECHO is a clipped policy-gradient method that uses posterior-sensitive rewards to give turn-level epistemic credit in multi-turn information-seeking tasks, outperforming trajectory-level GRPO on a new Clue Selector Game benchmark.

Policy learning with a language bottleneck.arXiv preprint arXiv:2405.04118, 2024

fields

years

verdicts

representative citing papers

citing papers explorer