QuickLAP combines physical corrections with LLM-parsed natural language in a closed-form Bayesian update, reducing reward-learning error in simulated driving and improving user ratings in a 15-person study.
Asking easy questions: A user-friendly approach to active reward learning.arXiv preprint arXiv:1910.04365, 2019
2 Pith papers cite this work. Polarity classification is still indexing.
2
Pith papers citing it
representative citing papers
Info-Synth synthesizes optimal preference queries via mutual information maximization in continuous space and a confidence-aware response model, with extensions for finite pools.
citing papers explorer
-
QuickLAP: Quick Language-Action Preference Learning for Semi-Autonomous Agents
QuickLAP combines physical corrections with LLM-parsed natural language in a closed-form Bayesian update, reducing reward-learning error in simulated driving and improving user ratings in a 15-person study.
-
Active Query Synthesis for Preference Learning
Info-Synth synthesizes optimal preference queries via mutual information maximization in continuous space and a confidence-aware response model, with extensions for finite pools.