Introduces a parametric reservation-index policy with GMM estimation and UCB exploration for contextual LLM cascading under output-mediated feedback, claiming dimension-dependent square-root regret.
Contextual bandits in a survey experiment on charitable giving: Within-experiment outcomes versus policy learning.arXiv preprint arXiv:2211.12004, 2022
2 Pith papers cite this work. Polarity classification is still indexing.
2
Pith papers citing it
years
2026 2verdicts
UNVERDICTED 2representative citing papers
Develops IPW-Z estimation framework for misspecified contextual bandits, establishing consistency and asymptotic normality under scaled inverse-propensity convergence for marginal moment targets.
citing papers explorer
-
Online Pandora's Box for Contextual LLM Cascading
Introduces a parametric reservation-index policy with GMM estimation and UCB exploration for contextual LLM cascading under output-mediated feedback, claiming dimension-dependent square-root regret.
-
Statistical Inference for Misspecified Contextual Bandits
Develops IPW-Z estimation framework for misspecified contextual bandits, establishing consistency and asymptotic normality under scaled inverse-propensity convergence for marginal moment targets.