DuplexPO decouples conversational timing from semantic content in full-duplex spoken dialogue models by using reinforcement learning on factorized dynamics rewards over local interaction-critical windows, improving turn-taking and backchanneling while preserving reasoning capabilities.
Title resolution pending
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
eess.AS 1years
2026 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Decoupling Conversational Dynamics in Full-Duplex Spoken Models through Reinforcement Learning
DuplexPO decouples conversational timing from semantic content in full-duplex spoken dialogue models by using reinforcement learning on factorized dynamics rewards over local interaction-critical windows, improving turn-taking and backchanneling while preserving reasoning capabilities.