A PPO agent with a Transformer encoder beats prompted LLMs and a history-limited Transformer baseline at Da Vinci Code, winning 58.5% of evaluation games.
Title resolution pending
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.AI 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Mastering Da Vinci Code: A Comparative Study of Transformer, LLM, and PPO-based Agents
A PPO agent with a Transformer encoder beats prompted LLMs and a history-limited Transformer baseline at Da Vinci Code, winning 58.5% of evaluation games.