← back to paper
arxiv: 2607.06008 · 2 revisions
PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents