Pith. sign in

Paper Citation Record · LEDGER

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

As of 22 August 2026, this Paper Citation Record lists 100 of 101 outbound references and 27 inbound Pith citation observations for arXiv:2509.08755.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2509.08755 v1

Coverage vector

measured 100 of 101 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-15T16:08:42.904325Z

measured 127 of 127 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-22T06:32:14.747728+00:00

measured 27 of 27 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-15T15:49:16.072327Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Reference resolution

100 of 101 outbound references displayed

  • verified exact2
  • verified fuzzy17
  • unresolved77
  • parse uncertain1
  • malformed identifier3
  • metadata mismatch0

External citation measurements

0
arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Outbound references

Observation c05bde1c-daba-41ab-858c-d56e8af08986 · outbound

This paper cites GPT-4 Technical Report.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning GPT-4 Technical Report

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:37.600517Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:37.600517Z digest=sha256:3ef91679d0c7cb2a84b7f244ae67c5c769cbc0e0f5abb801fd87d35e0ce8f879

Observation 49032693-a826-4a29-9457-6506e9a5e2b7 · outbound

This paper cites The claude 3 model family: Opus, sonnet, haiku.Claude-3 Model Card, 1(1):4, 2024.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning The claude 3 model family: Opus, sonnet, haiku.Claude-3 Model Card, 1(1):4, 2024

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:37.630983Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:37.630983Z digest=sha256:255803a3ff646bb51ac00ec8ef107b34d669293de3a7f9b8b490513cbe61c0b9

Observation f7dbd590-1d6a-413f-99a3-77c5ad84036a · outbound

This paper cites Gonzalez, and Ion Stoica.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Gonzalez, and Ion Stoica

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:37.682626Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:37.682626Z digest=sha256:be27875b5cd02b3fc0653cb943f513f509bf56635e3f778f86d5ab935e473c07

Observation f45c9255-87da-4228-b342-8b599bef5c8f · outbound

This paper cites FireAct: Toward Language Agent Fine-tuning.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning FireAct: Toward Language Agent Fine-tuning

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:37.751164Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:37.751164Z digest=sha256:86372536c91ba0fc1f4c79ea52875f62ce9f72a5d61d941001992fe83709d4f2

Observation ed751628-26f4-40fc-9c7c-eb9e32f6c7c4 · outbound

This paper cites Improving discriminative capability of reward models in RLHF using contrastive learning.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Improving discriminative capability of reward models in RLHF using contrastive learning

Reference 5

Resolution
malformed identifier
no resolver link, observed 2026-08-15T16:08:37.915657Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:37.915657Z digest=sha256:ac9ecfb7685103d90b7e3d8bef1991b8519f62949e8dcd46f78b66a3f35ad8b1

Observation 86434bf1-b516-4191-8f16-b879b95b0f87 · outbound

This paper cites Agent-flan: Designing data and methods of effective agent tuning for large language models.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Agent-flan: Designing data and methods of effective agent tuning for large language models

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:38.024095Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:38.024095Z digest=sha256:6b455cf0699d8a8e80493b7b8e57fc90a811daf0c6e40f1d0df3e58bb1e83f99

Observation ed35ed01-0716-4185-a42a-23a285b0ef14 · outbound

This paper cites Babyai: A platform to study the sample efficiency of grounded language learning.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Babyai: A platform to study the sample efficiency of grounded language learning

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:38.116032Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:38.116032Z digest=sha256:f33c29951274624c8a4c3c8c4826f25fd6d095361ee92956dc5ecc1f889e3284

Observation e79c8b03-2825-4e4e-9cf0-33bd564a9038 · outbound

This paper cites SELA: Tree-Search Enhanced LLM Agents for Automated Machine Learning.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning SELA: Tree-Search Enhanced LLM Agents for Automated Machine Learning

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:38.247786Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:38.247786Z digest=sha256:45c4c6609f7fcf212c815135a54aabfe83e0b93ed6411aed053d3e3289affb14

Observation dc9bb8dd-b2ff-4467-85c6-aa5607682a42 · outbound

This paper cites Inference-aware fine-tuning for best-of-n sampling in large language models.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Inference-aware fine-tuning for best-of-n sampling in large language models

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:38.418085Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:38.418085Z digest=sha256:e23a0f0aab06d47386ff9ecd77802c8d71d1a60e6c38eeac637f03b292ceec55

Observation f2ecc788-fdaf-421e-9f15-07790ea41ba4 · outbound

This paper cites Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:38.516895Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:38.516895Z digest=sha256:4b0e6ec3dc39a026d08e024bedc460ad29cb52799fe2ecaa46ee3e012520fc7d

Observation a8372011-820b-4c2e-be2d-9f100e52ecb5 · outbound

This paper cites DeepSeek-V3 Technical Report.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning DeepSeek-V3 Technical Report

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:38.670192Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:38.670192Z digest=sha256:3549ba0526563af16000917fa51f0fb931a93eb8a894e801c5b17adfdc3b6ec9

Observation 1b8af236-0990-4b07-a26f-057d2e69a667 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:38.677413Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:38.677413Z digest=sha256:2c44ff5635c89ccf116f1a47d2588a541c0a9b7d7e684df82dd27efb094e01eb

Observation 5e6eaf16-555d-4dd0-a9fb-d6ffb8d728e6 · outbound

This paper cites Mind2web: Towards a generalist agent for the web.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Mind2web: Towards a generalist agent for the web

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:38.719770Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:38.719770Z digest=sha256:21bbbaaf4feb73ad774703935a4de5c98e1338b662b614b0cb6e6e5ced961f1e

Observation e8fdb23b-6492-4fe3-94fa-30db71a195c5 · outbound

This paper cites The Llama 3 Herd of Models.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning The Llama 3 Herd of Models

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:38.790498Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:38.790498Z digest=sha256:dc4e6850b1fc19211585f8350bf6f8f8c45a85b3bf8c9160b2a047e8d97d1164

Observation d7627416-45e8-4088-88d1-72b8d982b0bc · outbound

This paper cites Minedojo: Building open-ended embodied agents with internet-scale knowledge.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Minedojo: Building open-ended embodied agents with internet-scale knowledge

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:38.795430Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:38.795430Z digest=sha256:6c7300f4c006390b7c6ed07306607ae04222df7a539a698d1cc688722a1d87b4

Observation b213f8a0-2881-4799-be1d-a01b14a50df5 · outbound

This paper cites MASTER: A multi-agent system with LLM specialized MCTS.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning MASTER: A multi-agent system with LLM specialized MCTS

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:38.816713Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:38.816713Z digest=sha256:d778b248c161572eb71227fa0f3b879b354707e45ed11dc17e17c6f7d40817de

Observation 530ccc16-1a6b-4563-9874-f3d5ff548979 · outbound

This paper cites CritiQ: Mining Data Quality Criteria from Human Preferences.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning CritiQ: Mining Data Quality Criteria from Human Preferences

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:38.840373Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:38.840373Z digest=sha256:939051e3c0d061826ad327b7cbfc31106d30332e5fe70d230b70c93f46dc6d68

Observation 2205a3cc-2d4d-4173-85bb-e2314cd0add3 · outbound

This paper cites Skywork Open Reasoner 1 Technical Report.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Skywork Open Reasoner 1 Technical Report

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:38.846484Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:38.846484Z digest=sha256:9939222db072433e318db694871ee9ad422768361d0287e6f2ba95771e1ecbc8

Observation c344a969-57c9-451e-a85f-76a326e8ccab · outbound

This paper cites Constructing A multi-hop QA dataset for comprehensive evaluation of reasoning steps.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Constructing A multi-hop QA dataset for comprehensive evaluation of reasoning steps

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:38.851741Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:38.851741Z digest=sha256:ba987791aaa6cb99e7ccc04c3e9ee90b4316fb307c77f6ac96412e459cb60ffc

Observation e50dbf88-be7a-4933-ab4e-144c6aba55e3 · outbound

This paper cites Metagpt: Meta programming for A multi-agent collaborative framework.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Metagpt: Meta programming for A multi-agent collaborative framework

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:38.880006Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:38.880006Z digest=sha256:8a2f9a09be26b6e99562c74178c0b97c2cb2589ed8347e4484042a2b696bde17

Observation e6223821-3664-4649-a17a-33fb68b3761a · outbound

This paper cites REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:38.975341Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:38.975341Z digest=sha256:377441ee4dc4d205758b4836c1cf279a4f99a3137efc52bc8327c0c464df47cd

Observation 111f82ab-f716-4c46-b9bf-fb68df4df0b2 · outbound

This paper cites GPT-4o System Card.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning GPT-4o System Card

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:38.980026Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:38.980026Z digest=sha256:1c74552b6f1e9680612bdacdb47d58e5e2085fbd49a68153ef3a3b043e73c66f

Observation 376527cd-9e01-411c-9ef1-b4174222c4a5 · outbound

This paper cites OpenAI o1 System Card.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning OpenAI o1 System Card

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:38.984341Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:38.984341Z digest=sha256:6fdd79f49773f64bc601a9d9e6a16aad88a5338f9d9f12f8683974355fe6da6e

Observation 53c100a1-18f2-4289-8aa7-e1bdba625018 · outbound

This paper cites AI Alignment: A Comprehensive Survey.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning AI Alignment: A Comprehensive Survey

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.072868Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.072868Z digest=sha256:8fd146637eac425daf6da86fd1b3efbb39fb4fc1f7bd6e2eba4579138f5ad234

Observation 6252f0a3-8341-473e-9c5e-a6ab0203c525 · outbound

This paper cites An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.097595Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.097595Z digest=sha256:47cf7e432a9b6b30e5dd66dfa95103e812fded525a6a98f816fe1544b897e9f7

Observation 42ea67a9-d00d-477f-af5c-5db7e70c5703 · outbound

This paper cites Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.103533Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.103533Z digest=sha256:3b9125dc5df8030700cc85ed8b4ee8b6c0b94a444a51749103e00f8436c0cd22

Observation 4a25a3e2-e9f6-4264-8b77-1bdda9d6d28e · outbound

This paper cites Regularized Best-of-N Sampling with Minimum Bayes Risk Objective for Language Model Alignment.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Regularized Best-of-N Sampling with Minimum Bayes Risk Objective for Language Model Alignment

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.194910Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.194910Z digest=sha256:f6f2e7341e1a4373c61a209bc608d8f69c06ba3ca6e84a9b34b69cc4eb0b7397

Observation 5929d08b-6932-4434-acfe-716666a3bbc7 · outbound

This paper cites Weld, and Luke Zettlemoyer.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Weld, and Luke Zettlemoyer

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.200134Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.200134Z digest=sha256:0594597c13af03973920386745a5cde194c87798ecfa4fe6436042c0eeef2950

Observation 4fab054a-dddf-448e-9ad1-9677d8bcab3d · outbound

This paper cites Buy 4 REINFORCE samples, get a baseline for free! InDeep Reinforcement Learning Meets Structured Prediction, ICLR 2019 Workshop, New Orleans, Louisiana, United States, May 6, 2019.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Buy 4 REINFORCE samples, get a baseline for free! InDeep Reinforcement Learning Meets Structured Prediction, ICLR 2019 Workshop, New Orleans, Louisiana, United States, May 6, 2019

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.209485Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.209485Z digest=sha256:160383c85f746b1f3cdb824be399b7b1e16cefbdeefd641566e7d713c511f63d

Observation dd9332c2-98fa-4616-a708-bab05710d2cf · outbound

This paper cites Co-Reyes, Avi Singh, Kate Baumli, Shariq Iqbal, Colton Bishop, Rebecca Roelofs, Lei M.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Co-Reyes, Avi Singh, Kate Baumli, Shariq Iqbal, Colton Bishop, Rebecca Roelofs, Lei M

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.254624Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.254624Z digest=sha256:ff4b3d602627cfbabb45aed0589f62eeb366d9576df9c91274e6ff4d59754981

Observation a0738f59-79e2-4968-9655-480a767e8fcd · outbound

This paper cites More agents is all you need.Trans.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning More agents is all you need.Trans

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.304390Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.304390Z digest=sha256:08fd5ec92e5048b61d4d20bd2bf0da2e37ab90e344c701db37cbb22fa8d5fc2f

Observation f7809971-b5cd-467e-aea9-edc65795bce4 · outbound

This paper cites Encouraging divergent thinking in large language models through multi-agent debate.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Encouraging divergent thinking in large language models through multi-agent debate

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.309173Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.309173Z digest=sha256:7dcd21c7343773d16fe7bbcec811e86147d7e14baab736217280e7507722d982

Observation b7f86344-60f1-4f52-bd54-944b461c78a0 · outbound

This paper cites Liu, and Jialu Liu.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Liu, and Jialu Liu

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.315407Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.315407Z digest=sha256:a6b9c855ff6d83492ab7e005ea57d9ae1ec36587547b74399924ba5e9549a146

Observation 55ebdc1b-1191-4e32-8427-e3c785c9369f · outbound

This paper cites BOLAA: Benchmarking and Orchestrating LLM-augmented Autonomous Agents.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning BOLAA: Benchmarking and Orchestrating LLM-augmented Autonomous Agents

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.320645Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.320645Z digest=sha256:c4bc96f8fb9fd3056cc7015409fd495cc7cf78aac2a4452735ae2a67c01b825f

Observation d92eb505-e877-47e4-987e-cd492bb7f1c5 · outbound

This paper cites Tang, Manan Roongta, Colin Cai, Jeffrey Luo, Tianjun Zhang, Li Erran Li, Raluca Ada Popa, and Ion Stoica.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Tang, Manan Roongta, Colin Cai, Jeffrey Luo, Tianjun Zhang, Li Erran Li, Raluca Ada Popa, and Ion Stoica

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.379007Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.379007Z digest=sha256:2f92b235d0cc1cb96f0c765a936f3c80468343d904f857cbf61d0bee11f60b39

Observation 15731945-d2eb-4750-b3c3-2ceb611e86b6 · outbound

This paper cites When Not to Trust Language Models: Investigating Effectiveness of Parametric and Non-Parametric Memories.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning When Not to Trust Language Models: Investigating Effectiveness of Parametric and Non-Parametric Memories

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.417051Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.417051Z digest=sha256:1916136c3c7d9dda013d11838b57ce6d908327da98ddb8c1159e5da79fa9f5ad

Observation b7138712-6bd5-4117-b8c0-f178d9bf9133 · outbound

This paper cites Kimi k2: Open agentic intelligence.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Kimi k2: Open agentic intelligence

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.422031Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.422031Z digest=sha256:80c49c36b761ab4f61fa0cc878a52961f051550c6e646be66db246fc947b63e1

Observation ce435bc5-a146-41d3-a9c4-f770f8031dc7 · outbound

This paper cites Long-horizon planning for multi-agent robots in partially observable environments.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Long-horizon planning for multi-agent robots in partially observable environments

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.426769Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.426769Z digest=sha256:4dafe1cb030b2eb339cf312e5078c6b471fa29be0007471384a90da0abfc741e

Observation 36bf6acb-606e-47f3-9aac-e4e9d6176570 · outbound

This paper cites GPT-4 Technical Report.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning GPT-4 Technical Report

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.431704Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.431704Z digest=sha256:f63ce15b0e0be762e35a4797aaae467c1a43d2aa1ea36984fe79d32a95c944e4

Observation 47240b98-5128-4d14-b8e2-2f03074258c1 · outbound

This paper cites Openai o3 and o4-mini system card.https://cdn.openai.com/pdf/2221c875-02dc-4789-800b-e7758 f3722c1/o3-and-o4-mini-system-card.pdf , 2025.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Openai o3 and o4-mini system card.https://cdn.openai.com/pdf/2221c875-02dc-4789-800b-e7758 f3722c1/o3-and-o4-mini-system-card.pdf , 2025

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.519858Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.519858Z digest=sha256:17dfa36ca631f4f7b201d6840021aa4d60de2e795eb492a247250a5bae842982

Observation 5e3fe7b8-b4da-4fb0-a8df-baded709a4a4 · outbound

This paper cites an unresolved cited work.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Unresolved cited work

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.524212Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.524212Z digest=sha256:6cdb1033a015d896a9208258c6dea8b6811acb83aff7ef2c70faa3aa0811e5e3

Observation 321eaa35-7b2d-474d-8950-07ffb70bdcdf · outbound

This paper cites Instruction Tuning with GPT-4.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Instruction Tuning with GPT-4

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.528674Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.528674Z digest=sha256:1829984d53d545cddaac92d1c0faecbfdd9d4dfc6308ceeccd9d5d49d70dbb5c

Observation 9b764c18-7e86-434b-a960-41adf7aa6d7d · outbound

This paper cites Adapt: As-needed decomposition and planning with language models.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Adapt: As-needed decomposition and planning with language models

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.533278Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.533278Z digest=sha256:d15fc26c7b9b8636c019d1f821dc14bd4639a7fb9ac06bbe1173d243304bcf37

Observation 66b95654-95a8-4cf7-94a1-3ca5e94da924 · outbound

This paper cites Smith, and Mike Lewis.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Smith, and Mike Lewis

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.601912Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.601912Z digest=sha256:e09518f7e140c1f9d6aa274e41fc9542e24820f56e05dc9c31dd859ef9aabde4

Observation 4001e3d7-f7fa-4c3d-949a-d1c204ddf3f7 · outbound

This paper cites Webrl: Training LLM web agents via self-evolving online curriculum reinforcement learning.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Webrl: Training LLM web agents via self-evolving online curriculum reinforcement learning

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.694720Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.694720Z digest=sha256:a4eac56699e76df24745e6b3531c7b47f736837eb9d6849500b077d187904ce5

Observation c5ef7cff-6d59-4efa-a6bf-4c3b4a9d8348 · outbound

This paper cites an unresolved cited work.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Unresolved cited work

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.817846Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.817846Z digest=sha256:b37019816a69c3cb134e21c737ed7428b2912283df8a0058dba8ce8d62234897

Observation 0b3685b8-ed08-4a38-87d0-4e7e501a990d · outbound

This paper cites Qwq-32b: Embracing the power of reinforcement learning, March 2025.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Qwq-32b: Embracing the power of reinforcement learning, March 2025

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T16:08:48.090772Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T16:08:39.898665Z digest=sha256:ed1f979f0e20ca29296f32bb3ce39d603de0734f8181f754737e4ee96858eb0c

Observation 9291ba2a-da47-456c-a360-ff861717daa1 · outbound

This paper cites Manning, Stefano Ermon, and Chelsea Finn.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Manning, Stefano Ermon, and Chelsea Finn

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T16:08:47.816003Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T16:08:40.047019Z digest=sha256:f6f18db54f0be5fde961fbc7555e9f9745027acd0919778b943fcae57105693a

Observation cc80a67f-3fc9-4482-8598-a56495206e19 · outbound

This paper cites Self-Reflection in LLM Agents: Effects on Problem-Solving Performance.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Self-Reflection in LLM Agents: Effects on Problem-Solving Performance

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:40.106049Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:40.106049Z digest=sha256:19fa62bf9d949a8ae1f537a689189f34df2cde49f0f384bab78ae7453786bdcf

Observation 9a93ac67-fd24-4d93-a7c1-13618bbab08e · outbound

This paper cites Jordan, and Philipp Moritz.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Jordan, and Philipp Moritz

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T16:08:47.725755Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T16:08:40.111338Z digest=sha256:25644909207c3a49ceda6ef1e5790b6c6cf52c691d2234ab5ea69dd0a72780b7

Observation 3628a375-f5b5-4de0-9c05-72ff6564ba58 · outbound

This paper cites Proximal Policy Optimization Algorithms.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Proximal Policy Optimization Algorithms

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:40.117952Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:40.117952Z digest=sha256:da7260bf9c5baa9b744350cbe42c09b156f549c580d6cc12667f22b1ec1e1117

Observation adb5e41d-7329-459e-b544-53531c9a35ac · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:40.219723Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:40.219723Z digest=sha256:8a8b5f466ab91a12aa085eb424e8049daf14c8ef35db52d17ef017a35525e265

Observation 81c7e9db-2afa-4e3c-b41f-20ce6ca35031 · outbound

This paper cites Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:40.225533Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:40.225533Z digest=sha256:710c1189fb068a1b3dca229f83838126a36e81bc6cc4d83a7a952a83a3918560

Observation 1b9fe2dc-42ba-49ab-b6bd-55913403c21e · outbound

This paper cites Hybridflow: A flexible and efficient RLHF framework.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Hybridflow: A flexible and efficient RLHF framework

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:40.230219Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:40.230219Z digest=sha256:9e264401179115ae2ccdbde76583b3db3058dae391042b9776151d95a214c0d6

Observation c11cf04b-2b0a-468a-8847-9ae872096c58 · outbound

This paper cites Reflexion: language agents with verbal reinforcement learning.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Reflexion: language agents with verbal reinforcement learning

Reference 57

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T16:08:47.606687Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T16:08:40.333561Z digest=sha256:c7287d133420bc903bbd4cfab48f0333eedde70768edcfd1f787df6ec16102d7

Observation fdf115c4-19aa-4508-93da-604656978bf9 · outbound

This paper cites Hausknecht.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Hausknecht

Reference 58

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T16:08:47.333232Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T16:08:40.483374Z digest=sha256:696320d7824f7d88e1883b6b7c4ac5cb9d4a04520562fb8b60f14b7a673e1c31

Observation 31498db6-3b98-4ac0-8bc3-6f23664490a5 · outbound

This paper cites an unresolved cited work.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Unresolved cited work

Reference 59

Resolution
unresolved
raw_fallback, observed 2026-08-15T16:08:47.519366Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T16:08:40.389507Z digest=sha256:15e7447c0f9550811dadf847cf0c662bc2ccdf58dbfcacb823b37f7d418fa415

Observation 8f7a4cf1-50f9-4d7f-a561-8f4e715ce3b0 · outbound

This paper cites PaperBench: Evaluating AI's Ability to Replicate AI Research.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning PaperBench: Evaluating AI's Ability to Replicate AI Research

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:40.493997Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:40.493997Z digest=sha256:13df6e758be38b4cb63504b92adc313e43ecb4f85bf4581edfd9ccf628663f68

Observation 006026b6-3723-4002-9bce-af7a72e9acd1 · outbound

This paper cites Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:40.488720Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:40.488720Z digest=sha256:342f095b91d6b3180dbc152efdc2a612e983ffec6f685f908a83859d0d653de7

Observation 03106ecc-edab-42a8-a294-27719c248ed9 · outbound

This paper cites Sutton and Andrew G.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Sutton and Andrew G

Reference 62

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T16:08:47.009894Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T16:08:40.504753Z digest=sha256:b15cea4baeea60f89e5a530f537a95c791df68d345cb9ae214418aeba7dea7cf

Observation 63885804-d288-4ca1-8b29-3120d5f3bbb7 · outbound

This paper cites Adaplanner: Adaptive planning from feedback with language models.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Adaplanner: Adaptive planning from feedback with language models

Reference 63

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T16:08:47.130353Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T16:08:40.499030Z digest=sha256:7348be48f51bfbed3f7e27336b4a09c18ace1877b1de826bf5ebbd24ad51451e

Observation 1422e5ea-66b1-4c5c-a413-2140fe4971c7 · outbound

This paper cites Multi-Agent Collaboration: Harnessing the Power of Intelligent LLM Agents.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Multi-Agent Collaboration: Harnessing the Power of Intelligent LLM Agents

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:40.624630Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:40.624630Z digest=sha256:808200329449590c9bdf149ef72c7c56be5516f21d6ad7c80e91d112ef767981

Observation 3dea4ca2-8cb5-4bab-86eb-6682c8a0f0df · outbound

This paper cites Gemini: A Family of Highly Capable Multimodal Models.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Gemini: A Family of Highly Capable Multimodal Models

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:40.740394Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:40.740394Z digest=sha256:08266408d57c5129bc02412b65faa1db597aa29a58b6e01dc1f3597c21b2f546

Observation c06f7733-5606-497f-b940-5ca77cae9725 · outbound

This paper cites Sutton, David A.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Sutton, David A

Reference 66

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T16:08:46.562456Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T16:08:40.618864Z digest=sha256:61185ae847da03c5574bfb2055c016ea75f60af5c6ba331714624d7f9f04fc41

Observation 97cc24de-8bd8-4ec4-86d2-295bea05cfc9 · outbound

This paper cites Musique: Multihop questions via single-hop question composition.Trans.Assoc.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Musique: Multihop questions via single-hop question composition.Trans.Assoc

Reference 67

Resolution
malformed identifier
no resolver link, observed 2026-08-15T16:08:40.842451Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:40.842451Z digest=sha256:88965ad3e11f834faf90bca6e710091b33f5d3a27a33ae65e440ef4d49a3594f

Observation 0dd2da24-b3b8-4530-8314-5657515611b5 · outbound

This paper cites Reft: Reasoning with reinforced fine-tuning.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Reft: Reasoning with reinforced fine-tuning

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:40.898413Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:40.898413Z digest=sha256:9a6fbcd0017a3dae8d631eb24080f99ffd15d3a0dd6aaf51e84a3998af94fd3f

Observation 532e615f-3a21-40bf-a4db-9cb23d09deb2 · outbound

This paper cites Kimi k1.5: Scaling Reinforcement Learning with LLMs.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Kimi k1.5: Scaling Reinforcement Learning with LLMs

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:40.805045Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:40.805045Z digest=sha256:dfdfa03385d221c98a5bddc5a3aef327c60014f83d395e5e344c758b1c376f3f

Observation 265a9530-001d-4455-8cb1-959fd7aa7d00 · outbound

This paper cites Le, Ed H.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Le, Ed H

Reference 70

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T16:08:46.341534Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T16:08:41.017873Z digest=sha256:31b9ae7b8e18edc5bd18e2bf8de47e4d3869e4bbd738493ea79c6199304da72f

Observation 9683a1b6-ce25-46b5-95c3-cbb4338ace2d · outbound

This paper cites RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:41.102876Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:41.102876Z digest=sha256:956d9fcca35494c838e58d389bf5a04580bbed34ec1176059c691760432409d7

Observation 4ab9bbf9-4a66-47db-9ce0-ada5f3d3fb59 · outbound

This paper cites Jansen, Marc-Alexandre Côté, and Prithviraj Ammanabrolu.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Jansen, Marc-Alexandre Côté, and Prithviraj Ammanabrolu

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:40.903651Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:40.903651Z digest=sha256:10cdeb7c108f39acf8b80cc329c204c9d367f1bc5c38924f28daefb2dd7defff

Observation ae062941-d08d-493b-8c08-577757bfd82d · outbound

This paper cites Williams.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Williams

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:41.296247Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:41.296247Z digest=sha256:7c4cd7206d6883b2ff8edbcf8ba04496da86807d82edcc0cf341b8a5af14858d

Observation 0d24e350-83ed-458c-ac11-aedca08b0180 · outbound

This paper cites AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:41.381835Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:41.381835Z digest=sha256:256b6c13f226610f564395e525ceccc75eddc38c21b79d4b6428de09c4188d7c

Observation 95356520-f7dc-4c93-9e37-f41cd17eef1b · outbound

This paper cites BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:41.200957Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:41.200957Z digest=sha256:adbda90d169f2ebf7744ebd9f2decccae29715f8dfe1a8e0e1c623e716bd873b

Observation bf255e61-772a-47ca-b0fa-3d0bbf8246a1 · outbound

This paper cites Training large language models for reasoning through reverse curriculum reinforcement learning.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Training large language models for reasoning through reverse curriculum reinforcement learning

Reference 76

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T16:08:45.885089Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T16:08:41.458791Z digest=sha256:c35362428dfa8c62abb55fab0e91284bb5af0839fa74271af10a1fab859e766c

Observation 1d53ab70-2c84-4fb0-972c-54d9354c5c59 · outbound

This paper cites AgentGym: Evolving Large Language Model-based Agents across Diverse Environments.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning AgentGym: Evolving Large Language Model-based Agents across Diverse Environments

Reference 77

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:41.489376Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:41.489376Z digest=sha256:8ba746ee7cc8d3a8e75b983194c553481049d3e0f22fc3a178b20e19ae933ce1

Observation 8077fde1-54f2-4cdd-bf6e-7fa50af5084a · outbound

This paper cites an unresolved cited work.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Unresolved cited work

Reference 78

Resolution
unresolved
raw_fallback, observed 2026-08-15T16:08:46.157653Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T16:08:41.387710Z digest=sha256:06aefa22332f59f8657164d057e9c13109415d5e0bb0ffe853b857d19283b584

Observation 2606dce6-2272-4fd5-99c9-ebe1c71a362c · outbound

This paper cites The rise and potential of large language model based agents: a survey.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning The rise and potential of large language model based agents: a survey

Reference 79

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:41.500771Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:41.500771Z digest=sha256:3417f97078ebc75d50d7e1c93d097626cc2c6d938fa77a1d111278a9bb136301

Observation b6a6cc2f-9582-4d9f-b2ef-4ddeb37530f8 · outbound

This paper cites Inverse-q*: Token level reinforcement learning for aligning large language models without preference data.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Inverse-q*: Token level reinforcement learning for aligning large language models without preference data

Reference 80

Resolution
verified exact
doi, observed 2026-08-15T16:08:43.458973Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T16:08:41.579580Z digest=sha256:01cf9f770f7897a9e5ab4a99016dacb4d4a85c30de07ca69962168e2b61f6060

Observation 4e4d0ea8-cdb9-45dd-8b92-9db67b2b7a05 · outbound

This paper cites Enhancing LLM Reasoning via Critique Models with Test-Time and Training-Time Supervision.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Enhancing LLM Reasoning via Critique Models with Test-Time and Training-Time Supervision

Reference 81

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:41.494963Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:41.494963Z digest=sha256:14ba8872e5c57c1ef525378071a7c851d5706ca365635c817e5a2d9a6652a1bb

Observation 39b4f6fe-10dc-468c-8232-5793c76ea01a · outbound

This paper cites Teaching language models to critique via reinforcement learning.CoRR, abs/2502.03492, 2025.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Teaching language models to critique via reinforcement learning.CoRR, abs/2502.03492, 2025

Reference 82

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:41.590120Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:41.590120Z digest=sha256:f11737d3c57dc2a396fc74acf11fb4503852a93fcca778e2bca3a9d353bd2b35

Observation fe637a45-7df9-4646-a616-084cd27712d8 · outbound

This paper cites Qwen2.5 Technical Report.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Qwen2.5 Technical Report

Reference 83

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:41.650422Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:41.650422Z digest=sha256:0c4d455e76affac6827d83937716640eff045335ca1b4eedc81a7eabf8700a2b

Observation 4d27eee0-bc0a-4db3-b455-7488bf2f5ce3 · outbound

This paper cites Self-evaluation guided beam search for reasoning.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Self-evaluation guided beam search for reasoning

Reference 84

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T16:08:45.673240Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T16:08:41.584987Z digest=sha256:bcf029215242edc2ea21f265d8486d492c4086faaa5aa6be45d3494248836d0b

Observation 42973a9a-fadf-4a85-837a-9fa5934bd73a · outbound

This paper cites Cohen, Ruslan Salakhutdinov, and Christopher D.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Cohen, Ruslan Salakhutdinov, and Christopher D

Reference 85

Resolution
malformed identifier
no resolver link, observed 2026-08-15T16:08:41.707152Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:41.707152Z digest=sha256:ded2dd1f34ceecc0968a65e4461a760988a60c4fca4cb96f9665f0a352713e1c

Observation ff00ba3d-15ef-4527-b494-59e0ae432c26 · outbound

This paper cites Language Agents: From Next-Token Prediction to Digital Automation.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Language Agents: From Next-Token Prediction to Digital Automation

Reference 86

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T16:08:45.390030Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T16:08:41.711910Z digest=sha256:9f262e6cc1c6961484ac5bd15aeab94c22e3a145398a4f0b343e2c18f103c5c3

Observation 86b114ba-b299-4ec5-bb13-bf18ce27975e · outbound

This paper cites Qwen3 Technical Report.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Qwen3 Technical Report

Reference 87

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:41.701294Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:41.701294Z digest=sha256:39a0ccfbc9c3a6d911c10345beb865af10a6aafb45401bf365cdf8eacad323a5

Observation e3300ea8-c0a7-4223-a3e8-c653c3aa1b5c · outbound

This paper cites Narasimhan, and Yuan Cao.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Narasimhan, and Yuan Cao

Reference 88

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T16:08:45.053916Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T16:08:41.804333Z digest=sha256:abf07590c55ae48698be57120e823a9cf706bcdca1e9e48d13f6ae40909f0314

Observation be99b73b-b1c7-4786-afd4-c5af248cafcf · outbound

This paper cites TL-Training: A Task-Feature-Based Framework for Training Large Language Models in Tool Use.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning TL-Training: A Task-Feature-Based Framework for Training Large Language Models in Tool Use

Reference 89

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:41.926916Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:41.926916Z digest=sha256:88b129fda47d1131d982f97dd3630519d50a7c4b6ff80cc328553039fe95b6c4

Observation 256e425d-08c8-40a3-bf98-6e352a98bd6c · outbound

This paper cites Webshop: Towards scalable real-world web interaction with grounded language agents.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Webshop: Towards scalable real-world web interaction with grounded language agents

Reference 90

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T16:08:45.254321Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T16:08:41.717784Z digest=sha256:3c8245805e810bb1cb17d44b14d1c27f8a3ff20d9bc23478cce8d106c6caabf5

Observation 5af19426-01d6-4d0c-a8fb-789ccc4fdaea · outbound

This paper cites Agenttuning: Enabling generalized agent abilities for llms.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Agenttuning: Enabling generalized agent abilities for llms

Reference 91

Resolution
verified exact
doi, observed 2026-08-15T16:08:43.224466Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T16:08:42.053976Z digest=sha256:defdc9104cc862bb28c306ddd7503bb7ad15331f4d3995f5959020297358cae9

Observation 48bef6c8-d0a6-444e-b1eb-ce4f4192a8b8 · outbound

This paper cites AgentOhana: Design Unified Data and Training Pipeline for Effective Agent Learning.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning AgentOhana: Design Unified Data and Training Pipeline for Effective Agent Learning

Reference 92

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:42.143756Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:42.143756Z digest=sha256:5592518e19c0f690308e28121906956a28eeadb08f1b0218236695efe40da703

Observation a2cf32f5-2ede-4cc9-8f31-e8fa9b291fa4 · outbound

This paper cites ToolHop: A Query-Driven Benchmark for Evaluating Large Language Models in Multi-Hop Tool Use.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning ToolHop: A Query-Driven Benchmark for Evaluating Large Language Models in Multi-Hop Tool Use

Reference 93

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:41.989075Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:41.989075Z digest=sha256:69ce859dd9a58777d0610dd73ee616b1c9e39b198894bb73cf78534c3351adbd

Observation dc31d1eb-0dd3-4546-97cc-a6c0b41e4e30 · outbound

This paper cites Xu, Hao Zhu, Xuhui Zhou, Robert Lo, Abishek Sridhar, Xianyi Cheng, Tianyue Ou, Yonatan Bisk, Daniel Fried, Uri Alon, and Graham Neubig.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Xu, Hao Zhu, Xuhui Zhou, Robert Lo, Abishek Sridhar, Xianyi Cheng, Tianyue Ou, Yonatan Bisk, Daniel Fried, Uri Alon, and Graham Neubig

Reference 94

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T16:08:44.943340Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T16:08:42.303584Z digest=sha256:efb11b13d35fc490458e1707e191585f6c98402c461da1887a810b174d473b17

Observation 60b2c832-1e32-4ef0-bd2c-ed49b1fe3cf4 · outbound

This paper cites Archer: Training language model agents via hierarchical multi-turn RL.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Archer: Training language model agents via hierarchical multi-turn RL

Reference 95

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T16:08:44.678860Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T16:08:42.424153Z digest=sha256:fbba3e99b78680fb56d0beaae916803f806b47174aa69835e6e39a53ef222708

Observation f73c0b1f-224b-4ba7-9ebb-7647afcba7e9 · outbound

This paper cites Secrets of RLHF in Large Language Models Part I: PPO.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Secrets of RLHF in Large Language Models Part I: PPO

Reference 96

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:42.217316Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:42.217316Z digest=sha256:21588864803c8776d939686d11dc5b161b8625ad045a5e431a52197d3be32ed9

Observation be068867-1ea1-4f98-a8ad-db57b7ccc02f · outbound

This paper cites Deductive Beam Search: Decoding Deducible Rationale for Chain-of-Thought Reasoning.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Deductive Beam Search: Decoding Deducible Rationale for Chain-of-Thought Reasoning

Reference 97

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:42.642649Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:42.642649Z digest=sha256:0507c9f7dd4dc5845e1d03743a2456745835d0e9462ebacbf007edef9a1050a4

Observation 008c251b-39bb-4631-92c4-a88dcfc3073f · outbound

This paper cites Scaling Test-time Compute for LLM Agents.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Scaling Test-time Compute for LLM Agents

Reference 99

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:42.543273Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:42.543273Z digest=sha256:47a87db847411e28d43b211acefd6ff2046f104887517583d0e696626580d8a9

Observation 7e4e754a-856d-4c40-b5a5-b1811875037a · outbound

This paper cites an unresolved cited work.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Unresolved cited work

Reference 108

Resolution
parse uncertain
raw_fallback, observed 2026-08-15T16:08:44.499894Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T16:08:42.848076Z digest=sha256:e3f84fec2e82304aeae8087db90f7b5969136d6235a46868dd44179112401676

Observation d791954a-b009-47fe-b3ee-636efe0335d6 · outbound

This paper cites Catalog Price Rule.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Catalog Price Rule

Reference 361

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T16:08:44.338624Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T16:08:42.904325Z digest=sha256:b5d7735c07968fb7e9c19fb097fce5b894ad9c6da84ae20d152266a218181c9a

Observation 3b9a8633-9adb-482a-97a8-879cc7197443 · outbound

This paper cites an unresolved cited work.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Unresolved cited work

Reference 2018

Resolution
unresolved
raw_fallback, observed 2026-08-15T16:08:46.790252Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T16:08:40.613077Z digest=sha256:9e556bbbd29cc547f58c7ec70d65eebb77af34c2acdb595205d7feee0a6f58d5

Observation 78edf6f1-8561-4f74-ba85-cf6c5240871c · outbound

This paper cites an unresolved cited work.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Unresolved cited work

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:38.785318Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:38.785318Z digest=sha256:294fddc4e91a6bbd2f0f486a96cc75894624f93c3332d1096581dd0cfa305d83

Pith citing papers

Observation 02f62de8-51c4-4717-824a-9f454d01bcf1 · inbound

DeepTravel: An End-to-End Agentic Reinforcement Learning Framework for Autonomous Travel Planning Agents cites this paper.

DeepTravel: An End-to-End Agentic Reinforcement Learning Framework for Autonomous Travel Planning Agents AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-15T15:49:16.072327Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T15:49:16.072327Z digest=sha256:3e21d3099a7a86996a6d043dccbb5e71ace61fb3e367a727e438309a72b1d0c0

Observation ab033493-353e-4c3c-86e5-a01590349bc5 · inbound

From Refusal to Recovery: A Control-Theoretic Approach to Generative AI Guardrails cites this paper.

From Refusal to Recovery: A Control-Theoretic Approach to Generative AI Guardrails AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 64

Resolution
verified exact
arxiv_id, observed 2026-05-21T20:44:22.032163Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-05-21T20:42:40.823721Z digest=sha256:ed1b8903a3a56d0139ca67bf2b27532e1cc20e88e30013e1fdb6d46e0369c75a

Observation 1bac4949-4614-4099-84cb-bf272862a396 · inbound

Graph-Enhanced Policy Optimization in LLM Agent Training cites this paper.

Graph-Enhanced Policy Optimization in LLM Agent Training AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-04T07:17:44.662944Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T07:17:44.662944Z digest=sha256:a3d54a72336ab2f82236a706f378ea5351e58c533b88a5c8c4faa813bd5d9552

Observation 65ecc095-b3c4-4c04-8fd5-45bd71d0c2f1 · inbound

No More Stale Feedback: Co-Evolving Critics for Open-World Agent Learning cites this paper.

No More Stale Feedback: Co-Evolving Critics for Open-World Agent Learning AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 18

Resolution
metadata mismatch
arxiv_id, observed 2026-05-16T16:03:04.350165Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-05-16T16:01:48.789986Z digest=sha256:a81aac48f4408aaaddf40f26dd76b50db0d39c53e8e1ccd0f450b46d9a2d4084

Observation 521c8bd2-31d2-4ddf-bc5f-0bfa840077e2 · inbound

SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents cites this paper.

SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-02T23:41:44.971735Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T23:41:44.971735Z digest=sha256:8f40c476dea0ea0cf31c252fae068810bfe7b1273c14837c9b2e890dca2705ef

Observation 62076d23-5f87-47e3-b40e-a118ffdc1d62 · inbound

HiMAC: Hierarchical Macro-Micro Learning for Long-Horizon LLM Agents cites this paper.

HiMAC: Hierarchical Macro-Micro Learning for Long-Horizon LLM Agents AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 56

Resolution
metadata mismatch
arxiv_id, observed 2026-05-15T18:36:28.302124Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-05-15T18:35:45.900606Z digest=sha256:ac41b4a07e42737228404450a91dd537484eb0177f42c4b26f19e356a6cc4be8

Observation 80e94209-9660-4f03-9d68-3a17f887eee7 · inbound

Multi-Agent Systems: From Classical Paradigms to Large Foundation Model-Enabled Futures cites this paper.

Multi-Agent Systems: From Classical Paradigms to Large Foundation Model-Enabled Futures AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 99

Resolution
verified exact
arxiv_id, observed 2026-05-11T11:51:04.003863Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-05-10T04:31:28.242097Z digest=sha256:ed95e09fe84a90fa07da05a66de52df799fdb25973f876fac4eef7dd994627c3

Observation a0a00fb7-0848-4b85-af89-ff144e01af2a · inbound

Gated Coordination for Efficient Multi-Agent Collaboration in Minecraft Game cites this paper.

Gated Coordination for Efficient Multi-Agent Collaboration in Minecraft Game AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 35

Resolution
verified exact
arxiv_id, observed 2026-05-11T13:16:10.668460Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-05-10T02:03:01.533652Z digest=sha256:3eb62eecc84ca6b4d3113f023d5c917cd5bed9cc23493ab050d3bde46b37e746

Observation 3f2fe3ee-5043-4fd1-86a5-ce7f9e1e0052 · inbound

Ask Only When Needed: Proactive Retrieval from Memory and Skills for Experience-Driven Lifelong Agents cites this paper.

Ask Only When Needed: Proactive Retrieval from Memory and Skills for Experience-Driven Lifelong Agents AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 31

Resolution
verified exact
arxiv_id, observed 2026-05-10T00:24:47.266164Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-05-10T00:07:50.798934Z digest=sha256:b1bea6a4f5633ce29c6f19e718cbd3077f65e7ab530ab5f9665b1e5c5eef9e93

Observation d56ae31f-1127-4d63-8d06-b6f79feefa8a · inbound

On Training Large Language Models for Long-Horizon Tasks: An Empirical Study of Horizon Length cites this paper.

On Training Large Language Models for Long-Horizon Tasks: An Empirical Study of Horizon Length AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 38

Resolution
metadata mismatch
arxiv_id, observed 2026-05-09T06:40:40.777758Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-05-08T18:13:25.735085Z digest=sha256:d1893a1e690d1f6161ea341a050beb61e89e90457a7801352304be3d0d06321a

Observation 62f24da8-3e94-423f-9baa-ad1e2f5b43ee · inbound

StraTA: Incentivizing Agentic Reinforcement Learning with Strategic Trajectory Abstraction cites this paper.

StraTA: Incentivizing Agentic Reinforcement Learning with Strategic Trajectory Abstraction AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 13

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T20:11:12.218032Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-05-08T09:59:48.604813Z digest=sha256:4bbba2ef91f27b29ef1233a2945de7bc7de88bb8af27ee15a2abf6ca965f2ec5

Observation 1e85163d-8550-442e-9751-e64bd6830b91 · inbound

Weblica: Scalable and Reproducible Training Environments for Visual Web Agents cites this paper.

Weblica: Scalable and Reproducible Training Environments for Visual Web Agents AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 39

Resolution
verified exact
arxiv_id, observed 2026-05-11T04:25:56.957645Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-05-11T01:25:44.578007Z digest=sha256:42dee38dd51e7b562fb5c580f11dbf519e0d2dc011ef16c2d6a83b58ab726220

Observation 8088afa4-dd0d-4fa3-8c33-a1292a4c46b5 · inbound

AgentForesight: Online Auditing for Early Failure Prediction in Multi-Agent Systems cites this paper.

AgentForesight: Online Auditing for Early Failure Prediction in Multi-Agent Systems AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 56

Resolution
verified exact
arxiv_id, observed 2026-05-12T08:06:27.547132Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-05-12T01:19:49.062330Z digest=sha256:7e6c7c08ef62b8a86ca865bec7e5fa8dd940fce93b027eddbd3dc7004032b956

Observation a6a7d221-1648-47b6-aefe-2964ec339729 · inbound

AgentForesight: Online Auditing for Early Failure Prediction in Multi-Agent Systems cites this paper.

AgentForesight: Online Auditing for Early Failure Prediction in Multi-Agent Systems AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 56

Resolution
verified exact
arxiv_id, observed 2026-05-15T05:25:03.885299Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-05-15T05:24:54.265411Z digest=sha256:141832a3d24de284d99e30607240a96f13a2631c0b89100e04873ab06efad46f

Observation f9d5f345-c44a-4e88-8985-0fe8803df340 · inbound

GRAFT: Graph-Tokenized LLMs for Tool Planning cites this paper.

GRAFT: Graph-Tokenized LLMs for Tool Planning AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 20

Resolution
verified exact
arxiv_id, observed 2026-05-13T07:22:28.269254Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-05-13T07:22:03.560420Z digest=sha256:f4ff924d2fd4408d33de34d9fe6d82c8d26c39e7135d263f98ce753a9a0b0d32

Observation d857d5c2-67c7-46cb-a55c-bc15d944de6b · inbound

Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control cites this paper.

Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 43

Resolution
metadata mismatch
arxiv_id, observed 2026-05-13T07:32:28.836944Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-05-13T07:30:41.399083Z digest=sha256:3a03809d22901af29cb227d68f3434a90c62704a4924bbec0cabffc0f081ca03

Observation 199a2e9b-eb9a-4a3a-940b-4e6a27353c78 · inbound

Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control cites this paper.

Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 84

Resolution
verified exact
arxiv_id, observed 2026-05-15T06:05:05.669079Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-05-15T06:04:32.640299Z digest=sha256:031fad60d5fd1cca41cccbacec47a21c2abb13f55856f47928086c0da3b9f21c

Observation 72827b3b-f976-4a54-9e0e-970c19d50e4d · inbound

PriorZero: Bridging Language Priors and World Models for Decision Making cites this paper.

PriorZero: Bridging Language Priors and World Models for Decision Making AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 26

Resolution
metadata mismatch
arxiv_id, observed 2026-05-13T05:27:18.624132Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-05-13T05:25:05.907123Z digest=sha256:d4d7e562aa3c1afd5e68828c45106394cf4e0a61c698059aaf80b8ddfc06f32a

Observation 468889c8-af3e-4213-baa3-d9b4c468334a · inbound

Resolving Action Bottleneck: Agentic Reinforcement Learning Informed by Token-Level Energy cites this paper.

Resolving Action Bottleneck: Agentic Reinforcement Learning Informed by Token-Level Energy AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 33

Resolution
verified exact
arxiv_id, observed 2026-05-15T01:48:28.618421Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-05-15T01:46:24.724553Z digest=sha256:9778d81617db536089c0dfff1f59723a05c01c700ec03d60e69fd70b3c69ffef

Observation e1ac94f0-db25-4541-9ebc-593bb43dfd4e · inbound

ICRL: Learning to Internalize Self-Critique with Reinforcement Learning cites this paper.

ICRL: Learning to Internalize Self-Critique with Reinforcement Learning AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 35

Resolution
metadata mismatch
arxiv_id, observed 2026-05-19T18:02:42.395542Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-05-19T17:58:05.817581Z digest=sha256:1397e211352909246e59f6b3fb1016ae7c8bc7d38e70e3239c07cd087b985d2d

Observation b59c1e80-b311-4087-a119-9dbbe090a57a · inbound

Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents cites this paper.

Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 39

Resolution
verified exact
arxiv_id, observed 2026-05-20T05:38:05.470067Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-05-20T05:35:45.084011Z digest=sha256:865222f33240eafe3f9fd9aa19acabfb647214c82c7a03d9d8fa4d80d0f69bd2

Observation 8d583fbf-e3c7-403d-b117-3b59177e3305 · inbound

SkillGrad: Optimizing Agent Skills Like Gradient Descent cites this paper.

SkillGrad: Optimizing Agent Skills Like Gradient Descent AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 1

Resolution
malformed identifier
arxiv_id, observed 2026-06-29T16:53:41.304135Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-06-29T16:46:09.930635Z digest=sha256:752f48bb590504cc3d4a0f3b0496f1bc7e2b048bf0e321e1b5828bb74fe248c8

Observation 6b1e739c-bb86-4664-9402-992f048bad50 · inbound

Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories cites this paper.

Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 43

Resolution
unresolved
no resolver link, observed 2026-07-14T10:33:54.851493Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T10:33:54.851493Z digest=sha256:5742a3eb4ae5fb8effd3e8362522956e2b10ef6896b859ab022e7eee1fc4a8a6

Observation 763e6f28-3062-4056-96fa-b9052d9b42fb · inbound

From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training cites this paper.

From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 2018

Resolution
unresolved
no resolver link, observed 2026-08-02T09:45:49.609534Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T09:45:49.609534Z digest=sha256:2b2a03f47a310d978c26aaa714f39a299383e7369e54f4f4896a6caa35c3ab2d

Observation 1a45e017-0649-429c-b45c-3054a1e94154 · inbound

From Trajectories to Prefixes: Reusing Teacher Trajectories via Replayed Prefixes and Online Continuation cites this paper.

From Trajectories to Prefixes: Reusing Teacher Trajectories via Replayed Prefixes and Online Continuation AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-02T08:56:35.257327Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T08:56:35.257327Z digest=sha256:2f3fc17af6fa58542a76d33c7f4ea588b3e9d9543b45bcb550a802a59d281417

Observation 1934517f-cac9-4a64-9ac3-74851e6dce68 · inbound

When Reasoning Narrows the Move: Diversity Collapse in LLM Game Play cites this paper.

When Reasoning Narrows the Move: Diversity Collapse in LLM Game Play AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-01T12:36:12.420962Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T12:36:12.420962Z digest=sha256:81f2e8cf7e336c9504f31e1cdf02bcba61eeccf904a3893fa99f803e138d0253

Observation 4e2c48f9-e951-48b3-8d4a-71238d638059 · inbound

SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution cites this paper.

SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 22

Resolution
unresolved
no resolver link, observed 2026-07-30T21:12:59.428554Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T21:12:59.428554Z digest=sha256:579dc9545e324b36572da4374a5d3c97748de858a9e8aeedc4be1f3ea784500e