Pith. sign in

Paper Citation Record · LEDGER

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use

As of 9 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 10 inbound Pith citation observations for arXiv:2508.18669.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2508.18669 v1

Coverage vector

measured 47 of 47 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-05T16:22:51.681755Z

measured 57 of 57 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-09T06:31:02.800959+00:00

measured 10 of 10 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-03T18:03:39.498611Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-07-08T15:35:07.151222Z

Reference resolution

47 of 47 outbound references displayed

  • verified exact0
  • verified fuzzy11
  • unresolved36
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation cd035e9a-a855-4838-9a5a-097e5365af56 · outbound

This paper cites Kimi K2: Open Agentic Intelligence.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use Kimi K2: Open Agentic Intelligence

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.495039Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.495039Z digest=sha256:d5fda9638d3485ea8fbd3b2535cdbeafaa3da18ba6cf4171d800e03d7cfe3bc4

Observation 05603cab-74cd-4ddd-a45a-4f6d17706760 · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.499436Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.499436Z digest=sha256:7dc7f9b36a02ea2e037df01f370640639a46470b211788d0c599df39b207bb57

Observation a0fb646b-3a1e-45cb-adb4-6f1ff32937aa · outbound

This paper cites ReTool: Reinforcement Learning for Strategic Tool Use in LLMs.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use ReTool: Reinforcement Learning for Strategic Tool Use in LLMs

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.503088Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.503088Z digest=sha256:0ec19e118cdb472169bce210d455118fd9e16af89880d3bb9c6a547289a69a27

Observation 8fe26866-1bab-4b30-bb80-e618129c16b4 · outbound

This paper cites Gonzalez, and Ion Stoica.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use Gonzalez, and Ion Stoica

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.507334Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.507334Z digest=sha256:2309a9e0f54d346d277640dc2544881f9c43318af588edf98ac1b485533f07f5

Observation 20ea23a1-92a8-4a08-8f9b-c2c8a16bfe37 · outbound

This paper cites RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.511495Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.511495Z digest=sha256:fc5a903d93cead97edcfd64c1892d11d1f3347dbe48075341f066f8efde897a8

Observation 3e7b5f80-c70a-47ab-acb1-122be6293cfe · outbound

This paper cites Proximal Policy Optimization Algorithms.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use Proximal Policy Optimization Algorithms

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.516645Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.516645Z digest=sha256:559bbf11eb413fe71b06aaa519d63dc42e845840eadc7c5c07ecf3c0d2566cfc

Observation a1dd30f9-0879-46db-82d8-0df364935d88 · outbound

This paper cites Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T16:22:52.378133Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T16:22:51.521563Z digest=sha256:c26e0a2b1a259cd485c69f4bd99658a2a5514ba2cbca2b0feb68ccfa0aa1341b

Observation 631af179-9c0a-4ff3-8b35-4918fdcf5670 · outbound

This paper cites Buy 4 reinforce samples, get a baseline for free! Learn- ing,Learning, Mar 2019.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use Buy 4 reinforce samples, get a baseline for free! Learn- ing,Learning, Mar 2019

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T16:22:52.367337Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T16:22:51.525173Z digest=sha256:3d9ec0de92ce5803bd520b6068b8ffdc7131f2beec747f486730751b94612826

Observation 724f0b98-6405-4417-b4f9-e4fd58dc0f24 · outbound

This paper cites DAPO: An Open-Source LLM Reinforcement Learning System at Scale.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use DAPO: An Open-Source LLM Reinforcement Learning System at Scale

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.529177Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.529177Z digest=sha256:764f90838181cbd2afc45b43949d117862aa5a438c2fa9eab12c28abd524011d

Observation e26e9302-4be4-4c86-8859-9b443d212786 · outbound

This paper cites Star: Bootstrapping reasoning with reasoning.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use Star: Bootstrapping reasoning with reasoning

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T16:22:52.356089Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T16:22:51.532984Z digest=sha256:a2ac5784bff0d58a07651114795649a55e0898c74476675768efc98bd361a037

Observation 0e42f05a-7af7-4101-b757-a994d78ff299 · outbound

This paper cites Reasoning with Language Model is Planning with World Model.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use Reasoning with Language Model is Planning with World Model

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.536655Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.536655Z digest=sha256:c749820e4c28a730b36fa3dc798a325389be7483b368eda812583547d40eac6c

Observation 8eceef6f-2047-4f61-82d9-b510836faff8 · outbound

This paper cites Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.541461Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.541461Z digest=sha256:abf5b63689937a6231d911e5732eeb35fde963f254e1f4d1f0b185ccdfb17463

Observation a0bc6eb0-5b3c-41a5-bc9e-111085d807b4 · outbound

This paper cites Code-r1: Reproducing r1 for code with reliable rewards.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use Code-r1: Reproducing r1 for code with reliable rewards

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.545595Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.545595Z digest=sha256:deab5df45180f93eb3f3c91326270dc8b5ad11f0246c59cc0d671baf927cd3a3

Observation 57ac40bf-5d47-480f-9deb-01ad51d2eccb · outbound

This paper cites VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.550260Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.550260Z digest=sha256:7336894e0cf30c8de2dd32b07db2bf8c688d57b164c88d0cb5f96403f7827268

Observation ea85cc3e-a2a6-40ac-a17d-32a8c242341c · outbound

This paper cites Program of Thoughts Prompting: Disentangling Computation from Reasoning for Numerical Reasoning Tasks.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use Program of Thoughts Prompting: Disentangling Computation from Reasoning for Numerical Reasoning Tasks

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.555224Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.555224Z digest=sha256:0ba39deb463060bb60ccad5b56f2c5526c9b49ac53cbb1023cf3dc2a2503c6bd

Observation cb121056-e228-4f72-9957-c62926009f79 · outbound

This paper cites Instructerc: Reforming emotion recognition in conversation with a retrieval multi-task llms framework.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use Instructerc: Reforming emotion recognition in conversation with a retrieval multi-task llms framework

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T16:22:52.345922Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T16:22:51.560011Z digest=sha256:b0fad7faebf09464006084a291c1df61d3ab3da8934223ae2c256215729bbd21

Observation 955b1022-2129-4f30-99d0-34d7346f240c · outbound

This paper cites Hammer: Robust function-calling for on-device language models via function masking.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use Hammer: Robust function-calling for on-device language models via function masking

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.563585Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.563585Z digest=sha256:d66c6ee85f1f7c79a50de758c81221ff8ce70d79a470954c11a8aab59f6495ee

Observation 1ee74172-ff78-4f40-9175-cbb1a1b76af0 · outbound

This paper cites xlam: A family of large action models to empower ai agent systems.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use xlam: A family of large action models to empower ai agent systems

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T16:22:52.334954Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T16:22:51.568240Z digest=sha256:9c899b2472e20774bf68a11f3b9f84c06379e48a039ca830e8952fad66465844

Observation 3d4b5ff1-95d3-4335-9607-07b90c82f338 · outbound

This paper cites Can a Single Model Master Both Multi-turn Conversations and Tool Use? CoALM: A Unified Conversational Agentic Language Model.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use Can a Single Model Master Both Multi-turn Conversations and Tool Use? CoALM: A Unified Conversational Agentic Language Model

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.571925Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.571925Z digest=sha256:e9c7505042faf06cf4420ee4184a4f0ce62be92484356813a746aa201dcaec81

Observation 115a9a25-065f-4794-89d2-efa50f9e47bf · outbound

This paper cites R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.575951Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.575951Z digest=sha256:d5805d7c954d9c6733f269d92bcae84494d5d98427dfd23756e2d07a6c08b17c

Observation 4aa972d9-522e-40aa-9b7d-71a8afa19c0e · outbound

This paper cites ZeroSearch: Incentivize the Search Capability of LLMs without Searching.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use ZeroSearch: Incentivize the Search Capability of LLMs without Searching

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.580729Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.580729Z digest=sha256:5c433d3bc94f81f1c7b7f4de088eb98d0b6a3f0227bf0ddc94e12d3591251523

Observation a7d18c52-045b-4390-a996-eb97c0cad2ef · outbound

This paper cites ToRL: Scaling Tool-Integrated RL.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use ToRL: Scaling Tool-Integrated RL

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.584383Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.584383Z digest=sha256:995b6457f708ee151afbdfd9c26e8d100f1350a0d83ee29ce11970c7af2e8977

Observation e52003de-437d-4409-ae87-f10b1522336c · outbound

This paper cites Agentic Reasoning and Tool Integration for LLMs via Reinforcement Learning.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use Agentic Reasoning and Tool Integration for LLMs via Reinforcement Learning

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.588510Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.588510Z digest=sha256:e0db39f6f2cdf54e1c639a31c4be9db97590a151e7f3a2928fc6298021884c52

Observation 6028b4a8-4a88-4342-a4a3-59af3a053aaa · outbound

This paper cites AgentInstruct: Toward Generative Teaching with Agentic Flows.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use AgentInstruct: Toward Generative Teaching with Agentic Flows

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.591964Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.591964Z digest=sha256:27d1b1e51e2706789eb7e9ed0d587c96de8c31c490a0ed2f615ef973bdab58b5

Observation a3d7c793-3654-490f-927a-e3eda35011e3 · outbound

This paper cites StableToolBench: Towards Stable Large-Scale Benchmarking on Tool Learning of Large Language Models.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use StableToolBench: Towards Stable Large-Scale Benchmarking on Tool Learning of Large Language Models

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.595736Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.595736Z digest=sha256:9cfce5f4a909a58c94bb1bc7dc749d2c007a4030158cf2aad34d53173430566a

Observation 116e2fdc-2134-4e72-b837-be93e9df192a · outbound

This paper cites Model Context Protocol (MCP): Landscape, Security Threats, and Future Research Directions.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use Model Context Protocol (MCP): Landscape, Security Threats, and Future Research Directions

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.599569Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.599569Z digest=sha256:4c23cddefb35efde5c6690aebbb161e50692c184bcb9b77819eb48e742a40652

Observation 3fa98f77-b13e-4083-8f07-8d24fc1c566e · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.603971Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.603971Z digest=sha256:3ad0b9c6bfeff3dc1894bbc71e0d67c8cb7dffe21e5944f28deba4bdc913a316

Observation cd6e296d-3ea8-473e-b4a2-77d08c328fd4 · outbound

This paper cites an unresolved cited work.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use Unresolved cited work

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.608211Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.608211Z digest=sha256:7a33d16b6b6b101e4806063fe976f9f0bd403b55e27057b3e61df621d20aa4fd

Observation 84ac58dc-b084-4e81-822e-dab037fe247c · outbound

This paper cites ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.611803Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.611803Z digest=sha256:729156d2c6159cb5d05544f852190cbac3607c586642361b5c10d24d785a675a

Observation 2a752a56-5318-43b5-8de1-6689bd32a4e0 · outbound

This paper cites WebThinker: Empowering Large Reasoning Models with Deep Research Capability.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use WebThinker: Empowering Large Reasoning Models with Deep Research Capability

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.615983Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.615983Z digest=sha256:643240ce384370d79eaa22e8f7d41e5d16e2b8374c8fc33fbc69fe91c4623033

Observation 16a9385a-cff2-4ccf-b27f-660bae9b7ddb · outbound

This paper cites Plm-based world models for text-based games.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use Plm-based world models for text-based games

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T16:22:52.323994Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T16:22:51.620068Z digest=sha256:b900b703a53d90088efe61b0d99e5b054ce6034db2936275ff33e038bfec4d66

Observation d255c769-1a32-4ece-a74a-6ca7d801855c · outbound

This paper cites Generative agents: Interactive simulacra of human behavior.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use Generative agents: Interactive simulacra of human behavior

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T16:22:52.312333Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T16:22:51.623606Z digest=sha256:7e54adb0df89d30b693f7c55c97645760391d881d6cde54ee53d96d2ca53dcfa

Observation 07ad9f53-0fc0-4992-8509-da22c3a4d494 · outbound

This paper cites ToolRL: Reward is All Tool Learning Needs.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use ToolRL: Reward is All Tool Learning Needs

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.627300Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.627300Z digest=sha256:d5d0b9c0a8c8cb83b698b39c88e8c37e751b99c946a51e0d937c8eb6b5165a00

Observation 159b4990-e5c7-4400-b315-9e5dbff73feb · outbound

This paper cites Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.631063Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.631063Z digest=sha256:2a8da00d4b07ae5496f1998f6892ab85301129c1e3dbae68d60eac302eef9234

Observation ed009504-4a98-4e4c-bb84-d7d1fe05d32d · outbound

This paper cites Reinforcing multi-turn reasoning in llm agents via turn-level credit assignment.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use Reinforcing multi-turn reasoning in llm agents via turn-level credit assignment

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T16:22:52.301977Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T16:22:51.634893Z digest=sha256:cd539638065869b7372062ed566718a99ccd0ecdad73b16fd07ab4317f9ca2df

Observation 28acd782-d161-40c5-9e51-5a45b0b240a9 · outbound

This paper cites Qwen3 Technical Report.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use Qwen3 Technical Report

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.638697Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.638697Z digest=sha256:0a6d8ec01821176236d6ef695fac0a0fa3d98307b026a6769808b8af526e362d

Observation 29c0c48d-3474-413f-bc63-c3baff453695 · outbound

This paper cites Decoupled Weight Decay Regularization.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use Decoupled Weight Decay Regularization

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.642783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.642783Z digest=sha256:55e1e7aa39aef093abc296a5ee2e6c6b5d8c96492e82996ea8288be5f391137a

Observation 99c154c9-34e3-4a41-9e52-733796921874 · outbound

This paper cites HybridFlow: A Flexible and Efficient RLHF Framework.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use HybridFlow: A Flexible and Efficient RLHF Framework

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.646536Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.646536Z digest=sha256:7990b262d0f18bbe94f02beb7a86585a4ac10faeabaddfac16eea325865f309f

Observation c329e446-20e4-4e70-a34b-45e5ac0a92eb · outbound

This paper cites $\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use $\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.650372Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.650372Z digest=sha256:8c53a0b4b6747e2f6b8aef6ecf1d43806397c9e2b2bc79a02737e428572add3f

Observation 86f669ba-ffd7-4308-b669-38a751da45e4 · outbound

This paper cites GPT-4o System Card.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use GPT-4o System Card

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.654164Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.654164Z digest=sha256:df7878cf3665d79e683ccd09c58ecc8b0e781d0902083562f720f2db059523e6

Observation 260d555d-7799-4ba3-93ef-e9f0e6d4d55d · outbound

This paper cites $\tau^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use $\tau^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.657952Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.657952Z digest=sha256:c5c63563578952f97c0b3fd5ea19a955c2f49623f2674fedbf7737ca591c0883

Observation 89b5a9ae-d96d-434f-aaf2-dc4ff909cb15 · outbound

This paper cites The berkeley function calling leaderboard (bfcl): From tool use to agentic evaluation of large language models.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use The berkeley function calling leaderboard (bfcl): From tool use to agentic evaluation of large language models

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T16:22:52.291068Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T16:22:51.662318Z digest=sha256:c2bd6115706f54a1144e096c4adffdd402e1a14a1c5f1a70258c393f607d0068

Observation b4a34744-4040-472f-a8f5-24a6df2c4a35 · outbound

This paper cites Acebench: Who wins the match point in tool usage? arXiv preprint arXiv:2501.12851, 2025.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use Acebench: Who wins the match point in tool usage? arXiv preprint arXiv:2501.12851, 2025

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.665618Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.665618Z digest=sha256:2c7bce58fee5d4fbc7d767aa85a96a7aedbb9f54acad0a79467d7db9d57db5e3

Observation d533bfd7-f531-4160-bdf8-d683f7845a16 · outbound

This paper cites DeepSeek-V3 Technical Report.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use DeepSeek-V3 Technical Report

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.669555Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.669555Z digest=sha256:b09ec9f0d0a93c325db5f22e5f35e04feae0b3561d47ecad792ced4ba7cd144d

Observation 14f7e64c-b556-46ef-bbd3-11a642a4470e · outbound

This paper cites GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.673650Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.673650Z digest=sha256:ead6c7897c5d65d5953d471bba7eddebdd4dc5f05aefe0708be7559cd26b685a

Observation 7cb328aa-1ec2-4dc1-84cd-094d76a1f226 · outbound

This paper cites term":"Sakura.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use term":"Sakura

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T16:22:52.279618Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T16:22:51.677850Z digest=sha256:4344567fb8ef061651171fb01c54e124271cb2005aaba0e399430e32f2ffb99a

Observation 9b796e61-8568-4fab-b7ea-ccc1bd211a66 · outbound

This paper cites 02:30:00.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use 02:30:00

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T16:22:52.268550Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T16:22:51.681755Z digest=sha256:622d73d841ae419745b9921772cf098d2cc38e92057f0cdab3e28141f0c69cf2

Pith citing papers

Observation 6d4fd521-4b00-4928-b9ea-5952643f3ce4 · inbound

Experience-Evolving Multi-Turn Tool-Use Agent with Hybrid Episodic-Procedural Memory cites this paper.

Experience-Evolving Multi-Turn Tool-Use Agent with Hybrid Episodic-Procedural Memory MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-03T18:03:39.498611Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T18:03:39.498611Z digest=sha256:776bdf2aa33a2bd3b56e1de5806b7df236d5a91c731d6fb00cc9478d08c0376c

Observation f10900cb-86fe-4da9-8034-b54a86907c95 · inbound

Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence cites this paper.

Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use

Reference 134

Resolution
verified exact
arxiv_id, observed 2026-05-10T05:25:54.646467Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-10T05:24:00.503836Z digest=sha256:e445f9299c6921f47d5e8dccb50da8f1738cea059d61057b6ddb72b759458f3e

Observation ee64902f-ac2d-4f45-bee9-a041bc1bbb7f · inbound

Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning cites this paper.

Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use

Reference 181

Resolution
verified exact
arxiv_id, observed 2026-05-10T23:15:49.418878Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-05-10T19:15:27.406778Z digest=sha256:3b52f56819a18eb45faf0b2b3b568e85a9de44112cf2d8677e912df97313da46

Observation a31372e8-1eb0-4ce9-b5fa-7c954d5b0eb0 · inbound

CustomerSim: Benchmarking and Aligning Multimodal Language Models as Retail User Simulators cites this paper.

CustomerSim: Benchmarking and Aligning Multimodal Language Models as Retail User Simulators MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use

Reference 44

Resolution
verified exact
arxiv_id, observed 2026-05-12T08:41:24.084915Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-12T00:51:57.796883Z digest=sha256:8779499deea25a7603409eecec32d00aa29a2c4fc8d72ee9bf399089a66f89fe

Observation 3bf48290-6246-46b3-98c8-504dd83bb253 · inbound

CustomerSim: Benchmarking and Aligning Multimodal Language Models as Retail User Simulators cites this paper.

CustomerSim: Benchmarking and Aligning Multimodal Language Models as Retail User Simulators MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-02T14:37:24.484309Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T14:37:24.484309Z digest=sha256:75788b56ea48b569275682af4506f080082eec58c12e5721369aa111bb94efff

Observation 4812cde0-8357-4799-be70-1e70dcc89e76 · inbound

When Simulation Lies: A Sim-to-Real Benchmark and Domain-Randomized RL Recipe for Tool-Use Agents cites this paper.

When Simulation Lies: A Sim-to-Real Benchmark and Domain-Randomized RL Recipe for Tool-Use Agents MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use

Reference 51

Resolution
verified exact
arxiv_id, observed 2026-05-13T05:52:22.056914Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-13T05:51:18.680969Z digest=sha256:8de5c512410c5bcdf0d66ae0e54ed4344d41241284e2e6015a48ff6e4cab63a8

Observation 633cafca-e809-453b-a331-369110412474 · inbound

Trust Region On-Policy Distillation cites this paper.

Trust Region On-Policy Distillation MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use

Reference 141

Resolution
metadata mismatch
arxiv_id, observed 2026-07-01T20:46:14.307374Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-06-28T17:38:50.313305Z digest=sha256:4b7e91d4ea3b443ed97de900fddfedd2de29e2b9406e9ee33ab4f311d33a818f

Observation 72b083e3-7392-4955-898f-74a650db6a31 · inbound

Synthesize and Reward -- Reinforcement Learning for Multi-Step Tool Use in Live Environments cites this paper.

Synthesize and Reward -- Reinforcement Learning for Multi-Step Tool Use in Live Environments MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use

Reference 27

Resolution
metadata mismatch
arxiv_id, observed 2026-07-02T03:36:29.692587Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-06-28T09:54:00.111238Z digest=sha256:190a842da09042fcbb80c7211a8a380ecbde81ed459f11eb683a0277e681ca22

Observation 73dd061a-8945-445a-86b7-ba01e5e90857 · inbound

CurateEvo: Data-Curation Evolving for Agentic Post-Training cites this paper.

CurateEvo: Data-Curation Evolving for Agentic Post-Training MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use

Reference 42

Resolution
metadata mismatch
local_arxiv, observed 2026-07-08T15:35:07.152620Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-07-08T15:33:01.138366Z digest=sha256:0c4440de8153dbece28f64e7268f945548fc72867168168db2fd4c550955d287

Observation b1bb2712-7032-43aa-84fb-fa6502ce6bdc · inbound

AgentOmnia: Scaling Agentic Models for Full-Scenario Applications cites this paper.

AgentOmnia: Scaling Agentic Models for Full-Scenario Applications MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-01T03:38:19.076593Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T03:38:19.076593Z digest=sha256:b8e316329173e566292c1a8425af642c7783f4c4c1c9817ea1a92384ce1cab8d