{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:GEFG2KKUR3KNR4YL7JAWMUD7QH","short_pith_number":"pith:GEFG2KKU","schema_version":"1.0","canonical_sha256":"310a6d29548ed4d8f30bfa4166507f81ebf6b208235632f98abbfdab677cab5e","source":{"kind":"arxiv","id":"2508.18669","version":1},"attestation_state":"computed","paper":{"title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.AI","authors_text":"Chengdi Ma, Lingbin Kong, Mingxiang Tuo, Weikang Zhao, Xiaowei Shi, Xili Wang, Xunliang Cai, Yitao Zhai, Zhaohua Yang","submitted_at":"2025-08-26T04:26:29Z","abstract_excerpt":"With the recent rapid advancement of Agentic Intelligence, agentic tool use in LLMs has become increasingly important. During multi-turn interactions between agents and users, the dynamic, uncertain, and stochastic nature of user demands poses significant challenges to the agent's tool invocation capabilities. Agents are no longer expected to simply call tools to deliver a result; rather, they must iteratively refine their understanding of user needs through communication while simultaneously invoking tools to resolve user queries. Existing reinforcement learning (RL) approaches for tool use l"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2508.18669","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.AI","submitted_at":"2025-08-26T04:26:29Z","cross_cats_sorted":[],"title_canon_sha256":"f8b82a87fe3f21b5aacb26c4f4dbd65d9327bf1b693c66e4e0a4cfb5617f8271","abstract_canon_sha256":"f7e4a56e3c5f54d74afb093d53d52322a9b093cc22a40d0c658bb0b81f138f67"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:59:29.012105Z","signature_b64":"f3mN31tdrWtKBlHiLxe63Z0Jzd8goIPaofuwp4Nvu9NnMk3d5UjqMg6WyKC7QVAWVg+jp268j7vMvJrq4c6+Dg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"310a6d29548ed4d8f30bfa4166507f81ebf6b208235632f98abbfdab677cab5e","last_reissued_at":"2026-07-05T11:59:29.011621Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:59:29.011621Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.AI","authors_text":"Chengdi Ma, Lingbin Kong, Mingxiang Tuo, Weikang Zhao, Xiaowei Shi, Xili Wang, Xunliang Cai, Yitao Zhai, Zhaohua Yang","submitted_at":"2025-08-26T04:26:29Z","abstract_excerpt":"With the recent rapid advancement of Agentic Intelligence, agentic tool use in LLMs has become increasingly important. During multi-turn interactions between agents and users, the dynamic, uncertain, and stochastic nature of user demands poses significant challenges to the agent's tool invocation capabilities. Agents are no longer expected to simply call tools to deliver a result; rather, they must iteratively refine their understanding of user needs through communication while simultaneously invoking tools to resolve user queries. Existing reinforcement learning (RL) approaches for tool use l"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2508.18669","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2508.18669/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2508.18669","created_at":"2026-07-05T11:59:29.011681+00:00"},{"alias_kind":"arxiv_version","alias_value":"2508.18669v1","created_at":"2026-07-05T11:59:29.011681+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2508.18669","created_at":"2026-07-05T11:59:29.011681+00:00"},{"alias_kind":"pith_short_12","alias_value":"GEFG2KKUR3KN","created_at":"2026-07-05T11:59:29.011681+00:00"},{"alias_kind":"pith_short_16","alias_value":"GEFG2KKUR3KNR4YL","created_at":"2026-07-05T11:59:29.011681+00:00"},{"alias_kind":"pith_short_8","alias_value":"GEFG2KKU","created_at":"2026-07-05T11:59:29.011681+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":7,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2607.06140","citing_title":"CurateEvo: Data-Curation Evolving for Agentic Post-Training","ref_index":42,"is_internal_anchor":true},{"citing_arxiv_id":"2606.03892","citing_title":"Synthesize and Reward -- Reinforcement Learning for Multi-Step Tool Use in Live Environments","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01249","citing_title":"Trust Region On-Policy Distillation","ref_index":141,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11928","citing_title":"When Simulation Lies: A Sim-to-Real Benchmark and Domain-Randomized RL Recipe for Tool-Use Agents","ref_index":51,"is_internal_anchor":false},{"citing_arxiv_id":"2605.08334","citing_title":"CustomerSim: Benchmarking and Aligning Multimodal Language Models as Retail User Simulators","ref_index":44,"is_internal_anchor":false},{"citing_arxiv_id":"2605.02913","citing_title":"Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning","ref_index":181,"is_internal_anchor":false},{"citing_arxiv_id":"2604.18292","citing_title":"Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence","ref_index":134,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/GEFG2KKUR3KNR4YL7JAWMUD7QH","json":"https://pith.science/pith/GEFG2KKUR3KNR4YL7JAWMUD7QH.json","graph_json":"https://pith.science/api/pith-number/GEFG2KKUR3KNR4YL7JAWMUD7QH/graph.json","events_json":"https://pith.science/api/pith-number/GEFG2KKUR3KNR4YL7JAWMUD7QH/events.json","paper":"https://pith.science/paper/GEFG2KKU"},"agent_actions":{"view_html":"https://pith.science/pith/GEFG2KKUR3KNR4YL7JAWMUD7QH","download_json":"https://pith.science/pith/GEFG2KKUR3KNR4YL7JAWMUD7QH.json","view_paper":"https://pith.science/paper/GEFG2KKU","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2508.18669&json=true","fetch_graph":"https://pith.science/api/pith-number/GEFG2KKUR3KNR4YL7JAWMUD7QH/graph.json","fetch_events":"https://pith.science/api/pith-number/GEFG2KKUR3KNR4YL7JAWMUD7QH/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/GEFG2KKUR3KNR4YL7JAWMUD7QH/action/timestamp_anchor","attest_storage":"https://pith.science/pith/GEFG2KKUR3KNR4YL7JAWMUD7QH/action/storage_attestation","attest_author":"https://pith.science/pith/GEFG2KKUR3KNR4YL7JAWMUD7QH/action/author_attestation","sign_citation":"https://pith.science/pith/GEFG2KKUR3KNR4YL7JAWMUD7QH/action/citation_signature","submit_replication":"https://pith.science/pith/GEFG2KKUR3KNR4YL7JAWMUD7QH/action/replication_record"}},"created_at":"2026-07-05T11:59:29.011681+00:00","updated_at":"2026-07-05T11:59:29.011681+00:00"}