{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:T5P7AR3LO4URT23OR6QWUV5A4N","short_pith_number":"pith:T5P7AR3L","schema_version":"1.0","canonical_sha256":"9f5ff0476b772919eb6e8fa16a57a0e3633783120fd102bc9afa2aa7410ab497","source":{"kind":"arxiv","id":"2409.00920","version":2},"attestation_state":"computed","paper":{"title":"ToolACE: Winning the Points of LLM Function Calling","license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","headline":"","cross_cats":["cs.AI","cs.CL"],"primary_cat":"cs.LG","authors_text":"Bin Wang, Chuhan Wu, Dandan Tu, Defu Lian, Dexun Li, Duyu Tang, Enhong Chen, Lifeng Shang, Qun Liu, Ruiming Tang, Shuai Wang, Shuai Yu, Weinan Gan, Weiwen Liu, Wu Ning, Xingshan Zeng, Xin Jiang, Xinlong Hao, Xinzhi Wang, Xu Huang, Yasheng Wang, Yong Liu, Yuanqing Yu, Yutai Hou, Yuxian Wang, Zezhong Wang, Zhengying Liu","submitted_at":"2024-09-02T03:19:56Z","abstract_excerpt":"Function calling significantly extends the application boundary of large language models, where high-quality and diverse training data is critical for unlocking this capability. However, real function-calling data is quite challenging to collect and annotate, while synthetic data generated by existing pipelines tends to lack coverage and accuracy. In this paper, we present ToolACE, an automatic agentic pipeline designed to generate accurate, complex, and diverse tool-learning data. ToolACE leverages a novel self-evolution synthesis process to curate a comprehensive API pool of 26,507 diverse A"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2409.00920","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","primary_cat":"cs.LG","submitted_at":"2024-09-02T03:19:56Z","cross_cats_sorted":["cs.AI","cs.CL"],"title_canon_sha256":"0a8cb9ccc3f0c8ca0a98601ddf9b43684954817b64f2e3d279ccc8586eb5cc54","abstract_canon_sha256":"34f7cf0a1a9463cbdcc78e40bdc76df8530992afcb4e72cbfaba07235df75c0e"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:43:07.279612Z","signature_b64":"Uvah0vod/GNtVlSUEvHCItfRPw76Xs0Mwqauin4CPCMIOY/bUYaPQiEwWkM7Vnk3qr1/SaZxSHn9z/H5cpC4BA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"9f5ff0476b772919eb6e8fa16a57a0e3633783120fd102bc9afa2aa7410ab497","last_reissued_at":"2026-07-05T11:43:07.279086Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:43:07.279086Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"ToolACE: Winning the Points of LLM Function Calling","license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","headline":"","cross_cats":["cs.AI","cs.CL"],"primary_cat":"cs.LG","authors_text":"Bin Wang, Chuhan Wu, Dandan Tu, Defu Lian, Dexun Li, Duyu Tang, Enhong Chen, Lifeng Shang, Qun Liu, Ruiming Tang, Shuai Wang, Shuai Yu, Weinan Gan, Weiwen Liu, Wu Ning, Xingshan Zeng, Xin Jiang, Xinlong Hao, Xinzhi Wang, Xu Huang, Yasheng Wang, Yong Liu, Yuanqing Yu, Yutai Hou, Yuxian Wang, Zezhong Wang, Zhengying Liu","submitted_at":"2024-09-02T03:19:56Z","abstract_excerpt":"Function calling significantly extends the application boundary of large language models, where high-quality and diverse training data is critical for unlocking this capability. However, real function-calling data is quite challenging to collect and annotate, while synthetic data generated by existing pipelines tends to lack coverage and accuracy. In this paper, we present ToolACE, an automatic agentic pipeline designed to generate accurate, complex, and diverse tool-learning data. ToolACE leverages a novel self-evolution synthesis process to curate a comprehensive API pool of 26,507 diverse A"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2409.00920","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2409.00920/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2409.00920","created_at":"2026-07-05T11:43:07.279144+00:00"},{"alias_kind":"arxiv_version","alias_value":"2409.00920v2","created_at":"2026-07-05T11:43:07.279144+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2409.00920","created_at":"2026-07-05T11:43:07.279144+00:00"},{"alias_kind":"pith_short_12","alias_value":"T5P7AR3LO4UR","created_at":"2026-07-05T11:43:07.279144+00:00"},{"alias_kind":"pith_short_16","alias_value":"T5P7AR3LO4URT23O","created_at":"2026-07-05T11:43:07.279144+00:00"},{"alias_kind":"pith_short_8","alias_value":"T5P7AR3L","created_at":"2026-07-05T11:43:07.279144+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":31,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2604.20316","citing_title":"R2IF: Aligning Reasoning with Decisions via Composite Rewards for Interpretable LLM Function Calling","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2606.18051","citing_title":"Compositional Skill Routing for LLM Agents: Decompose, Retrieve, and Compose","ref_index":49,"is_internal_anchor":false},{"citing_arxiv_id":"2606.12474","citing_title":"SAIGuard: Communication-State Simulation for Proactive Defense of LLM Multi-Agent Systems","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2606.09182","citing_title":"Understanding How Enterprises Adopt the Model Context Protocol for LLM-Driven Software Engineering","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2606.10064","citing_title":"Bittensor Agent Arenas as a Trajectory Primitive: Distilling a Shopping Agent from ShoppingBench Subnet Traces","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2607.00989","citing_title":"SenseWalk: Agent-Based Semantic Trajectory Simulation Powered by Large Language Models in Zoned Environments","ref_index":34,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01912","citing_title":"SMH-Bench: Benchmarking LLM Agents for Environment-Grounded Reasoning and Action in Smart Homes","ref_index":38,"is_internal_anchor":false},{"citing_arxiv_id":"2605.15077","citing_title":"Concurrency without Model Changes: Future-based Asynchronous Function Calling for LLMs","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2605.17774","citing_title":"Internalizing Tool Knowledge in Small Language Models via QLoRA Fine-Tuning","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2605.25971","citing_title":"Anticipate and Learn: Unleashing Idle-Time Compute in Proactive Agents","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2605.28146","citing_title":"Cybersecurity AI (CAI) Dataset","ref_index":58,"is_internal_anchor":false},{"citing_arxiv_id":"2606.00135","citing_title":"On Effectiveness and Efficiency of Agentic Tool-calling and RL Training","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2605.09730","citing_title":"RubricRefine: Improving Tool-Use Agent Reliability with Training-Free Pre-Execution Refinement","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2509.18847","citing_title":"Failure Makes the Agent Stronger: Enhancing Accuracy through Structured Reflection for Reliable Tool Interactions","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2510.14703","citing_title":"ToolPRM: Fine-Grained Inference Scaling of Structured Outputs for Function Calling","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2603.15473","citing_title":"Agent Lifecycle Toolkit (ALTK): Reusable Middleware Components for Robust AI Agents","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2604.13064","citing_title":"Red Skills or Blue Skills? A Dive Into Skills Published on ClawHub","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2601.05242","citing_title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2605.09730","citing_title":"RubricRefine: Improving Tool-Use Agent Reliability with Training-Free Pre-Execution Refinement","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2604.02022","citing_title":"ATBench: A Diverse and Realistic Agent Trajectory Benchmark for Safety Evaluation and Diagnosis","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2504.13958","citing_title":"ToolRL: Reward is All Tool Learning Needs","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2604.02022","citing_title":"ATBench: A Diverse and Realistic Agent Trajectory Benchmark for Safety Evaluation and Diagnosis","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2605.03476","citing_title":"CuraView: A Multi-Agent Framework for Medical Hallucination Detection with GraphRAG-Enhanced Knowledge Verification","ref_index":42,"is_internal_anchor":false},{"citing_arxiv_id":"2605.09730","citing_title":"RubricRefine: Improving Tool-Use Agent Reliability with Training-Free Pre-Execution Refinement","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2605.01347","citing_title":"MAD-OPD: Breaking the Ceiling in On-Policy Distillation via Multi-Agent Debate","ref_index":26,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/T5P7AR3LO4URT23OR6QWUV5A4N","json":"https://pith.science/pith/T5P7AR3LO4URT23OR6QWUV5A4N.json","graph_json":"https://pith.science/api/pith-number/T5P7AR3LO4URT23OR6QWUV5A4N/graph.json","events_json":"https://pith.science/api/pith-number/T5P7AR3LO4URT23OR6QWUV5A4N/events.json","paper":"https://pith.science/paper/T5P7AR3L"},"agent_actions":{"view_html":"https://pith.science/pith/T5P7AR3LO4URT23OR6QWUV5A4N","download_json":"https://pith.science/pith/T5P7AR3LO4URT23OR6QWUV5A4N.json","view_paper":"https://pith.science/paper/T5P7AR3L","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2409.00920&json=true","fetch_graph":"https://pith.science/api/pith-number/T5P7AR3LO4URT23OR6QWUV5A4N/graph.json","fetch_events":"https://pith.science/api/pith-number/T5P7AR3LO4URT23OR6QWUV5A4N/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/T5P7AR3LO4URT23OR6QWUV5A4N/action/timestamp_anchor","attest_storage":"https://pith.science/pith/T5P7AR3LO4URT23OR6QWUV5A4N/action/storage_attestation","attest_author":"https://pith.science/pith/T5P7AR3LO4URT23OR6QWUV5A4N/action/author_attestation","sign_citation":"https://pith.science/pith/T5P7AR3LO4URT23OR6QWUV5A4N/action/citation_signature","submit_replication":"https://pith.science/pith/T5P7AR3LO4URT23OR6QWUV5A4N/action/replication_record"}},"created_at":"2026-07-05T11:43:07.279144+00:00","updated_at":"2026-07-05T11:43:07.279144+00:00"}