{"work":{"id":"8b577494-0367-43d0-82ca-804c3a431082","openalex_id":"https://openalex.org/W7127324322","doi":"10.48550/arxiv.2602.01869","arxiv_id":"2602.01869","raw_key":null,"title":"Skill-Pro: Learning Reusable Skills from Experience via Non-Parametric PPO for LLM Agents","authors":null,"authors_text":"Qirui Mi, Zhijian Ma, Mengyue Yang, Haoxuan Li, Yisen Wang, HaiFeng Zhang, Jun Wang","year":2026,"venue":"cs.AI","abstract":"LLM-driven agents excel at sequential decision-making but often rely on on-the-fly reasoning, re-deriving solutions even in recurring scenarios. This insufficient experience reuse leads to computational redundancy and instability. To bridge this gap, we propose Skill-Pro, a framework enabling agents to autonomously learn reusable procedural skills from interaction experiences without parameter updates. By formalizing a Skill-MDP, Skill-Pro transforms passive episodic narratives into executable Skills defined by activation, execution, and termination conditions to ensure executability. To achieve reliable reusability without capability degradation, we introduce Non-Parametric PPO, which leverages semantic gradients for high-quality candidate generation and a PPO Gate for robust Skill verification. Through score-based maintenance, Skill-Pro sustains compact, high-quality procedural memory. Experimental results across in-domain, cross-task, and cross-agent scenarios demonstrate that Skill-Pro achieves superior reuse rates and significant gains with extreme memory compression. Visualized evolutionary trajectories and Skill distributions further reveal how Skill-Pro transparently accumulates, refines, and reuses procedural knowledge to facilitate long-term autonomy.","external_url":"https://arxiv.org/abs/2602.01869","cited_by_count":0,"metadata_source":"pith","metadata_fetched_at":"2026-08-05T02:28:24.338817+00:00","pith_arxiv_id":"2602.01869","created_at":"2026-05-10T00:14:46.445787+00:00","updated_at":"2026-08-05T02:49:54.815029+00:00","title_quality_ok":true,"display_title":"Skill-Pro: Learning Reusable Skills from Experience via Non-Parametric PPO for LLM Agents","render_title":"Skill-Pro: Learning Reusable Skills from Experience via Non-Parametric PPO for LLM Agents"},"hub":{"state":{"work_id":"8b577494-0367-43d0-82ca-804c3a431082","tier":"hub","tier_reason":"10+ Pith inbound or 1,000+ external citations","pith_inbound_count":21,"external_cited_by_count":0,"distinct_field_count":6,"first_pith_cited_at":"2026-04-16T14:55:49+00:00","last_pith_cited_at":"2026-07-06T15:17:09+00:00","author_build_status":"not_needed","summary_status":"needed","contexts_status":"needed","graph_status":"needed","ask_index_status":"not_needed","reader_status":"not_needed","recognition_status":"not_needed","updated_at":"2026-08-22T02:09:40.696551+00:00","tier_text":"hub"},"tier":"hub","role_counts":[{"context_role":"background","n":7}],"polarity_counts":[{"context_polarity":"background","n":6},{"context_polarity":"unclear","n":1}],"runs":{},"summary":{},"graph":{},"authors":[]}}