{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:COBT7Y5PW4VMEY7XT5FPMKDQ4I","short_pith_number":"pith:COBT7Y5P","schema_version":"1.0","canonical_sha256":"13833fe3afb72ac263f79f4af62870e20d682f796fa87122315ccfcd9f7bca01","source":{"kind":"arxiv","id":"2502.10325","version":1},"attestation_state":"computed","paper":{"title":"Process Reward Models for LLM Agents: Practical Framework and Directions","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.LG","authors_text":"Sanjiban Choudhury","submitted_at":"2025-02-14T17:34:28Z","abstract_excerpt":"We introduce Agent Process Reward Models (AgentPRM), a simple and scalable framework for training LLM agents to continually improve through interactions. AgentPRM follows a lightweight actor-critic paradigm, using Monte Carlo rollouts to compute reward targets and optimize policies. It requires minimal modifications to existing RLHF pipelines, making it easy to integrate at scale. Beyond AgentPRM, we propose InversePRM, which learns process rewards directly from demonstrations without explicit outcome supervision. We also explore key challenges and opportunities, including exploration, process"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2502.10325","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2025-02-14T17:34:28Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"47ac6aea72fe3a16d136d0af626083ed77472c8070ba4b19d067c98173136357","abstract_canon_sha256":"7ab7ef86fc6303098af974c71d6da94a1b4180a735bd05f1becba03abfe010ee"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:14:32.356441Z","signature_b64":"r6BrJxn+ZVU104UZ7ZbTScSHMh93QgM+/fZ2pfJmTL305p+7fFyUkiCwFAcMRK3c52h3MvnJ2hLD5HqZB3CfAw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"13833fe3afb72ac263f79f4af62870e20d682f796fa87122315ccfcd9f7bca01","last_reissued_at":"2026-07-05T10:14:32.355934Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:14:32.355934Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Process Reward Models for LLM Agents: Practical Framework and Directions","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.LG","authors_text":"Sanjiban Choudhury","submitted_at":"2025-02-14T17:34:28Z","abstract_excerpt":"We introduce Agent Process Reward Models (AgentPRM), a simple and scalable framework for training LLM agents to continually improve through interactions. AgentPRM follows a lightweight actor-critic paradigm, using Monte Carlo rollouts to compute reward targets and optimize policies. It requires minimal modifications to existing RLHF pipelines, making it easy to integrate at scale. Beyond AgentPRM, we propose InversePRM, which learns process rewards directly from demonstrations without explicit outcome supervision. We also explore key challenges and opportunities, including exploration, process"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2502.10325","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2502.10325/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2502.10325","created_at":"2026-07-05T10:14:32.355998+00:00"},{"alias_kind":"arxiv_version","alias_value":"2502.10325v1","created_at":"2026-07-05T10:14:32.355998+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2502.10325","created_at":"2026-07-05T10:14:32.355998+00:00"},{"alias_kind":"pith_short_12","alias_value":"COBT7Y5PW4VM","created_at":"2026-07-05T10:14:32.355998+00:00"},{"alias_kind":"pith_short_16","alias_value":"COBT7Y5PW4VMEY7X","created_at":"2026-07-05T10:14:32.355998+00:00"},{"alias_kind":"pith_short_8","alias_value":"COBT7Y5P","created_at":"2026-07-05T10:14:32.355998+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":16,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.26080","citing_title":"Neglected Free Lunch from Post-training: Progress Advantage for LLM Agents","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2606.25852","citing_title":"Semantic Consistency Policy Optimization for Reinforcement Learning of LLM Agents","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2606.23640","citing_title":"Learning Process Rewards via Success Visitation Matching for Efficient RL","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2606.21399","citing_title":"Calibration Is Not Control: Why LLM-Agent Oversight Needs Intervention","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2606.21262","citing_title":"ARCO: Adaptive Rubrics with Co-Evolution for Multi-Step LLM-Based Agents","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2606.07367","citing_title":"Self-evolving LLM agents with in-distribution Optimization","ref_index":33,"is_internal_anchor":false},{"citing_arxiv_id":"2606.07027","citing_title":"StainFlow: Entity-Stain Tracking and Evidence Linking for Process Rewards in GUI Agents","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2606.29745","citing_title":"ECHO: Learning Epistemically Adaptive Language Agents with Turn-Level Credit","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2507.14200","citing_title":"A Scalable Multi-LLM Collaboration System with Retrieval-based Selection and Exploration-Exploitation-Driven Enhancement","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2509.02547","citing_title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","ref_index":268,"is_internal_anchor":false},{"citing_arxiv_id":"2507.21046","citing_title":"A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence","ref_index":235,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11235","citing_title":"Internalizing Curriculum Judgment for LLM Reinforcement Fine-Tuning","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2503.09567","citing_title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","ref_index":137,"is_internal_anchor":false},{"citing_arxiv_id":"2605.09934","citing_title":"TRACER: Verifiable Generative Provenance for Multimodal Tool-Using Agents","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06200","citing_title":"A$^2$TGPO: Agentic Turn-Group Policy Optimization with Adaptive Turn-level Clipping","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2604.07851","citing_title":"ReRec: Reasoning-Augmented LLM-based Recommendation Assistant via Reinforcement Fine-tuning","ref_index":8,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/COBT7Y5PW4VMEY7XT5FPMKDQ4I","json":"https://pith.science/pith/COBT7Y5PW4VMEY7XT5FPMKDQ4I.json","graph_json":"https://pith.science/api/pith-number/COBT7Y5PW4VMEY7XT5FPMKDQ4I/graph.json","events_json":"https://pith.science/api/pith-number/COBT7Y5PW4VMEY7XT5FPMKDQ4I/events.json","paper":"https://pith.science/paper/COBT7Y5P"},"agent_actions":{"view_html":"https://pith.science/pith/COBT7Y5PW4VMEY7XT5FPMKDQ4I","download_json":"https://pith.science/pith/COBT7Y5PW4VMEY7XT5FPMKDQ4I.json","view_paper":"https://pith.science/paper/COBT7Y5P","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2502.10325&json=true","fetch_graph":"https://pith.science/api/pith-number/COBT7Y5PW4VMEY7XT5FPMKDQ4I/graph.json","fetch_events":"https://pith.science/api/pith-number/COBT7Y5PW4VMEY7XT5FPMKDQ4I/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/COBT7Y5PW4VMEY7XT5FPMKDQ4I/action/timestamp_anchor","attest_storage":"https://pith.science/pith/COBT7Y5PW4VMEY7XT5FPMKDQ4I/action/storage_attestation","attest_author":"https://pith.science/pith/COBT7Y5PW4VMEY7XT5FPMKDQ4I/action/author_attestation","sign_citation":"https://pith.science/pith/COBT7Y5PW4VMEY7XT5FPMKDQ4I/action/citation_signature","submit_replication":"https://pith.science/pith/COBT7Y5PW4VMEY7XT5FPMKDQ4I/action/replication_record"}},"created_at":"2026-07-05T10:14:32.355998+00:00","updated_at":"2026-07-05T10:14:32.355998+00:00"}