{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:Y45YWD6TTG5A5G3TH23BP4TFOB","short_pith_number":"pith:Y45YWD6T","schema_version":"1.0","canonical_sha256":"c73b8b0fd399ba0e9b733eb617f265705c2603fa4f084ca2832f6ee72ba6dfba","source":{"kind":"arxiv","id":"2503.15478","version":1},"attestation_state":"computed","paper":{"title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.LG","authors_text":"Jason Weston, Sainbayar Sukhbaatar, Sergey Levine, Song Jiang, Xian Li, Yifei Zhou, Yuandong Tian","submitted_at":"2025-03-19T17:55:08Z","abstract_excerpt":"Large language model (LLM) agents need to perform multi-turn interactions in real-world tasks. However, existing multi-turn RL algorithms for optimizing LLM agents fail to perform effective credit assignment over multiple turns while leveraging the generalization capabilities of LLMs and it remains unclear how to develop such algorithms. To study this, we first introduce a new benchmark, ColBench, where an LLM agent interacts with a human collaborator over multiple turns to solve realistic tasks in backend programming and frontend design. Building on this benchmark, we propose a novel RL algor"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2503.15478","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2025-03-19T17:55:08Z","cross_cats_sorted":[],"title_canon_sha256":"6e6d4c0b70697aed83a116067bb9186c310ed5df7164b183c8b9def354f8587c","abstract_canon_sha256":"0ed552d53f383ea11db8448cf90f3882261c4197efa360374118d470835cde52"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:35:27.159610Z","signature_b64":"Rn/kZQba+NP2AgIXOhrq5skANo8dY1mOaUAqyohJLK21inXROGNj6I97f90pOwg0WGuFswggAs1p01rP4cyKCw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"c73b8b0fd399ba0e9b733eb617f265705c2603fa4f084ca2832f6ee72ba6dfba","last_reissued_at":"2026-07-05T10:35:27.158682Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:35:27.158682Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.LG","authors_text":"Jason Weston, Sainbayar Sukhbaatar, Sergey Levine, Song Jiang, Xian Li, Yifei Zhou, Yuandong Tian","submitted_at":"2025-03-19T17:55:08Z","abstract_excerpt":"Large language model (LLM) agents need to perform multi-turn interactions in real-world tasks. However, existing multi-turn RL algorithms for optimizing LLM agents fail to perform effective credit assignment over multiple turns while leveraging the generalization capabilities of LLMs and it remains unclear how to develop such algorithms. To study this, we first introduce a new benchmark, ColBench, where an LLM agent interacts with a human collaborator over multiple turns to solve realistic tasks in backend programming and frontend design. Building on this benchmark, we propose a novel RL algor"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2503.15478","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2503.15478/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2503.15478","created_at":"2026-07-05T10:35:27.158803+00:00"},{"alias_kind":"arxiv_version","alias_value":"2503.15478v1","created_at":"2026-07-05T10:35:27.158803+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2503.15478","created_at":"2026-07-05T10:35:27.158803+00:00"},{"alias_kind":"pith_short_12","alias_value":"Y45YWD6TTG5A","created_at":"2026-07-05T10:35:27.158803+00:00"},{"alias_kind":"pith_short_16","alias_value":"Y45YWD6TTG5A5G3T","created_at":"2026-07-05T10:35:27.158803+00:00"},{"alias_kind":"pith_short_8","alias_value":"Y45YWD6T","created_at":"2026-07-05T10:35:27.158803+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":14,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2605.22240","citing_title":"Unlocking Proactivity in Task-Oriented Dialogue","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2605.22240","citing_title":"Unlocking Proactivity in Task-Oriented Dialogue","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2605.17877","citing_title":"PAIR: Prefix-Aware Internal Reward Model for Multi-Turn Agent Optimization","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2509.02547","citing_title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","ref_index":169,"is_internal_anchor":false},{"citing_arxiv_id":"2510.19225","citing_title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","ref_index":55,"is_internal_anchor":false},{"citing_arxiv_id":"2511.00413","citing_title":"Tree Training: Accelerating Agentic LLMs Training via Shared Prefix Reuse","ref_index":20,"is_internal_anchor":false},{"citing_arxiv_id":"2601.12538","citing_title":"Agentic Reasoning for Large Language Models","ref_index":235,"is_internal_anchor":false},{"citing_arxiv_id":"2602.06475","citing_title":"Towards Generalizable Reasoning: Group Causal Counterfactual Policy Optimization for LLM Reasoning","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2604.02869","citing_title":"Multi-Turn Reinforcement Learning for Tool-Calling Agents with Iterative Reward Calibration","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2604.27955","citing_title":"GUI Agents with Reinforcement Learning: Toward Digital Inhabitants","ref_index":88,"is_internal_anchor":false},{"citing_arxiv_id":"2605.08334","citing_title":"CustomerSim: Benchmarking and Aligning Multimodal Language Models as Retail User Simulators","ref_index":47,"is_internal_anchor":false},{"citing_arxiv_id":"2605.10674","citing_title":"Step Rejection Fine-Tuning: A Practical Distillation Recipe","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2604.07645","citing_title":"PRIME: Training Free Proactive Reasoning via Iterative Memory Evolution for User-Centric Agent","ref_index":24,"is_internal_anchor":false},{"citing_arxiv_id":"2604.05529","citing_title":"ActivityEditor: Learning to Synthesize Physically Valid Human Mobility","ref_index":5,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/Y45YWD6TTG5A5G3TH23BP4TFOB","json":"https://pith.science/pith/Y45YWD6TTG5A5G3TH23BP4TFOB.json","graph_json":"https://pith.science/api/pith-number/Y45YWD6TTG5A5G3TH23BP4TFOB/graph.json","events_json":"https://pith.science/api/pith-number/Y45YWD6TTG5A5G3TH23BP4TFOB/events.json","paper":"https://pith.science/paper/Y45YWD6T"},"agent_actions":{"view_html":"https://pith.science/pith/Y45YWD6TTG5A5G3TH23BP4TFOB","download_json":"https://pith.science/pith/Y45YWD6TTG5A5G3TH23BP4TFOB.json","view_paper":"https://pith.science/paper/Y45YWD6T","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2503.15478&json=true","fetch_graph":"https://pith.science/api/pith-number/Y45YWD6TTG5A5G3TH23BP4TFOB/graph.json","fetch_events":"https://pith.science/api/pith-number/Y45YWD6TTG5A5G3TH23BP4TFOB/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/Y45YWD6TTG5A5G3TH23BP4TFOB/action/timestamp_anchor","attest_storage":"https://pith.science/pith/Y45YWD6TTG5A5G3TH23BP4TFOB/action/storage_attestation","attest_author":"https://pith.science/pith/Y45YWD6TTG5A5G3TH23BP4TFOB/action/author_attestation","sign_citation":"https://pith.science/pith/Y45YWD6TTG5A5G3TH23BP4TFOB/action/citation_signature","submit_replication":"https://pith.science/pith/Y45YWD6TTG5A5G3TH23BP4TFOB/action/replication_record"}},"created_at":"2026-07-05T10:35:27.158803+00:00","updated_at":"2026-07-05T10:35:27.158803+00:00"}