{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2026:JV7MQWMUU62ANEFYQBRGFPETTJ","short_pith_number":"pith:JV7MQWMU","schema_version":"1.0","canonical_sha256":"4d7ec85994a7b40690b8806262bc939a45c946bc8b082d923270f767823394e9","source":{"kind":"arxiv","id":"2602.05547","version":2},"attestation_state":"computed","paper":{"title":"Multi-Task GRPO: Reliable LLM Reasoning Across Tasks","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.LG"],"primary_cat":"cs.CL","authors_text":"Aurelien Lucchi, Haitham Bou Ammar, Ilija Bogunovic, Matthieu Zimmer, Sangwoong Yoon, Shyam Sundhar Ramesh, Xiaotong Ji, Zhiyong Wang","submitted_at":"2026-02-05T11:06:37Z","abstract_excerpt":"RL-based post-training with GRPO is widely used to improve large language models on individual reasoning tasks. However, real-world deployment requires reliable performance across diverse tasks. A straightforward multi-task adaptation of GRPO often leads to imbalanced outcomes, with some tasks dominating optimization while others stagnate. Moreover, tasks can vary widely in how frequently prompts yield zero advantages (and thus zero gradients), which further distorts their effective contribution to the optimization signal. To address these issues, we propose a novel Multi-Task GRPO (MT-GRPO) a"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2602.05547","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2026-02-05T11:06:37Z","cross_cats_sorted":["cs.AI","cs.LG"],"title_canon_sha256":"d06168a7770c6c93cd7f564637ffbb85c24d457a46e277f96e6c409dc9df6427","abstract_canon_sha256":"2409e1b19b4180fa51ae26ee86f0f8612b3986d000feebc5974b9c93f0107f3c"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-28T02:23:25.403732Z","signature_b64":"AwxvlfQMq5JyZLxExBZeEBnpKr5/03HEUe53skqlqNM4EAjGUsf+SabbSRf8wp68bpTJ1CNfuNfuXkYv0CqwBQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"4d7ec85994a7b40690b8806262bc939a45c946bc8b082d923270f767823394e9","last_reissued_at":"2026-07-28T02:23:25.402767Z","signature_status":"signed_v1","first_computed_at":"2026-07-28T02:23:25.402767Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Multi-Task GRPO: Reliable LLM Reasoning Across Tasks","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.LG"],"primary_cat":"cs.CL","authors_text":"Aurelien Lucchi, Haitham Bou Ammar, Ilija Bogunovic, Matthieu Zimmer, Sangwoong Yoon, Shyam Sundhar Ramesh, Xiaotong Ji, Zhiyong Wang","submitted_at":"2026-02-05T11:06:37Z","abstract_excerpt":"RL-based post-training with GRPO is widely used to improve large language models on individual reasoning tasks. However, real-world deployment requires reliable performance across diverse tasks. A straightforward multi-task adaptation of GRPO often leads to imbalanced outcomes, with some tasks dominating optimization while others stagnate. Moreover, tasks can vary widely in how frequently prompts yield zero advantages (and thus zero gradients), which further distorts their effective contribution to the optimization signal. To address these issues, we propose a novel Multi-Task GRPO (MT-GRPO) a"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2602.05547","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2602.05547/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2602.05547","created_at":"2026-07-28T02:23:25.403216+00:00"},{"alias_kind":"arxiv_version","alias_value":"2602.05547v2","created_at":"2026-07-28T02:23:25.403216+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2602.05547","created_at":"2026-07-28T02:23:25.403216+00:00"},{"alias_kind":"pith_short_12","alias_value":"JV7MQWMUU62A","created_at":"2026-07-28T02:23:25.403216+00:00"},{"alias_kind":"pith_short_16","alias_value":"JV7MQWMUU62ANEFY","created_at":"2026-07-28T02:23:25.403216+00:00"},{"alias_kind":"pith_short_8","alias_value":"JV7MQWMU","created_at":"2026-07-28T02:23:25.403216+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":7,"internal_anchor_count":7,"sample":[{"citing_arxiv_id":"2606.25178","citing_title":"Transferability for General Reasoning: An Automated Curriculum for Multi-Domain RLVR","ref_index":45,"is_internal_anchor":true},{"citing_arxiv_id":"2607.01470","citing_title":"World Feedback for Clinical Agents: Diagnosing RL in FHIR Environments","ref_index":15,"is_internal_anchor":true},{"citing_arxiv_id":"2606.25178","citing_title":"Transferability for General Reasoning: An Automated Curriculum for Multi-Domain RLVR","ref_index":45,"is_internal_anchor":true},{"citing_arxiv_id":"2605.25443","citing_title":"Harmony in Diversity: Multi-domain Contrastive Policy Optimization for Large Reasoning Models","ref_index":12,"is_internal_anchor":true},{"citing_arxiv_id":"2606.00609","citing_title":"CARE-RL: Capability-Aware Reinforcement Learning for Mitigating Cross-Domain Conflicts","ref_index":39,"is_internal_anchor":true},{"citing_arxiv_id":"2605.09879","citing_title":"M2A: Synergizing Mathematical and Agentic Reasoning in Large Language Models","ref_index":28,"is_internal_anchor":true},{"citing_arxiv_id":"2604.06159","citing_title":"Target Policy Optimization","ref_index":12,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/JV7MQWMUU62ANEFYQBRGFPETTJ","json":"https://pith.science/pith/JV7MQWMUU62ANEFYQBRGFPETTJ.json","graph_json":"https://pith.science/api/pith-number/JV7MQWMUU62ANEFYQBRGFPETTJ/graph.json","events_json":"https://pith.science/api/pith-number/JV7MQWMUU62ANEFYQBRGFPETTJ/events.json","paper":"https://pith.science/paper/JV7MQWMU"},"agent_actions":{"view_html":"https://pith.science/pith/JV7MQWMUU62ANEFYQBRGFPETTJ","download_json":"https://pith.science/pith/JV7MQWMUU62ANEFYQBRGFPETTJ.json","view_paper":"https://pith.science/paper/JV7MQWMU","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2602.05547&json=true","fetch_graph":"https://pith.science/api/pith-number/JV7MQWMUU62ANEFYQBRGFPETTJ/graph.json","fetch_events":"https://pith.science/api/pith-number/JV7MQWMUU62ANEFYQBRGFPETTJ/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/JV7MQWMUU62ANEFYQBRGFPETTJ/action/timestamp_anchor","attest_storage":"https://pith.science/pith/JV7MQWMUU62ANEFYQBRGFPETTJ/action/storage_attestation","attest_author":"https://pith.science/pith/JV7MQWMUU62ANEFYQBRGFPETTJ/action/author_attestation","sign_citation":"https://pith.science/pith/JV7MQWMUU62ANEFYQBRGFPETTJ/action/citation_signature","submit_replication":"https://pith.science/pith/JV7MQWMUU62ANEFYQBRGFPETTJ/action/replication_record"}},"created_at":"2026-07-28T02:23:25.403216+00:00","updated_at":"2026-07-28T02:23:25.403216+00:00"}