{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:B27XQPW7K53XZAU5UROC332AWL","short_pith_number":"pith:B27XQPW7","schema_version":"1.0","canonical_sha256":"0ebf783edf57777c829da45c2def40b2cabe3ee06cf5a81d5a05757c46733aa2","source":{"kind":"arxiv","id":"2504.15930","version":1},"attestation_state":"computed","paper":{"title":"StreamRL: Scalable, Heterogeneous, and Elastic RL for LLMs with Disaggregated Stream Generation","license":"http://creativecommons.org/licenses/by-sa/4.0/","headline":"","cross_cats":["cs.DC"],"primary_cat":"cs.LG","authors_text":"Bingyang Wu, Changyi Wan, Chao Jin, Daxin Jiang, Hanpeng Hu, Hongyu Zhou, Nuo Chen, Xiaoniu Song, Yibo Zhu, Yimin Jiang, Yinmin Zhong, Yukun Chen, Yu Zhou, Zili Zhang","submitted_at":"2025-04-22T14:19:06Z","abstract_excerpt":"Reinforcement learning (RL) has become the core post-training technique for large language models (LLMs). RL for LLMs involves two stages: generation and training. The LLM first generates samples online, which are then used to derive rewards for training. The conventional view holds that the colocated architecture, where the two stages share resources via temporal multiplexing, outperforms the disaggregated architecture, in which dedicated resources are assigned to each stage. However, in real-world deployments, we observe that the colocated architecture suffers from resource coupling, where t"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2504.15930","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by-sa/4.0/","primary_cat":"cs.LG","submitted_at":"2025-04-22T14:19:06Z","cross_cats_sorted":["cs.DC"],"title_canon_sha256":"14ac7d7421a41fa67579cc47bba6e157647e3d0c1b85b5a9d55e2ccac26fe061","abstract_canon_sha256":"e7d439610fa7130e7b8a9458cc64e2c02130ffc1bfd1cb23823d52ec11321414"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:52:32.090703Z","signature_b64":"CQliIR3yZR7bk/rZihi5cGzFSFH0+UhLvuHaFS3BfNv5gwpBTDDuacrCKW7bZ27D5sdS1PURXCZPA+URwn0MCQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"0ebf783edf57777c829da45c2def40b2cabe3ee06cf5a81d5a05757c46733aa2","last_reissued_at":"2026-07-05T10:52:32.089956Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:52:32.089956Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"StreamRL: Scalable, Heterogeneous, and Elastic RL for LLMs with Disaggregated Stream Generation","license":"http://creativecommons.org/licenses/by-sa/4.0/","headline":"","cross_cats":["cs.DC"],"primary_cat":"cs.LG","authors_text":"Bingyang Wu, Changyi Wan, Chao Jin, Daxin Jiang, Hanpeng Hu, Hongyu Zhou, Nuo Chen, Xiaoniu Song, Yibo Zhu, Yimin Jiang, Yinmin Zhong, Yukun Chen, Yu Zhou, Zili Zhang","submitted_at":"2025-04-22T14:19:06Z","abstract_excerpt":"Reinforcement learning (RL) has become the core post-training technique for large language models (LLMs). RL for LLMs involves two stages: generation and training. The LLM first generates samples online, which are then used to derive rewards for training. The conventional view holds that the colocated architecture, where the two stages share resources via temporal multiplexing, outperforms the disaggregated architecture, in which dedicated resources are assigned to each stage. However, in real-world deployments, we observe that the colocated architecture suffers from resource coupling, where t"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2504.15930","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2504.15930/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2504.15930","created_at":"2026-07-05T10:52:32.090243+00:00"},{"alias_kind":"arxiv_version","alias_value":"2504.15930v1","created_at":"2026-07-05T10:52:32.090243+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2504.15930","created_at":"2026-07-05T10:52:32.090243+00:00"},{"alias_kind":"pith_short_12","alias_value":"B27XQPW7K53X","created_at":"2026-07-05T10:52:32.090243+00:00"},{"alias_kind":"pith_short_16","alias_value":"B27XQPW7K53XZAU5","created_at":"2026-07-05T10:52:32.090243+00:00"},{"alias_kind":"pith_short_8","alias_value":"B27XQPW7","created_at":"2026-07-05T10:52:32.090243+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":26,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.24143","citing_title":"AsyncOPD: How Stale Can On-Policy Distillation Be?","ref_index":34,"is_internal_anchor":false},{"citing_arxiv_id":"2606.26607","citing_title":"Moebius: Serving Mixture-of-Expert Models with Seamless Runtime Parallelism Switch","ref_index":45,"is_internal_anchor":false},{"citing_arxiv_id":"2607.01120","citing_title":"Next-Generation Agentic Reinforcement Learning Systems Enable Self-Evolving Agents","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2606.11867","citing_title":"Harnessing Routing Foresight for Micro-step-level MoE load balancing in RL Post-training","ref_index":75,"is_internal_anchor":false},{"citing_arxiv_id":"2606.05597","citing_title":"AsyncWebRL: Efficient Asynchronous Reinforcement Learning for Multi-Step Visual Web Agents","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2606.04560","citing_title":"Rollout-Level Advantage-Prioritized Experience Replay for GRPO","ref_index":83,"is_internal_anchor":false},{"citing_arxiv_id":"2607.01120","citing_title":"Next-Generation Agentic Reinforcement Learning Systems Enable Self-Evolving Agents","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2606.03077","citing_title":"Libra: Efficient Resource Management for Agentic RL Post-Training","ref_index":67,"is_internal_anchor":false},{"citing_arxiv_id":"2605.23945","citing_title":"Accelerating Long-Tail Generation in Synchronous RLHF Training via Adaptive Tensor Parallelism","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2605.28095","citing_title":"SiDP: Memory-Efficient Data Parallelism for Offline LLM Inference","ref_index":40,"is_internal_anchor":false},{"citing_arxiv_id":"2605.30859","citing_title":"DARTS: Distribution-Aware Active Rollout Trajectory Shaping for Accelerating LLM Reinforcement Learning","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06534","citing_title":"ROSE: Rollout On Serving GPUs via Cooperative Elasticity for Agentic RL","ref_index":96,"is_internal_anchor":false},{"citing_arxiv_id":"2605.15565","citing_title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","ref_index":50,"is_internal_anchor":false},{"citing_arxiv_id":"2605.17570","citing_title":"How Off-Policy Can GRPO Be? Mu-GRPO for Efficient LLM Reinforcement Learning","ref_index":38,"is_internal_anchor":false},{"citing_arxiv_id":"2510.19225","citing_title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","ref_index":52,"is_internal_anchor":false},{"citing_arxiv_id":"2511.14617","citing_title":"Seer: Online Context Learning for Fast Synchronous LLM Reinforcement Learning","ref_index":54,"is_internal_anchor":false},{"citing_arxiv_id":"2512.12476","citing_title":"HetRL: Efficient Reinforcement Learning for LLMs in Heterogeneous Environments","ref_index":49,"is_internal_anchor":false},{"citing_arxiv_id":"2505.24298","citing_title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","ref_index":70,"is_internal_anchor":false},{"citing_arxiv_id":"2604.26256","citing_title":"DORA: A Scalable Asynchronous Reinforcement Learning System for Language Model Training","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2605.08862","citing_title":"BubbleSpec: Turning Long-Tail Bubbles into Speculative Rollout Drafts for Synchronous Reinforcement Learning","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2605.08520","citing_title":"FlashEvolve: Accelerating Agent Self-Evolution with Asynchronous Stage Orchestration","ref_index":38,"is_internal_anchor":false},{"citing_arxiv_id":"2605.08639","citing_title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","ref_index":68,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06534","citing_title":"ROSE: Rollout On Serving GPUs via Cooperative Elasticity for Agentic RL","ref_index":97,"is_internal_anchor":false},{"citing_arxiv_id":"2604.23838","citing_title":"JigsawRL: Assembling RL Pipelines for Efficient LLM Post-Training","ref_index":68,"is_internal_anchor":false},{"citing_arxiv_id":"2604.09107","citing_title":"TensorHub: Scalable and Elastic Weight Transfer for LLM RL Training","ref_index":46,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/B27XQPW7K53XZAU5UROC332AWL","json":"https://pith.science/pith/B27XQPW7K53XZAU5UROC332AWL.json","graph_json":"https://pith.science/api/pith-number/B27XQPW7K53XZAU5UROC332AWL/graph.json","events_json":"https://pith.science/api/pith-number/B27XQPW7K53XZAU5UROC332AWL/events.json","paper":"https://pith.science/paper/B27XQPW7"},"agent_actions":{"view_html":"https://pith.science/pith/B27XQPW7K53XZAU5UROC332AWL","download_json":"https://pith.science/pith/B27XQPW7K53XZAU5UROC332AWL.json","view_paper":"https://pith.science/paper/B27XQPW7","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2504.15930&json=true","fetch_graph":"https://pith.science/api/pith-number/B27XQPW7K53XZAU5UROC332AWL/graph.json","fetch_events":"https://pith.science/api/pith-number/B27XQPW7K53XZAU5UROC332AWL/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/B27XQPW7K53XZAU5UROC332AWL/action/timestamp_anchor","attest_storage":"https://pith.science/pith/B27XQPW7K53XZAU5UROC332AWL/action/storage_attestation","attest_author":"https://pith.science/pith/B27XQPW7K53XZAU5UROC332AWL/action/author_attestation","sign_citation":"https://pith.science/pith/B27XQPW7K53XZAU5UROC332AWL/action/citation_signature","submit_replication":"https://pith.science/pith/B27XQPW7K53XZAU5UROC332AWL/action/replication_record"}},"created_at":"2026-07-05T10:52:32.090243+00:00","updated_at":"2026-07-05T10:52:32.090243+00:00"}