{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2026:RBWOVWSADWK5QSXTMPRH3HQI5I","short_pith_number":"pith:RBWOVWSA","schema_version":"1.0","canonical_sha256":"886ceada401d95d84af363e27d9e08ea28cd76c639211ef6461ca471061b2166","source":{"kind":"arxiv","id":"2608.11152","version":1},"attestation_state":"computed","paper":{"title":"Scheduling Mixed RL Rollouts Beyond Prefix Locality","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.DC","authors_text":"Chen Tian, Daxin Jiang, Song Yuan, Yibo Zhu, Yuanhao Ding, Zetao Hong, Zhibin Wang","submitted_at":"2026-08-11T17:10:50Z","abstract_excerpt":"Modern reinforcement learning (RL) post-training pipelines for large language models (LLMs) increasingly combine rollout workloads across multiple domains and feedback paradigms. Prefix-aware routing improves inference efficiency through cache reuse and load balancing, but it does not control how heterogeneous rollout sessions compete for KV-cache capacity. When reinforcement learning with verifiable rewards (RLVR), reinforcement learning from human feedback (RLHF), and agentic rollouts share an asynchronous inference service, their distinct sequence structures, interaction patterns, and KV-re"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2608.11152","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.DC","submitted_at":"2026-08-11T17:10:50Z","cross_cats_sorted":["cs.LG"],"title_canon_sha256":"47b57dc468c23d169eee84b86aad274a860d335d5a2f52a82d9f8470d7fa15d6","abstract_canon_sha256":"7b4cd22020bd71bf51a6c7ea6d0f5bf083c3d484d99b4c4f510a0019a802e75b"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-08-12T01:24:42.601075Z","signature_b64":"Hpcr+EV2+9/nPz80YM0uX9wH+QOZ7nOQDDWtvs1vCAXFv67j8VrPxlHH5vsxiFQsb6/NAziHYDS/5H1iyifmBw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"886ceada401d95d84af363e27d9e08ea28cd76c639211ef6461ca471061b2166","last_reissued_at":"2026-08-12T01:24:42.598777Z","signature_status":"signed_v1","first_computed_at":"2026-08-12T01:24:42.598777Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Scheduling Mixed RL Rollouts Beyond Prefix Locality","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.DC","authors_text":"Chen Tian, Daxin Jiang, Song Yuan, Yibo Zhu, Yuanhao Ding, Zetao Hong, Zhibin Wang","submitted_at":"2026-08-11T17:10:50Z","abstract_excerpt":"Modern reinforcement learning (RL) post-training pipelines for large language models (LLMs) increasingly combine rollout workloads across multiple domains and feedback paradigms. Prefix-aware routing improves inference efficiency through cache reuse and load balancing, but it does not control how heterogeneous rollout sessions compete for KV-cache capacity. When reinforcement learning with verifiable rewards (RLVR), reinforcement learning from human feedback (RLHF), and agentic rollouts share an asynchronous inference service, their distinct sequence structures, interaction patterns, and KV-re"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2608.11152","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2608.11152/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2608.11152","created_at":"2026-08-12T01:24:42.603176+00:00"},{"alias_kind":"arxiv_version","alias_value":"2608.11152v1","created_at":"2026-08-12T01:24:42.603176+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2608.11152","created_at":"2026-08-12T01:24:42.603176+00:00"},{"alias_kind":"pith_short_12","alias_value":"RBWOVWSADWK5","created_at":"2026-08-12T01:24:42.603176+00:00"},{"alias_kind":"pith_short_16","alias_value":"RBWOVWSADWK5QSXT","created_at":"2026-08-12T01:24:42.603176+00:00"},{"alias_kind":"pith_short_8","alias_value":"RBWOVWSA","created_at":"2026-08-12T01:24:42.603176+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":0,"internal_anchor_count":0,"sample":[]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/RBWOVWSADWK5QSXTMPRH3HQI5I","json":"https://pith.science/pith/RBWOVWSADWK5QSXTMPRH3HQI5I.json","graph_json":"https://pith.science/api/pith-number/RBWOVWSADWK5QSXTMPRH3HQI5I/graph.json","events_json":"https://pith.science/api/pith-number/RBWOVWSADWK5QSXTMPRH3HQI5I/events.json","paper":"https://pith.science/paper/RBWOVWSA"},"agent_actions":{"view_html":"https://pith.science/pith/RBWOVWSADWK5QSXTMPRH3HQI5I","download_json":"https://pith.science/pith/RBWOVWSADWK5QSXTMPRH3HQI5I.json","view_paper":"https://pith.science/paper/RBWOVWSA","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2608.11152&json=true","fetch_graph":"https://pith.science/api/pith-number/RBWOVWSADWK5QSXTMPRH3HQI5I/graph.json","fetch_events":"https://pith.science/api/pith-number/RBWOVWSADWK5QSXTMPRH3HQI5I/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/RBWOVWSADWK5QSXTMPRH3HQI5I/action/timestamp_anchor","attest_storage":"https://pith.science/pith/RBWOVWSADWK5QSXTMPRH3HQI5I/action/storage_attestation","attest_author":"https://pith.science/pith/RBWOVWSADWK5QSXTMPRH3HQI5I/action/author_attestation","sign_citation":"https://pith.science/pith/RBWOVWSADWK5QSXTMPRH3HQI5I/action/citation_signature","submit_replication":"https://pith.science/pith/RBWOVWSADWK5QSXTMPRH3HQI5I/action/replication_record"}},"created_at":"2026-08-12T01:24:42.603176+00:00","updated_at":"2026-08-12T01:24:42.603176+00:00"}