{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:RYKBNT2YW7TOSFYJ2L6GZB4EOY","short_pith_number":"pith:RYKBNT2Y","schema_version":"1.0","canonical_sha256":"8e1416cf58b7e6e91709d2fc6c878476229b1606077325300ccbe98184158875","source":{"kind":"arxiv","id":"2504.14966","version":2},"attestation_state":"computed","paper":{"title":"SLO-Aware Scheduling for Large Language Model Inferences","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.DC","authors_text":"Entong Li, Jinqi Huang, Li Zeng, Wenjie Huang, Xin Chen, Xuebing Yu, Yi Xiong","submitted_at":"2025-04-21T08:48:48Z","abstract_excerpt":"Large language models (LLMs) have revolutionized applications such as code completion, chatbots, and online classification. To elevate user experiences, service level objectives (SLOs) serve as crucial benchmarks for assessing inference services capabilities. In practice, an inference service processes multiple types of tasks, each with its own distinct SLO. To ensure satisfactory user experiences, each request's distinct SLOs should be considered in scheduling. However, existing designs lack this consideration, leading to insufficient hardware utility and suboptimal performance.\n  This paper "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2504.14966","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.DC","submitted_at":"2025-04-21T08:48:48Z","cross_cats_sorted":[],"title_canon_sha256":"31e40532683b3bd0b91a72de15a31ac2a8d6c3fe2ff1ced27c65f62547caffa1","abstract_canon_sha256":"c305966318f82d6956c3e7020f38b3149c70698db8bfea02dc6b45bedb110e36"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:20:11.519828Z","signature_b64":"izkpW3EXRSWGEDgJs8nncxC7gQ5z0GEqjpLy23OfLPxA2cG25GCbD5iRx6IQSaQcDYdkKpUsbJLdANUA4nQ3Bg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"8e1416cf58b7e6e91709d2fc6c878476229b1606077325300ccbe98184158875","last_reissued_at":"2026-07-05T11:20:11.519219Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:20:11.519219Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"SLO-Aware Scheduling for Large Language Model Inferences","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.DC","authors_text":"Entong Li, Jinqi Huang, Li Zeng, Wenjie Huang, Xin Chen, Xuebing Yu, Yi Xiong","submitted_at":"2025-04-21T08:48:48Z","abstract_excerpt":"Large language models (LLMs) have revolutionized applications such as code completion, chatbots, and online classification. To elevate user experiences, service level objectives (SLOs) serve as crucial benchmarks for assessing inference services capabilities. In practice, an inference service processes multiple types of tasks, each with its own distinct SLO. To ensure satisfactory user experiences, each request's distinct SLOs should be considered in scheduling. However, existing designs lack this consideration, leading to insufficient hardware utility and suboptimal performance.\n  This paper "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2504.14966","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2504.14966/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2504.14966","created_at":"2026-07-05T11:20:11.519281+00:00"},{"alias_kind":"arxiv_version","alias_value":"2504.14966v2","created_at":"2026-07-05T11:20:11.519281+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2504.14966","created_at":"2026-07-05T11:20:11.519281+00:00"},{"alias_kind":"pith_short_12","alias_value":"RYKBNT2YW7TO","created_at":"2026-07-05T11:20:11.519281+00:00"},{"alias_kind":"pith_short_16","alias_value":"RYKBNT2YW7TOSFYJ","created_at":"2026-07-05T11:20:11.519281+00:00"},{"alias_kind":"pith_short_8","alias_value":"RYKBNT2Y","created_at":"2026-07-05T11:20:11.519281+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":2,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2601.20309","citing_title":"SuperInfer: SLO-Aware Rotary Scheduling and Memory Management for LLM Inference on Superchips","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2601.11652","citing_title":"WISP: Waste- and Interference-Suppressed Distributed Speculative LLM Serving at the Edge via Dynamic Drafting and SLO-Aware Batching","ref_index":15,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/RYKBNT2YW7TOSFYJ2L6GZB4EOY","json":"https://pith.science/pith/RYKBNT2YW7TOSFYJ2L6GZB4EOY.json","graph_json":"https://pith.science/api/pith-number/RYKBNT2YW7TOSFYJ2L6GZB4EOY/graph.json","events_json":"https://pith.science/api/pith-number/RYKBNT2YW7TOSFYJ2L6GZB4EOY/events.json","paper":"https://pith.science/paper/RYKBNT2Y"},"agent_actions":{"view_html":"https://pith.science/pith/RYKBNT2YW7TOSFYJ2L6GZB4EOY","download_json":"https://pith.science/pith/RYKBNT2YW7TOSFYJ2L6GZB4EOY.json","view_paper":"https://pith.science/paper/RYKBNT2Y","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2504.14966&json=true","fetch_graph":"https://pith.science/api/pith-number/RYKBNT2YW7TOSFYJ2L6GZB4EOY/graph.json","fetch_events":"https://pith.science/api/pith-number/RYKBNT2YW7TOSFYJ2L6GZB4EOY/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/RYKBNT2YW7TOSFYJ2L6GZB4EOY/action/timestamp_anchor","attest_storage":"https://pith.science/pith/RYKBNT2YW7TOSFYJ2L6GZB4EOY/action/storage_attestation","attest_author":"https://pith.science/pith/RYKBNT2YW7TOSFYJ2L6GZB4EOY/action/author_attestation","sign_citation":"https://pith.science/pith/RYKBNT2YW7TOSFYJ2L6GZB4EOY/action/citation_signature","submit_replication":"https://pith.science/pith/RYKBNT2YW7TOSFYJ2L6GZB4EOY/action/replication_record"}},"created_at":"2026-07-05T11:20:11.519281+00:00","updated_at":"2026-07-05T11:20:11.519281+00:00"}