{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:FLVY5AA4LANN3BLUOYVRPWVCTT","short_pith_number":"pith:FLVY5AA4","schema_version":"1.0","canonical_sha256":"2aeb8e801c581add8574762b17daa29ccf5b2c6323a1533aca6dc9308ce5f3f7","source":{"kind":"arxiv","id":"2512.04013","version":3},"attestation_state":"computed","paper":{"title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Jiexiong Xu, Wenhai Lin, Wenzhi Chen, Ying Wang, Yiquan Chen, Zhen Jin","submitted_at":"2025-12-03T17:49:38Z","abstract_excerpt":"As augmented large language models (LLMs) with external tools become increasingly popular in web applications, improving augmented LLM inference serving efficiency and optimizing service-level objectives (SLOs) are critical for enhancing user experience. To achieve this, inference systems must maximize request handling within latency constraints, referred to as increasing effective throughput. However, existing systems face two major challenges: (i) reliance on first-come-first-served (FCFS) scheduling causes severe head-of-line blocking, leading to queuing delays exceeding the SLOs for many r"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2512.04013","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2025-12-03T17:49:38Z","cross_cats_sorted":[],"title_canon_sha256":"2ccbba167dbdeaeadcb5e2bb109403c67ff572333bd802361cd29b4f8e320e5d","abstract_canon_sha256":"1024619f105855a26e40a470557280147af3393456b41f205f78d62971fa695e"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-13T01:20:04.819296Z","signature_b64":"SuoqJHmLKQccwag9zxm52GR3ud1TAukVUPGZy9g2LjuRUK1yaYWQqd1IpWtCAHji5V+sfcFnVyXZq5xUvhdhCg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"2aeb8e801c581add8574762b17daa29ccf5b2c6323a1533aca6dc9308ce5f3f7","last_reissued_at":"2026-07-13T01:20:04.817786Z","signature_status":"signed_v1","first_computed_at":"2026-07-13T01:20:04.817786Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Jiexiong Xu, Wenhai Lin, Wenzhi Chen, Ying Wang, Yiquan Chen, Zhen Jin","submitted_at":"2025-12-03T17:49:38Z","abstract_excerpt":"As augmented large language models (LLMs) with external tools become increasingly popular in web applications, improving augmented LLM inference serving efficiency and optimizing service-level objectives (SLOs) are critical for enhancing user experience. To achieve this, inference systems must maximize request handling within latency constraints, referred to as increasing effective throughput. However, existing systems face two major challenges: (i) reliance on first-come-first-served (FCFS) scheduling causes severe head-of-line blocking, leading to queuing delays exceeding the SLOs for many r"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2512.04013","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2512.04013/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2512.04013","created_at":"2026-07-13T01:20:04.818535+00:00"},{"alias_kind":"arxiv_version","alias_value":"2512.04013v3","created_at":"2026-07-13T01:20:04.818535+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2512.04013","created_at":"2026-07-13T01:20:04.818535+00:00"},{"alias_kind":"pith_short_12","alias_value":"FLVY5AA4LANN","created_at":"2026-07-13T01:20:04.818535+00:00"},{"alias_kind":"pith_short_16","alias_value":"FLVY5AA4LANN3BLU","created_at":"2026-07-13T01:20:04.818535+00:00"},{"alias_kind":"pith_short_8","alias_value":"FLVY5AA4","created_at":"2026-07-13T01:20:04.818535+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":2,"internal_anchor_count":2,"sample":[{"citing_arxiv_id":"2605.02329","citing_title":"Taming Request Imbalance: SLO-Aware Scheduling for Disaggregated LLM Inference","ref_index":12,"is_internal_anchor":true},{"citing_arxiv_id":"2605.02329","citing_title":"Taming Request Imbalance: SLO-Aware Scheduling for Disaggregated LLM Inference","ref_index":12,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/FLVY5AA4LANN3BLUOYVRPWVCTT","json":"https://pith.science/pith/FLVY5AA4LANN3BLUOYVRPWVCTT.json","graph_json":"https://pith.science/api/pith-number/FLVY5AA4LANN3BLUOYVRPWVCTT/graph.json","events_json":"https://pith.science/api/pith-number/FLVY5AA4LANN3BLUOYVRPWVCTT/events.json","paper":"https://pith.science/paper/FLVY5AA4"},"agent_actions":{"view_html":"https://pith.science/pith/FLVY5AA4LANN3BLUOYVRPWVCTT","download_json":"https://pith.science/pith/FLVY5AA4LANN3BLUOYVRPWVCTT.json","view_paper":"https://pith.science/paper/FLVY5AA4","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2512.04013&json=true","fetch_graph":"https://pith.science/api/pith-number/FLVY5AA4LANN3BLUOYVRPWVCTT/graph.json","fetch_events":"https://pith.science/api/pith-number/FLVY5AA4LANN3BLUOYVRPWVCTT/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/FLVY5AA4LANN3BLUOYVRPWVCTT/action/timestamp_anchor","attest_storage":"https://pith.science/pith/FLVY5AA4LANN3BLUOYVRPWVCTT/action/storage_attestation","attest_author":"https://pith.science/pith/FLVY5AA4LANN3BLUOYVRPWVCTT/action/author_attestation","sign_citation":"https://pith.science/pith/FLVY5AA4LANN3BLUOYVRPWVCTT/action/citation_signature","submit_replication":"https://pith.science/pith/FLVY5AA4LANN3BLUOYVRPWVCTT/action/replication_record"}},"created_at":"2026-07-13T01:20:04.818535+00:00","updated_at":"2026-07-13T01:20:04.818535+00:00"}