{"as_of":"2026-08-17T09:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7b373648382a1fb15cec35403ade312302f231b59b003b5a07a739a0b96c1595","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T18:34:39.461915Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.19677/citation-record","integrity":"/paper/2506.19677/integrity","json":"/paper/2506.19677/citation-record.json","paper":"/paper/2506.19677"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-08-13T04:25:38.282910Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-15T18:34:39.135939Z","title":"Code llama: Open foundation models for code,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.135939Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:ca2860fc84c3ea6c72b8e2f49a98e711f10b95adaf930fae7ae19fb02dffbf87","observation_id":"a7b85b78-d2bc-4062-9493-ee49a6281da0","resolution":{"observed_at":"2026-08-15T18:34:39.135939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14196","last_updated":"2024-01-26T09:23:11Z","snapshot_observed_at":"2026-08-06T22:40:28.707813Z","submitted_at":"2024-01-25T14:17:53Z","title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14196","snapshot_observed_at":"2026-08-15T18:34:39.142344Z","title":"Deepseek-coder: When the large language model meets programming–the rise of code intelligence,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.142344Z"},"links":{"cited_paper":"/paper/2401.14196","citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:b9af47b88cea3cf953e4fe3a7373f6d7633ffbfff139ccf7a6d10c480822adf2","observation_id":"5ae8e1bb-65c9-45b7-9679-9d03881705af","resolution":{"observed_at":"2026-08-15T18:34:39.142344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-15T18:34:39.148481Z","title":"Qwen2. 5-coder technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.148481Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:41898160085682c3f09ae9e41d31f1f0609ef1618dc7da10268bd8cace995d6b","observation_id":"fa6e4015-90ca-4285-8d57-536cdf6b889d","resolution":{"observed_at":"2026-08-15T18:34:39.148481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19173","last_updated":"2024-02-29T13:53:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T13:53:35Z","title":"StarCoder 2 and The Stack v2: The Next Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19173","snapshot_observed_at":"2026-08-15T18:34:39.154863Z","title":"Starcoder 2 and the stack v2: The next generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.154863Z"},"links":{"cited_paper":"/paper/2402.19173","citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:6ff252a716a9ac8983d0f0fdd003c29dc792c5b5ee66530a643768abf4232a62","observation_id":"2487f045-311f-4609-b73a-42cec3188f6a","resolution":{"observed_at":"2026-08-15T18:34:39.154863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:34:40.829826Z","title":"Fine tuning large language model for secure code generation,","venue":null,"work_id":"0c47231d-4eaf-430d-88d1-750c6d01d5ca","year":2024},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.160386Z"},"links":{"citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:1b23e3362673b6ef5f0f7e69224bc52c195419bdc9b1f10bf167e74befd0a461","observation_id":"0419d7b9-9f88-44a2-bc25-02f8c6df7a6b","resolution":{"observed_at":"2026-08-15T18:34:40.836208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06095","last_updated":"2024-08-14T16:15:31Z","snapshot_observed_at":"2026-08-16T14:11:17.202918Z","submitted_at":"2024-03-10T05:10:34Z","title":"RepoHyper: Search-Expand-Refine on Semantic Graphs for Repository-Level Code Completion","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06095","snapshot_observed_at":"2026-08-15T18:34:39.164978Z","title":"Repohyper: Search-expand-refine on semantic graphs for repository-level code com- pletion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.164978Z"},"links":{"cited_paper":"/paper/2403.06095","citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:5f32895df19d3cab85bff9b4e2474414e3b303fc72eb8f3fe5ac29fc512886ee","observation_id":"975034c9-d087-43a5-9f57-3da2366bb72c","resolution":{"observed_at":"2026-08-15T18:34:39.164978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00515","last_updated":"2024-11-10T22:02:27Z","snapshot_observed_at":"2026-08-14T16:40:35.729198Z","submitted_at":"2024-06-01T17:48:15Z","title":"A Survey on Large Language Models for Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00515","snapshot_observed_at":"2026-08-15T18:34:39.171573Z","title":"A survey on large language models for code generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.171573Z"},"links":{"cited_paper":"/paper/2406.00515","citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:f142a7bb09404803dc55c4900b1fc63e30d16b3bd779aafc3fbbca92b9d143f0","observation_id":"d2e1e620-1d0c-4cde-94ba-99ea4809c32d","resolution":{"observed_at":"2026-08-15T18:34:39.171573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:34:40.799622Z","title":"Language models for code completion: A practical evaluation,","venue":null,"work_id":"3fa9f302-756d-4ab8-8bd1-5e24f33bbed3","year":2024},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.177142Z"},"links":{"citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:e053cc3d7be99d7be75eaaa71b61996f998558644fc63f5fe9c021da1efd6684","observation_id":"81fda2bd-3062-49c6-b4bd-e9f3b4f75e8f","resolution":{"observed_at":"2026-08-15T18:34:40.808922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12050","last_updated":"2024-02-16T19:52:45Z","snapshot_observed_at":"2026-08-16T15:31:33.419780Z","submitted_at":"2023-05-20T00:45:15Z","title":"AI-assisted Code Authoring at Scale: Fine-tuning, deploying, and mixed methods evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.12050","snapshot_observed_at":"2026-08-15T18:34:39.182174Z","title":"Ai-assisted code authoring at scale: Fine-tuning, deploying, and mixed methods evaluation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.182174Z"},"links":{"cited_paper":"/paper/2305.12050","citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:ac188a574f38f2729d0787a6149520cbb1c6c63941726b4c5913354099b49030","observation_id":"984a41e3-9824-4d89-9e67-147a8cc2a164","resolution":{"observed_at":"2026-08-15T18:34:39.182174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:34:39.188655Z","title":"A survey on large language model (llm) security and privacy: The good, the bad, and the ugly,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.188655Z"},"links":{"citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:af5c4ec52704e8bddf686cda7c89853a6c067ca571eb0aab077cd737161fe69d","observation_id":"de5cda9c-beef-486e-8e3b-f51dd0b660cf","resolution":{"observed_at":"2026-08-15T18:34:39.188655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:34:39.194272Z","title":"Security and privacy challenges of large language models: A survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.194272Z"},"links":{"citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:3d69f5cedc1e21ac58ba33fd1ae2578f81aff487c31016b3ed37c05f61e6114c","observation_id":"fb1b5d8a-fc0d-4f20-baaa-3956624fb948","resolution":{"observed_at":"2026-08-15T18:34:39.194272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07857","last_updated":"2025-01-14T05:48:27Z","snapshot_observed_at":"2026-08-16T18:14:05.257893Z","submitted_at":"2025-01-14T05:48:27Z","title":"Hierarchical Repository-Level Code Summarization for Business Applications Using Local LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07857","snapshot_observed_at":"2026-08-15T18:34:39.201458Z","title":"Hierarchical repository-level code summarization for business applications using local llms,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.201458Z"},"links":{"cited_paper":"/paper/2501.07857","citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:cff7e7451e65fd45b1556971deec293fe94ae69de59f3a154479f30721a5fb7b","observation_id":"e4245da9-307c-43c7-9d71-8c95c8245d53","resolution":{"observed_at":"2026-08-15T18:34:39.201458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:34:39.206736Z","title":"Using ollama,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.206736Z"},"links":{"citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:b1390bea86937a67e6b67dea6443ab83b2cc856a158da60b0a880ae676a7260f","observation_id":"a0de50b7-d19b-447a-82fa-61a647a202e0","resolution":{"observed_at":"2026-08-15T18:34:39.206736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:34:39.212463Z","title":"Efficient memory management for large language model serving with pagedattention,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.212463Z"},"links":{"citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:7010b8c4b08c33fd7c923e464dd2db9d560814d29813cc64797e536b96945a6c","observation_id":"a86f1378-8681-47e0-a439-8386e407f3f4","resolution":{"observed_at":"2026-08-15T18:34:39.212463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:34:39.218200Z","title":"Efficiently programming large language models using sglang","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.218200Z"},"links":{"citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:6dca1b7a6737da6e9b379120b9b3f13e62d634fc2dbb0aad2b579ed1866d3e2a","observation_id":"6a3e9bb0-2cca-41c1-acce-1740743c9e2c","resolution":{"observed_at":"2026-08-15T18:34:39.218200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:34:40.700487Z","title":null,"venue":null,"work_id":"1ed26abb-c510-43ec-bb55-049c59b359ba","year":2023},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.223034Z"},"links":{"citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:de94ab3fdcb85cde75a397b6f3ae043e503b4fb7948bf676c3443a9cf125e0ba","observation_id":"88e3acd8-986c-4367-ae0a-968afae4c9ba","resolution":{"observed_at":"2026-08-15T18:34:40.707301Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:34:40.676239Z","title":"Orca: A distributed serving system for{Transformer-Based}generative models,","venue":null,"work_id":"d476a099-5368-4647-94d3-109bcfdd6b72","year":2022},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.228640Z"},"links":{"citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:1ad463c2924e85af424b0635b41750fb66ce88de81b5575673036ba8a78fc83f","observation_id":"f9dfc8c3-0af7-4947-9eb9-76716a57586a","resolution":{"observed_at":"2026-08-15T18:34:40.682085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:34:39.234092Z","title":"Llumnix: Dynamic scheduling for large language model serving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.234092Z"},"links":{"citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:e06b0b5841f5bbb2b64122d8e12e1cc8ea37b4d0ffa1ad519afa5e748bb5c510","observation_id":"6b06a26a-ab7e-4c13-8a75-f654254649d1","resolution":{"observed_at":"2026-08-15T18:34:39.234092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:34:40.643286Z","title":"Batch: Machine learn- ing inference serving on serverless platforms with adaptive batching,","venue":null,"work_id":"2bdc3f8c-c2cd-4d54-a748-7454e732f3c5","year":2020},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.240589Z"},"links":{"citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:70ab08c6d53a0587c248d5305b538743b0a2efbfa70e27a9d91bc69d54d4c7f6","observation_id":"14004c0c-c6cd-4aca-b686-b31b093e8020","resolution":{"observed_at":"2026-08-15T18:34:40.650655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:34:40.610277Z","title":null,"venue":null,"work_id":"45994ad4-4c08-4e7f-8062-758446081d56","year":2022},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.246143Z"},"links":{"citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:046274cad22fbbf13c9036ff77367bf4456044a48f9101b4de7f98658ebcb879","observation_id":"4b467c65-bc88-42d3-942d-1f11c637c742","resolution":{"observed_at":"2026-08-15T18:34:40.621627Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:34:40.584688Z","title":"Efficient deep neural network serving: Fast and furious,","venue":null,"work_id":"678b62c5-dc79-4aee-94d7-ef24eee2f9cc","year":2018},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.251838Z"},"links":{"citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:2316d22352fc997b8d8a51354c96fa161ebb41530c5b0681729cbdeefee9b80a","observation_id":"92ebd5ed-4418-4c73-aae6-d5b413ab1033","resolution":{"observed_at":"2026-08-15T18:34:40.593282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:34:39.257810Z","title":"A comprehensive review of yolo architectures in computer vision: From yolov1 to yolov8 and yolo-nas,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.257810Z"},"links":{"citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:5b7360edd2a94cf44f49010604ef7ad27f0b0f9b6f51dd0c9ab103b18aa754ee","observation_id":"7b077c26-7f02-4c97-bc65-36badbd8e441","resolution":{"observed_at":"2026-08-15T18:34:39.257810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:34:40.528485Z","title":"Survey of uncertainty estimation in large language models-sources, methods, applications, and challenge,","venue":null,"work_id":"c4d704ab-56c5-4cb5-baa8-dd074c6e78f2","year":2025},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.263884Z"},"links":{"citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:b77d5c9f48f305ad0c4532025ad9268969f29c7688496c5a24c2fb76a328cc83","observation_id":"89693262-08b4-4aca-9dad-bd170f4f25b9","resolution":{"observed_at":"2026-08-15T18:34:40.544746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:34:40.504850Z","title":"Enabling efficient batch serving for lmaas via generation length prediction,","venue":null,"work_id":"1477886d-10cd-484a-9383-7c1f73e5edb9","year":2024},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.270108Z"},"links":{"citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:75c6e3b5eed3a983c44ed9b28f070787f1b76db2e5cbfbef9af36bdbd5fbf1fb","observation_id":"c44c90cf-5c58-4362-ae34-376fab391135","resolution":{"observed_at":"2026-08-15T18:34:40.511175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:34:40.483800Z","title":"[performance]: [v1] increasing the request batch size causes a significant drop in performance,","venue":null,"work_id":"cad616a7-5e59-467b-8936-54f5f94985f9","year":2025},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.276247Z"},"links":{"citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:a4f7499f7715944b0dfea8c0f96177f29fc4237a9178a76f6253e5cc89244de6","observation_id":"6a2720c6-3fe5-4df3-8cab-5ac2e9704ee3","resolution":{"observed_at":"2026-08-15T18:34:40.490366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:34:40.460517Z","title":"[performance]: Added request take too much time, and the model will not run untill all the request are added into the cache,","venue":null,"work_id":"c08cf0d3-0c03-49d3-b56f-23ecc16932af","year":2025},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.282691Z"},"links":{"citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:195ae79042da56635fec540bc272978f2b26fb0d7d83b2d29e5a3abf5cad3140","observation_id":"7c6a5c16-1a97-460e-8382-232caa403ddf","resolution":{"observed_at":"2026-08-15T18:34:40.467521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:34:40.439353Z","title":"[performance]: Why does the tpot increase with the request rate increase?","venue":null,"work_id":"793ffa40-66a9-42c7-8674-1ea5bb87e001","year":2025},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.289069Z"},"links":{"citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:d4ff030e5fef8c616d330f83036e249d10b97d054ec127ef258048e058228caf","observation_id":"d333ecd6-60c1-43c3-a91c-7f704869250c","resolution":{"observed_at":"2026-08-15T18:34:40.445506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:34:40.413790Z","title":"[performance]: Ttft spikes when qps increases during deepseek- r1 testing with tp8 and pp2,","venue":null,"work_id":"81846629-0b8c-4a0d-aa2e-4ae634e829be","year":2025},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.295612Z"},"links":{"citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:169b2e5964cb8e5f8fc150f7109b953b8c85bbed813f28daa4a8a0725a175372","observation_id":"1e11c2fc-df77-4507-a78f-0a568eedddaa","resolution":{"observed_at":"2026-08-15T18:34:40.420072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:34:40.372020Z","title":"[performance]: poor performance in pipeline parallesm when batch-size is large,","venue":null,"work_id":"02843fef-b363-4533-b206-e95a9a2c1b99","year":2025},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.302539Z"},"links":{"citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:b54f9ae479e31bc14e357522714a8ebdcfc024321c9c5a1da5a99a563d94c408","observation_id":"63039161-2ca4-4e2c-a2b2-1f7096b417f9","resolution":{"observed_at":"2026-08-15T18:34:40.389296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:34:40.345069Z","title":"[performance]: How to improve performance under concurrency,","venue":null,"work_id":"1540c7e3-7564-4920-88b6-dae07e95bac2","year":2025},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.313230Z"},"links":{"citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:772198a936435511a5e97abb07a78fcd573ad7ad42632b026fcc1c403f48d9b2","observation_id":"6a219196-1625-497f-9766-d0269f70d488","resolution":{"observed_at":"2026-08-15T18:34:40.354487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:34:40.322887Z","title":"{SHEPHERD}: Serv- ing{DNNs}in the wild,","venue":null,"work_id":"839661f6-5063-4cf2-a0c3-815f7a7bac83","year":2023},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.318307Z"},"links":{"citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:7b5b1aa0a971894439b93688bd91216582f4afac26fd95811e036527eaa1e4ae","observation_id":"dac3f033-f474-435b-9908-ae705c93400c","resolution":{"observed_at":"2026-08-15T18:34:40.331059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:34:40.291323Z","title":"Serving{DNNs}like clockwork: Performance predictability from the bottom up,","venue":null,"work_id":"af87af4a-a050-41a4-9490-a0a42625d6d7","year":2020},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.324673Z"},"links":{"citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:5c359b58012b55301ac8a98f756168a6fa15dc7de45bdb580ab9a7c8fde171b7","observation_id":"fc85e42c-445e-4c5f-9ca3-c736a7f1623f","resolution":{"observed_at":"2026-08-15T18:34:40.299244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:34:40.257908Z","title":"{INFaaS}: Automated model-less inference serving,","venue":null,"work_id":"a3a3dfc1-f7ab-4345-a3cb-e0a4235d8db8","year":2021},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.332023Z"},"links":{"citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:ddf68e6fb0f3dcd31f27b6303b96b92cd2ccb6ad1ac223df4dc928904e4ff4b4","observation_id":"7f1229fe-691c-4f25-841c-a679c64f1c80","resolution":{"observed_at":"2026-08-15T18:34:40.270319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:34:40.226005Z","title":"Llama: A heterogeneous & serverless framework for auto-tuning video analytics pipelines,","venue":null,"work_id":"5a633b9d-fafd-4b8e-afaf-a009e5a01581","year":2021},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.337702Z"},"links":{"citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:eaa3dcde92d9ffc9ba3ec180344a3a31d1e8f6b8724818eb6bee0686685cfd58","observation_id":"f50f9745-b263-4575-b556-0e150cb23a47","resolution":{"observed_at":"2026-08-15T18:34:40.239989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03243","last_updated":"2024-06-05T13:20:18Z","snapshot_observed_at":"2026-08-16T13:45:53.919899Z","submitted_at":"2024-06-05T13:20:18Z","title":"Llumnix: Dynamic Scheduling for Large Language Model Serving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03243","snapshot_observed_at":"2026-08-15T18:34:39.343001Z","title":"Llumnix: Dynamic scheduling for large language model serving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.343001Z"},"links":{"cited_paper":"/paper/2406.03243","citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:99284db9888244d7f431cb9d2d0e9637daab12a562dc79e494b84bf22c3eed94","observation_id":"0abfbf75-a5bd-4d1e-ae6f-e57c0c0b8f48","resolution":{"observed_at":"2026-08-15T18:34:39.343001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:34:39.348915Z","title":"{DistServe}: Disaggregating prefill and decoding for goodput-optimized large language model serving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.348915Z"},"links":{"citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:68e9ba19b39be4fdd493c8a57798d0b13df7f51d2053d54fc37a945d662c61cf","observation_id":"6d0980ed-da06-4666-a1f9-6df49d0f4ce8","resolution":{"observed_at":"2026-08-15T18:34:39.348915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16369","last_updated":"2023-08-31T00:03:02Z","snapshot_observed_at":"2026-08-15T04:42:28.752204Z","submitted_at":"2023-08-31T00:03:02Z","title":"SARATHI: Efficient LLM Inference by Piggybacking Decodes with Chunked Prefills","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16369","snapshot_observed_at":"2026-08-15T18:34:39.354289Z","title":"Sarathi: Efficient llm inference by piggybacking decodes with chunked prefills,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.354289Z"},"links":{"cited_paper":"/paper/2308.16369","citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:4b12b44c4fbc88c54c7bd9dfac1f26fbfb1854fa148c047cfa7bd93a48351407","observation_id":"21f521eb-5287-4847-bfeb-ea744a2059ac","resolution":{"observed_at":"2026-08-15T18:34:39.354289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11181","last_updated":"2024-01-20T09:43:36Z","snapshot_observed_at":"2026-08-16T14:25:57.735259Z","submitted_at":"2024-01-20T09:43:36Z","title":"Inference without Interference: Disaggregate LLM Inference for Mixed Downstream Workloads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11181","snapshot_observed_at":"2026-08-15T18:34:39.360289Z","title":"Inference without interference: Disaggre- gate llm inference for mixed downstream workloads,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.360289Z"},"links":{"cited_paper":"/paper/2401.11181","citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:0b5913db6fbfbafb85980deca6106be32500e38f915533d260e7e0fbd53ccabc","observation_id":"6d72c8f2-8d06-49c2-bfb3-2007f5d3bef8","resolution":{"observed_at":"2026-08-15T18:34:39.360289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:34:39.366807Z","title":"Splitwise: Efficient generative llm inference using phase splitting,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.366807Z"},"links":{"citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:799d172e1975c2a6107799842f74b15ec73de20494a5f00880690ebd2752615b","observation_id":"6b687260-c7e0-4390-a200-4ad5d118d0ff","resolution":{"observed_at":"2026-08-15T18:34:39.366807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07947","last_updated":"2024-03-15T06:21:56Z","snapshot_observed_at":"2026-08-17T09:44:25.054751Z","submitted_at":"2024-03-15T06:21:56Z","title":"ExeGPT: Constraint-Aware Resource Scheduling for LLM Inference","version":1},"cited_work":{"arxiv_id":"2404.07947","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.07947","snapshot_observed_at":"2026-08-15T18:34:39.592627Z","title":"ExeGPT: Constraint-Aware Resource Scheduling for LLM Inference","venue":"cs.DC","work_id":"b60e65b2-bc87-4e67-9e87-636459b6faf2","year":2024},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.373993Z"},"links":{"cited_paper":"/paper/2404.07947","citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:26d0d22f540f94341588658f32e39a46947f5522f17b604865d1a6401f884b32","observation_id":"f4dfdf25-cd56-47a8-abc6-fd64155fa57c","resolution":{"observed_at":"2026-08-15T18:34:39.600636Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.22562","last_updated":"2025-03-28T16:04:20Z","snapshot_observed_at":"2026-08-16T12:45:54.754460Z","submitted_at":"2025-03-28T16:04:20Z","title":"Niyama : Breaking the Silos of LLM Inference Serving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.22562","snapshot_observed_at":"2026-08-15T18:34:39.381247Z","title":"Niyama : Breaking the silos of llm inference serving,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.381247Z"},"links":{"cited_paper":"/paper/2503.22562","citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:4f19becbeca4ddae21bd3591ffaf0ffdb3b6d6a558f00f368d6bc4a149f1076a","observation_id":"94df0066-4de7-4408-a830-7d0e450f6759","resolution":{"observed_at":"2026-08-15T18:34:39.381247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:34:40.168636Z","title":"Hl-codellama-chat-response dataset,","venue":null,"work_id":"7ed950f7-8e55-4de1-8f88-500030e19a6a","year":2025},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.386759Z"},"links":{"citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:81a54b090bf49ca551a4aa6028493558b64f311370b412cabe857e9b83d89e54","observation_id":"558ef808-996f-4c05-8fbd-566875a77a00","resolution":{"observed_at":"2026-08-15T18:34:40.174778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:34:40.136200Z","title":"Synthetic code generations dataset,","venue":null,"work_id":"51f1acab-4d64-4634-91c5-a434af3faacd","year":2025},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.392953Z"},"links":{"citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:2c26f71ef8f601e18048e479821ced64607790c1ed08aa43e1b82c44439e0610","observation_id":"472ce62f-cb3a-439c-bf13-eacd8a120661","resolution":{"observed_at":"2026-08-15T18:34:40.143508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:34:40.098081Z","title":"Code summary java dataset,","venue":null,"work_id":"b844e263-faec-43e2-abf3-67cccd9045bd","year":2025},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.398191Z"},"links":{"citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:82ce5b4a91ee584804404780f985e758222a18535fb6ffc6417fc22439617af8","observation_id":"4d48ba10-b845-4ee8-b8c9-133f8d9f1a82","resolution":{"observed_at":"2026-08-15T18:34:40.111151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:34:40.068834Z","title":"Code translation dataset,","venue":null,"work_id":"af951dbf-cb4e-487b-a7a4-d3066fbe8ff5","year":2025},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.403669Z"},"links":{"citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:10923b69bc9c55536bcec12535cd34070ffe01e6b156b9a0b02e93fe2c6c50fd","observation_id":"3e23a315-b542-4f1f-bce9-46d62a2dfad2","resolution":{"observed_at":"2026-08-15T18:34:40.075428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07886","last_updated":"2024-07-15T03:54:20Z","snapshot_observed_at":"2026-08-16T14:27:21.818959Z","submitted_at":"2024-01-15T18:28:17Z","title":"Learned Best-Effort LLM Serving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07886","snapshot_observed_at":"2026-08-15T18:34:39.408803Z","title":"Learned best-effort llm serving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.408803Z"},"links":{"cited_paper":"/paper/2401.07886","citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:52aeb341831f92f0bb501bcfb595a1f5aefd4408be757b7451da72a8751b397c","observation_id":"651f9bd1-fc9f-4958-902d-92d799ad9696","resolution":{"observed_at":"2026-08-15T18:34:39.408803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00023","last_updated":"2024-10-03T17:50:33Z","snapshot_observed_at":"2026-08-16T13:54:26.904904Z","submitted_at":"2024-05-08T06:30:58Z","title":"Preble: Efficient Distributed Prompt Scheduling for LLM Serving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00023","snapshot_observed_at":"2026-08-15T18:34:39.414400Z","title":"Preble: Efficient distributed prompt scheduling for llm serving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.414400Z"},"links":{"cited_paper":"/paper/2407.00023","citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:6b2386fa4171d01efb5dbf9ea34ee327047743adb951c6f965973e453eeedb81","observation_id":"be3f75a8-9c4f-4c8b-9263-3e8fb2d439ec","resolution":{"observed_at":"2026-08-15T18:34:39.414400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:34:40.042586Z","title":"Past-future scheduler for llm serving under sla guarantees,","venue":null,"work_id":"245c422b-1c49-4fb9-84d5-490900d36c82","year":2025},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.419712Z"},"links":{"citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:3cec02160db02a640ad4a6b3f90963c270afa3dd570a16e6b2d8300e394860b8","observation_id":"20cc696d-a5b2-448a-9bff-b0a632792fa4","resolution":{"observed_at":"2026-08-15T18:34:40.049337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:34:40.012923Z","title":"ShareGPT Dataset: A Collection of ChatGPT Conversations,","venue":null,"work_id":"68c0ae89-5076-4a10-bf88-bac0b1d1383b","year":2023},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.425745Z"},"links":{"citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:091411b9910d6a30fbaa6c0993a706616d5e39b386312ee80e5b7a3beee0a0d4","observation_id":"44a109d9-1384-44a7-9802-babe4e010d8b","resolution":{"observed_at":"2026-08-15T18:34:40.019737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:34:39.986130Z","title":"Integrating concurrency control in n-tier application scaling management in the cloud,","venue":null,"work_id":"fff8f030-e1db-4bc9-a528-dd5dfaafbfa5","year":2018},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.431313Z"},"links":{"citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:df9c54eb6ba7080dfffabcf2fd7143947a95138ef7ee22160fde20a79a4716b1","observation_id":"269a077a-b8b5-40d8-83d7-fd363b68b917","resolution":{"observed_at":"2026-08-15T18:34:39.992542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:34:39.959147Z","title":"An r-square coefficient based on final prediction error,","venue":null,"work_id":"f1433d1b-149c-451a-8eb9-6ddc0075708c","year":2007},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.436591Z"},"links":{"citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:991806d0a873b848b4bcd4b2831145769d717d4b1e2b89fac72ef326123bca4d","observation_id":"09d6d1a8-8d6c-4637-b690-604c3accdab1","resolution":{"observed_at":"2026-08-15T18:34:39.966406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:34:39.442683Z","title":"Scipy 1.0: fundamental algorithms for scientific computing in python,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.442683Z"},"links":{"citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:cf258e22908ddbabc8d16651114cd893c82930f2c6c2b2b6e0920ee859e4bd71","observation_id":"b2a8c6f6-3f6f-4d29-8a61-959cdc3073f1","resolution":{"observed_at":"2026-08-15T18:34:39.442683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:34:39.911970Z","title":"Multi-dimensional sla-based resource allocation for multi-tier cloud computing systems,","venue":null,"work_id":"1b423ed6-2115-44ed-a15f-39bf80f2a557","year":2011},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.448659Z"},"links":{"citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:9aaef9bc2ba2729612d0011cfe6d2a69172effd80d8cade7fb4137c3c687ac3f","observation_id":"328358dd-936f-4e48-9342-cc8dc09198ec","resolution":{"observed_at":"2026-08-15T18:34:39.919225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:34:39.891161Z","title":"Decision model for cloud comput- ing under sla constraints,","venue":null,"work_id":"fb1a18ea-c15e-4ffd-8626-e61d9b5b95f1","year":2010},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.455244Z"},"links":{"citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:45185c567c3fac92ff4dd316a565a1cd0de21561dfad0dcc31a9a6b917cf4cf0","observation_id":"780e5dfe-4108-4577-84f5-14c7ff256e7c","resolution":{"observed_at":"2026-08-15T18:34:39.898075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:34:39.873006Z","title":"When average is not average: large response time fluctuations in n-tier systems,","venue":null,"work_id":"823e3c01-f8c7-422b-91b3-6c9a46664b69","year":2012},"citing_paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T18:34:39.461915Z"},"links":{"citing_paper":"/paper/2506.19677"},"observation_digest":"sha256:86558dcaf617f76eaab8f026a383cc2f76511e04067d3bacf91ed1ec520d6bfa","observation_id":"1018c585-1bd8-4c21-88f1-880752fcb863","resolution":{"observed_at":"2026-08-15T18:34:39.878885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.19677","last_updated":"2025-06-25T16:13:14Z","latest_version":2,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-15T18:25:55.881132Z","submitted_at":"2025-06-24T14:44:33Z","title":"Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":1,"verified_fuzzy":28},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 0 inbound Pith citation observations for arXiv:2506.19677."}