{"as_of":"2026-08-07T18:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c2210e1a014b11b7f69b155c57715a414b34cc3113f6d2870510ed5b224029aa","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T20:10:09.020308Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2602.24044/citation-record","integrity":"/paper/2602.24044/integrity","json":"/paper/2602.24044/citation-record.json","paper":"/paper/2602.24044"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:10:08.892976Z","title":"Vidur: A large-scale simulation framework for llm inference","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24044","last_updated":"2026-07-06T16:40:44Z","snapshot_observed_at":"2026-08-05T17:21:45.697907Z","submitted_at":"2026-02-27T14:22:51Z","title":"Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T20:10:08.892976Z"},"links":{"citing_paper":"/paper/2602.24044"},"observation_digest":"sha256:d3456d1ade978f5ff31a94aefe3e4c271dff91825a5d24d44334b648479dd3fc","observation_id":"a233e350-3aef-4861-bfb5-7c5561a4e573","resolution":{"observed_at":"2026-08-02T20:10:08.892976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:10:08.896492Z","title":"Taming throughput-latency tradeoff in llm in- ference with sarathi-serve, in: 18th USENIX Sympo- sium on Operating Systems Design and Implementa- tion (OSDI 24), pp","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24044","last_updated":"2026-07-06T16:40:44Z","snapshot_observed_at":"2026-08-05T17:21:45.697907Z","submitted_at":"2026-02-27T14:22:51Z","title":"Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T20:10:08.896492Z"},"links":{"citing_paper":"/paper/2602.24044"},"observation_digest":"sha256:ca0174d7a4c2da7ca8f74c3a336e3439c7f4910c70da21533d3a7d0e055abb63","observation_id":"fdc99142-7a9c-4d2d-8acc-efddddf537ab","resolution":{"observed_at":"2026-08-02T20:10:08.896492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:10:08.899550Z","title":"Clean sharegpt dataset","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.24044","last_updated":"2026-07-06T16:40:44Z","snapshot_observed_at":"2026-08-05T17:21:45.697907Z","submitted_at":"2026-02-27T14:22:51Z","title":"Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T20:10:08.899550Z"},"links":{"citing_paper":"/paper/2602.24044"},"observation_digest":"sha256:7dcec032f546632dbe963bf80f404f4d458543435e4191790af630ad4f3bf6bf","observation_id":"c588857d-a1c0-4dbc-bee2-680e866c66f0","resolution":{"observed_at":"2026-08-02T20:10:08.899550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:10:08.902565Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.24044","last_updated":"2026-07-06T16:40:44Z","snapshot_observed_at":"2026-08-05T17:21:45.697907Z","submitted_at":"2026-02-27T14:22:51Z","title":"Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T20:10:08.902565Z"},"links":{"citing_paper":"/paper/2602.24044"},"observation_digest":"sha256:0437444e34fb1560f6b38430502999fd79e18ee9d494c0facf5dcb244e171de4","observation_id":"f21e5e5f-995e-4756-b5e2-0308f70745f3","resolution":{"observed_at":"2026-08-02T20:10:08.902565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00066","last_updated":"2025-05-29T20:47:12Z","snapshot_observed_at":"2026-07-06T18:38:38.104034Z","submitted_at":"2024-06-17T15:21:35Z","title":"Compress then Serve: Serving Thousands of LoRA Adapters with Little Overhead","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00066","snapshot_observed_at":"2026-08-02T20:10:08.905901Z","title":"Compress then serve: Serving thousands of lora adapters with little overhead","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.24044","last_updated":"2026-07-06T16:40:44Z","snapshot_observed_at":"2026-08-05T17:21:45.697907Z","submitted_at":"2026-02-27T14:22:51Z","title":"Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T20:10:08.905901Z"},"links":{"cited_paper":"/paper/2407.00066","citing_paper":"/paper/2602.24044"},"observation_digest":"sha256:5d89af2dc94c0102c46b32fbb0d769defc4bf738fdafba60ebb984295b098b8a","observation_id":"67101bfd-3a65-42ee-a873-c8bef006c2de","resolution":{"observed_at":"2026-08-02T20:10:08.905901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:10:08.909475Z","title":"Punica: Multi-tenant lora serving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.24044","last_updated":"2026-07-06T16:40:44Z","snapshot_observed_at":"2026-08-05T17:21:45.697907Z","submitted_at":"2026-02-27T14:22:51Z","title":"Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T20:10:08.909475Z"},"links":{"citing_paper":"/paper/2602.24044"},"observation_digest":"sha256:a2accb3ec36001a92729abc42987a0dad50cdd078fa3545b3a4d9191b4ffaad0","observation_id":"4b2e137e-b616-469a-bce4-2465627afe24","resolution":{"observed_at":"2026-08-02T20:10:08.909475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:10:08.912329Z","title":"Llmservingsim: A hw/sw co-simulation infrastructure for llm inference serving at scale, in: 2024 IEEE Inter- national Symposium on Workload Characterization (IISWC), IEEE","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.24044","last_updated":"2026-07-06T16:40:44Z","snapshot_observed_at":"2026-08-05T17:21:45.697907Z","submitted_at":"2026-02-27T14:22:51Z","title":"Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T20:10:08.912329Z"},"links":{"citing_paper":"/paper/2602.24044"},"observation_digest":"sha256:31618f796d33983d7b509fb94f3d286a7acc429c54ec46e139c804135799d861","observation_id":"9976b25a-4d08-4f3f-8498-aff7bd17953b","resolution":{"observed_at":"2026-08-02T20:10:08.912329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:10:08.915930Z","title":"Computers and Intractability: A Guide to the Theory of NP- Completeness","venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2602.24044","last_updated":"2026-07-06T16:40:44Z","snapshot_observed_at":"2026-08-05T17:21:45.697907Z","submitted_at":"2026-02-27T14:22:51Z","title":"Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T20:10:08.915930Z"},"links":{"citing_paper":"/paper/2602.24044"},"observation_digest":"sha256:e12161c2a722803d7eb19ef728237c621690581c5acfc1a2348ca185a057bec2","observation_id":"3564582c-e288-4c54-abbf-e373ff3ab183","resolution":{"observed_at":"2026-08-02T20:10:08.915930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-02T20:10:08.919252Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.24044","last_updated":"2026-07-06T16:40:44Z","snapshot_observed_at":"2026-08-05T17:21:45.697907Z","submitted_at":"2026-02-27T14:22:51Z","title":"Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T20:10:08.919252Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2602.24044"},"observation_digest":"sha256:c8cdd0f373835db70267145dd63e8d9d5e6c9f5cf2c608925d6bc50c5c393e12","observation_id":"1993d999-a665-403d-9414-96f8f4695b9a","resolution":{"observed_at":"2026-08-02T20:10:08.919252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:10:08.922159Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.24044","last_updated":"2026-07-06T16:40:44Z","snapshot_observed_at":"2026-08-05T17:21:45.697907Z","submitted_at":"2026-02-27T14:22:51Z","title":"Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T20:10:08.922159Z"},"links":{"citing_paper":"/paper/2602.24044"},"observation_digest":"sha256:6e7982b90a524a70b14674eb347b857ab56fbcfa405c81c304dc7669cdd184f1","observation_id":"db4615fc-356e-4dd0-aa26-c0a0f3b6827b","resolution":{"observed_at":"2026-08-02T20:10:08.922159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:10:08.925916Z","title":"Parameter-efficient transfer learning fornlp, in: Internationalconferenceonmachinelearn- ing, PMLR","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.24044","last_updated":"2026-07-06T16:40:44Z","snapshot_observed_at":"2026-08-05T17:21:45.697907Z","submitted_at":"2026-02-27T14:22:51Z","title":"Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T20:10:08.925916Z"},"links":{"citing_paper":"/paper/2602.24044"},"observation_digest":"sha256:05cf609aff2d4c2795cd3f8e3c77e524871589763cd55778a4236b6a4190f1ae","observation_id":"9075a214-5de2-4296-858d-e129efa4f2f7","resolution":{"observed_at":"2026-08-02T20:10:08.925916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:10:08.928867Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.24044","last_updated":"2026-07-06T16:40:44Z","snapshot_observed_at":"2026-08-05T17:21:45.697907Z","submitted_at":"2026-02-27T14:22:51Z","title":"Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T20:10:08.928867Z"},"links":{"citing_paper":"/paper/2602.24044"},"observation_digest":"sha256:6dd1126293c382b500c311566b7716810ad4dd39300b41351b33acdc4425df21","observation_id":"dd75c6e9-a505-4c97-a0f4-ad899115142f","resolution":{"observed_at":"2026-08-02T20:10:08.928867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:10:08.932682Z","title":"Chameleon: Adap- tive Caching and Scheduling for Many-Adapter LLM Inference Environments","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.24044","last_updated":"2026-07-06T16:40:44Z","snapshot_observed_at":"2026-08-05T17:21:45.697907Z","submitted_at":"2026-02-27T14:22:51Z","title":"Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T20:10:08.932682Z"},"links":{"citing_paper":"/paper/2602.24044"},"observation_digest":"sha256:977956b034f7ede63861b2310a39c8c51982b810bedadd065ca5ec8827b8d065","observation_id":"08683555-6cef-4227-b645-c18032096df5","resolution":{"observed_at":"2026-08-02T20:10:08.932682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/s0022-0000(74)80026-7","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fast algorithms for bin packing","venue":"Journal of Computer and System Sciences","work_id":"60f5d64c-d767-41d3-aa39-e10dcaaa3109","year":1974},"citing_paper":{"arxiv_id":"2602.24044","last_updated":"2026-07-06T16:40:44Z","snapshot_observed_at":"2026-08-05T17:21:45.697907Z","submitted_at":"2026-02-27T14:22:51Z","title":"Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T20:10:08.935608Z"},"links":{"citing_paper":"/paper/2602.24044"},"observation_digest":"sha256:56ace773880300ee906d59c3b7f9ab1ffd3b081d362b07844374e5c677702a34","observation_id":"a5c88794-6735-49cb-836d-c4514b9275ed","resolution":{"observed_at":"2026-08-02T20:14:03.025533Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:10:08.939076Z","title":"Ef- ficient memory management for large language model serving with pagedattention, in: Proceedings of the 29th Symposium on Operating Systems Principles, pp","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.24044","last_updated":"2026-07-06T16:40:44Z","snapshot_observed_at":"2026-08-05T17:21:45.697907Z","submitted_at":"2026-02-27T14:22:51Z","title":"Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T20:10:08.939076Z"},"links":{"citing_paper":"/paper/2602.24044"},"observation_digest":"sha256:6c7f7626b8696b0f4cacb82671ff8d9df01e774e4d1fae7aa37f67060a4af2c7","observation_id":"f5de80dd-d827-4444-b286-57fe4a32d0fd","resolution":{"observed_at":"2026-08-02T20:10:08.939076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:10:08.941951Z","title":"Numba: A llvm-based python jit compiler, in: Proceedings of the Second Workshop on the LLVM Compiler Infrastruc- ture in HPC, pp","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2602.24044","last_updated":"2026-07-06T16:40:44Z","snapshot_observed_at":"2026-08-05T17:21:45.697907Z","submitted_at":"2026-02-27T14:22:51Z","title":"Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T20:10:08.941951Z"},"links":{"citing_paper":"/paper/2602.24044"},"observation_digest":"sha256:648c89b2db8710a46a7dbea32305a2c3d83b847005830fbca0f553bdd6f3184f","observation_id":"12d10cbb-89b8-458b-8b9a-8802fbb884c2","resolution":{"observed_at":"2026-08-02T20:10:08.941951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11240","last_updated":"2024-01-20T14:37:48Z","snapshot_observed_at":"2026-07-06T17:18:16.042313Z","submitted_at":"2024-01-20T14:37:48Z","title":"CaraServe: CPU-Assisted and Rank-Aware LoRA Serving for Generative LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11240","snapshot_observed_at":"2026-08-02T20:10:08.944967Z","title":"Caraserve: Cpu- assistedandrank-awareloraservingforgenerativellm inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.24044","last_updated":"2026-07-06T16:40:44Z","snapshot_observed_at":"2026-08-05T17:21:45.697907Z","submitted_at":"2026-02-27T14:22:51Z","title":"Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T20:10:08.944967Z"},"links":{"cited_paper":"/paper/2401.11240","citing_paper":"/paper/2602.24044"},"observation_digest":"sha256:e0d30c66e9889e9338f4f4a39046e0c31149bf2eeb534bfac30d0a7f5dc58496","observation_id":"87a2a520-729a-4c87-a011-486123706c54","resolution":{"observed_at":"2026-08-02T20:10:08.944967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:10:08.948035Z","title":"Prefix-tuning: Optimizing continuouspromptsforgeneration","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.24044","last_updated":"2026-07-06T16:40:44Z","snapshot_observed_at":"2026-08-05T17:21:45.697907Z","submitted_at":"2026-02-27T14:22:51Z","title":"Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T20:10:08.948035Z"},"links":{"citing_paper":"/paper/2602.24044"},"observation_digest":"sha256:dfcd152c8c7081e955182414760e0c26e87ff4d9fc3ab23bc0a9a7985f2848f8","observation_id":"37946ea0-ddb1-44b4-a58d-8d8a77ebfa97","resolution":{"observed_at":"2026-08-02T20:10:08.948035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:10:08.951260Z","title":"Few-shot parameter- efficient fine-tuning is better and cheaper than in- context learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.24044","last_updated":"2026-07-06T16:40:44Z","snapshot_observed_at":"2026-08-05T17:21:45.697907Z","submitted_at":"2026-02-27T14:22:51Z","title":"Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T20:10:08.951260Z"},"links":{"citing_paper":"/paper/2602.24044"},"observation_digest":"sha256:42e7cd5896369f34d17d30059e6bbdd3fb7e7cb3b31a322ad770bddaa5dc3c74","observation_id":"33c53d03-6a39-407a-9f01-f00723626e73","resolution":{"observed_at":"2026-08-02T20:10:08.951260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:10:08.954583Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24044","last_updated":"2026-07-06T16:40:44Z","snapshot_observed_at":"2026-08-05T17:21:45.697907Z","submitted_at":"2026-02-27T14:22:51Z","title":"Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T20:10:08.954583Z"},"links":{"citing_paper":"/paper/2602.24044"},"observation_digest":"sha256:e3311ba12fc5fa61a99bd6edbb37df1a0b3788262268f23ae8f1ead2826953ca","observation_id":"b8aa8b5f-7ea3-414a-8524-ce4954c1acf8","resolution":{"observed_at":"2026-08-02T20:10:08.954583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:10:08.960311Z","title":"DeepSpeed-MII","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.24044","last_updated":"2026-07-06T16:40:44Z","snapshot_observed_at":"2026-08-05T17:21:45.697907Z","submitted_at":"2026-02-27T14:22:51Z","title":"Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T20:10:08.960311Z"},"links":{"citing_paper":"/paper/2602.24044"},"observation_digest":"sha256:6fa4c17709df69dfcfbbda7f12369729da3fe2d2d7d6b4c4e0e3b6ec969fa606","observation_id":"ec86f556-fabc-4bfc-888f-a8f2483cce29","resolution":{"observed_at":"2026-08-02T20:10:08.960311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:10:08.963043Z","title":"TensorRT-LLM","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.24044","last_updated":"2026-07-06T16:40:44Z","snapshot_observed_at":"2026-08-05T17:21:45.697907Z","submitted_at":"2026-02-27T14:22:51Z","title":"Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T20:10:08.963043Z"},"links":{"citing_paper":"/paper/2602.24044"},"observation_digest":"sha256:bf0d3355ee05353776766af6b0340ccc8290b3ba3e1c59ef31a2f0ed0f85bfd6","observation_id":"d0938c5d-4b1e-49fd-add6-667da2e48b4a","resolution":{"observed_at":"2026-08-02T20:10:08.963043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:10:08.966262Z","title":"Scikit-learn: Machine learning in Python","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2602.24044","last_updated":"2026-07-06T16:40:44Z","snapshot_observed_at":"2026-08-05T17:21:45.697907Z","submitted_at":"2026-02-27T14:22:51Z","title":"Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T20:10:08.966262Z"},"links":{"citing_paper":"/paper/2602.24044"},"observation_digest":"sha256:ec9ee5974c0e1d0d5cf86b1a7528e876797cefdd4518eb0849cb8f145e0e8ddd","observation_id":"70a7674a-31bc-4549-94cf-3e7a42334af4","resolution":{"observed_at":"2026-08-02T20:10:08.966262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:10:08.969561Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.24044","last_updated":"2026-07-06T16:40:44Z","snapshot_observed_at":"2026-08-05T17:21:45.697907Z","submitted_at":"2026-02-27T14:22:51Z","title":"Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T20:10:08.969561Z"},"links":{"citing_paper":"/paper/2602.24044"},"observation_digest":"sha256:0ef480b7f73c56492189b178317d358b5e2dcb77f042be85a895153e97fc5d6e","observation_id":"cf9b79c7-9b4b-4f42-a965-abcf0052d886","resolution":{"observed_at":"2026-08-02T20:10:08.969561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:10:08.972431Z","title":"Mind the memory gap: Unveiling gpu bottlenecks in large- batch llm inference, in: 2025 IEEE 18th International Conference on Cloud Computing (CLOUD), IEEE","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.24044","last_updated":"2026-07-06T16:40:44Z","snapshot_observed_at":"2026-08-05T17:21:45.697907Z","submitted_at":"2026-02-27T14:22:51Z","title":"Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T20:10:08.972431Z"},"links":{"citing_paper":"/paper/2602.24044"},"observation_digest":"sha256:84fe0cfd9675274f6d653d170b6cfd944500dcc8d185e9d6bd53b156fafd973d","observation_id":"5a8fd1af-78de-40ca-bcd3-5c1640ec3b85","resolution":{"observed_at":"2026-08-02T20:10:08.972431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:10:08.975710Z","title":"Towards pareto optimal throughput in small language model serving, in: Proceedings of the 4th Workshop on Machine Learning and Systems, pp","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.24044","last_updated":"2026-07-06T16:40:44Z","snapshot_observed_at":"2026-08-05T17:21:45.697907Z","submitted_at":"2026-02-27T14:22:51Z","title":"Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T20:10:08.975710Z"},"links":{"citing_paper":"/paper/2602.24044"},"observation_digest":"sha256:2faff6d29bcb2b84c4f389fb8bdf332c49364bef3d6731c79fcad0d1249af1f3","observation_id":"2bd1c87a-613d-49c5-98f9-2dd29576e5da","resolution":{"observed_at":"2026-08-02T20:10:08.975710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:10:08.978780Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24044","last_updated":"2026-07-06T16:40:44Z","snapshot_observed_at":"2026-08-05T17:21:45.697907Z","submitted_at":"2026-02-27T14:22:51Z","title":"Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T20:10:08.978780Z"},"links":{"citing_paper":"/paper/2602.24044"},"observation_digest":"sha256:671cdb5decfc642a2b8f1d11b969921bf8fb273098f9b9c3e28a7fd95fc249ef","observation_id":"6265eb50-4119-41ef-b976-97a1edf34905","resolution":{"observed_at":"2026-08-02T20:10:08.978780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:10:08.984732Z","title":"EdgeLoRA: An Efficient Multi- Tenant LLM Serving System on Edge Devices","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.24044","last_updated":"2026-07-06T16:40:44Z","snapshot_observed_at":"2026-08-05T17:21:45.697907Z","submitted_at":"2026-02-27T14:22:51Z","title":"Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T20:10:08.984732Z"},"links":{"citing_paper":"/paper/2602.24044"},"observation_digest":"sha256:183dd0664f565b84f5babc097c8fbe5160c0b6ed1083d71125efa2290d491139","observation_id":"81d040ed-fc9e-4e9c-8d29-4b62ded7c17b","resolution":{"observed_at":"2026-08-02T20:10:08.984732Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:10:08.987262Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24044","last_updated":"2026-07-06T16:40:44Z","snapshot_observed_at":"2026-08-05T17:21:45.697907Z","submitted_at":"2026-02-27T14:22:51Z","title":"Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T20:10:08.987262Z"},"links":{"citing_paper":"/paper/2602.24044"},"observation_digest":"sha256:c7a6151697b21db9cdc8a63c732e0bb42909a8bb8e6d44cc32ebfa7b09fcb583","observation_id":"56fc4404-708a-42d0-96d8-7f36aae052dd","resolution":{"observed_at":"2026-08-02T20:10:08.987262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:10:08.993204Z","title":"Lst: Ladder side-tuning for parameter and memory efficient trans- fer learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.24044","last_updated":"2026-07-06T16:40:44Z","snapshot_observed_at":"2026-08-05T17:21:45.697907Z","submitted_at":"2026-02-27T14:22:51Z","title":"Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T20:10:08.993204Z"},"links":{"citing_paper":"/paper/2602.24044"},"observation_digest":"sha256:026b5524eca41d135f644a9e0920959a4a4fc5198fb1575549df2168c086b91c","observation_id":"9c28a3b1-8b30-40c5-893a-e75f15e5a616","resolution":{"observed_at":"2026-08-02T20:10:08.993204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-02T20:10:08.996368Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.24044","last_updated":"2026-07-06T16:40:44Z","snapshot_observed_at":"2026-08-05T17:21:45.697907Z","submitted_at":"2026-02-27T14:22:51Z","title":"Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T20:10:08.996368Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2602.24044"},"observation_digest":"sha256:9bec5cd4d87738d55219aacec8b4287f906649bb7d711844492e675a19cb8dc3","observation_id":"bc657ccd-90b0-4be8-815d-7c2b060a9bb7","resolution":{"observed_at":"2026-08-02T20:10:08.996368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:10:08.999561Z","title":"Parameter-efficient fine-tuning in large language models: a survey of methodologies","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.24044","last_updated":"2026-07-06T16:40:44Z","snapshot_observed_at":"2026-08-05T17:21:45.697907Z","submitted_at":"2026-02-27T14:22:51Z","title":"Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T20:10:08.999561Z"},"links":{"citing_paper":"/paper/2602.24044"},"observation_digest":"sha256:d0fb89ab99226db89af27da6bcb142b124c922c443a1683f0fbb8a04042bef6c","observation_id":"891765e7-c9dd-440d-8513-9a076fdbe722","resolution":{"observed_at":"2026-08-02T20:10:08.999561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:10:09.002086Z","title":"Finance lora adapter for llama-3.1-8b instruct","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.24044","last_updated":"2026-07-06T16:40:44Z","snapshot_observed_at":"2026-08-05T17:21:45.697907Z","submitted_at":"2026-02-27T14:22:51Z","title":"Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T20:10:09.002086Z"},"links":{"citing_paper":"/paper/2602.24044"},"observation_digest":"sha256:4bdec171948d28def2e8b35c1f9905c84857a547bce52689e8935dd6d49d928d","observation_id":"a8f7eb87-51b8-4e3e-ad3e-5bc027b201ca","resolution":{"observed_at":"2026-08-02T20:10:09.002086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:10:09.005354Z","title":"dlora: Dynamically orchestrating requests and adapters for lora llm serving, in: 18th USENIX Symposium on Operating Systems Design and Imple- mentation (OSDI 24), pp","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.24044","last_updated":"2026-07-06T16:40:44Z","snapshot_observed_at":"2026-08-05T17:21:45.697907Z","submitted_at":"2026-02-27T14:22:51Z","title":"Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T20:10:09.005354Z"},"links":{"citing_paper":"/paper/2602.24044"},"observation_digest":"sha256:47ed5e3f608d4a34dc51ebccf455887a4979f3ebc445df8ba6b46acf7ae6a9ec","observation_id":"05e5b63a-373b-4efc-ad73-542a674052bd","resolution":{"observed_at":"2026-08-02T20:10:09.005354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-02T20:10:09.007780Z","title":"Qwen2.5 technical re- port","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.24044","last_updated":"2026-07-06T16:40:44Z","snapshot_observed_at":"2026-08-05T17:21:45.697907Z","submitted_at":"2026-02-27T14:22:51Z","title":"Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T20:10:09.007780Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2602.24044"},"observation_digest":"sha256:7542d312bd854818197c09d5b86319050cd07063d858382f930e0a8afc97c126","observation_id":"d48b7ccf-1f00-41ef-b96d-406399b665e8","resolution":{"observed_at":"2026-08-02T20:10:09.007780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:10:09.010810Z","title":"Sql lora for llama-2-7b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.24044","last_updated":"2026-07-06T16:40:44Z","snapshot_observed_at":"2026-08-05T17:21:45.697907Z","submitted_at":"2026-02-27T14:22:51Z","title":"Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T20:10:09.010810Z"},"links":{"citing_paper":"/paper/2602.24044"},"observation_digest":"sha256:5e4fba2dadcf4534d504ed7ef10f91ba1af5ad26b4ed1440f04738012d0cdec6","observation_id":"a11e7cb8-9054-44ef-8339-f5fcbc1de873","resolution":{"observed_at":"2026-08-02T20:10:09.010810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:10:09.013776Z","title":"Orca: A distributed serving system for transformer-based generative models, in: 16th USENIX Symposium on Operating Systems Design and Implementation (OSDI 22), pp","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.24044","last_updated":"2026-07-06T16:40:44Z","snapshot_observed_at":"2026-08-05T17:21:45.697907Z","submitted_at":"2026-02-27T14:22:51Z","title":"Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T20:10:09.013776Z"},"links":{"citing_paper":"/paper/2602.24044"},"observation_digest":"sha256:bb28721464e4d32bb93408eb4da8104a53bd0f6bea2245d5b21324dd8c358f0e","observation_id":"dfefe2b4-30b1-4f6a-bbf2-5108a1e93d95","resolution":{"observed_at":"2026-08-02T20:10:09.013776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:10:09.017071Z","title":"Shepherd: Serving dnns in the wild, in: 20th USENIX Symposium on Networked Systems Design and Imple- mentation (NSDI 23), pp","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.24044","last_updated":"2026-07-06T16:40:44Z","snapshot_observed_at":"2026-08-05T17:21:45.697907Z","submitted_at":"2026-02-27T14:22:51Z","title":"Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T20:10:09.017071Z"},"links":{"citing_paper":"/paper/2602.24044"},"observation_digest":"sha256:1096e0a559ffa83f1c9df8e0b597b42b197d861e0175aca64083898c19a43f96","observation_id":"e8dc3b4a-6280-417c-9c12-19a398a439de","resolution":{"observed_at":"2026-08-02T20:10:09.017071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:10:09.020308Z","title":"Medical lora for qwen2.5-7b- instruc","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.24044","last_updated":"2026-07-06T16:40:44Z","snapshot_observed_at":"2026-08-05T17:21:45.697907Z","submitted_at":"2026-02-27T14:22:51Z","title":"Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T20:10:09.020308Z"},"links":{"citing_paper":"/paper/2602.24044"},"observation_digest":"sha256:1516d410e432f03ef57e0028f759ccab37a6e769b35964d0e8734d665ad4bcbe","observation_id":"6436fb1a-26a4-47bd-8d82-aff6012b05d2","resolution":{"observed_at":"2026-08-02T20:10:09.020308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:10:08.981876Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24044","last_updated":"2026-07-06T16:40:44Z","snapshot_observed_at":"2026-08-05T17:21:45.697907Z","submitted_at":"2026-02-27T14:22:51Z","title":"Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-02T20:10:08.981876Z"},"links":{"citing_paper":"/paper/2602.24044"},"observation_digest":"sha256:6377b525a6522a5e39a9196d8e25d8ac5e5793413058146cdac0dc3656dd4128","observation_id":"f6931a87-de69-4e14-86cd-972d2714ead2","resolution":{"observed_at":"2026-08-02T20:10:08.981876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:10:08.990224Z","title":"Proceedings of Machine Learning and Sys- tems 6, 296–311","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24044","last_updated":"2026-07-06T16:40:44Z","snapshot_observed_at":"2026-08-05T17:21:45.697907Z","submitted_at":"2026-02-27T14:22:51Z","title":"Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T20:10:08.990224Z"},"links":{"citing_paper":"/paper/2602.24044"},"observation_digest":"sha256:a5333bb1e10285d71c120462b92e5918515326a3abe0a538f788b2fb7147b91e","observation_id":"d4c5a457-55d4-4e16-b8be-eed0b6a16d19","resolution":{"observed_at":"2026-08-02T20:10:08.990224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:10:08.957354Z","title":"Poster session, San Diego, CA","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.24044","last_updated":"2026-07-06T16:40:44Z","snapshot_observed_at":"2026-08-05T17:21:45.697907Z","submitted_at":"2026-02-27T14:22:51Z","title":"Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T20:10:08.957354Z"},"links":{"citing_paper":"/paper/2602.24044"},"observation_digest":"sha256:e8b9b5f7b98e95ff28afef7f40a76e5c24994eaf9346a0f51f7bbb756bac581c","observation_id":"312734b0-5dc8-41d7-8b9c-7ce034606633","resolution":{"observed_at":"2026-08-02T20:10:08.957354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.24044","last_updated":"2026-07-06T16:40:44Z","latest_version":2,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-05T17:21:45.697907Z","submitted_at":"2026-02-27T14:22:51Z","title":"Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 0 inbound Pith citation observations for arXiv:2602.24044."}