{"as_of":"2026-08-04T05:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cd62d09b2b088f6c5de7a7327653f5d95ecdacc339c87fb133d8fc93d2ef2e68","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T10:33:00.445749Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-03T06:30:56.289259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T12:16:10.904456Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-12T18:15:00.917874Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"cited_work":{"arxiv_id":"2604.16400","doi":"10.48550/arxiv.2604.16400","metadata_source":"pith","pith_arxiv_id":"2604.16400","snapshot_observed_at":"2026-07-12T18:15:00.917874Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","venue":"cs.DC","work_id":"9a36f8a3-e4a3-4630-b5b7-ff8138839389","year":2026},"citing_paper":{"arxiv_id":"2607.02544","last_updated":"2026-06-24T05:57:19Z","snapshot_observed_at":"2026-07-12T12:16:06.570774Z","submitted_at":"2026-06-24T05:57:19Z","title":"Not Every Sync Is Safe: Calibrated DiLoCo Scheduling for Shared AI Infrastructure","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-12T12:16:10.904456Z"},"links":{"cited_paper":"/paper/2604.16400","citing_paper":"/paper/2607.02544"},"observation_digest":"sha256:ca47074bebf205ea598fe39a6c2235d90fadd592b19c18fc8d513b8d5dfdb657","observation_id":"20c7d213-03f7-42e7-b8d9-1be3412ad707","resolution":{"observed_at":"2026-07-12T12:18:48.204349Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2604.16400/citation-record","integrity":"/paper/2604.16400/integrity","json":"/paper/2604.16400/citation-record.json","paper":"/paper/2604.16400"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"(2023) Github copilot","venue":null,"work_id":"a0438c77-0b7f-4736-96c8-b7f3e2f83c5a","year":2023},"citing_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:00.445749Z"},"links":{"citing_paper":"/paper/2604.16400"},"observation_digest":"sha256:6a8d01c04ad403f1b7aa03b31416eec3971564bad735b2abad9db3e4b03ce625","observation_id":"775ea295-3671-4c55-a06b-644f12684d2b","resolution":{"observed_at":"2026-05-21T10:34:07.876878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"befcfbbd-b2de-4e26-9b88-a00718db3580","year":2023},"citing_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:00.445749Z"},"links":{"citing_paper":"/paper/2604.16400"},"observation_digest":"sha256:cac529c5a39b6add704e6072cc910743c7b97aa45e64aea975f8ded9508f1b48","observation_id":"9192094e-7af7-40e9-a642-b62d659bdfcd","resolution":{"observed_at":"2026-05-21T10:34:07.873951Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"(2022) Chatgpt: Optimizing language models for dialogue","venue":null,"work_id":"175760ad-434a-4f5e-8548-0a00838c51c2","year":2022},"citing_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:00.445749Z"},"links":{"citing_paper":"/paper/2604.16400"},"observation_digest":"sha256:0103ff11dcc6d89b3144356096b7cde545550067f218f6e77cdf8c0fe5ae096c","observation_id":"ed653408-5948-4088-9d6f-0c33e71ca280","resolution":{"observed_at":"2026-05-21T10:34:07.871447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3719664","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:53:50.775939Z","title":"A review on edge large language models: Design, execution, and applications","venue":null,"work_id":"330bda7d-3e5b-48b6-b53e-c3c2d88c42e1","year":2025},"citing_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:00.445749Z"},"links":{"citing_paper":"/paper/2604.16400"},"observation_digest":"sha256:f437852325e915e0948da12b1d12185d759c3ab8c7e822bc965da7d02e802af9","observation_id":"65a5ec62-2864-4bc9-b10d-8c05786e360f","resolution":{"observed_at":"2026-05-21T10:34:06.931096Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mobile edge intelligence for large language models: A contemporary survey","venue":null,"work_id":"23b0d0c0-3ca2-4a8b-a4f1-59932eb8cffe","year":2025},"citing_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:00.445749Z"},"links":{"citing_paper":"/paper/2604.16400"},"observation_digest":"sha256:75acd5ed4319f8df7b13055389b1181e3d92da10b34134c193ee59f61cc10655","observation_id":"f2113891-e3dd-47f7-8a76-d74edbc4d43e","resolution":{"observed_at":"2026-05-21T10:34:07.861644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring parameter-efficient fine-tuning to enable foundation models in feder- ated learning","venue":null,"work_id":"0a138d63-4e13-4c9b-baf2-963aafa39f2b","year":2024},"citing_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:00.445749Z"},"links":{"citing_paper":"/paper/2604.16400"},"observation_digest":"sha256:8bb2f07af8af227bcb2ba390b52c998f92975938c4ab06e59eec95ae9225a6d3","observation_id":"f6bbf74a-4cbd-4060-bf8d-106b9bad304c","resolution":{"observed_at":"2026-05-21T10:34:07.851757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Heterogeneous LoRA for federated fine-tuning of on-device foundation models","venue":null,"work_id":"f3d13d93-5a19-4439-8d75-8e0ee71a5ca7","year":2024},"citing_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:00.445749Z"},"links":{"citing_paper":"/paper/2604.16400"},"observation_digest":"sha256:7a3ecd33f06898ebdd1676ba3a456675d120e9a6b87b56b36ee4e2022e46d77e","observation_id":"96d713be-7495-44c1-8ddb-92f6f4c5a614","resolution":{"observed_at":"2026-05-21T10:34:07.854222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2025.353112","doi":"10.1109/tpds.2025.3531123","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Federated fine-tuning for pre-trained foundation models over wireless networks","venue":null,"work_id":"cb981a6e-402d-4538-8f44-78e983070cf4","year":2025},"citing_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:00.445749Z"},"links":{"citing_paper":"/paper/2604.16400"},"observation_digest":"sha256:a5fb81e3f5743a192574e66c662b2c84600c412c53f9ca06e8cac6506a612b81","observation_id":"e1195fcc-cfbb-4e19-969c-390963878770","resolution":{"observed_at":"2026-05-21T10:34:06.923091Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T11:07:02.139855Z","title":"LoRA: Low-rank adaptation of large language models","venue":null,"work_id":"4e87050d-de4c-4aaf-9053-79c037dba7f0","year":2022},"citing_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:00.445749Z"},"links":{"citing_paper":"/paper/2604.16400"},"observation_digest":"sha256:6ec5b64b8a2bb0c054e477282aed51198313823ca25b58008c1fda98fe9dbe57","observation_id":"2ddfaebd-12b1-497d-8eda-e1f240aff3bf","resolution":{"observed_at":"2026-05-21T10:34:07.848824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond scale: the diversity coefficient as a data quality metric demonstrates llms are pre-trained on formally diverse data","venue":null,"work_id":"c269f5b7-689c-4efe-8c12-dbb858d888c4","year":2023},"citing_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:00.445749Z"},"links":{"citing_paper":"/paper/2604.16400"},"observation_digest":"sha256:6c1f31d383630dd4e0d1f0d1c0ca1c0d0d8db486027f071691c811a9d11d3ae7","observation_id":"c3cbe103-acca-4c20-a093-1928c8fbbe31","resolution":{"observed_at":"2026-05-21T10:34:07.843236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DeepBoot: Dynamic Scheduling System for Training and Inference Deep Learning Tasks in GPU Cluster","venue":null,"work_id":"8fbe411e-29ac-4e3b-8607-fbcf46b1958a","year":2023},"citing_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:00.445749Z"},"links":{"citing_paper":"/paper/2604.16400"},"observation_digest":"sha256:d839d6a5a5589a28c4d1b8b8b8658a8550f354dfbe3929220f9623bf08e0b746","observation_id":"49bcd51f-07f6-4fe6-8c07-ffcd311d5c5a","resolution":{"observed_at":"2026-05-21T10:34:07.845891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3689031","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T21:33:58.462483Z","title":"Multiplexing dynamic deep learning workloads with slo-awareness in gpu clusters","venue":null,"work_id":"fd2831a9-53c6-49ed-a9a0-1cee5ababf8c","year":2025},"citing_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:00.445749Z"},"links":{"citing_paper":"/paper/2604.16400"},"observation_digest":"sha256:8d95293feb76e3c7822e3f39c08c57cf2640c212ecdc8dfa665170a73fd60e85","observation_id":"3ddc8af0-704b-4d46-997c-109aed6be3f6","resolution":{"observed_at":"2026-05-21T10:34:06.934184Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":"2001.08361","doi":"10.1145/3616855.3635845","metadata_source":"pith","pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Scaling Laws for Neural Language Models","venue":"cs.LG","work_id":"b7dd8749-9c45-4977-ab9b-64478dce1ae8","year":2020},"citing_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:00.445749Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2604.16400"},"observation_digest":"sha256:5a5a22f9b7c2a4606b929b7e8981549703d6f8a1ed649d445695d1bd825811fe","observation_id":"4b8318f0-0267-4140-b2ee-3a1106ac983d","resolution":{"observed_at":"2026-05-21T10:34:07.208947Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2326.358744","doi":"10.1145/3552326.3587442","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Lyra: Elastic scheduling for deep learning clusters","venue":null,"work_id":"e1307e19-6ca6-403c-82bc-1fce2a41d52a","year":2023},"citing_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:00.445749Z"},"links":{"citing_paper":"/paper/2604.16400"},"observation_digest":"sha256:7788b3d6a43849e27baf95a9609f21c36ff0d987824afb8202a0aaf56082b217","observation_id":"db49b4a8-191e-4a31-b0ac-7b94630a49fe","resolution":{"observed_at":"2026-05-21T10:34:06.930067Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-11T03:19:20.798897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T03:19:20.798897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Serving hetero- geneous machine learning models on Multi-GPU servers with Spatio- Temporal sharing","venue":null,"work_id":"f011868e-ecc7-4779-ac47-f1c9c67e67c8","year":2022},"citing_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:00.445749Z"},"links":{"citing_paper":"/paper/2604.16400"},"observation_digest":"sha256:9b2a194069f1a531a506abfd7659c78662784aafde58f195314512c94ad8a75a","observation_id":"2c5c4f4c-e305-4ee6-9ee7-b5077943bad7","resolution":{"observed_at":"2026-05-21T10:34:07.834860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"(2023) Multi-process service (mps)","venue":null,"work_id":"6acf4d05-dbbc-4383-a265-49ee883499f3","year":2023},"citing_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:00.445749Z"},"links":{"citing_paper":"/paper/2604.16400"},"observation_digest":"sha256:2b2199459b97f1441ce76b3bb9fb695b8d84b14a32991b1b028826a8e50a80b0","observation_id":"2a03124e-a738-473a-b4ff-8092765c21fd","resolution":{"observed_at":"2026-05-21T10:34:07.837262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Shepherd : Serving DNNs in the Wild","venue":null,"work_id":"4a792bef-884c-4ee6-933d-dee437059067","year":2023},"citing_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:00.445749Z"},"links":{"citing_paper":"/paper/2604.16400"},"observation_digest":"sha256:bec2c2274814584460a8340c5cae73e8e5054bb69edffef889a3b5c3c3443210","observation_id":"5e589751-e464-4d9e-87e2-0527db0ee71a","resolution":{"observed_at":"2026-05-21T10:34:07.831997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Federated Learning while Pro- viding Model as a Service: Joint Training and Inference Optimization","venue":null,"work_id":"5ce49162-f252-43a4-8ebc-8b45cb40c329","year":2024},"citing_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:00.445749Z"},"links":{"citing_paper":"/paper/2604.16400"},"observation_digest":"sha256:16d53be7aa7fa2cd480b6e9e3ec408df4562680b0e57e411ae7c775fa4694308","observation_id":"77f0ca7c-c4e4-40c6-bed2-4fa9fa9740ae","resolution":{"observed_at":"2026-05-21T10:34:07.827137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Communication-efficient learning of deep networks from decentralized data","venue":null,"work_id":"c310870d-8f85-479d-bbef-c121d4a34119","year":2017},"citing_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:00.445749Z"},"links":{"citing_paper":"/paper/2604.16400"},"observation_digest":"sha256:ac206658f359fb4771c302e1b0bc0cf1cde6333dc2a25ca41b60fc4dab964ac0","observation_id":"cba83386-c1de-4b08-9c7d-0c460e8cc593","resolution":{"observed_at":"2026-05-21T10:34:07.830485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fedadapt: Adaptive offloading for iot devices in federated learning","venue":null,"work_id":"c7e586a1-8aac-47e7-b006-7aaa67c45bb2","year":2022},"citing_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:00.445749Z"},"links":{"citing_paper":"/paper/2604.16400"},"observation_digest":"sha256:2bec92f401865749de810599dd4821374bdf44756f8ec5f6e0f68ba37fdf31f1","observation_id":"5b5e2263-c77a-47ff-91f4-4d3f828cf7f8","resolution":{"observed_at":"2026-05-21T10:34:07.866515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qlora: Efficient finetuning of quantized llms","venue":null,"work_id":"a6c9acb6-c79e-4b51-a8ca-beef3f72db8e","year":2023},"citing_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:00.445749Z"},"links":{"citing_paper":"/paper/2604.16400"},"observation_digest":"sha256:5b5d2d4d3fb4c963e3afac96a8d44fc69809cc7c875efcb359034df1889c6a05","observation_id":"074ad771-90d2-4000-8bd0-d8228d83cb25","resolution":{"observed_at":"2026-05-21T10:34:07.868958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.06098","last_updated":"2023-01-19T08:21:44Z","snapshot_observed_at":"2026-07-06T11:38:02.479171Z","submitted_at":"2021-08-13T07:16:40Z","title":"FedPara: Low-Rank Hadamard Product for Communication-Efficient Federated Learning","version":3},"cited_work":{"arxiv_id":"2108.06098","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.06098","snapshot_observed_at":"2026-06-29T10:23:17.950956Z","title":"Fedpara: Low-rank hadamard product for communication-efficient federated learning.arXiv preprint arXiv: 2108.06098","venue":null,"work_id":"e2aaa36c-e39a-41a2-9820-5933399a4ef5","year":2021},"citing_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:00.445749Z"},"links":{"cited_paper":"/paper/2108.06098","citing_paper":"/paper/2604.16400"},"observation_digest":"sha256:93a7c9c529228e13be0539e052422124e6c44c8839039969498ccdc834a3c817","observation_id":"e3827efd-b301-4c5a-b170-b681ef926f0d","resolution":{"observed_at":"2026-05-21T10:34:07.204964Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05638","last_updated":"2022-08-26T16:23:29Z","snapshot_observed_at":"2026-07-06T13:08:59.614061Z","submitted_at":"2022-05-11T17:10:41Z","title":"Few-Shot Parameter-Efficient Fine-Tuning is Better and Cheaper than In-Context Learning","version":2},"cited_work":{"arxiv_id":"2205.05638","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.05638","snapshot_observed_at":"2026-07-04T11:09:46.495658Z","title":"Tam, D","venue":null,"work_id":"7f74e8fa-f34c-4991-bc0f-322b7e519b85","year":2022},"citing_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:00.445749Z"},"links":{"cited_paper":"/paper/2205.05638","citing_paper":"/paper/2604.16400"},"observation_digest":"sha256:b3ac81248b5e8cba57c4d3062703243f990ee01563bfa4dacd3b955bea1eadeb","observation_id":"993e34c6-12b1-4303-a6ee-487bc8fb2f64","resolution":{"observed_at":"2026-05-21T10:34:07.212972Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Don’t decay the learning rate, increase the batch size","venue":null,"work_id":"2d9896c0-c75d-4fe1-87e9-7ffd05fcb1da","year":2018},"citing_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:00.445749Z"},"links":{"citing_paper":"/paper/2604.16400"},"observation_digest":"sha256:4d1a5e03c351271c58aaf5546642858b86d33354735594f61513bebc0e0b5a83","observation_id":"4e16538c-c1d6-4348-9893-df8789664171","resolution":{"observed_at":"2026-05-21T10:34:07.829654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient Coordination of Federated Learning and Inference Offloading at the Edge: A Proactive Optimization Paradigm","venue":null,"work_id":"b877b258-2906-4e05-a792-7ad5a2e26380","year":2024},"citing_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:00.445749Z"},"links":{"citing_paper":"/paper/2604.16400"},"observation_digest":"sha256:619c44711808af9cbc5675cab58b2d3356e67a994b3654591fadef11880fb774","observation_id":"856899ea-8e0c-4e58-9267-f87205099c00","resolution":{"observed_at":"2026-05-21T10:34:07.866062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s10462-022-10246-w","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T01:47:44.566679Z","title":"Human-in-the-loop machine learning: a state of the art","venue":"Artificial Intelligence Review","work_id":"923270dc-7dde-4daa-b838-48d6fc10a7c6","year":2023},"citing_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:00.445749Z"},"links":{"citing_paper":"/paper/2604.16400"},"observation_digest":"sha256:c33613277c975ed9fbcfccc4f3ff83925d05f385194c7a5e261cca4373ad12b9","observation_id":"1c6d0ce5-703b-49f2-bc55-8b14ca1d3a10","resolution":{"observed_at":"2026-05-21T10:34:06.936589Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-17T20:21:26.022603+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-17T20:21:26.022603+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Illustrating reinforcement learning from human feedback (rlhf)","venue":null,"work_id":"fe442a59-393e-4bec-bacc-5606f3a75b59","year":2022},"citing_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:00.445749Z"},"links":{"citing_paper":"/paper/2604.16400"},"observation_digest":"sha256:7e454f769f12ef74bddf51411883682e8711b973276162e85fd8fcb4a4a20eab","observation_id":"6392a0aa-4de5-4cb6-8a33-36c724ff6297","resolution":{"observed_at":"2026-05-21T10:34:07.819819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"manim code","venue":null,"work_id":"2c849b31-ebbb-4509-8eae-ac52a040018a","year":null},"citing_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:00.445749Z"},"links":{"citing_paper":"/paper/2604.16400"},"observation_digest":"sha256:aff1853eb247671035e1a5b5f817e80b336fbc132b46f01bf45bc43aaa1e2e73","observation_id":"5c17ec63-b5f9-4c24-931e-c6dacb33ca8d","resolution":{"observed_at":"2026-05-21T10:34:07.812887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Codealpaca-20k","venue":null,"work_id":"e6dbddf2-0dcc-4cc3-b12c-1e6aea76727d","year":null},"citing_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:00.445749Z"},"links":{"citing_paper":"/paper/2604.16400"},"observation_digest":"sha256:2088bf949d36cff7bfd0106db741fc4f9cda5fd007d54f9455363849170b75bf","observation_id":"ff13a1f7-48aa-4196-b4d1-a180755a37da","resolution":{"observed_at":"2026-05-21T10:34:07.859220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"code instructions 120k alpaca","venue":null,"work_id":"11b76171-c148-45f9-911e-e338f0d543eb","year":null},"citing_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:00.445749Z"},"links":{"citing_paper":"/paper/2604.16400"},"observation_digest":"sha256:76a3096afbd56c0f6f8d819b44e29ceb6dcfa62abd884f5f1b11d241465eed90","observation_id":"ffbc9b68-049d-469a-849c-4b136ccf2b18","resolution":{"observed_at":"2026-05-21T10:34:07.810463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f8c17833-23f3-44f3-b1e6-93c13900d8a9","year":null},"citing_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:00.445749Z"},"links":{"citing_paper":"/paper/2604.16400"},"observation_digest":"sha256:0fe6d7aef8c97a2ab09b6329aa1c598cca4f2f7f7e3459f5dedaec5530e1047c","observation_id":"2ea815c5-59d5-4377-9774-f45126575679","resolution":{"observed_at":"2026-05-21T10:34:07.822289Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpteacher-general-instruct","venue":null,"work_id":"4b944045-ad18-4135-b915-f1242eec3e1e","year":null},"citing_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:00.445749Z"},"links":{"citing_paper":"/paper/2604.16400"},"observation_digest":"sha256:8a8f26e731c0b4e496abb8660e20363d802f1772e99554a6ecbfd4e1ce8962f8","observation_id":"376dbce9-94fa-438d-a184-177b33a9420d","resolution":{"observed_at":"2026-05-21T10:34:07.806230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"open-instruct-v1","venue":null,"work_id":"ec11519f-510a-44d5-9d68-79609e76f47d","year":null},"citing_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:00.445749Z"},"links":{"citing_paper":"/paper/2604.16400"},"observation_digest":"sha256:3d0a50b1b60e3c8d343ca1a163a5550b29c326241c3789e25a391b92345040d8","observation_id":"cd0fcd64-4f94-4791-859e-c6fc646776e7","resolution":{"observed_at":"2026-05-21T10:34:07.863998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1900.2025","doi":"10.1109/hpca61900.2025","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"URL https://doi.org/10.1109/HPCA61900.2025.00102","venue":null,"work_id":"9a3dd984-c85a-45b3-bb07-804460585f5b","year":2025},"citing_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:00.445749Z"},"links":{"citing_paper":"/paper/2604.16400"},"observation_digest":"sha256:f8bd1e895959e8482baf118ae5d31fc45986399e83993d002f6119d75c73eefb","observation_id":"7ba89d86-4fc0-48c2-a7bd-96e8b5223ab0","resolution":{"observed_at":"2026-05-21T10:34:06.923936Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:49:27.349189+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:49:27.349189+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"dLoRA: Dynamically Orchestrating Requests and Adapters for LoRA LLM Serving","venue":null,"work_id":"5afb768a-cc56-4d0e-bcbb-9f40d3bb080c","year":2024},"citing_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:00.445749Z"},"links":{"citing_paper":"/paper/2604.16400"},"observation_digest":"sha256:92fe46db300cee6752de7c4b57b1ef8f68fc36a4760ae014685f5db64616ee34","observation_id":"691d4f20-924d-4d59-b161-6d5e23210a1a","resolution":{"observed_at":"2026-05-21T10:34:07.801803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Peft: State-of-the-art parameter-efficient fine-tuning methods","venue":null,"work_id":"95f4f4ca-7d5a-4c63-95bf-fa6b80e47f3a","year":2022},"citing_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:00.445749Z"},"links":{"citing_paper":"/paper/2604.16400"},"observation_digest":"sha256:ca9a6b82f248322c1d28066412af4188d820497b4968fa391f068f27e9d8b708","observation_id":"6bb1b16b-5f8c-4308-aec2-d01ccc6cf215","resolution":{"observed_at":"2026-05-21T10:34:07.798265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Accelerating End-Cloud Collaborative Inference via Near Bubble-free Pipeline Opti- mization","venue":null,"work_id":"681e2abd-029a-4ab3-b9d2-41a030716b16","year":2025},"citing_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:00.445749Z"},"links":{"citing_paper":"/paper/2604.16400"},"observation_digest":"sha256:5ba30023b916dd0e1ce31d15304b3cae3b6091e20e75fe5457919b6545a97200","observation_id":"9deabcba-3c8a-4423-9614-3d4b59ffd3a6","resolution":{"observed_at":"2026-05-21T10:34:07.879424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adaptive parameter-efficient federated fine-tuning on heterogeneous devices","venue":null,"work_id":"4a597518-fa5b-47be-9529-90ee9d3fe6e7","year":2025},"citing_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:00.445749Z"},"links":{"citing_paper":"/paper/2604.16400"},"observation_digest":"sha256:abac72bcaebe884418b6f6850e48662fccab7495c4408cfba14ac64f2c19d1e3","observation_id":"b9b026c3-cf21-40d7-9e7c-92d9739bbaf2","resolution":{"observed_at":"2026-05-21T10:34:07.856667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Haflq: Heterogeneous adaptive federated lora fine-tuned llm with quantization","venue":null,"work_id":"b90e3907-0b98-470b-b96d-5100d835b949","year":null},"citing_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:00.445749Z"},"links":{"citing_paper":"/paper/2604.16400"},"observation_digest":"sha256:099aa7d4fa0a6fee0084829c29d1d2749eb7e0e9df5d5f7e8957876ddd47ed5f","observation_id":"0ba0af59-037b-42e1-a304-f5b9b825924d","resolution":{"observed_at":"2026-05-21T10:34:07.795435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06581","last_updated":"2025-05-16T11:03:52Z","snapshot_observed_at":"2026-07-06T19:48:10.800324Z","submitted_at":"2024-11-10T19:59:54Z","title":"HAFLQ: Heterogeneous Adaptive Federated LoRA Fine-tuned LLM with Quantization","version":2},"cited_work":{"arxiv_id":"2411.06581","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.06581","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Available: https://arxiv.org/abs/2411.06581","venue":null,"work_id":"709e06c4-f324-4757-b5b9-f68893078735","year":null},"citing_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:00.445749Z"},"links":{"cited_paper":"/paper/2411.06581","citing_paper":"/paper/2604.16400"},"observation_digest":"sha256:9e7f13d6034c9c6277a1cdfe9a789fecf6bc3d887f850a0cafa6f2dc486796d5","observation_id":"7e3457b9-2896-4ac6-94b7-9f907d69f673","resolution":{"observed_at":"2026-05-21T10:34:07.201257Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"FwdLLM: Efficient Feder- ated Finetuning of Large Language Models with Perturbed Inferences","venue":null,"work_id":"da1d6a94-d90d-462c-b9ca-ffe060882d2a","year":2024},"citing_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:00.445749Z"},"links":{"citing_paper":"/paper/2604.16400"},"observation_digest":"sha256:ee5a43ae46a3a493325c8ab53f1131c21469c381fef0a4430967c93f10579f8d","observation_id":"dce4c978-3b52-49dd-ad44-1d2bd507a384","resolution":{"observed_at":"2026-05-21T10:34:07.816008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Partitioned collaborative inference for on-device models via evolution- ary reinforcement learning","venue":null,"work_id":"2e503efb-e6be-428d-9fc2-12d69bafacc4","year":2025},"citing_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:00.445749Z"},"links":{"citing_paper":"/paper/2604.16400"},"observation_digest":"sha256:80a11d41473f6b79eea90518ae9da1666eafb5aef78a0cc6c7195806ab6faa19","observation_id":"eda66662-e4db-46cd-b83d-02ad304d67c3","resolution":{"observed_at":"2026-05-21T10:34:07.851507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6ced843a-36be-467f-8b86-7d0e4afda4f9","year":2025},"citing_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:00.445749Z"},"links":{"citing_paper":"/paper/2604.16400"},"observation_digest":"sha256:b1ba5a7ae04d638dfb5061d87837858822b69feb4749c5675f897f2d76c892f3","observation_id":"a0263514-3ee5-4ba5-8939-f3e0a02b3bae","resolution":{"observed_at":"2026-05-21T10:34:07.863773Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Online Resource Allocation for Edge Intelligence with Colocated Model Retraining and Inference","venue":null,"work_id":"f66b53a8-fd81-49d0-abe5-62912340eb17","year":1900},"citing_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:00.445749Z"},"links":{"citing_paper":"/paper/2604.16400"},"observation_digest":"sha256:2c550f421016765cf604ca840fe26574f4c7d3a6adfc3017a94e1bd3d17c4b86","observation_id":"91d9592c-0a08-4e0b-bf58-a671bfb206fe","resolution":{"observed_at":"2026-05-21T10:34:07.791808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LLMStation: Resource Multiplexing in Tuning and Serving Large Language Models","venue":null,"work_id":"9cb83c5b-24c4-4d8c-b3c1-d39a94d41f8c","year":2025},"citing_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:00.445749Z"},"links":{"citing_paper":"/paper/2604.16400"},"observation_digest":"sha256:a67c3f6a1a06a639d884d17f91d2a8f06ed3bb4ce386f0c3134cbfb601036c76","observation_id":"9e09f437-8138-45aa-9a9b-5e8af549157f","resolution":{"observed_at":"2026-05-21T10:34:07.786283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2402.18789","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T13:36:59.442458Z","title":"Flexllm: Token-level co-serving of llm inference and finetuning with slo guarantees","venue":null,"work_id":"4cfe121d-8e22-4be2-bda1-902450083b63","year":2024},"citing_paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-21T10:33:00.445749Z"},"links":{"citing_paper":"/paper/2604.16400"},"observation_digest":"sha256:2e92d20c664464c8a0eb41ec4153394a100431aeb22cfdc0a641ebe958a73b19","observation_id":"5fd616b3-b39c-44b0-af8c-264fbae54aa0","resolution":{"observed_at":"2026-05-21T10:34:07.216605Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.16400","last_updated":"2026-05-15T08:08:50Z","latest_version":2,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-03T05:06:36.867183Z","submitted_at":"2026-03-31T09:49:47Z","title":"CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":3,"verified_exact":7,"verified_fuzzy":32},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 1 inbound Pith citation observation for arXiv:2604.16400."}