{"as_of":"2026-08-08T20:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9e205b94c2064be20e7aad35aaf67053094b0fd6a9652fc7505fb704f2f9a729","coverage":[{"denominator":87,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":87,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T10:10:23.140836Z","state":"measured"},{"denominator":88,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":88,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T15:26:01.283448Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T15:30:17.957796Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"cited_work":{"arxiv_id":"2502.08182","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08182","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Memory offload- ing for large language model inference with latency slo guarantees.arXiv preprint arXiv:2502.08182","venue":null,"work_id":"d4ce496d-ffa3-4747-972d-2c9505021913","year":null},"citing_paper":{"arxiv_id":"2601.20309","last_updated":"2026-05-18T19:51:16Z","snapshot_observed_at":"2026-07-06T22:43:17.026472Z","submitted_at":"2026-01-28T07:01:46Z","title":"SuperInfer: SLO-Aware Rotary Scheduling and Memory Management for LLM Inference on Superchips","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-21T15:26:01.283448Z"},"links":{"cited_paper":"/paper/2502.08182","citing_paper":"/paper/2601.20309"},"observation_digest":"sha256:096055eb1f615307fddd535d721bb66930801c38d4313605b24028020353b426","observation_id":"0f7bd89d-1367-495f-859a-f4031d98415d","resolution":{"observed_at":"2026-05-21T15:30:17.959799Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.08182/citation-record","integrity":"/paper/2502.08182/integrity","json":"/paper/2502.08182/citation-record.json","paper":"/paper/2502.08182"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:22.710232Z","title":"URL https://huggingface.co/ docs/accelerate/index","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.710232Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:11d5ad2bc5b59432a53f83153511537c1dbd19079eb39ac721cc8ce33f347ed4","observation_id":"dfd3e3b5-9f1e-48c8-bd5b-a897ed731d4c","resolution":{"observed_at":"2026-08-08T10:10:22.710232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:22.716168Z","title":"URL https://sharegpt.com/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.716168Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:16c43008be538ad601aabfb18b6d9ce70d0b8bcaef4b7aade9dced0b49ac5eb9","observation_id":"ea0366ba-6bb8-4a30-9625-dce2bdc4c27f","resolution":{"observed_at":"2026-08-08T10:10:22.716168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:26.244148Z","title":"Acharya, B","venue":null,"work_id":"364ace30-8be6-494c-8ea6-6ae35072ee9c","year":2023},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.721928Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:06fd0a66387778b0eb833396636d75fe9927a5603319acc35dfc4f0e556db39e","observation_id":"c809b2a0-2bd0-4602-9c5b-dbf0129b93cd","resolution":{"observed_at":"2026-08-08T10:10:26.250091Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16434","last_updated":"2024-12-21T01:48:52Z","snapshot_observed_at":"2026-08-08T14:36:41.235069Z","submitted_at":"2024-12-21T01:48:52Z","title":"SYMPHONY: Improving Memory Management for LLM Inference Workloads","version":1},"cited_work":{"arxiv_id":"2412.16434","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.16434","snapshot_observed_at":"2026-08-08T10:10:26.073425Z","title":"SYMPHONY: Improving Memory Management for LLM Inference Workloads","venue":"cs.DC","work_id":"a26f6cdb-613c-432e-9211-428062c787f3","year":2024},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.727386Z"},"links":{"cited_paper":"/paper/2412.16434","citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:e5f978d6469a18810f665b4524208a04378592729d480ba08733f312c531f774","observation_id":"aea5f611-4591-4f01-8d04-77904f1a748f","resolution":{"observed_at":"2026-08-08T10:10:26.078778Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16369","last_updated":"2023-08-31T00:03:02Z","snapshot_observed_at":"2026-08-06T15:43:00.292272Z","submitted_at":"2023-08-31T00:03:02Z","title":"SARATHI: Efficient LLM Inference by Piggybacking Decodes with Chunked Prefills","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16369","snapshot_observed_at":"2026-08-08T10:10:22.732763Z","title":"Agrawal, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.732763Z"},"links":{"cited_paper":"/paper/2308.16369","citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:07bcba37ce8bc4b5b9385eb6d118d2ced8d16855453dd792315eb168e9c6fa9b","observation_id":"b16632af-cffe-4664-a125-b340c71fcf6f","resolution":{"observed_at":"2026-08-08T10:10:22.732763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11514","last_updated":"2024-07-30T23:37:20Z","snapshot_observed_at":"2026-07-06T17:04:50.608413Z","submitted_at":"2023-12-12T18:57:08Z","title":"LLM in a flash: Efficient Large Language Model Inference with Limited Memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11514","snapshot_observed_at":"2026-08-08T10:10:22.738166Z","title":"Alizadeh, I","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.738166Z"},"links":{"cited_paper":"/paper/2312.11514","citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:486e15a5cf7b7e98013ed3d104269ff5f0d1f9ef66de3eb65d9f51086f3327e2","observation_id":"e73bab42-7498-48f5-bf9d-7c33882b4062","resolution":{"observed_at":"2026-08-08T10:10:22.738166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:22.743842Z","title":"Alomari, N","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.743842Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:99785a08610e6322cca5b9a35dbecb45ddc73b88d30b90053ad8aef2bb6489f9","observation_id":"cf37bd70-da3b-4841-97b7-fd4028c59005","resolution":{"observed_at":"2026-08-08T10:10:22.743842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1404.2022","last_updated":"2014-04-08T06:50:36Z","snapshot_observed_at":"2026-07-06T03:40:36.456030Z","submitted_at":"2014-04-08T06:50:36Z","title":"Neutrino Production via $e^-e^+$ Collision at $Z$-boson Peak","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1404.2022","snapshot_observed_at":"2026-08-08T10:10:22.753134Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.753134Z"},"links":{"cited_paper":"/paper/1404.2022","citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:2c6dbd80e4bc697df49144b89a229a3533bf2c2b15a13c34106ba38e6e581403","observation_id":"64d1de85-13b0-46c8-b1a0-474069fc9f6b","resolution":{"observed_at":"2026-08-08T10:10:22.753134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01698","last_updated":"2025-05-15T02:46:53Z","snapshot_observed_at":"2026-08-08T08:03:05.182888Z","submitted_at":"2024-06-03T18:00:50Z","title":"Demystifying AI Platform Design for Distributed Inference of Next-Generation LLM models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01698","snapshot_observed_at":"2026-08-08T10:10:22.757378Z","title":"Bambhaniya, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.757378Z"},"links":{"cited_paper":"/paper/2406.01698","citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:af899523f40379340c0280fecc5227e30f78f49e1b01b4b8197df65314a04714","observation_id":"bd779b54-fef4-4499-b02c-d0d4df4e3041","resolution":{"observed_at":"2026-08-08T10:10:22.757378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14806","last_updated":"2023-11-16T11:47:05Z","snapshot_observed_at":"2026-07-06T15:32:18.583350Z","submitted_at":"2023-05-24T07:00:00Z","title":"AWESOME: GPU Memory-constrained Long Document Summarization using Memory Mechanism and Global Salient Content","version":2},"cited_work":{"arxiv_id":"2305.14806","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14806","snapshot_observed_at":"2026-08-08T10:10:25.984236Z","title":"AWESOME: GPU Memory-constrained Long Document Summarization using Memory Mechanism and Global Salient Content","venue":"cs.CL","work_id":"69877985-8ca2-4dda-8b14-42334a60e853","year":2023},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.761709Z"},"links":{"cited_paper":"/paper/2305.14806","citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:e5c9265238d0cc22ece253746d0aab86eb66de8545c15d0f37cfeaccdf57771d","observation_id":"99c060a7-b00f-4a3d-be13-bf570ed796c5","resolution":{"observed_at":"2026-08-08T10:10:25.989475Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-08T10:10:22.765947Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.765947Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:8ac3e944c476a5b27bf255d2bde24413e676045befc8fee89a1e2bc9dcfda6cf","observation_id":"2e3514d0-fad9-46f4-b93b-1a6e6adea279","resolution":{"observed_at":"2026-08-08T10:10:22.765947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:22.770073Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.770073Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:ce645cf520229c0ab56183afb7b03afc26ed8f8db04971336efb84b25dcb1df2","observation_id":"31fa23cf-a362-426c-bd5e-0524c2d95eaa","resolution":{"observed_at":"2026-08-08T10:10:22.770073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:22.779090Z","title":"Cheng, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.779090Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:35d54ade662b56eea97ef98aac37e8290786a7cd016001c18120f16a10d92355","observation_id":"3ec6d3e6-3e3c-4a2c-8d75-392c61dbe549","resolution":{"observed_at":"2026-08-08T10:10:22.779090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:25.733901Z","title":"Choquette, W","venue":null,"work_id":"137dcf6a-f09c-4a7e-9ebc-7c9f561de282","year":2021},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.783485Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:3c59fdfd3d48d561b696779674b7f1cea485106b7a4de31caa7dff172bd1c228","observation_id":"361882a4-e08b-49c1-b7f5-b9e10f42196d","resolution":{"observed_at":"2026-08-08T10:10:25.739015Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:22.788626Z","title":"Crankshaw, X","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.788626Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:20c1a25ce98cae6a9cf128d00a91c14c0231409801bde9ad69e2a4a38c3e7b6d","observation_id":"a217b87c-3eb6-4156-8223-f9e31b9318d4","resolution":{"observed_at":"2026-08-08T10:10:22.788626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:22.794421Z","title":"Crankshaw, G.-E","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.794421Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:a52e66b08ed92afc3aaca57b8ba4d8aacd8bd8dee21411e6f45790e71a921abd","observation_id":"0eb26b63-d62b-433a-b9dd-49bd525b9a5e","resolution":{"observed_at":"2026-08-08T10:10:22.794421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:22.804664Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.804664Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:7d409ecafe041d4fd8812942bf96480fdc1aaa70189b592c90155a72a64fc82d","observation_id":"8864959f-64f8-4c43-8edb-a01c5363656d","resolution":{"observed_at":"2026-08-08T10:10:22.804664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:26.621854Z","title":null,"venue":null,"work_id":"a085abda-63fa-4ecb-ac6e-0d788ff2c761","year":2023},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.809216Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:7ee71a51bf518d55847a7a7498c089660b5c60b10bba0f72e624eca651969820","observation_id":"2d267163-9e1d-4904-b99b-ae00d8b36c70","resolution":{"observed_at":"2026-08-08T10:10:26.626313Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:26.607774Z","title":null,"venue":null,"work_id":"1f98b173-9b46-4d07-a8c0-97ab651168c7","year":2022},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.815367Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:342342c17250ddcfb33a2dffc9aa3bd6e3c88906ee08497ae43b5836f2ebca81","observation_id":"c055ce8a-9ab6-43ec-9bda-0a119794ef09","resolution":{"observed_at":"2026-08-08T10:10:26.612178Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03518","last_updated":"2025-01-23T04:04:22Z","snapshot_observed_at":"2026-08-08T12:43:57.317563Z","submitted_at":"2024-07-03T21:34:26Z","title":"Improving LLM Abilities in Idiomatic Translation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03518","snapshot_observed_at":"2026-08-08T10:10:22.822360Z","title":"Donthi, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.822360Z"},"links":{"cited_paper":"/paper/2407.03518","citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:1edfdbdbe0fd77d60f3eadca0c1188fdb3096c1ef424fab1dff297da709479dd","observation_id":"868c2bb5-b7aa-4d78-b8f9-516d52af42b3","resolution":{"observed_at":"2026-08-08T10:10:22.822360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.20018","last_updated":"2024-07-29T13:53:27Z","snapshot_observed_at":"2026-07-06T18:53:22.585501Z","submitted_at":"2024-07-29T13:53:27Z","title":"Efficient Training of Large Language Models on Distributed Infrastructures: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.20018","snapshot_observed_at":"2026-08-08T10:10:22.827490Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.827490Z"},"links":{"cited_paper":"/paper/2407.20018","citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:4d8cb97893dca44f084a681bf42165f8f7d39f11b270d68eadd409d56d412ef1","observation_id":"b7d1cb3d-82fc-453c-be89-0574bc0e903d","resolution":{"observed_at":"2026-08-08T10:10:22.827490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:26.593906Z","title":"Elliott, M","venue":null,"work_id":"3f0c6426-0b39-425a-a168-bbe2c64cf687","year":2024},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.832686Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:3a8f8133de4353f8f8b33cc4bb005b677388cd47e61336e413b491733ffe1608","observation_id":"ad2081ed-afb5-4bab-9329-e09f717e306c","resolution":{"observed_at":"2026-08-08T10:10:26.598091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:26.579505Z","title":"Gambhir and V","venue":null,"work_id":"36353dd6-2d07-41c7-8674-fa8894c3183c","year":2017},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.837711Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:5176ff7d9b37903d07bc0a3597ddde2db189c02c611bf31fb04437af0ebeab4e","observation_id":"f513ccb5-2799-4452-84e7-1bf801a016da","resolution":{"observed_at":"2026-08-08T10:10:26.584171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:26.564535Z","title":null,"venue":null,"work_id":"552ad19a-68bd-476f-a191-91ea7fb41957","year":2024},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.842527Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:db425e894e5f6829d01e232659de2ce43ec510bd87c0a6017ec7047c681254c3","observation_id":"aab287a1-5331-43ed-9816-6b4d6f824e8a","resolution":{"observed_at":"2026-08-08T10:10:26.569988Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05004","last_updated":"2024-10-07T13:03:45Z","snapshot_observed_at":"2026-08-02T07:44:22.597823Z","submitted_at":"2024-10-07T13:03:45Z","title":"Fast State Restoration in LLM Serving with HCache","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05004","snapshot_observed_at":"2026-08-08T10:10:22.848211Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.848211Z"},"links":{"cited_paper":"/paper/2410.05004","citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:54c542078fb50463012e7b298b19d1140da053483b8b6ed54e8a71c721e8bb9b","observation_id":"05f2565b-fce5-4450-aa48-bc54c5e0504e","resolution":{"observed_at":"2026-08-08T10:10:22.848211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14527","last_updated":"2024-07-22T10:56:19Z","snapshot_observed_at":"2026-07-06T18:04:00.217896Z","submitted_at":"2024-04-22T18:56:18Z","title":"M\\'elange: Cost Efficient Large Language Model Serving by Exploiting GPU Heterogeneity","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14527","snapshot_observed_at":"2026-08-08T10:10:22.853443Z","title":"Griggs, X","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.853443Z"},"links":{"cited_paper":"/paper/2404.14527","citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:3965657ad418612df1d1e6899ad28ff3df33c0cd4edab27a3eca8ac31595c4c9","observation_id":"0875813d-2c66-4ca6-bea5-74fc4b222a31","resolution":{"observed_at":"2026-08-08T10:10:22.853443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:25.288060Z","title":null,"venue":null,"work_id":"a9c44380-4974-43ad-b399-1c3433d5fa09","year":2023},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.858724Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:5758fdae89e3216f0b2204603297f9e06372b1fbeb5c8d70d4dd7de527e9c01a","observation_id":"079c3fe8-7d92-4e73-9b8f-29ff9a898f21","resolution":{"observed_at":"2026-08-08T10:10:25.293444Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:26.550055Z","title":"Gujarati, R","venue":null,"work_id":"382ae7dc-f2df-4144-8806-20b10c5487ff","year":2020},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.863209Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:25e4aecf40d8b23ce4fda20b78cd2b509defae9bc8aca65411ca1a2e9284ea12","observation_id":"3e9542ac-3d38-458a-9453-dbf985ba63f4","resolution":{"observed_at":"2026-08-08T10:10:26.554673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:26.536024Z","title":"Gujarati, R","venue":null,"work_id":"5c110265-ae2e-40d3-9281-63312383f264","year":2020},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.867754Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:a78a9ad265720e93246339588713435d21e967fb0a572bf95ae759a45b08c98b","observation_id":"6c2f1dc1-ed41-4cce-8198-907b1da0d872","resolution":{"observed_at":"2026-08-08T10:10:26.540571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08671","last_updated":"2024-01-09T06:49:40Z","snapshot_observed_at":"2026-07-06T17:16:25.682072Z","submitted_at":"2024-01-09T06:49:40Z","title":"DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08671","snapshot_observed_at":"2026-08-08T10:10:22.872509Z","title":"Holmes, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.872509Z"},"links":{"cited_paper":"/paper/2401.08671","citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:1fae67ba280544561033f8dfb36d96d97305d74a5c088dc71ba588c72b2d2267","observation_id":"6bedb766-c3d8-4009-a6f4-8cabf5d05c7c","resolution":{"observed_at":"2026-08-08T10:10:22.872509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18679","last_updated":"2024-10-15T15:52:57Z","snapshot_observed_at":"2026-08-03T22:36:45.725094Z","submitted_at":"2024-02-28T19:49:55Z","title":"Data Interpreter: An LLM Agent For Data Science","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18679","snapshot_observed_at":"2026-08-08T10:10:22.878437Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.878437Z"},"links":{"cited_paper":"/paper/2402.18679","citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:4ca3f008cf438e0549e2478907272f91b5aa2d22d2071254782951cd9445cafb","observation_id":"4102a7aa-35ba-4dfa-8a29-3e9d8efcfe92","resolution":{"observed_at":"2026-08-08T10:10:22.878437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11181","last_updated":"2024-01-20T09:43:36Z","snapshot_observed_at":"2026-08-05T23:35:16.350557Z","submitted_at":"2024-01-20T09:43:36Z","title":"Inference without Interference: Disaggregate LLM Inference for Mixed Downstream Workloads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11181","snapshot_observed_at":"2026-08-08T10:10:22.887709Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.887709Z"},"links":{"cited_paper":"/paper/2401.11181","citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:9e4c4c0625f6b219b3571b69196b905507c12e8dd5a6711809dfb131f36b8243","observation_id":"7c6ccbed-f64c-4d5b-8fd7-4062c9ac36e2","resolution":{"observed_at":"2026-08-08T10:10:22.887709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-08T10:10:22.891857Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.891857Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:c383e060011cf07b41dde02369bbad70d2d8aff3b20160e3dbc0e1c0ee88a96c","observation_id":"c16fe9b7-a4e6-4618-80d9-5f3d3eb0c748","resolution":{"observed_at":"2026-08-08T10:10:22.891857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:26.520592Z","title":"Jayaram Subramanya, D","venue":null,"work_id":"444f63c3-40c4-4897-bd03-529a0e898580","year":null},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.896278Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:daa018fcf34becc9f68b68707c796c55356d4d20a33a6457d2f71ac3eb0f7fea","observation_id":"080b3edf-e083-4039-befa-b6418483dec4","resolution":{"observed_at":"2026-08-08T10:10:26.525397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01142","last_updated":"2024-11-02T05:15:44Z","snapshot_observed_at":"2026-07-06T19:43:59.326124Z","submitted_at":"2024-11-02T05:15:44Z","title":"NEO: Saving GPU Memory Crisis with CPU Offloading for Online LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01142","snapshot_observed_at":"2026-08-08T10:10:22.904998Z","title":"Jiang, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.904998Z"},"links":{"cited_paper":"/paper/2411.01142","citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:79258fefb794a55fdc3ec66c97703d3c71dca59192bf9fdd053433a61e1bbd15","observation_id":"d1d0193d-511a-475f-be6f-ed6b8ca82988","resolution":{"observed_at":"2026-08-08T10:10:22.904998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12488","last_updated":"2024-12-17T02:44:43Z","snapshot_observed_at":"2026-07-06T20:08:16.471575Z","submitted_at":"2024-12-17T02:44:43Z","title":"A System for Microserving of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12488","snapshot_observed_at":"2026-08-08T10:10:22.910074Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.910074Z"},"links":{"cited_paper":"/paper/2412.12488","citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:b665f1eea75f8f7f93495601d6215119ffdf0907d0d776f2d752bab1dc684e98","observation_id":"8d8bef64-1fbb-4748-884f-0e9ed2d915f8","resolution":{"observed_at":"2026-08-08T10:10:22.910074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08147","last_updated":"2024-08-15T13:32:25Z","snapshot_observed_at":"2026-07-06T19:01:06.124684Z","submitted_at":"2024-08-15T13:32:25Z","title":"P/D-Serve: Serving Disaggregated Large Language Model at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08147","snapshot_observed_at":"2026-08-08T10:10:22.915120Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.915120Z"},"links":{"cited_paper":"/paper/2408.08147","citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:a086bfb9d42830a26b3028620ecf9fe9acc581f0ffd8e802b66d872c1bb680ea","observation_id":"98edf3ec-67d3-4150-bca6-d89a37b78ddb","resolution":{"observed_at":"2026-08-08T10:10:22.915120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:22.920018Z","title":"Kasner and O","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.920018Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:72f4278a9fe542b782e685eda0d9d5fff1d52ef3173fae58179b95a988d66880","observation_id":"71ab360a-47e1-4829-a2cc-787f9493e12a","resolution":{"observed_at":"2026-08-08T10:10:22.920018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04636","last_updated":"2024-02-07T07:39:27Z","snapshot_observed_at":"2026-08-05T00:34:55.766743Z","submitted_at":"2024-02-07T07:39:27Z","title":"TransLLaMa: LLM-based Simultaneous Translation System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04636","snapshot_observed_at":"2026-08-08T10:10:22.924765Z","title":"Koshkin, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.924765Z"},"links":{"cited_paper":"/paper/2402.04636","citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:9aa6ea628bd1e93e011e0b6b3bf8db5398d1161212efcb5f4cdf8320b6991a2a","observation_id":"551ac547-c551-4136-985d-96db252a50a6","resolution":{"observed_at":"2026-08-08T10:10:22.924765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:26.507395Z","title":"Koziolek, S","venue":null,"work_id":"d917e082-fccb-48f8-8202-848cf506fa1f","year":null},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.929391Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:0a98d47151a89b3ac42468887f0be01b7414e851258e505bbcd48c78f59d23a8","observation_id":"b6999be8-0db9-4b49-9d4b-110ca6713b84","resolution":{"observed_at":"2026-08-08T10:10:26.511870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:25.014050Z","title":null,"venue":null,"work_id":"672c1c67-edd1-4f0b-b090-3ae3d6bd8b97","year":2023},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.939282Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:31dd029aec14fa54bc6b8caec211291cc9a6afd77566849403ead33929a151f7","observation_id":"8a8b374e-b10d-4e9a-9594-7daa28bf3f7d","resolution":{"observed_at":"2026-08-08T10:10:25.018864Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:26.492866Z","title":null,"venue":null,"work_id":"e8cc2254-dd53-4fc4-b586-bd4ee68f6a0b","year":null},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.943986Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:80e27c0dbd5f261886b4ea55af1534b84515ae89a5dff3834a0e295cd7c993a9","observation_id":"843c7021-a90c-4e97-831c-8d9dcc4d6a57","resolution":{"observed_at":"2026-08-08T10:10:26.497975Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:24.613726Z","title":null,"venue":null,"work_id":"f6ead3de-cbd2-4211-b760-935dd6091694","year":2019},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.953648Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:44fb13cbcdd9c94cf80995011cb673860c2ed9fdb3f9dc787635fa9ffe55ae2d","observation_id":"3bd7c19c-e72d-450c-8ce4-93341d3e4ac1","resolution":{"observed_at":"2026-08-08T10:10:24.618588Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:22.958296Z","title":"Li and Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.958296Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:6b8d755065f79df9d3a54885d2c283a093b48b85bbb9976f611750d5b475b138","observation_id":"1c8af5f9-0bca-478e-a65f-338ecd210b1d","resolution":{"observed_at":"2026-08-08T10:10:22.958296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:24.768967Z","title":"ISBN 9798400705793","venue":null,"work_id":"082d562b-733c-4d2d-b093-94b389c81bcc","year":null},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.934079Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:806c81343343fb94f4d647c8fcffd7d3290fde57b6af35fa91887d6ece738e15","observation_id":"00cfd601-3e0b-45c4-bde4-0a203f62de22","resolution":{"observed_at":"2026-08-08T10:10:24.774126Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:26.445517Z","title":null,"venue":null,"work_id":"8f6128da-cb0c-4633-a381-5ee52bd9005d","year":null},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.969690Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:0b7937657945a7bbafbc452ebb7080b11cfb770efb14e864c094680cf8414292","observation_id":"67037a46-e217-4161-9602-77ce5d054a37","resolution":{"observed_at":"2026-08-08T10:10:26.451086Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02213","last_updated":"2023-12-03T07:03:04Z","snapshot_observed_at":"2026-07-06T16:56:49.877351Z","submitted_at":"2023-12-03T07:03:04Z","title":"JarviX: A LLM No code Platform for Tabular Data Analysis and Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02213","snapshot_observed_at":"2026-08-08T10:10:22.978430Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.978430Z"},"links":{"cited_paper":"/paper/2312.02213","citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:7d6a69a13975bd0b2691c13a50718cd851ebc90796190614364d66a0fa91d606","observation_id":"78c06f67-3fea-4181-9542-0d3614066805","resolution":{"observed_at":"2026-08-08T10:10:22.978430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:26.477108Z","title":"ISBN 978-1-939133-40-3","venue":null,"work_id":"bfd588fb-f562-4fed-ba3e-1cad6b9d57bc","year":null},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.948862Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:1cff5ae70bbf276f3280ee3e473ca950fc7787c4f2b7d844ec2533aa67118beb","observation_id":"933940f3-c2ba-45f7-842e-3de9c9c88baa","resolution":{"observed_at":"2026-08-08T10:10:26.482902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:22.989448Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.989448Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:027d68c135168e3641fe97f7bb38b00d77c5cffe03f6e845972181d0dc845870","observation_id":"3ee6f993-8a04-4e54-b4ac-517074a9be2b","resolution":{"observed_at":"2026-08-08T10:10:22.989448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:24.351923Z","title":"Patel, E","venue":null,"work_id":"6e9ed554-3544-4495-8a6c-6cd178de57a1","year":2024},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.994847Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:3516b12e1cd6d7941cbe9cdf3c68f306518c9e368b5abe8217b7775a3be54ee6","observation_id":"1869ca4a-04c4-436d-80ab-e9a07dd08f58","resolution":{"observed_at":"2026-08-08T10:10:24.356569Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:26.461873Z","title":null,"venue":null,"work_id":"733a81a9-a35a-4858-8bf7-a944acd55f57","year":2023},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.964842Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:ff37406d123a7a143e801c085bcfa97dec15c96799e3e33df9803c6ec2119dce","observation_id":"23f0e975-cf2d-4376-aefd-7619d2c91c38","resolution":{"observed_at":"2026-08-08T10:10:26.467178Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03107","last_updated":"2023-08-06T13:18:38Z","snapshot_observed_at":"2026-07-06T16:03:06.694839Z","submitted_at":"2023-08-06T13:18:38Z","title":"Embedding-based Retrieval with LLM for Effective Agriculture Information Extracting from Unstructured Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03107","snapshot_observed_at":"2026-08-08T10:10:23.008155Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:23.008155Z"},"links":{"cited_paper":"/paper/2308.03107","citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:a5ce1f9e2c8f56c4aae5c4edd1f6268e3429f52750008c0a5f85ce13560a10e2","observation_id":"d3080e40-7188-4226-b8df-5d76f9baf677","resolution":{"observed_at":"2026-08-08T10:10:23.008155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-07-06T17:11:55.112404Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-08-08T10:10:22.973785Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.973785Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:fb573041b4f739197d7d973beb1976a19d0af30334ddb2d5d82a060daad21f46","observation_id":"2edf95f3-8250-47f2-b3ef-aa5241ad9e9d","resolution":{"observed_at":"2026-08-08T10:10:22.973785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:26.398547Z","title":"Radford, J","venue":null,"work_id":"4d489860-04af-476f-881e-598cef3117ea","year":2019},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:23.018461Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:8afe84961e5238b3e2b186d6adfd19f907b54a775c180173e4bfc125c6aa297d","observation_id":"859140e1-5240-453b-bb61-92f8c698617f","resolution":{"observed_at":"2026-08-08T10:10:26.403802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05975","last_updated":"2024-10-12T03:20:44Z","snapshot_observed_at":"2026-08-08T14:35:50.035070Z","submitted_at":"2024-07-08T14:18:28Z","title":"LLaMAX: Scaling Linguistic Horizons of LLM by Enhancing Translation Capabilities Beyond 100 Languages","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05975","snapshot_observed_at":"2026-08-08T10:10:22.983923Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.983923Z"},"links":{"cited_paper":"/paper/2407.05975","citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:eab36d0ef41ee567b4c4c384e56e377b755f3d1202ba3b3842087cae94ded886","observation_id":"89689631-2df4-43fd-acbb-f8bd492b7d58","resolution":{"observed_at":"2026-08-08T10:10:22.983923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:23.925683Z","title":null,"venue":null,"work_id":"c0453ff6-647a-4766-a0b2-d59d73f91157","year":2019},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:23.027812Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:20356a9340ca103d816410dbb2b9e1a05b732ea54d36f1e176b6fff5523a8ed5","observation_id":"b5ab214a-be66-4b90-be9b-270b12727c8d","resolution":{"observed_at":"2026-08-08T10:10:23.940852Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:26.368322Z","title":"Sheng, L","venue":null,"work_id":"e9d5eaa6-ce14-41ef-83c9-e4d3ef58e58a","year":2023},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:23.031820Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:3fc027695b48992524b127b2d1aaf691c3a11a85b7fe2595e6abffa3ae3f5925","observation_id":"ee04131e-c1a4-4b82-a082-b917a0c239fc","resolution":{"observed_at":"2026-08-08T10:10:26.372442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:26.428998Z","title":"Patke, D","venue":null,"work_id":"e02aff39-63b5-4e00-a04d-29d0581f8a2d","year":2024},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.999634Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:1e96fa8675a052de930189a3a37d9df9724f0c7c45d3109d58573aee259e6b24","observation_id":"b1865967-9974-40fd-9d08-a0f2b497d8ef","resolution":{"observed_at":"2026-08-08T10:10:26.434280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:24.178237Z","title":"ISBN 9798400712869","venue":null,"work_id":"1829fefe-0376-4bbf-8b05-bdd605e387d3","year":null},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:23.003701Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:bdeaa68a5639508a16d922b821e8e69c6c8856bfb58865f3338b2736b17af8cb","observation_id":"9dd51793-6362-43ee-bb19-d1a6b6bfa105","resolution":{"observed_at":"2026-08-08T10:10:24.193122Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01876","last_updated":"2024-03-04T09:32:05Z","snapshot_observed_at":"2026-07-06T17:39:03.755444Z","submitted_at":"2024-03-04T09:32:05Z","title":"D\\'ej\\`aVu: KV-cache Streaming for Fast, Fault-tolerant Generative LLM Serving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01876","snapshot_observed_at":"2026-08-08T10:10:23.045273Z","title":"Strati, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:23.045273Z"},"links":{"cited_paper":"/paper/2403.01876","citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:08b67466072c8da06a5b839ab17d62443900f55405cb3b22dcac7f32069885ad","observation_id":"662abd6e-5878-4a70-b9fb-c2d4c8dd6cf4","resolution":{"observed_at":"2026-08-08T10:10:23.045273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:26.414342Z","title":null,"venue":null,"work_id":"ff29a79a-4fbe-44e1-afed-4285bd16ef71","year":2021},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:23.013101Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:86f140c71b74ed9d16028bb2d9e872d1ed7d6f615f37b7ba594d5daeef3022f4","observation_id":"a99035e2-d60e-4602-a506-c98c8c941309","resolution":{"observed_at":"2026-08-08T10:10:26.419027Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:26.323641Z","title":"Taori, I","venue":null,"work_id":"4b54e69e-8037-4c20-944a-b03499c14035","year":2023},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:23.055114Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:448083ac46c4ceb0f0b1057ffba9ed452f0ccd6252932345ef2bf4636fb633b0","observation_id":"39c68a13-1fb8-4926-a96e-7bd0d068d316","resolution":{"observed_at":"2026-08-08T10:10:26.329163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:26.383443Z","title":null,"venue":null,"work_id":"b1fa0eb5-f931-4e86-bd46-7ed87dc44c0f","year":2021},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:23.023103Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:efd03b22d558b24ebae2a3c5559c0cb1b165d75dc0b9c632cfe7f19560b01fe2","observation_id":"94410835-311f-4f22-8d66-a29178cc0ccd","resolution":{"observed_at":"2026-08-08T10:10:26.388049Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01632","last_updated":"2024-11-06T18:04:35Z","snapshot_observed_at":"2026-08-04T17:38:49.392434Z","submitted_at":"2024-03-03T22:38:35Z","title":"SynCode: LLM Generation with Grammar Augmentation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01632","snapshot_observed_at":"2026-08-08T10:10:23.065020Z","title":"Ugare, T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:23.065020Z"},"links":{"cited_paper":"/paper/2403.01632","citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:80357da1feb69c4e223f8b58ace9a7c32ad0e417b055be06a0785b1decf88464","observation_id":"57493d46-6d0c-4de4-b325-1d93336b9913","resolution":{"observed_at":"2026-08-08T10:10:23.065020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-08T10:10:23.069757Z","title":"Vaswani, N","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:23.069757Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:b823b526fdc10a26c39a178fa6f4519285b2d01ce88891ee7b4fb42c378ffb04","observation_id":"7c171c9a-a435-4661-abb7-c565c78cbb53","resolution":{"observed_at":"2026-08-08T10:10:23.069757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:23.740185Z","title":null,"venue":null,"work_id":"5d95b185-b3f6-4713-87f1-0234d503b26a","year":2022},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:23.036534Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:bd68441215d61d5e48c0cd5098f7f8081c44e586422bb92a3870b7984b563478","observation_id":"e7d609aa-25e5-40d3-9b0b-0a22d781f7de","resolution":{"observed_at":"2026-08-08T10:10:23.745609Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:26.354678Z","title":"Sivakumar","venue":null,"work_id":"740c6df2-55c5-4d0a-9f76-334debf231d1","year":2024},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:23.040912Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:5a94326eab253a5e8dfc6aea04d4f76270756bf11cd1e85649b3dd6b26399110","observation_id":"9c88a061-ac65-4cc4-9197-81ade5109dc1","resolution":{"observed_at":"2026-08-08T10:10:26.358754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-08T10:10:23.089056Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:23.089056Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:5b7e60cc19fc0a71f259199363a0c148011bb7ad09f66ed3c6a1009259ae2741","observation_id":"04c34b7b-ae75-4b9c-b79b-59d040fa0e2e","resolution":{"observed_at":"2026-08-08T10:10:23.089056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:26.340133Z","title":null,"venue":null,"work_id":"7932c624-ef1c-4c9d-a701-5ae011294ae1","year":2024},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:23.050027Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:03effdc551b7e77338921dfb6cf73021939a0ffde616697ecd551ed47e61be5e","observation_id":"74f6e1bd-4e2e-472b-ad3c-45f13b31fea5","resolution":{"observed_at":"2026-08-08T10:10:26.345078Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00428","last_updated":"2024-10-09T11:40:31Z","snapshot_observed_at":"2026-07-06T19:25:06.162911Z","submitted_at":"2024-10-01T06:23:17Z","title":"LayerKV: Optimizing Large Language Model Serving with Layer-wise KV Cache Management","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00428","snapshot_observed_at":"2026-08-08T10:10:23.098928Z","title":"Xiong, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:23.098928Z"},"links":{"cited_paper":"/paper/2410.00428","citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:7c36e3f4edf46303ef5aaa9a5615c53dc7e5734607451df028fb7d064e1687e4","observation_id":"702c9932-288c-49ce-8502-41fabbff8863","resolution":{"observed_at":"2026-08-08T10:10:23.098928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-08T10:10:23.060164Z","title":"Touvron, L","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:23.060164Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:be33b43d7614786bfdcb8445d40c88f112aa77f15920045af8f7d65dae939012","observation_id":"7ef46cc2-c744-4699-ab3a-3650b3babf5b","resolution":{"observed_at":"2026-08-08T10:10:23.060164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:26.292242Z","title":null,"venue":null,"work_id":"e28d188d-90c8-4bdb-8382-8cfa3eaa7344","year":2022},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:23.108846Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:7aaf75f2a59581d4809b9807a918a629d43710b07244c764ffaf8b0fd88bbff9","observation_id":"73c879ee-4105-496f-9fea-418b7edf8bb9","resolution":{"observed_at":"2026-08-08T10:10:26.297051Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-08-08T10:10:23.113427Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:23.113427Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:0c506c7656d81d9c35116259a1de3327409e678f7e19bb66e6ff6d81edee8c4f","observation_id":"6ed6c039-3b37-495c-8cbe-b021ae7d85a0","resolution":{"observed_at":"2026-08-08T10:10:23.113427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10560","last_updated":"2023-05-25T23:50:07Z","snapshot_observed_at":"2026-07-06T14:33:11.945106Z","submitted_at":"2022-12-20T18:59:19Z","title":"Self-Instruct: Aligning Language Models with Self-Generated Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10560","snapshot_observed_at":"2026-08-08T10:10:23.074632Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:23.074632Z"},"links":{"cited_paper":"/paper/2212.10560","citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:269c1c7204450014c48a99f7277c98af37d904d036fe0d7afc2a6c24ae78307d","observation_id":"85a06af6-94c4-4c7d-8068-6b465a061033","resolution":{"observed_at":"2026-08-08T10:10:23.074632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:26.307381Z","title":null,"venue":null,"work_id":"1df4f996-5715-4abf-99e4-a97972aea3a1","year":null},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:23.079314Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:4769032556717205cd83474bc88b5f4633ffb1f73c66a3044323521c22844116","observation_id":"31e23aa1-de2f-45ca-a08b-7f8daffda8d9","resolution":{"observed_at":"2026-08-08T10:10:26.312598Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05920","last_updated":"2024-09-25T05:57:51Z","snapshot_observed_at":"2026-07-06T15:25:24.491136Z","submitted_at":"2023-05-10T06:17:50Z","title":"Fast Distributed Inference Serving for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.05920","snapshot_observed_at":"2026-08-08T10:10:23.083720Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:23.083720Z"},"links":{"cited_paper":"/paper/2305.05920","citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:07ae9f95380d6b5752c83798c324c4675685a67e5964fa3f794e026d47a8b48d","observation_id":"d9e39e33-03ee-45d4-9459-ef5051e604bf","resolution":{"observed_at":"2026-08-08T10:10:23.083720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:26.261649Z","title":"Zhong, S","venue":null,"work_id":"c7ad0f57-1dbd-4b15-9fc4-474a71d9875e","year":2024},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:23.130873Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:d0049bbe4fe19ab098173f0551994a4d01256195c2ce35ee0aab1834aad428f6","observation_id":"1fb437f5-8eb6-4b00-9e21-9ba31727476f","resolution":{"observed_at":"2026-08-08T10:10:26.266298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02839","last_updated":"2023-07-08T07:50:44Z","snapshot_observed_at":"2026-07-31T11:50:50.971090Z","submitted_at":"2023-07-06T08:13:53Z","title":"Enhancing LLM with Evolutionary Fine Tuning for News Summary Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02839","snapshot_observed_at":"2026-08-08T10:10:23.094126Z","title":"Xiao and X","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:23.094126Z"},"links":{"cited_paper":"/paper/2307.02839","citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:94e552915daf2ea80af24e57bf67872d6a55cd032d8a8e669d0a905b3d5da4f8","observation_id":"7d24709d-5531-4835-a6a8-ae200dff1cbb","resolution":{"observed_at":"2026-08-08T10:10:23.094126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2020.acl-main.121","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:23.174206Z","title":null,"venue":null,"work_id":"fa7af1fc-33cd-458b-94b0-9b545cad3ad6","year":2020},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:23.140836Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:a19147f5b5854c7f8bd142725f88d18a63cd940be6c17b0cf40a358ebfd3fe7a","observation_id":"49859a21-b5f5-4422-afb2-cbf81ec3b713","resolution":{"observed_at":"2026-08-08T10:10:23.181192Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03067","last_updated":"2024-09-04T20:38:14Z","snapshot_observed_at":"2026-08-07T00:39:57.646385Z","submitted_at":"2024-09-04T20:38:14Z","title":"A Comparative Study of Offline Models and Online LLMs in Fake News Detection","version":1},"cited_work":{"arxiv_id":"2409.03067","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.03067","snapshot_observed_at":"2026-08-08T10:10:23.311655Z","title":"A Comparative Study of Offline Models and Online LLMs in Fake News Detection","venue":"cs.SI","work_id":"e83ffc1f-ab32-4d91-a225-34b886cf6c20","year":2024},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:23.103915Z"},"links":{"cited_paper":"/paper/2409.03067","citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:f1e827c071ae6e5209f3e5a06f787c5ef3d385209bdda90013ec3545bbd9d9a7","observation_id":"e0698959-7015-43d3-ab8a-17a0f7d293ca","resolution":{"observed_at":"2026-08-08T10:10:23.316805Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:26.276608Z","title":"Zhang, Y","venue":null,"work_id":"1e8725ab-7ec3-4cd9-aa3f-c1707fbddcf7","year":2023},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:23.118218Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:dd378ca881cf4326bf811856ce38b166725c2050941cc104fae9a04383ae3f80","observation_id":"684d01be-6bba-4e3a-b5c0-df6027b1f96b","resolution":{"observed_at":"2026-08-08T10:10:26.282165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-08T10:10:23.122052Z","title":"Zhang, S","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:23.122052Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:e385f567139fdeaf158c3c9acbe132ec5c416fe73c2eb30411655782521ecf25","observation_id":"d4a23382-f0b9-483a-aa37-fb196362d0f2","resolution":{"observed_at":"2026-08-08T10:10:23.122052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12117","last_updated":"2025-01-15T08:03:55Z","snapshot_observed_at":"2026-07-06T18:47:29.911559Z","submitted_at":"2024-07-16T18:59:49Z","title":"MEMO: Fine-grained Tensor Management For Ultra-long Context LLM Training","version":3},"cited_work":{"arxiv_id":"2407.12117","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.12117","snapshot_observed_at":"2026-08-08T10:10:23.259659Z","title":"MEMO: Fine-grained Tensor Management For Ultra-long Context LLM Training","venue":"cs.LG","work_id":"476b2e58-3d4b-4623-b0df-85cbeb42c94a","year":2024},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:23.126229Z"},"links":{"cited_paper":"/paper/2407.12117","citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:215901f04571553fb466f6a974c80a88e13a60bfab64c4f85dc16cfb67a05d35","observation_id":"c1d5ee91-2e11-40cb-943f-04393324bc8c","resolution":{"observed_at":"2026-08-08T10:10:23.264959Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02643","last_updated":"2024-02-04T23:42:02Z","snapshot_observed_at":"2026-07-06T17:25:09.951423Z","submitted_at":"2024-02-04T23:42:02Z","title":"LLM-Enhanced Data Management","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02643","snapshot_observed_at":"2026-08-08T10:10:23.135618Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:23.135618Z"},"links":{"cited_paper":"/paper/2402.02643","citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:efff273bcb6e03362fdcf58b4c3a0a6266215c56ea74d5c4c4b298c2d268da00","observation_id":"78ff80cd-7750-4a06-bf4b-db00c4e2132a","resolution":{"observed_at":"2026-08-08T10:10:23.135618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:25.536045Z","title":"ISBN 9781450381376","venue":null,"work_id":"19255522-6c6d-4ca0-8400-69a9ba2902d8","year":null},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.799477Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:b9d3054f13b2dfa7c5f5bfc564216f900c573ca2667547fd98f42a18d472cdf9","observation_id":"9c7f6cc5-0cdd-4cf1-83c4-8069fea15ff8","resolution":{"observed_at":"2026-08-08T10:10:25.541451Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.csl.2021","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:10:23.223343Z","title":"doi: https://doi.org/10.1016/j.csl.2021","venue":null,"work_id":"c5d84bb6-fc97-406c-b54c-1466157b10c6","year":2021},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.748456Z"},"links":{"citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:5a84a2c10324557dbf82a4822ad8517ee1303de228d83937446c69ec970240ef","observation_id":"863f88bd-2095-4e28-8bc3-5619ec192cf1","resolution":{"observed_at":"2026-08-08T10:10:23.228323Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10181","last_updated":"2025-02-09T15:55:44Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T16:59:11Z","title":"Practical offloading for fine-tuning LLM on commodity GPU via learned sparse projectors","version":2},"cited_work":{"arxiv_id":"2406.10181","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.10181","snapshot_observed_at":"2026-08-08T10:10:25.944940Z","title":"Practical offloading for fine-tuning LLM on commodity GPU via learned sparse projectors","venue":"cs.DC","work_id":"4d58c5e9-c01c-4398-b95c-bb5955aecc1e","year":2024},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.774052Z"},"links":{"cited_paper":"/paper/2406.10181","citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:27ec5518c118ee4d0beb87133cbbf2eb4c1319edb2ba8bafbf0e058b40a4cc44","observation_id":"c827061c-605c-455c-b76a-ab5a0c378816","resolution":{"observed_at":"2026-08-08T10:10:25.951139Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees"},"reference_resolution":{"displayed":87,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":55,"verified_exact":18,"verified_fuzzy":14},"total_outbound_references":87},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 87 of 87 outbound references and 1 inbound Pith citation observation for arXiv:2502.08182."}