{"as_of":"2026-08-05T12:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6b2745adff9ab4257227ac87a664108e6c1147570cabd6645286efb88df6cd1b","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T15:03:07.651839Z","state":"measured"},{"denominator":169,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":169,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":180,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T15:17:55.992637Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2310.01801","last_updated":"2024-10-29T18:26:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T05:17:08Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","version":4},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-17T11:11:21.460613Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2310.01801"},"observation_digest":"sha256:658d12ffca2db6f8e9c72a28c60788e7a1637b3f2799916fa65cba3821769f84","observation_id":"a09cee7c-e6fb-4a8d-8a7f-8e6db35e1ce7","resolution":{"observed_at":"2026-05-17T11:11:21.608774Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2310.11511","last_updated":"2023-10-17T18:18:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-17T18:18:32Z","title":"Self-RAG: Learning to Retrieve, Generate, and Critique through Self-Reflection","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-12T14:15:10.907921Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2310.11511"},"observation_digest":"sha256:abae3ee6bcc74ad9bc9a9f12122d47b8d56a1e63cd32fb809090a52554275546","observation_id":"44a29f19-7905-4a89-a7ad-7673f5708cf5","resolution":{"observed_at":"2026-05-12T15:03:08.022500Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2403.04652","last_updated":"2025-01-21T10:12:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-07T16:52:49Z","title":"Yi: Open Foundation Models by 01.AI","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-13T05:47:27.775529Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2403.04652"},"observation_digest":"sha256:aab6d1e1ff99c843a334fcb2d58a4353f2891532cbc4a506a3f409ef7882e39c","observation_id":"e90940b9-37a1-46b0-bbfb-bbd9e07b8577","resolution":{"observed_at":"2026-05-13T05:47:27.868094Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:2156a4085d6774a4e13686eca9ed025509f039c01a753ea02353f6448d4e0bfd","observation_id":"fd045068-0ad5-4337-b55a-975fd7ff9702","resolution":{"observed_at":"2026-05-12T15:03:08.022500Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2509.00081","last_updated":"2026-04-24T20:40:48Z","snapshot_observed_at":"2026-07-06T22:20:50.350336Z","submitted_at":"2025-08-26T23:17:33Z","title":"Enabling Transparent Cyber Threat Intelligence Combining Large Language Models and Domain Ontologies","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-18T20:31:49.857895Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2509.00081"},"observation_digest":"sha256:2155d8e03d4aaada742f8bf282dd3ed29578bd05c58d923ecfae93d54b48f045","observation_id":"84d3b738-2ec1-488c-a7a9-80e4e4f191b3","resolution":{"observed_at":"2026-05-18T20:32:50.776285Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2509.19182","last_updated":"2026-05-19T02:00:01Z","snapshot_observed_at":"2026-07-06T22:30:36.671861Z","submitted_at":"2025-09-23T15:57:42Z","title":"YAC: Bridging Natural Language and Interactive Visual Exploration with Generative AI for Biomedical Data Discovery","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T22:10:43.859139Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2509.19182"},"observation_digest":"sha256:c7d21f402cc4a219d29425b42cff293563297c4f7ef648fb687450ca474d888e","observation_id":"1a5eeee8-d283-4b6c-88b8-539ab86f7d08","resolution":{"observed_at":"2026-05-21T22:14:23.425786Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2509.19729","last_updated":"2026-04-22T06:30:11Z","snapshot_observed_at":"2026-08-03T15:52:53.487402Z","submitted_at":"2025-09-24T03:15:37Z","title":"Amoeba: Runtime Tensor Parallel Transformation for LLM Inference Services","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T14:59:38.194894Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2509.19729"},"observation_digest":"sha256:54e3abc49c548b1ba19c897afa0269dbe913e97fc777f8383eee16522af531bd","observation_id":"6e306f6b-cea3-4bfa-824d-2702ab97836a","resolution":{"observed_at":"2026-05-18T15:01:31.493359Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2509.19893","last_updated":"2026-04-03T01:16:52Z","snapshot_observed_at":"2026-08-03T00:01:04.239016Z","submitted_at":"2025-09-24T08:44:12Z","title":"Future Policy Approximation for Offline Reinforcement Learning Improves Mathematical Reasoning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2509.19893"},"observation_digest":"sha256:3c6240c0804f71adac1d49b48d313d5123334ee7479a0f6ad4b0043fc9c27c7e","observation_id":"8352fb9f-2190-44d3-9802-aee7ad2f0fb8","resolution":{"observed_at":"2026-05-18T14:41:29.206997Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2509.20491","last_updated":"2026-06-30T16:30:15Z","snapshot_observed_at":"2026-08-04T15:17:52.917693Z","submitted_at":"2025-09-24T19:09:09Z","title":"SpecDetect4ML: Detecting Non-Local ML Code Smells with Code Property Graphs","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T13:38:29.809045Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2509.20491"},"observation_digest":"sha256:5a108af163d1ace4fb083827af1d5054d3996b0d55539180bcbc6739f7b3fc5b","observation_id":"16ce4b77-a270-4a88-b99e-4a8ff69b7ace","resolution":{"observed_at":"2026-05-18T13:41:25.122310Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-04T15:17:55.992637Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.20491","last_updated":"2026-06-30T16:30:15Z","snapshot_observed_at":"2026-08-04T15:17:52.917693Z","submitted_at":"2025-09-24T19:09:09Z","title":"SpecDetect4ML: Detecting Non-Local ML Code Smells with Code Property Graphs","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:55.992637Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2509.20491"},"observation_digest":"sha256:284cd8e86b995f71d70d5d0c6d0d3a592fda7fbcc55a31870f594b6722001f59","observation_id":"fa27d06a-24dd-487a-a6f2-55b48744a6e2","resolution":{"observed_at":"2026-08-04T15:17:55.992637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2510.01409","last_updated":"2026-04-24T19:29:08Z","snapshot_observed_at":"2026-08-05T11:55:35.753439Z","submitted_at":"2025-10-01T19:46:15Z","title":"OntoLogX: Ontology-Guided Knowledge Graph Extraction from Cybersecurity Logs with Large Language Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-18T10:09:08.307199Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2510.01409"},"observation_digest":"sha256:cfe558fe4702a4fb310bce8aa6de795f645b71c3a72568856145e2ba7a93e007","observation_id":"3f5828a3-4a97-4d7e-acc2-6b66459574f5","resolution":{"observed_at":"2026-05-18T10:11:14.059288Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2510.04265","last_updated":"2026-05-12T01:55:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-05T16:14:03Z","title":"Don't Pass@k: A Bayesian Framework for Large Language Model Evaluation","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T10:04:39.223895Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2510.04265"},"observation_digest":"sha256:dfcbf25c4d4e5f4b28b1af8398679dd2a9964dfe450856bd8d9316d20a3b46fd","observation_id":"b09c3e4c-bd94-49fa-a538-a7ac835e08a2","resolution":{"observed_at":"2026-05-18T10:06:13.713378Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2510.06133","last_updated":"2026-05-26T03:39:22Z","snapshot_observed_at":"2026-08-04T11:16:44.535486Z","submitted_at":"2025-10-07T17:08:33Z","title":"CreditDecoding: Accelerating Parallel Decoding in Diffusion Large Language Models with Trace Credit","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T09:06:25.049493Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2510.06133"},"observation_digest":"sha256:30851dfdbdb97ce0b19a1403b35299ff3c6e53c3f349817beb4ede4255b9272e","observation_id":"0fdd69aa-b0f5-4dbb-93be-cdb0a736e4fc","resolution":{"observed_at":"2026-05-18T09:11:09.985826Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-04T11:16:46.216400Z","title":"Xiaoran Liu, Zhigeng Liu, Zengfeng Huang, Qipeng Guo, Ziwei He, and Xipeng Qiu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.06133","last_updated":"2026-05-26T03:39:22Z","snapshot_observed_at":"2026-08-04T11:16:44.535486Z","submitted_at":"2025-10-07T17:08:33Z","title":"CreditDecoding: Accelerating Parallel Decoding in Diffusion Large Language Models with Trace Credit","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T11:16:46.216400Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2510.06133"},"observation_digest":"sha256:9cf3a86d94dfe8267811d8dcbb530b31edc2631a151adc240383b23deb1c0ae6","observation_id":"f7b06a5f-0f9a-4511-bc40-5fe4f38a3c81","resolution":{"observed_at":"2026-08-04T11:16:46.216400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-04T00:32:58.992599Z","title":"Efficient Memory Manage- ment for Large Language Model Serving with PagedAttention,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.00651","last_updated":"2026-07-09T21:30:29Z","snapshot_observed_at":"2026-08-04T00:32:57.261230Z","submitted_at":"2025-11-01T18:19:41Z","title":"Leveraging Multi-Agent System (MAS) and Fine-Tuned Small Language Models (SLMs) for Automated Telecom Network Troubleshooting","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T00:32:58.992599Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2511.00651"},"observation_digest":"sha256:e53c1bf566840fe99c09c3b8757d92e84fcc7ea514316a6e50213b25338d08b4","observation_id":"91c3ed04-8613-45e9-bef5-9f8ce13c9ed3","resolution":{"observed_at":"2026-08-04T00:32:58.992599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2511.03092","last_updated":"2026-04-08T21:56:44Z","snapshot_observed_at":"2026-08-02T21:39:50.543195Z","submitted_at":"2025-11-05T00:38:31Z","title":"SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators","version":6},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T01:59:30.583027Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2511.03092"},"observation_digest":"sha256:76f1c4100ed7d2900e871c1c14ee25b2dccbe5d2277257f2fbcb8981b800bc91","observation_id":"f76bc791-9b01-41e9-a8b3-5726bb1c4118","resolution":{"observed_at":"2026-05-18T02:00:39.352517Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-03T23:30:25.092756Z","title":"Efficient memory management for large language model serving with pagedattention,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.05747","last_updated":"2026-07-05T01:13:42Z","snapshot_observed_at":"2026-08-03T23:30:15.305612Z","submitted_at":"2025-11-07T22:35:31Z","title":"CoT-X: An Adaptive Framework for Cross-Model Chain-of-Thought Transfer and Optimization","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T23:30:25.092756Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2511.05747"},"observation_digest":"sha256:f51c0d1b29b3f9415253d5be800ab63b48f8ba36c276111071774499b8a13aeb","observation_id":"e12f028e-a27a-49da-8839-6559f4736ef6","resolution":{"observed_at":"2026-08-03T23:30:25.092756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2511.06516","last_updated":"2026-06-28T18:20:13Z","snapshot_observed_at":"2026-08-03T23:21:36.698338Z","submitted_at":"2025-11-09T19:58:24Z","title":"You Had One Job: Per-Task Quantization Using LLMs' Hidden Representations","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-21T18:46:04.926179Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2511.06516"},"observation_digest":"sha256:7961a09b6e4759de1694c92f34a89086edda129cf9392a7200167cf366f87081","observation_id":"8a04c1cb-01ee-4d22-8017-2e79f859b5a6","resolution":{"observed_at":"2026-05-21T18:50:30.208417Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-03T23:21:39.362759Z","title":"H., Gonzalez, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.06516","last_updated":"2026-06-28T18:20:13Z","snapshot_observed_at":"2026-08-03T23:21:36.698338Z","submitted_at":"2025-11-09T19:58:24Z","title":"You Had One Job: Per-Task Quantization Using LLMs' Hidden Representations","version":4},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-03T23:21:39.362759Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2511.06516"},"observation_digest":"sha256:560be10bb3ed91389ea2e9e29cde6386a3bd9ca043d3a3f71b682d65945d305c","observation_id":"7bae5c0c-e4bc-491b-952a-6a0e910ed617","resolution":{"observed_at":"2026-08-03T23:21:39.362759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2511.07833","last_updated":"2026-05-09T19:03:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-11T05:03:22Z","title":"MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-17T23:13:43.754235Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2511.07833"},"observation_digest":"sha256:5d6229b42d50049dd96821e44a66aaa4b682cb2eacd70c1104d03df6031dd260","observation_id":"df5a381d-ad51-42b3-9a13-c7d69b8bf89b","resolution":{"observed_at":"2026-05-17T23:15:26.729709Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-03T17:22:04.070787Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.10054","last_updated":"2026-07-18T20:06:01Z","snapshot_observed_at":"2026-08-05T10:29:34.461734Z","submitted_at":"2025-12-10T20:19:10Z","title":"Parallel Decoder Transformer: Planner-Conditioned Latent Coordination for Model-Intrinsic Parallel Generation","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T17:22:04.070787Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2512.10054"},"observation_digest":"sha256:94560fd8af85dd0edf0704c66eff4930c80a271d47e3b49f351fac7c3b9dec2c","observation_id":"1ffd6fc1-8044-4e95-8afa-9db274f6991d","resolution":{"observed_at":"2026-08-03T17:22:04.070787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2512.20856","last_updated":"2025-12-24T00:24:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-24T00:24:05Z","title":"NVIDIA Nemotron 3: Efficient and Open Intelligence","version":1},"reference_index":111,"source":"arxiv_source","source_observed_at":"2026-05-18T01:40:42.190369Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2512.20856"},"observation_digest":"sha256:db86f885ae0ec4ba64fb27a38a632c035cddb0243976b8a31f21fc1040ba037b","observation_id":"21438ac9-8943-42c3-a3a1-ee107a5e15fb","resolution":{"observed_at":"2026-05-18T01:40:42.554096Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-03T14:10:35.629946Z","title":"Efficient memory management for large language model serving with pagedattention.arXiv preprint arXiv:2309.06180, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.21430","last_updated":"2026-06-03T18:06:11Z","snapshot_observed_at":"2026-08-03T15:13:16.061241Z","submitted_at":"2025-12-24T21:36:34Z","title":"EVE: A Generator-Verifier System for Generative Policies","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T14:10:35.629946Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2512.21430"},"observation_digest":"sha256:c8bea17e6be4ae45703f19ad3819fbc2b323a3032374e6fec479c9cc52d366d8","observation_id":"dabb644d-35e5-417d-9992-56045faa4ed3","resolution":{"observed_at":"2026-08-03T14:10:35.629946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-03T13:19:47.766001Z","title":"Hunter Lightman, Vineet Kosaraju, Yura Burda, Harri Edwards, Bowen Baker, Teddy Lee, Jan Leike, John Schulman, Ilya Sutskever, and Karl Cobbe","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24776","last_updated":"2025-12-31T10:51:32Z","snapshot_observed_at":"2026-08-03T13:19:45.909163Z","submitted_at":"2025-12-31T10:51:32Z","title":"Compute-Accuracy Pareto Frontiers for Open-Source Reasoning Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T13:19:47.766001Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2512.24776"},"observation_digest":"sha256:bcf2a6265ac9e12e2e6429faa99eb92458aef7b776d2918a96303c61f1564cc5","observation_id":"83f47a5b-8cb9-4c34-b86d-fe721771d66b","resolution":{"observed_at":"2026-08-03T13:19:47.766001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-03T12:29:43.908771Z","title":"InThe Thirty- eight Conference on Neural Information Processing Systems Datasets and Benchmarks Track","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.02986","last_updated":"2026-06-22T09:17:24Z","snapshot_observed_at":"2026-08-03T12:29:38.070183Z","submitted_at":"2026-01-06T12:53:53Z","title":"P-Check: Advancing Personalized Reward Model via Learning to Generate Dynamic Checklist","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T12:29:43.908771Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2601.02986"},"observation_digest":"sha256:7a78398e61fced02c4eef07ce99d6576338a27e09383ef91379a2ff90cd2ace5","observation_id":"e32ca7d8-4c0b-4a10-93a1-8148a62a2950","resolution":{"observed_at":"2026-08-03T12:29:43.908771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2601.11652","last_updated":"2026-04-07T01:02:52Z","snapshot_observed_at":"2026-07-06T22:41:58.373427Z","submitted_at":"2026-01-15T16:46:01Z","title":"WISP: Waste- and Interference-Suppressed Distributed Speculative LLM Serving at the Edge via Dynamic Drafting and SLO-Aware Batching","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T14:12:06.034679Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2601.11652"},"observation_digest":"sha256:0b69998e8eb0e8b6f9111b2978ff3fdd59038f243aded669bd985361fbf17b9b","observation_id":"79106028-0630-4467-b74d-e580f9316f61","resolution":{"observed_at":"2026-05-16T14:12:58.654290Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2601.13606","last_updated":"2026-04-29T05:49:25Z","snapshot_observed_at":"2026-07-06T22:42:12.887517Z","submitted_at":"2026-01-20T05:11:44Z","title":"ChartVerse: Scaling Chart Reasoning via Reliable Programmatic Synthesis from Scratch","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T13:12:01.889341Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2601.13606"},"observation_digest":"sha256:5db5f10d795f4655eb61af7441387c40f69e8bafce49cebfebfb7f9c8cd75b8c","observation_id":"55908e28-d2b4-4fda-8dfa-a68a54216ec3","resolution":{"observed_at":"2026-05-16T13:12:54.825297Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-03T09:30:00.354187Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.13836","last_updated":"2026-06-17T10:28:13Z","snapshot_observed_at":"2026-08-03T17:07:22.325179Z","submitted_at":"2026-01-20T10:47:20Z","title":"FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T09:30:00.354187Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2601.13836"},"observation_digest":"sha256:041d083d9a0dd1178eccb0502114dc3ae073e6047b216d420dc76449883a8023","observation_id":"0145f447-cc1b-4b41-8253-502b0bac7606","resolution":{"observed_at":"2026-08-03T09:30:00.354187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-03T08:03:24.576463Z","title":"11 Chin-Yew Lin","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.18350","last_updated":"2026-07-27T02:39:58Z","snapshot_observed_at":"2026-08-03T08:03:23.116120Z","submitted_at":"2026-01-26T10:54:06Z","title":"Adapter Merging Reactivates Latent Reasoning Traces: A Mechanism Analysis","version":5},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T08:03:24.576463Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2601.18350"},"observation_digest":"sha256:6b8f2ed5a15448a461d84b65674e024843b6f4955e9ab3833c71cf35e5b04a50","observation_id":"59a51cf2-28e8-489c-860c-e93b170f367c","resolution":{"observed_at":"2026-08-03T08:03:24.576463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2602.05695","last_updated":"2026-02-23T09:49:19Z","snapshot_observed_at":"2026-07-06T22:44:42.380489Z","submitted_at":"2026-02-05T14:21:00Z","title":"SweetSpot: An Analytical Model for Predicting Energy Efficiency of LLM Inference","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T07:05:56.380048Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2602.05695"},"observation_digest":"sha256:b195b02c4422cccb7db90add2cb0359683e566fe1a5be4788b11e474306b5863","observation_id":"53a6b8c7-9528-42b9-8dcf-2db0fd1a2a66","resolution":{"observed_at":"2026-05-16T07:07:29.603499Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-02T23:32:12.337470Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.13692","last_updated":"2026-06-30T17:19:18Z","snapshot_observed_at":"2026-08-02T23:32:10.162628Z","submitted_at":"2026-02-14T09:26:41Z","title":"ThunderAgent: A Simple, Fast and Program-Aware Agentic Inference System","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T23:32:12.337470Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2602.13692"},"observation_digest":"sha256:7e6c850ca279af6e4581d6259e11eb5bcb6348e5ce6805aa57f90325483aaec8","observation_id":"f5e16b7c-324e-4620-9fcc-84330660ff6a","resolution":{"observed_at":"2026-08-02T23:32:12.337470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-02T23:06:03.369714Z","title":"Kwon, W., Li, Z., Zhuang, S., Sheng, Y ., Zheng, L., Yu, C., Gonzalez, J., Zhang, H., and Stoica, I","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.14849","last_updated":"2026-05-29T14:05:41Z","snapshot_observed_at":"2026-08-02T23:06:01.640112Z","submitted_at":"2026-02-16T15:46:19Z","title":"Atomix: Timely, Transactional Tool Use for Reliable Agentic Workflows","version":2},"reference_index":714,"source":"pdf_text","source_observed_at":"2026-08-02T23:06:03.369714Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2602.14849"},"observation_digest":"sha256:2824e7c716ada03bb7083bae99f8cf24be27fff9174fee03ed780284626847eb","observation_id":"9c365dc1-ac4e-4c10-9549-d0a342db390b","resolution":{"observed_at":"2026-08-02T23:06:03.369714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-02T18:16:46.493319Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.14785","last_updated":"2026-07-26T17:22:03Z","snapshot_observed_at":"2026-08-02T18:16:43.947213Z","submitted_at":"2026-03-16T03:35:04Z","title":"SkipOPU: An FPGA-based Overlay Processor for Large Language Models with Dynamically Allocated Computation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T18:16:46.493319Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2603.14785"},"observation_digest":"sha256:932402c259757a5d3078d7b948ab5ec3e2300601a698179c0594d44a33b866f4","observation_id":"fd911f9d-4ae1-4fbf-8312-e4656226fca4","resolution":{"observed_at":"2026-08-02T18:16:46.493319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2603.29493","last_updated":"2026-04-07T07:28:08Z","snapshot_observed_at":"2026-07-06T22:51:13.690351Z","submitted_at":"2026-03-31T09:38:21Z","title":"MemFactory: Unified Inference & Training Framework for Agent Memory","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-14T00:02:14.821285Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2603.29493"},"observation_digest":"sha256:e48d39eeb2fd6673146c3df09dacf20fb475231d9ac72313162b4a7323ed3797","observation_id":"52ac49f6-aba6-43bb-97c0-4fc05963c61f","resolution":{"observed_at":"2026-05-14T00:03:28.661682Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2604.07345","last_updated":"2026-04-08T17:56:41Z","snapshot_observed_at":"2026-07-06T22:55:37.787732Z","submitted_at":"2026-04-08T17:56:41Z","title":"Measurement of Generative AI Workload Power Profiles for Whole-Facility Data Center Infrastructure Planning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T17:23:15.999195Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2604.07345"},"observation_digest":"sha256:f17f32ac677e829345de238497e0683a429c4a7483fa36386a83d1b77db07065","observation_id":"00658988-ccf1-4cf2-8028-d7dca793c69e","resolution":{"observed_at":"2026-05-12T15:03:08.022500Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2604.07760","last_updated":"2026-04-09T03:28:12Z","snapshot_observed_at":"2026-07-06T22:57:00.904627Z","submitted_at":"2026-04-09T03:28:12Z","title":"Reduced-Mass Orbital AI Inference via Integrated Solar, Compute, and Radiator Panels","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T18:07:40.881627Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2604.07760"},"observation_digest":"sha256:03a47b3b52a0c69052128213b63f997c43a2eae288356de5dfd3b0cf8d896ca3","observation_id":"e4a8daeb-d2d5-4605-9713-562afeb2418b","resolution":{"observed_at":"2026-05-12T15:03:08.022500Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2604.09593","last_updated":"2026-03-04T15:59:46Z","snapshot_observed_at":"2026-08-02T23:51:40.139079Z","submitted_at":"2026-03-04T15:59:46Z","title":"Benchmarking Compound AI Applications for Hardware-Software Co-Design","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T16:17:08.045511Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2604.09593"},"observation_digest":"sha256:33f832a0e912ef0cab7b94e01117e8f0d60eaf43cbac515d21575419310f873d","observation_id":"e52651ee-5d58-4c47-aa5c-48ab9dbc99c4","resolution":{"observed_at":"2026-05-15T16:20:09.892247Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2604.09952","last_updated":"2026-04-10T23:11:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-10T23:11:57Z","title":"SLM Finetuning for Natural Language to Domain Specific Code Generation in Production","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-10T16:38:30.184565Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2604.09952"},"observation_digest":"sha256:43db33d7958a5111012eed97164a0a7cbc91062fcac608bb024c2ae513c4dc5d","observation_id":"6d71ee04-a1e3-418d-8710-12d1b98f8dc7","resolution":{"observed_at":"2026-05-12T15:03:08.022500Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2604.11109","last_updated":"2026-04-13T07:25:12Z","snapshot_observed_at":"2026-07-06T22:59:36.571641Z","submitted_at":"2026-04-13T07:25:12Z","title":"Record-Remix-Replay: Hierarchical GPU Kernel Optimization using Evolutionary Search","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T15:55:04.835146Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2604.11109"},"observation_digest":"sha256:7a403d8bf5bf59e4638bb5eeb2c693095541d9eafa39d67ef3b920073b4624a7","observation_id":"10a927ef-35f0-4dea-bde0-019c641a9532","resolution":{"observed_at":"2026-05-12T15:03:08.022500Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2604.12056","last_updated":"2026-04-13T20:53:51Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:53:51Z","title":"LoSA: Locality Aware Sparse Attention for Block-Wise Diffusion Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T15:06:03.504804Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2604.12056"},"observation_digest":"sha256:d41984e699dfc39904f6030eca7589f96a6f92382fb07ad43304dc201f24ba75","observation_id":"e61aa8b3-c2d6-468f-a5e1-0615aa80d029","resolution":{"observed_at":"2026-05-12T15:03:08.022500Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-07-12T21:37:29.667707Z","title":"H., Gonzalez, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.12057","last_updated":"2026-06-18T23:24:41Z","snapshot_observed_at":"2026-07-12T21:37:19.431631Z","submitted_at":"2026-04-13T20:56:17Z","title":"Local Rules for Directing the Emergence of Global Properties in Complex Structures","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T21:37:29.667707Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2604.12057"},"observation_digest":"sha256:2658998a4c6bf87283d8997a3eedd1728d4f83aabd6323d4611a9dd4e47c775f","observation_id":"a87505b2-e5e1-4561-9e1c-d1794343e3d4","resolution":{"observed_at":"2026-07-12T21:37:29.667707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2604.14442","last_updated":"2026-04-15T21:34:48Z","snapshot_observed_at":"2026-07-06T23:02:13.885476Z","submitted_at":"2026-04-15T21:34:48Z","title":"Hierarchical vs. Flat Iteration in Shared-Weight Transformers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T12:59:34.289283Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2604.14442"},"observation_digest":"sha256:22efa9c719e1ff149086d5fd8768a7cb240a8ae1ca61c859ec12ebbb9ba4b583","observation_id":"a964f57f-d5ad-4310-aeaa-d56d086dd49e","resolution":{"observed_at":"2026-05-12T15:03:08.022500Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2604.16359","last_updated":"2026-05-19T20:19:49Z","snapshot_observed_at":"2026-07-06T23:03:43.854612Z","submitted_at":"2026-03-18T20:34:58Z","title":"LLM4Log: A Systematic Review of Large Language Model-based Log Analysis","version":1},"reference_index":133,"source":"pdf_text","source_observed_at":"2026-05-15T08:21:04.998443Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2604.16359"},"observation_digest":"sha256:ad47c7665a79c4d99f9f46a823eb6f10b4fa47593b877b61eb8854c085fda9c5","observation_id":"bf9c7bb6-5a24-4be6-a233-0cba20a5f1e3","resolution":{"observed_at":"2026-05-15T08:25:19.087407Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2604.16359","last_updated":"2026-05-19T20:19:49Z","snapshot_observed_at":"2026-07-06T23:03:43.854612Z","submitted_at":"2026-03-18T20:34:58Z","title":"LLM4Log: A Systematic Review of Large Language Model-based Log Analysis","version":2},"reference_index":133,"source":"pdf_text","source_observed_at":"2026-05-21T10:00:03.036921Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2604.16359"},"observation_digest":"sha256:bb31517fbdcd4e9560fcf56b78c66d8aebb61c01189c7cca68325933388ed2df","observation_id":"f8510faa-f26c-49eb-9d44-bcd0b9754c9e","resolution":{"observed_at":"2026-05-21T10:04:06.618589Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2604.16893","last_updated":"2026-04-18T07:56:32Z","snapshot_observed_at":"2026-07-06T23:04:05.813982Z","submitted_at":"2026-04-18T07:56:32Z","title":"EasyVideoR1: Easier RL for Video Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T07:41:27.231098Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2604.16893"},"observation_digest":"sha256:635aa56cc683af6c143f6b010bf863a16ad95afe5bd8944930bc4acf4a05a71c","observation_id":"49a2065e-77cc-4752-894b-5225250cbd7d","resolution":{"observed_at":"2026-05-12T15:03:08.022500Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2604.16957","last_updated":"2026-04-18T10:39:28Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T10:39:28Z","title":"Open-TQ-Metal: Fused Compressed-Domain Attention for Long-Context LLM Inference on Apple Silicon","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T07:18:26.936652Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2604.16957"},"observation_digest":"sha256:d4a455dc7c9ed7d42132fa1838eb708c3a746bfc8003735bc3c337d3cf3e5eb1","observation_id":"4806eeca-cb61-45cc-9895-cf72e050fb07","resolution":{"observed_at":"2026-05-12T15:03:08.022500Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2604.18002","last_updated":"2026-04-20T09:26:28Z","snapshot_observed_at":"2026-07-06T23:04:59.629739Z","submitted_at":"2026-04-20T09:26:28Z","title":"Neural Garbage Collection: Learning to Forget while Learning to Reason","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T04:57:12.923258Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2604.18002"},"observation_digest":"sha256:cbb037ad9eab001b16b418b11321f6711f1c98b543c00acadfbfaec86aa047b6","observation_id":"969bc451-96bf-41e1-85d8-f8af4cfde9ca","resolution":{"observed_at":"2026-05-12T15:03:08.022500Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2604.22117","last_updated":"2026-04-28T07:34:34Z","snapshot_observed_at":"2026-07-06T23:08:33.204647Z","submitted_at":"2026-04-23T23:32:36Z","title":"PermaFrost-Attack: Stealth Pretraining Seeding(SPS) for planting Logic Landmines During LLM Training","version":2},"reference_index":132,"source":"arxiv_source","source_observed_at":"2026-05-09T21:42:16.848186Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2604.22117"},"observation_digest":"sha256:93dca0877e6d893a2ca6117b417d1309aa9f2b36afb22325ccbd26dcc66f6c14","observation_id":"d3a847f2-9f36-4042-bdbf-bb6d3ec55701","resolution":{"observed_at":"2026-05-12T15:03:08.022500Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2604.22768","last_updated":"2026-03-25T17:38:20Z","snapshot_observed_at":"2026-08-02T08:16:48.215474Z","submitted_at":"2026-03-25T17:38:20Z","title":"Secure On-Premise Deployment of Open-Weights Large Language Models in Radiology: An Isolation-First Architecture with Prospective Pilot Evaluation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T00:22:23.136915Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2604.22768"},"observation_digest":"sha256:f334a0d3236dbfe1f642538a5cf86dc0a1d63c7e24c55ffc0d888d556159c394","observation_id":"147a6f06-0d99-4e6c-af08-006dcfa5ea24","resolution":{"observed_at":"2026-05-15T00:23:22.366584Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2604.24715","last_updated":"2026-04-27T17:23:37Z","snapshot_observed_at":"2026-08-02T10:33:56.860167Z","submitted_at":"2026-04-27T17:23:37Z","title":"Long-Context Aware Upcycling: A New Frontier for Hybrid LLM Scaling","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T03:39:37.485602Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2604.24715"},"observation_digest":"sha256:b79d76542509edcdce9b47d8c4291823ace00458840e488efdca8c8d53a181fa","observation_id":"56f30735-a94e-4f8b-83f8-bf582ad11a9b","resolution":{"observed_at":"2026-05-12T15:03:08.022500Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2604.25080","last_updated":"2026-04-28T00:24:29Z","snapshot_observed_at":"2026-08-02T22:43:47.990475Z","submitted_at":"2026-04-28T00:24:29Z","title":"CacheFlow: Efficient LLM Serving with 3D-Parallel KV Cache Restoration","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-07T15:32:32.808799Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2604.25080"},"observation_digest":"sha256:4fbd302fc0b48c73a7efc09807b89ac051558739a13e1c7d8e41cca041c4c616","observation_id":"7e876114-b1b1-4689-b641-77fa36e076c3","resolution":{"observed_at":"2026-05-12T15:03:08.022500Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2604.27476","last_updated":"2026-06-08T07:15:10Z","snapshot_observed_at":"2026-07-06T23:12:57.730833Z","submitted_at":"2026-04-30T06:18:50Z","title":"EdgeFM: Efficient Edge Inference for Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-07T08:30:35.264804Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2604.27476"},"observation_digest":"sha256:19d6dc8b25b320928a6be1f31c62199672e37477e983f2df828854b3ae1dae83","observation_id":"88eabef9-6c84-43c2-bf68-82201e3f6ab9","resolution":{"observed_at":"2026-05-12T15:03:08.022500Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2604.27476","last_updated":"2026-06-08T07:15:10Z","snapshot_observed_at":"2026-07-06T23:12:57.730833Z","submitted_at":"2026-04-30T06:18:50Z","title":"EdgeFM: Efficient Edge Inference for Vision-Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-01T08:54:41.845820Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2604.27476"},"observation_digest":"sha256:8e913620191160abb65d59e2cfa5e0ba810715a77bdaa19f12f5423f2207ec15","observation_id":"a5cc1126-612b-47d4-950e-78cad4bfa8b0","resolution":{"observed_at":"2026-07-01T08:55:34.739614Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.00519","last_updated":"2026-05-04T08:03:22Z","snapshot_observed_at":"2026-08-04T19:03:45.889341Z","submitted_at":"2026-05-01T08:45:47Z","title":"Silicon Showdown: Performance, Efficiency, and Ecosystem Barriers in Consumer-Grade LLM Inference","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-09T15:23:21.456692Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.00519"},"observation_digest":"sha256:1038cbedcef9379de5bdec76994ad13626d1c6aca18e3247dc66da2bce3fdd51","observation_id":"e09ce1cb-c9df-48ce-bcec-b1abddffe5b7","resolution":{"observed_at":"2026-05-12T15:03:08.022500Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.02568","last_updated":"2026-05-04T13:19:29Z","snapshot_observed_at":"2026-07-31T19:18:10.074012Z","submitted_at":"2026-05-04T13:19:29Z","title":"StreamIndex: Memory-Bounded Compressed Sparse Attention via Streaming Top-k","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-08T18:44:42.456111Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.02568"},"observation_digest":"sha256:dc49841c95a55b818093c5e03ccd935310a6513abf99ff0d61def2b25ca48db3","observation_id":"c0185c61-96ba-4647-8b6e-0a23c9aab31a","resolution":{"observed_at":"2026-05-12T15:03:08.022500Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.03351","last_updated":"2026-05-05T04:13:32Z","snapshot_observed_at":"2026-07-06T23:16:15.509235Z","submitted_at":"2026-05-05T04:13:32Z","title":"VLMaxxing through FrameMogging Training-Free Anti-Recomputation for Video Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-08T01:30:15.463051Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.03351"},"observation_digest":"sha256:4e0bbefca945a10ca4fd452196b1410cf41098d2094d0a7f286bd376733cd35d","observation_id":"a75bdfc5-750c-4315-8524-cfeecea13224","resolution":{"observed_at":"2026-05-12T15:03:08.022500Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.04763","last_updated":"2026-05-06T11:09:42Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T11:09:42Z","title":"How Does Chunking Affect Retrieval-Augmented Code Completion? A Controlled Empirical Study","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T17:26:49.023109Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.04763"},"observation_digest":"sha256:737414d2a0ff308697176220945d6f25f2a46243ae314c97b14a3b653e7f2398","observation_id":"6cb5c210-50d6-49c3-a800-a33efa8ae065","resolution":{"observed_at":"2026-05-12T15:03:08.022500Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.05219","last_updated":"2026-04-17T09:24:58Z","snapshot_observed_at":"2026-07-06T23:17:52.987860Z","submitted_at":"2026-04-17T09:24:58Z","title":"Sparse Prefix Caching for Hybrid and Recurrent LLM Serving","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T08:49:24.880528Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.05219"},"observation_digest":"sha256:f6b457f01fd2183b3a4d443b1767ddda675a7993276c7955a147f0c9693b0617","observation_id":"c992578f-207e-46e3-8e13-f0010e0a8f38","resolution":{"observed_at":"2026-05-12T15:03:08.022500Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.07865","last_updated":"2026-05-08T15:24:51Z","snapshot_observed_at":"2026-07-06T23:20:11.042952Z","submitted_at":"2026-05-08T15:24:51Z","title":"KL for a KL: On-Policy Distillation with Control Variate Baseline","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-11T03:31:07.462474Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.07865"},"observation_digest":"sha256:8fc8618e328869bf69f11b2ce586a770c263d17957beb0bfbe15a80b65814f48","observation_id":"32b523ad-def9-4fe4-950d-d00400fcfe55","resolution":{"observed_at":"2026-05-12T15:03:08.022500Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.08441","last_updated":"2026-05-08T20:03:19Z","snapshot_observed_at":"2026-08-02T05:33:25.541249Z","submitted_at":"2026-05-08T20:03:19Z","title":"DUET: Optimize Token-Budget Allocation for Reinforcement Learning with Verifiable Rewards","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T01:57:11.065744Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.08441"},"observation_digest":"sha256:e561da9f62df10a7020018b0e05dd239656c1f4e02a3d1cc250ba2f91747ab9a","observation_id":"c4817d65-5487-43c3-916f-1ff8151a4cdc","resolution":{"observed_at":"2026-05-12T15:03:08.022500Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.08580","last_updated":"2026-05-09T00:47:43Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-09T00:47:43Z","title":"Slipstream: Trajectory-Grounded Compaction Validation for Long-Horizon Agents","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-12T01:04:55.618417Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.08580"},"observation_digest":"sha256:a511857df9fc3a455ff842c6c0afd5817170567abf7635c55b6dc73639e04446","observation_id":"49752ddc-d2a5-441d-a809-c9c8cb5f4677","resolution":{"observed_at":"2026-05-12T15:03:08.022500Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.08913","last_updated":"2026-05-14T11:50:32Z","snapshot_observed_at":"2026-08-02T22:02:14.182961Z","submitted_at":"2026-05-09T12:26:36Z","title":"Non-Monotonic Latency in Apple MPS Decoding: KV Cache Interactions and Execution Regimes","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-12T01:53:36.091037Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.08913"},"observation_digest":"sha256:aa5690c062dc00ae4e2c2d9f52fd6bb2311a22602b25f4a78e361c955ff9a190","observation_id":"c2d228a4-6dfa-4e57-9ad0-9d888623c70c","resolution":{"observed_at":"2026-05-12T15:03:08.022500Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.08913","last_updated":"2026-05-14T11:50:32Z","snapshot_observed_at":"2026-08-02T22:02:14.182961Z","submitted_at":"2026-05-09T12:26:36Z","title":"Non-Monotonic Latency in Apple MPS Decoding: KV Cache Interactions and Execution Regimes","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-15T05:05:12.267070Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.08913"},"observation_digest":"sha256:678e5fdb2a990b0b9fad26a3e30267fffd5b3aacafe246382e9e9866f000bc54","observation_id":"91304a7c-a0e0-47fa-9aa1-2eab54439058","resolution":{"observed_at":"2026-05-15T05:09:46.085858Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.10670","last_updated":"2026-05-11T14:53:00Z","snapshot_observed_at":"2026-07-06T23:22:37.355450Z","submitted_at":"2026-05-11T14:53:00Z","title":"Surviving Partial Rank Failures in Wide Expert-Parallel MoE Inference","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T04:30:58.729425Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.10670"},"observation_digest":"sha256:dc94ccb13fc5527a258b3a99a65ed6110dbb89dd7ca587ed63af4cc991fa7db2","observation_id":"b4764dc5-d6b6-4fad-808f-2a81a08cff98","resolution":{"observed_at":"2026-05-12T15:03:08.022500Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.11030","last_updated":"2026-06-30T03:38:58Z","snapshot_observed_at":"2026-07-06T23:22:57.012338Z","submitted_at":"2026-05-10T21:24:53Z","title":"An Executable Benchmarking Suite for Tool-Using Agents","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-13T01:08:46.020900Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.11030"},"observation_digest":"sha256:bb52e3a863859174ac16e933df9d8099f1af684337e588f3f323f8f6346c55b0","observation_id":"22f72be2-9076-4ace-9a53-8d280b79fc15","resolution":{"observed_at":"2026-05-13T01:52:06.217699Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.11235","last_updated":"2026-05-11T20:50:29Z","snapshot_observed_at":"2026-07-06T23:23:06.755816Z","submitted_at":"2026-05-11T20:50:29Z","title":"Internalizing Curriculum Judgment for LLM Reinforcement Fine-Tuning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-13T02:19:27.345348Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.11235"},"observation_digest":"sha256:8575c93835383568272ecb750568e55087cd68a3e667b2c0c2ab70aefd54c76b","observation_id":"43461c72-10b5-4330-91ed-4783fa6158c8","resolution":{"observed_at":"2026-05-13T02:22:06.763384Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.11733","last_updated":"2026-05-12T08:15:04Z","snapshot_observed_at":"2026-07-06T23:23:30.499023Z","submitted_at":"2026-05-12T08:15:04Z","title":"Position: LLM Inference Should Be Evaluated as Energy-to-Token Production","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-13T05:17:24.147248Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.11733"},"observation_digest":"sha256:14e666724d478054b26aa30d53d9f4b4ad4fdb1a06a82488e38368266cb8fa74","observation_id":"2f701fc2-3453-4ce1-866f-64a16063b7a8","resolution":{"observed_at":"2026-05-13T05:27:19.432534Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.11999","last_updated":"2026-05-12T11:48:16Z","snapshot_observed_at":"2026-08-02T19:02:31.798979Z","submitted_at":"2026-05-12T11:48:16Z","title":"The Illusion of Power Capping in LLM Decode: A Phase-Aware Energy Characterisation Across Attention Architectures","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T04:48:46.006687Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.11999"},"observation_digest":"sha256:776be6010db8c1851d73778f25157386a6901bab15cafa6c03f3a884d2815f16","observation_id":"98e77faf-e7b7-497a-ab03-9963f6cb71b2","resolution":{"observed_at":"2026-05-13T04:52:17.201341Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.12396","last_updated":"2026-05-12T16:57:53Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T16:57:53Z","title":"NCCLZ: Compression-Enabled GPU Collectives with Decoupled Quantization and Entropy Coding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T03:32:28.187814Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.12396"},"observation_digest":"sha256:927da62e5c01bdd0987d4ced012711c5d2b1fe87d36e3afa88bd7743f7ceec80","observation_id":"69df9bfd-99df-488c-954f-f41289fc3d83","resolution":{"observed_at":"2026-05-13T03:37:11.490744Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.12400","last_updated":"2026-05-29T21:49:52Z","snapshot_observed_at":"2026-08-04T04:38:27.102172Z","submitted_at":"2026-05-12T17:00:53Z","title":"OGLS-SD: On-Policy Self-Distillation with Outcome-Guided Logit Steering for LLM Reasoning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T21:57:38.752094Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.12400"},"observation_digest":"sha256:c121409a7e913b94ce671a0a447a949afe903a1ed986d309071d4119494a0f9e","observation_id":"3fa28c05-8db8-4bc8-a1ad-319aee585b18","resolution":{"observed_at":"2026-06-30T22:05:06.027944Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.14117","last_updated":"2026-05-13T21:06:12Z","snapshot_observed_at":"2026-08-03T04:59:26.074215Z","submitted_at":"2026-05-13T21:06:12Z","title":"Generative Floor Plan Design with LLMs via Reinforcement Learning with Verifiable Rewards","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T05:01:22.151862Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.14117"},"observation_digest":"sha256:34870670a33f60181bae8b9f9eccccd49be27ea124da35dfaed7a41b45c3e2e8","observation_id":"c54eed09-b2f9-45a1-a00a-7ce456243ab3","resolution":{"observed_at":"2026-05-15T05:05:02.434663Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.14790","last_updated":"2026-05-14T12:57:56Z","snapshot_observed_at":"2026-07-06T23:26:09.066863Z","submitted_at":"2026-05-14T12:57:56Z","title":"Graphs of Research: Citation Evolution Graphs as Supervision for Research Idea Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T20:52:32.567107Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.14790"},"observation_digest":"sha256:bb32a9e1bbad6f82305dc758e379e46d173b00113c8d248eb2d01c1106db2b06","observation_id":"96c141c2-fe94-4275-b0e6-076a59498710","resolution":{"observed_at":"2026-06-30T20:55:04.034104Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.15156","last_updated":"2026-05-20T17:53:38Z","snapshot_observed_at":"2026-07-06T23:26:28.006734Z","submitted_at":"2026-05-14T17:51:34Z","title":"MeMo: Memory as a Model","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-15T03:17:23.202604Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.15156"},"observation_digest":"sha256:b89c10adedc3536bb0a8dacf149a5bd7f9c238af827d7f4c16f1767d34d4a7d6","observation_id":"2402af29-3a3a-43ca-968a-235d89c6b7e9","resolution":{"observed_at":"2026-05-15T03:19:43.362686Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.15156","last_updated":"2026-05-20T17:53:38Z","snapshot_observed_at":"2026-07-06T23:26:28.006734Z","submitted_at":"2026-05-14T17:51:34Z","title":"MeMo: Memory as a Model","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-21T08:36:31.022046Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.15156"},"observation_digest":"sha256:9e41fa2b91a05cefeec2c3b45df3914870fb880e9fe0a63c9e3ed0d197d92f0e","observation_id":"e84f747f-2ce1-48b9-87ea-656b6fdaa540","resolution":{"observed_at":"2026-05-21T08:39:53.593616Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.16479","last_updated":"2026-05-15T17:30:45Z","snapshot_observed_at":"2026-07-06T23:27:38.955917Z","submitted_at":"2026-05-15T17:30:45Z","title":"Policy-Grounded Dynamic Facet Suggestions for Job Search","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-19T21:36:48.182204Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.16479"},"observation_digest":"sha256:f5c34b499e7071afe65b57bce48b70293d87af4c9faf97d943d3c18964db0f8b","observation_id":"e058c1c4-0739-4b7b-9e41-db8e0a35eb58","resolution":{"observed_at":"2026-05-19T21:37:47.818605Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.16604","last_updated":"2026-05-15T20:10:24Z","snapshot_observed_at":"2026-07-06T23:27:43.762904Z","submitted_at":"2026-05-15T20:10:24Z","title":"R2V Agent: Teaching SLMs When to Ask for Help","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T20:26:29.804427Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.16604"},"observation_digest":"sha256:8a6d3262fa166d60dbc0dbd3294342f562dc6930e34c8d26b390b72b074967e1","observation_id":"3d04e3f3-a7b8-40a4-895a-56ecab78a467","resolution":{"observed_at":"2026-05-20T20:28:59.748806Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.17164","last_updated":"2026-05-19T23:51:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-16T21:28:22Z","title":"Charon: A Unified and Fine-Grained Simulator for Large-Scale LLM Training and Inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T14:11:58.106397Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.17164"},"observation_digest":"sha256:85c6e17453c1bab37c916bc32f4554d708c8c56231bea2aa2e37433e6ccb5b15","observation_id":"09ddf539-c9e4-441e-b92e-8413f0c31e30","resolution":{"observed_at":"2026-05-20T14:13:21.193394Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.17164","last_updated":"2026-05-19T23:51:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-16T21:28:22Z","title":"Charon: A Unified and Fine-Grained Simulator for Large-Scale LLM Training and Inference","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T08:55:31.298030Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.17164"},"observation_digest":"sha256:ce129649f4e57b218fefc4bfc9949ccf7dc920c275621cdfc5230f6aa39a3967","observation_id":"7672d4f9-ed35-468c-9705-6137f79c72c3","resolution":{"observed_at":"2026-05-21T08:59:55.801689Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.17613","last_updated":"2026-05-17T19:18:39Z","snapshot_observed_at":"2026-07-06T23:28:36.134614Z","submitted_at":"2026-05-17T19:18:39Z","title":"VeriCache: Turning Lossy KV Cache into Lossless LLM Inference","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-19T22:09:15.782104Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.17613"},"observation_digest":"sha256:dd747629de540eac608793515eb636715ac1a84a3803f39d7af4fe977b045134","observation_id":"b99c7520-b32f-4b93-a5ca-c30ad5988397","resolution":{"observed_at":"2026-05-19T22:12:51.171962Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.18053","last_updated":"2026-05-18T08:41:34Z","snapshot_observed_at":"2026-07-06T23:28:59.503300Z","submitted_at":"2026-05-18T08:41:34Z","title":"Protection Is (Nearly) All You Need: Structural Protection Dominates Scoring in Globally Capped KV Eviction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T12:13:14.295659Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.18053"},"observation_digest":"sha256:351bd430525daeeae0975d13d94f558e8879b118fdc6c2f7b01cb6c98610c633","observation_id":"72746384-2afe-4780-a416-fdbe9be3c996","resolution":{"observed_at":"2026-05-20T12:13:15.959185Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.18850","last_updated":"2026-05-13T09:15:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-13T09:15:35Z","title":"KadiAssistant: A conversational AI Agent for information retrieval in Kadi4Mat","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T21:41:01.078882Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.18850"},"observation_digest":"sha256:fa8d5b52dd3025bc57550d534e78c9d0becb12928d415dbae4a2cb3d4067be02","observation_id":"03917308-d875-440b-9684-266e62329fc9","resolution":{"observed_at":"2026-05-20T21:43:45.328808Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.19484","last_updated":"2026-05-19T07:35:22Z","snapshot_observed_at":"2026-07-06T23:30:11.337726Z","submitted_at":"2026-05-19T07:35:22Z","title":"CutVerse: A Compositional GUI Agents Benchmark for Media Post-Production Editing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T07:06:01.621365Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.19484"},"observation_digest":"sha256:d250cbd634dcc9c346669194b3f520180211981aa8a539fc339a9f0c85d8b46d","observation_id":"14b8c744-e225-4851-b42e-957d4467c921","resolution":{"observed_at":"2026-05-20T07:08:07.070717Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.19915","last_updated":"2026-05-19T14:39:54Z","snapshot_observed_at":"2026-08-03T00:34:24.061101Z","submitted_at":"2026-05-19T14:39:54Z","title":"LLM Agents Make Collective Belief Dynamics Programmable: Challenges and Research Directions","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-20T04:37:01.368357Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.19915"},"observation_digest":"sha256:514fba46c53d3f281a4561c81631a4762e03517a559215a301ac29665eb847bd","observation_id":"b011f7fa-9874-453b-8649-d5dc50d75c65","resolution":{"observed_at":"2026-05-20T04:38:04.623177Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.20863","last_updated":"2026-05-20T07:55:06Z","snapshot_observed_at":"2026-07-06T23:31:23.407780Z","submitted_at":"2026-05-20T07:55:06Z","title":"PlexRL: Cluster-Level Orchestration of Serviceized LLM Execution for RLVR","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-21T02:24:48.872065Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.20863"},"observation_digest":"sha256:203ca1211812553914df6308030f8fb8a5c55754d9f9f3b881622a696537d99f","observation_id":"2846e575-b3af-49bc-85bc-7c86f40ffed2","resolution":{"observed_at":"2026-05-21T02:29:25.352053Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.20868","last_updated":"2026-05-20T08:04:40Z","snapshot_observed_at":"2026-07-06T23:31:23.407780Z","submitted_at":"2026-05-20T08:04:40Z","title":"Runtime-Certified Bounded-Error Quantized Attention","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T05:45:42.295527Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.20868"},"observation_digest":"sha256:60e2b44a90444c905676d472faa5584c76eddac39c05b6da88cb1ac0d029fe1e","observation_id":"ad17b4d6-3f03-4b2e-a6e9-6cd28c9f670e","resolution":{"observed_at":"2026-05-21T05:49:41.119692Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.21606","last_updated":"2026-05-20T18:14:03Z","snapshot_observed_at":"2026-07-06T23:32:01.202542Z","submitted_at":"2026-05-20T18:14:03Z","title":"When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:37.960991Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.21606"},"observation_digest":"sha256:d41ee9575a7507306e28e56b147b3aab9ea5db1757d6a2f4785db777eb253cd4","observation_id":"ccdd2310-86f0-4a47-a25e-e61b8922d932","resolution":{"observed_at":"2026-05-22T09:26:20.608066Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.21622","last_updated":"2026-05-20T18:32:56Z","snapshot_observed_at":"2026-07-06T23:32:01.202542Z","submitted_at":"2026-05-20T18:32:56Z","title":"TO-Agents: A Multi-Agent AI Pipeline for Preference-Guided Topology Optimization","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-22T09:33:43.733883Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.21622"},"observation_digest":"sha256:eab6aa6e139d8d8fed21a94ca386bc6a095c8243bebfcf375d9fe5edb7cb2a5b","observation_id":"85dcd48c-f689-411c-b247-c166ab2f5352","resolution":{"observed_at":"2026-05-22T09:34:46.904666Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.22416","last_updated":"2026-05-21T12:37:34Z","snapshot_observed_at":"2026-07-06T23:32:44.699825Z","submitted_at":"2026-05-21T12:37:34Z","title":"Asymmetric Virtual Memory Paging for Hybrid Mamba-Transformer Inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T07:28:35.020478Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.22416"},"observation_digest":"sha256:ae2b08fd7e081e2f295208db07890cef29911d9efe35fbe594ce96855545e35f","observation_id":"d5bdee5d-6b54-491d-9c74-b70c16387b58","resolution":{"observed_at":"2026-05-22T07:31:14.086093Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.24217","last_updated":"2026-05-26T05:47:59Z","snapshot_observed_at":"2026-07-06T23:34:18.555542Z","submitted_at":"2026-05-22T20:57:26Z","title":"Identifying and Mitigating Systemic Measurement Bias in Production LLM Inference Benchmarks","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T15:42:21.405913Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.24217"},"observation_digest":"sha256:4c7507c1d7310718a7015b172629211bc4fae760f75f37604aca45b6a66d8b94","observation_id":"34c4f42d-43e7-4577-8b93-866d8b07cbc4","resolution":{"observed_at":"2026-06-30T15:44:48.300700Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.24259","last_updated":"2026-05-22T22:25:31Z","snapshot_observed_at":"2026-08-02T20:07:37.055832Z","submitted_at":"2026-05-22T22:25:31Z","title":"Resident KV Claims: A Conformance Contract for Future Reuse under Active KV Pressure","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T14:18:35.209571Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.24259"},"observation_digest":"sha256:964eca38b179a8c83459e2d2a6dc776502bdc5e7cdadb378b1faead0d36aae6f","observation_id":"bd290409-6fe2-431b-8ffb-8ac5e58023bb","resolution":{"observed_at":"2026-06-30T14:24:45.205057Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.25550","last_updated":"2026-05-25T08:07:47Z","snapshot_observed_at":"2026-07-31T12:35:46.854130Z","submitted_at":"2026-05-25T08:07:47Z","title":"DisagFusion: Asynchronous Pipeline Parallelism and Elastic Scheduling for Disaggregated Diffusion Serving","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T20:46:51.896596Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.25550"},"observation_digest":"sha256:e1fd0476dca635280683556f5d5f8f0d1927668c7a68d1a9cefc935d4a4db2c9","observation_id":"7d7ed762-0779-442a-b35b-a5737d33461a","resolution":{"observed_at":"2026-06-29T20:53:57.592169Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.26128","last_updated":"2026-05-20T07:11:32Z","snapshot_observed_at":"2026-08-01T15:25:52.680612Z","submitted_at":"2026-05-20T07:11:32Z","title":"The Constraint Tax: Measuring Validity-Correctness Tradeoffs in Structured Outputs for Small Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T17:39:16.469049Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.26128"},"observation_digest":"sha256:3b94644019b3e8c44b29538f79ec3b6e865b87fcbe1b82d8b564795eae5d7428","observation_id":"0465413f-89c2-4459-a945-f5b3dacbc004","resolution":{"observed_at":"2026-06-30T17:44:57.816321Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.26172","last_updated":"2026-05-25T04:07:44Z","snapshot_observed_at":"2026-07-06T23:36:06.135765Z","submitted_at":"2026-05-25T04:07:44Z","title":"ARBITER: Reasoning Trajectory Basins and Majority Vote Failures in Test-Time Sampling","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-29T22:22:02.802499Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.26172"},"observation_digest":"sha256:939298c539c7302e89092f02509d32b30157f9fe1aebfd7d98a40501ecfab39f","observation_id":"e0df5a6f-056a-48b6-bf7a-342314744147","resolution":{"observed_at":"2026-06-29T22:23:59.947279Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.27441","last_updated":"2026-06-07T18:26:33Z","snapshot_observed_at":"2026-08-03T00:06:51.758034Z","submitted_at":"2026-05-22T19:35:15Z","title":"A Unified Structured Query Understanding Framework for Industrial Semantic Search","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T14:51:33.630394Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.27441"},"observation_digest":"sha256:46d2ca60ace693dc92f31526ffcfc74c4cb9ddced8ae849e3a1fdb0b571ad006","observation_id":"8e49efcf-4d58-4f29-b07a-0610410dff25","resolution":{"observed_at":"2026-06-30T14:54:44.842416Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.27686","last_updated":"2026-05-26T21:03:42Z","snapshot_observed_at":"2026-08-02T04:59:17.402182Z","submitted_at":"2026-05-26T21:03:42Z","title":"Tensor Memory: Fixed-Size Recurrent State for Long-Horizon Transformers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T18:08:42.533804Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.27686"},"observation_digest":"sha256:ff2dfb4e8324dde985970830722561aac770442e5cc470d4573191e92af8b2ae","observation_id":"428c5f72-fa48-40ad-a416-05461800ea45","resolution":{"observed_at":"2026-06-29T18:13:48.664439Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.27763","last_updated":"2026-05-26T23:22:55Z","snapshot_observed_at":"2026-07-31T18:23:26.053584Z","submitted_at":"2026-05-26T23:22:55Z","title":"A Paired Testing Protocol for Batch-Conditioned Refusal Robustness in LLM Serving","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-29T18:03:19.798168Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.27763"},"observation_digest":"sha256:c5b7e63708d9fe3d4b8f01cd30aeb6ba38a45432f6ecaac1bd68a1052c65c022","observation_id":"2524a5f8-f395-47b8-8e88-026ff4d2f44c","resolution":{"observed_at":"2026-06-29T18:03:47.859616Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.27825","last_updated":"2026-05-27T01:31:40Z","snapshot_observed_at":"2026-08-02T19:56:32.199762Z","submitted_at":"2026-05-27T01:31:40Z","title":"MRMMIA: Membership Inference Attacks on Memory in Chat Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T12:04:53.511344Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.27825"},"observation_digest":"sha256:feb612c0502a086e15ed77fb9a3867213c2f922f6249c46b199ae804eb50e29c","observation_id":"4fc5ae9e-3a64-42ef-95cb-bd2983a67c28","resolution":{"observed_at":"2026-06-29T12:13:27.042754Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.29662","last_updated":"2026-07-24T01:54:48Z","snapshot_observed_at":"2026-08-02T12:54:38.753199Z","submitted_at":"2026-05-28T09:23:08Z","title":"SAFE-Pruner: Semantic Attention-Guided Future-Aware Token Pruning for Efficient Vision-Language-Action Manipulation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T08:40:10.152344Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.29662"},"observation_digest":"sha256:a717dadb80da41b0ff9abdf2b9fd2331c3aca6292a35cd9d4dd746ee3e4f4af8","observation_id":"86cf3189-d1ac-40de-9ed0-67bd3350a318","resolution":{"observed_at":"2026-06-29T08:43:14.945933Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-02T12:54:41.542034Z","title":"arXiv preprint arXiv:2309.06180 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.29662","last_updated":"2026-07-24T01:54:48Z","snapshot_observed_at":"2026-08-02T12:54:38.753199Z","submitted_at":"2026-05-28T09:23:08Z","title":"SAFE-Pruner: Semantic Attention-Guided Future-Aware Token Pruning for Efficient Vision-Language-Action Manipulation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T12:54:41.542034Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.29662"},"observation_digest":"sha256:56aa1e74b9522deda566030a7fcc2d6d8ae214dbfe63df69ccf4ad4b82f0bffa","observation_id":"eb8ab6dd-fd67-44ed-bb74-56c90c3eace4","resolution":{"observed_at":"2026-08-02T12:54:41.542034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2605.30824","last_updated":"2026-05-29T04:18:55Z","snapshot_observed_at":"2026-08-04T19:06:24.801521Z","submitted_at":"2026-05-29T04:18:55Z","title":"Planner-Centric Reinforcement Learning for Deep Research with Structure-Aware Reward","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-28T22:30:00.735630Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2605.30824"},"observation_digest":"sha256:d0b5e941b0f2aa2b2fe51943562b497763bbb115ed59227afef1d088ff4b1952","observation_id":"88cc7254-93c5-475d-bf14-610287411264","resolution":{"observed_at":"2026-06-28T22:32:44.005264Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2309.06180/citation-record","integrity":"/paper/2309.06180/integrity","json":"/paper/2309.06180/citation-record.json","paper":"/paper/2309.06180"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2207.00032","last_updated":"2022-06-30T18:01:08Z","snapshot_observed_at":"2026-08-01T05:24:40.015236Z","submitted_at":"2022-06-30T18:01:08Z","title":"DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale","version":1},"cited_work":{"arxiv_id":"2207.00032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2207.00032","snapshot_observed_at":"2026-07-03T22:59:03.322421Z","title":"Deepspeed inference: Enabling efficient inference of transformer models at unprecedented scale","venue":null,"work_id":"fe39d11d-9a1a-4cf6-bda1-94e047ec6171","year":2022},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"cited_paper":"/paper/2207.00032","citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:349c9899c51329e1542ca10ee64a68d630c1bd5cfae6cc0e34b9b275cea0e6bb","observation_id":"08dccdd5-98d0-49e9-8fc2-68424e18710b","resolution":{"observed_at":"2026-05-12T15:03:07.819111Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":"1607.06450","doi":"10.1007/978-3-319-32025-0","metadata_source":"pith","pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Layer Normalization","venue":"stat.ML","work_id":"20a2d720-0046-4c7c-bcd6-327ec8143f69","year":2016},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:6dc63152e256f7ebdf2db6243fda0f93a322d910a70fdcf954485c306cdc83c2","observation_id":"ea5d1a3a-06f2-4b50-92b3-4ff93d6f7d9b","resolution":{"observed_at":"2026-05-12T15:03:07.793926Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2e1678f3-601b-46e9-97b7-6f4ba44edf48","year":2000},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:e113be236f00964e18a186dbb708aeae77ca1948f0d309bb80f359f3890a3888","observation_id":"020a3db1-7f86-418e-a32c-f59844f53d99","resolution":{"observed_at":"2026-05-12T15:03:07.961032Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"71e9ab74-b55c-4366-aad5-ca251a6d9ce5","year":2016},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:b9047ab8c07b42679f2f4951a5910e132f363275683197cabe2d75961f0e4a51","observation_id":"a93fed71-3f98-4bbe-830a-fcc14605e2ba","resolution":{"observed_at":"2026-05-12T15:03:07.964835Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1fdfe9ff-6a52-4b8a-9b37-f9d8e09ceaae","year":2020},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:370e3b4427332edcf394060c567a002c58cf8c8489585eb6b0324a123c6da5cf","observation_id":"dbca0eb2-521c-44bd-b4ae-1ac2f4b43420","resolution":{"observed_at":"2026-05-12T15:03:07.968780Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:2f0cf1d666047d9ba1c9b122f38d8d7ccb1c6c534d2234d3784626d51fb43906","observation_id":"fa3293c6-1d77-49e6-addc-9ad3407bc999","resolution":{"observed_at":"2026-05-12T15:03:07.724048Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1604.06174","last_updated":"2016-04-22T19:21:36Z","snapshot_observed_at":"2026-08-04T13:01:58.606241Z","submitted_at":"2016-04-21T04:15:27Z","title":"Training Deep Nets with Sublinear Memory Cost","version":2},"cited_work":{"arxiv_id":"1604.06174","doi":"10.48550/arxiv.1604.06174","metadata_source":"pith","pith_arxiv_id":"1604.06174","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training Deep Nets with Sublinear Memory Cost","venue":"cs.LG","work_id":"f2c5c287-a500-40e4-a136-e7e3172db1d7","year":2016},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"cited_paper":"/paper/1604.06174","citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:ff81bd4404b9c74285df976435622b4d574a30ad17d5df24dfe45e2f7fb2df05","observation_id":"824e324e-c329-43f7-a910-2250e37ef738","resolution":{"observed_at":"2026-05-12T15:03:07.738692Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:26:33.666045+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:26:33.666045+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":"a890e2dc-4428-4d78-ba3b-49d10c29ae17","year":2023},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:35c8c55615f2e039f21e7ece24e22bebb8c2d0fc7018e40a7e2c00d5313e25e1","observation_id":"a908b3f5-513c-4a51-bfce-6ff7685937dc","resolution":{"observed_at":"2026-05-12T15:03:07.972494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":"2204.02311","doi":"10.48550/arxiv.2204.02311","metadata_source":"pith","pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaLM: Scaling Language Modeling with Pathways","venue":"cs.CL","work_id":"a94f3ef7-2c49-4445-93fe-6ec16aafd966","year":2022},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:6ce4ebfa98bd7595c266ac9bf0f67c8889b3e868f04ff45e5691a0ecc92b2408","observation_id":"7fc5054a-6c19-48f0-ba31-5b0a7cb2c84a","resolution":{"observed_at":"2026-05-12T15:03:07.716855Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:25:21.411055+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:25:21.411055+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d5a5400d-fd5b-45b9-ba90-4917cc9cfcde","year":2020},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:b6fd34de8abd8dc0e059973fd3d5ddca73a21da7e99f7245e1238a4243d5018c","observation_id":"c5b99f57-bbde-4dcd-ba2a-b0c62cecee45","resolution":{"observed_at":"2026-05-12T15:03:07.976033Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f07df24d-7809-46d1-9879-17d55fe2b9a1","year":2017},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:4206b52c9134074eef4412b7fa48adb3b7decfcea825fba219706fc1e0764809","observation_id":"3c795a00-0234-4a5e-9838-52853962a2c9","resolution":{"observed_at":"2026-05-12T15:03:07.980069Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b94551dd-e797-496e-ac77-ef8efd04357a","year":2022},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:e969c0405b558f176c70d552f309c95dd59e4820c5821af39c0af60b99048814","observation_id":"f60ccf6b-6748-4095-a8ea-2770d22cd497","resolution":{"observed_at":"2026-05-12T15:03:07.983910Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T13:01:10.693285Z","title":null,"venue":null,"work_id":"dc6101ca-0996-4225-a8d3-755e7e0d55bf","year":null},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:6d9e219842cb5c13168a9ea322bc8ca631402f533ab34b8f2f9ddf634e9a5548","observation_id":"5421875f-a657-44c1-bfaf-46a7ab549b3f","resolution":{"observed_at":"2026-05-12T15:03:07.987914Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems 35 (2022), 16344–16359","venue":null,"work_id":"adfa1183-3e52-4e87-834a-a4945a989038","year":2022},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:0f5639c4e82a9895b133c72fa4118047f7f4e6e094815194d491fc7f71dde766","observation_id":"8475f1f3-5c14-4de7-be9d-5744bad783c3","resolution":{"observed_at":"2026-05-12T15:03:07.991726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4088f26c-d08d-4885-9c5d-27212cd93357","year":2021},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:59c74c4c8d470ba432c28c166de7ab793ab777e3e3135c7984d115c64d75ed6c","observation_id":"22f35f2e-51c1-411f-8b07-44a03537b375","resolution":{"observed_at":"2026-05-12T15:03:07.995879Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"74ba551c-2bed-4d90-b421-454777638d2b","year":2023},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:ee34a3ef8f68a73b3b3d90c8fbafb4d91b4ebf1994e43c940c257dcee0af8bd4","observation_id":"c0b92cc6-7b6f-4c43-ab9a-64c35c09c07d","resolution":{"observed_at":"2026-05-12T15:03:07.999490Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"988636b9-ccbe-4df4-982c-9b9264b00645","year":2018},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:183bd571bd8a13be9de91df054f739b7406738a4d6278c2bb79ccae3dc654bcd","observation_id":"ecbb2d0a-e0ea-41db-8bac-7d9947ce92af","resolution":{"observed_at":"2026-05-12T15:03:08.003049Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1c172c8b-da78-491f-aa91-97f36413b47c","year":2021},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:7c306a9cadda6af0b1db7ff006f8858cc32a31806932b127d01cd44c26b30252","observation_id":"7f0b4fcf-41f2-4301-87d0-aded4ffa0da1","resolution":{"observed_at":"2026-05-12T15:03:08.006385Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"80d3464a-5928-466e-9d2e-39b7d76ce004","year":2022},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:6ec9fc5e608f2336fab0a7b75c9de9e4afabc7ca2f186abe8cfd0c087249a5e4","observation_id":"47d9e4d5-8cb7-4862-9c75-82ccc985a1c0","resolution":{"observed_at":"2026-05-12T15:03:08.010300Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c7af06da-cd4e-40a1-9418-0cebf4e9d316","year":2023},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:e8d3f561766251890a9f059fe30a9b18f89f1e1cbe679a5a30a8afb03d0abe92","observation_id":"649cd9d0-3c15-4f92-8c73-69860ecf4dac","resolution":{"observed_at":"2026-05-12T15:03:08.013932Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"96974486-1424-4fb1-ac0c-a62fb4e02567","year":2020},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:f6b2adaa4459f13a5a9ff7af5c1d57f858b6beee388be23aaf150391619b32dd","observation_id":"7171c841-29bd-4898-8258-adc70234a42c","resolution":{"observed_at":"2026-05-12T15:03:08.017449Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"15cf978b-403f-46ba-8cfe-ce1c4cde32c7","year":null},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:2eed8362c31796acb27d46b98e8726053dd6240a77cd155354cf33483f8e8e3d","observation_id":"41b994ad-0cee-4d6e-b3ac-4f54a8316759","resolution":{"observed_at":"2026-05-12T15:03:08.021083Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In 16th USENIX Symposium on Oper- ating Systems Design and Implementation (OSDI 22)","venue":null,"work_id":"bb7a8b97-dce3-47eb-a9c4-3c56dc7d2a43","year":null},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:f01fbab7c2d102bd92382642c8f00d2e23f74ebdccb10ec5402adef0fd6da3cf","observation_id":"69f0cf92-1c2e-4a5d-8b51-f3002f882278","resolution":{"observed_at":"2026-05-12T15:03:07.824156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:47:06.098401Z","title":null,"venue":null,"work_id":"550a9563-29cf-472d-9d3c-f54832a99f92","year":2016},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:e74c0ba8d06948144f52236eb006ae6433c8b6739d381aeb808e0f7adc58d89f","observation_id":"585c1e67-09ac-4976-8be7-93d98b0e0134","resolution":{"observed_at":"2026-05-12T15:03:07.829337Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"aa82be22-d04b-4d8c-93b1-e49451c1bd73","year":2020},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:7379aac1e093685e5b2daebbd4b5b8268935c798ad6ec5f96824ea1dc277e216","observation_id":"6b4f3895-665d-4efb-8785-9c4633f6c278","resolution":{"observed_at":"2026-05-12T15:03:07.833668Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"393d539c-eff4-4071-b9f8-bd57898319bf","year":2020},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:deae4034a49993d5a0a64f5217f41fc7f675fb6cc6b67b7c8f8a3e5e9c710ba8","observation_id":"5db4699b-9297-40fb-b135-f11ec619aa4e","resolution":{"observed_at":"2026-05-12T15:03:07.837719Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"73a24806-016a-4194-9db0-5040664aa615","year":1962},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:1c5ca7140c4b96960c024b21c6e87b90a948bc36ab6ed72afa49e26a472360b5","observation_id":"bf0d9868-991c-4e70-97a0-d86b8857242b","resolution":{"observed_at":"2026-05-12T15:03:07.841979Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08691","last_updated":"2021-09-02T17:34:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-04-18T03:19:26Z","title":"The Power of Scale for Parameter-Efficient Prompt Tuning","version":2},"cited_work":{"arxiv_id":"2104.08691","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.08691","snapshot_observed_at":"2026-07-04T14:59:55.372222Z","title":"The Power of Scale for Parameter-Efficient Prompt Tuning","venue":"cs.CL","work_id":"1056ba8e-7b3f-4811-be8e-9a3ed9269acb","year":2021},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"cited_paper":"/paper/2104.08691","citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:021c540b96672cbe451d1abea1166e318171c8cc470518f408fb59a9f317a49d","observation_id":"4734b47f-db5b-4741-bfc8-23bc9e216ee7","resolution":{"observed_at":"2026-05-12T15:03:07.753723Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00190","last_updated":"2021-01-01T08:00:36Z","snapshot_observed_at":"2026-07-06T10:29:18.734092Z","submitted_at":"2021-01-01T08:00:36Z","title":"Prefix-Tuning: Optimizing Continuous Prompts for Generation","version":1},"cited_work":{"arxiv_id":"2101.00190","doi":null,"metadata_source":"pith","pith_arxiv_id":"2101.00190","snapshot_observed_at":"2026-07-04T13:29:51.032515Z","title":"Prefix-Tuning: Optimizing Continuous Prompts for Generation","venue":"cs.CL","work_id":"23ddcedc-909d-4b18-b28a-943a50a8cef7","year":2021},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"cited_paper":"/paper/2101.00190","citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:3e4932362bc4df0e5c6ea6a1700dece5a11211d37a3cc8847afb87d0b25ad540","observation_id":"090d8bc3-9a77-4681-8587-00d9448e823b","resolution":{"observed_at":"2026-05-12T15:03:07.767558Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11665","last_updated":"2023-07-19T04:03:11Z","snapshot_observed_at":"2026-07-06T14:54:49.257829Z","submitted_at":"2023-02-22T21:41:34Z","title":"AlpaServe: Statistical Multiplexing with Model Parallelism for Deep Learning Serving","version":2},"cited_work":{"arxiv_id":"2302.11665","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2302.11665","snapshot_observed_at":"2026-07-03T06:37:42.189481Z","title":"AlpaServe: Statistical Multiplexing with Model Parallelism for Deep Learning Serving,","venue":null,"work_id":"4dcdb5bb-2c7f-44ec-85a3-f5f3ca5d14e9","year":2023},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"cited_paper":"/paper/2302.11665","citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:c8bd2f08ff0699931cfdb884c01bacb1a5178b3a77eb600fde3ac3780b2fcab7","observation_id":"42994f68-102c-4f9c-a533-fa2ce75b0a5c","resolution":{"observed_at":"2026-05-12T15:03:07.780556Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"257f9d3f-b040-437d-9667-6a7e5f1461c5","year":2020},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:2e2e7a70938fc9c4ec3ae925a4ab8eab802bad9babe5b19a304c7ecd9457d370","observation_id":"6611d062-ea7b-4b1a-8e1c-a04ea637c734","resolution":{"observed_at":"2026-05-12T15:03:07.846713Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e5a652c2-48f1-41b7-aa77-fd3374bf04c9","year":null},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:addb755710e39dcabbefd3a7e787695909737a51aa18349aee8bbc685d118e6b","observation_id":"7d738a63-1597-49db-8fff-96a626340e43","resolution":{"observed_at":"2026-05-12T15:03:07.850427Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a5d10adf-1481-45be-9d38-b01e97b16b49","year":2023},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:4dbff02a9ea7532e7b9348fbde0c0738e02cac85eb8e924fd777c114bc81de79","observation_id":"20103cf5-3f6f-4484-8635-05f8794c2528","resolution":{"observed_at":"2026-05-12T15:03:07.854142Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2002c269-2584-4f0b-894e-7820d5466bca","year":2023},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:5bca3a7d2cf33a2b22d22e2a3e1728ec833e0c9cb815182e9a44cf0b25e64ece","observation_id":"ecff823f-3c41-4263-bcf4-36e0aadf93f2","resolution":{"observed_at":"2026-05-12T15:03:07.858277Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8e1faa74-4da1-415b-8ba9-35ffc25bba44","year":null},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:27d2a3edaa529c6be879ed1c5735fe4c30a952840f775212116d8370b567297a","observation_id":"d242a37f-13c8-4bf9-9225-05daabbd8863","resolution":{"observed_at":"2026-05-12T15:03:07.862706Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.06139","last_updated":"2017-12-27T20:43:02Z","snapshot_observed_at":"2026-08-02T02:13:21.763849Z","submitted_at":"2017-12-17T16:36:26Z","title":"TensorFlow-Serving: Flexible, High-Performance ML Serving","version":2},"cited_work":{"arxiv_id":"1712.06139","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.06139","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TensorFlow-Serving: Flexible, High-Performance ML Serving","venue":"cs.DC","work_id":"41d2f994-f6ad-4f0f-aea0-50f2aa456a1e","year":2017},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"cited_paper":"/paper/1712.06139","citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:e907acc93c409b80cf42dc9834471996754d1499a42ee8104102232f608689d5","observation_id":"6573c59c-e979-4709-aa4d-49841a90a965","resolution":{"observed_at":"2026-05-12T15:03:07.761225Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7e881ef6-738b-45fc-9654-8ceb490e2c82","year":2020},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:0ad22286cb08cb6e5b3c3247679a085620c562dbac4a7739925785d318ddedd1","observation_id":"fe748ac2-8082-48f9-af31-e99b892a8716","resolution":{"observed_at":"2026-05-12T15:03:07.867075Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fd6c5e52-d7f6-4838-aba6-32b54f256d47","year":2022},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:adff234a3384474d93153bd1b1956d3c09185aa4f1ca84695284ee441ac0b63e","observation_id":"6970e59a-e3bd-45f9-a0e1-1ca53edf0330","resolution":{"observed_at":"2026-05-12T15:03:07.870878Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"377653b8-7589-43fc-ac9b-14f6bf354824","year":2023},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:64e6aac880418a1a37c48f87e90193c3ee40b88f957d0e37b130e22605727df8","observation_id":"5f9a882f-fecc-46b0-880b-1058a20b94bc","resolution":{"observed_at":"2026-05-12T15:03:07.874552Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:786386ae62962d3fe7728d51f0eb8cc0a87a55fcbd840ef7b46e74fc56d41930","observation_id":"30a47c21-5c3f-4249-bff7-a8cc348693f6","resolution":{"observed_at":"2026-05-12T15:03:07.708918Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"99321eb4-a92a-489b-96a1-dcb659efdca4","year":2023},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:893ad74632c1e813e629b40ef0fc1e49219ed6d1aee7fa3cdaba3a17e0ca3b6b","observation_id":"a1cc0d46-d309-403d-82ff-3d711eff3e3a","resolution":{"observed_at":"2026-05-12T15:03:07.878270Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c05b6260-faf3-41dc-984e-ee19a63c0a4e","year":2019},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:3a22ea5f1689e615950b50d1ea1c665434cc89b4661e1cd5437d4b3ff56517ce","observation_id":"fd199c6e-1b18-4516-8610-557303632b5a","resolution":{"observed_at":"2026-05-12T15:03:07.882604Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4685f965-4e37-4085-9bf0-e8c9ec7d8b8e","year":2022},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:c0732e698700b1658ce6b23844290c7f9fcca3b6960cdcb429a46cd4711a4ae7","observation_id":"eefaaf41-bbe0-44e1-a186-ceee8ffa759b","resolution":{"observed_at":"2026-05-12T15:03:07.886267Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-03T21:52:33.988566Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":"2211.05102","doi":"10.48550/arxiv.2211.05102","metadata_source":"pith","pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Eﬃciently Scaling Transformer Inference","venue":"cs.LG","work_id":"89acfce1-19be-43c5-b74d-cdfe66fa10d8","year":2022},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:71d415ed3d3673249227559a31685ec967f85318c04e2082778f690c43426cb3","observation_id":"659423ce-ded9-4c05-970b-b38ca297a6d8","resolution":{"observed_at":"2026-05-12T15:03:07.746609Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"57d6701d-86a3-4198-9c47-21c9b215c4d2","year":null},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:b9f9218d8e1ef816d2c33cdfeab0355db3fc81fd1b87a7e59625316099bbf80b","observation_id":"17795cef-1a39-41a4-b047-882332367102","resolution":{"observed_at":"2026-05-12T15:03:07.890597Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In USENIX Annual Technical Conference","venue":null,"work_id":"ced11d59-85fc-457f-a681-4c8977e36d1f","year":null},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:94cd333a2c1b54c3d38d7e17e8a1570da4cb9725f9d1baf5456e4613c3026bd6","observation_id":"464d2b8d-cfa6-4cba-b873-82cf65375e79","resolution":{"observed_at":"2026-05-12T15:03:07.895483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"11e3f356-1aca-405f-a814-814e708fcb0e","year":2023},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:03fe3bfcd99ed8c29328a651886eb4515d0f27abd0a8e6a87c5baf754da16b7a","observation_id":"9e37e6ef-7bb2-4691-816c-8a6faf31ca45","resolution":{"observed_at":"2026-05-12T15:03:07.899533Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5f28c8ee-9309-4750-b9b1-085789c7f653","year":2023},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:73c3408b939ce9c70e9bf71646adf50e144d1e0f653aab019488e7e1a42ed2e6","observation_id":"27a18ba0-8337-42ad-8a2c-12987079e10f","resolution":{"observed_at":"2026-05-12T15:03:07.903474Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"33de7533-d59c-4f40-8e3c-19a49cc6894b","year":2019},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:c118c7c1233f17687570b2982c11165f4be1ae58ecc06a693ac2ca866f6bccd6","observation_id":"04f25914-1bb7-4542-b0fe-bc53824a95b6","resolution":{"observed_at":"2026-05-12T15:03:07.907553Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06865","last_updated":"2023-06-12T07:48:53Z","snapshot_observed_at":"2026-07-06T15:02:25.281739Z","submitted_at":"2023-03-13T05:19:28Z","title":"FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPU","version":2},"cited_work":{"arxiv_id":"2303.06865","doi":"10.48550/arxiv.2303.06865","metadata_source":"pith","pith_arxiv_id":"2303.06865","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Xie, Z., Chen, B., Barrett, C., Gonzalez, J","venue":"cs.LG","work_id":"c99785d7-2d72-4d2f-8363-f4db53cf669f","year":2023},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"cited_paper":"/paper/2303.06865","citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:403d34674d8810a4a9f58a32741ce451d57e3c53303c3ec61b83093383459237","observation_id":"b514fe48-8fb9-4ec3-9311-fb3b4b968682","resolution":{"observed_at":"2026-05-12T15:03:07.800919Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":"1909.08053","doi":"10.48550/arxiv.1909.08053","metadata_source":"pith","pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","venue":"cs.CL","work_id":"c888e6d1-0b1d-43d6-9ef5-f0912a0efa1b","year":2019},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:d9b2502f30947e69366d6d2656c23acb58416ef5a79d88036728e869e64b2b2a","observation_id":"3cb0556b-ffb3-46a6-a7b9-f38e2f5426be","resolution":{"observed_at":"2026-05-12T15:03:07.812810Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.12924","last_updated":"2022-11-02T19:22:24Z","snapshot_observed_at":"2026-07-06T14:09:24.691330Z","submitted_at":"2022-10-24T02:39:13Z","title":"OLLA: Optimizing the Lifetime and Location of Arrays to Reduce the Memory Usage of Neural Networks","version":2},"cited_work":{"arxiv_id":"2210.12924","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.12924","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"OLLA: Optimizing the lifetime and location of arrays to reduce the memory usage of neural networks","venue":null,"work_id":"219831af-7a9a-4daf-bccf-efb833bdbf4f","year":2022},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"cited_paper":"/paper/2210.12924","citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:05a3bb161b7b86c9bc54b5a4c6a70ebf713b5e5a373314466360b2e2f6374c72","observation_id":"453495f7-8cb5-4a78-9245-7bd54665c69b","resolution":{"observed_at":"2026-05-12T15:03:07.701241Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"39d04908-f577-4160-9c73-e64d985789d3","year":2014},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:21aa3d5ce300421886b144e92702b17b321abe7b7a5e24b2488674712e8cf501","observation_id":"6272fdd7-76f8-4f80-8260-be9929539786","resolution":{"observed_at":"2026-05-12T15:03:07.911343Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hashimoto","venue":null,"work_id":"c3dc7e76-e363-4707-bbe9-27ec2ef815b0","year":2023},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:be5be0f4eedbce86875376cacb4a26ba2da98ce478bbb03fa77a70565771def4","observation_id":"18a53911-7127-4192-a747-a445c79dc7b9","resolution":{"observed_at":"2026-05-12T15:03:07.914879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4e16f1c6-aa2e-4d3a-a90e-7fc60fcfe61c","year":2023},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:47209bfeb33ad33a1a650fafd3ff4cef801a0a190238ad4b58ecca209797007f","observation_id":"fbc8220c-365a-45f1-892c-eb1ab0919310","resolution":{"observed_at":"2026-05-12T15:03:07.918408Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:badbe57bce215b28a9cf0a6cf2d66564893714d7fc25e4f4dada2dc88e38ffb6","observation_id":"fd745b65-5172-4485-b2fd-d57ee7c8f11e","resolution":{"observed_at":"2026-05-12T15:03:07.731206Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4ffb9db3-cd4e-47db-b2ab-4488fe408a9d","year":2017},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:3bff6d242b429902b2ec3107a171e1a24b5e2fa928387802879a9b0d329f98eb","observation_id":"df58395b-c622-403e-a2a9-7aa76c595b9c","resolution":{"observed_at":"2026-05-12T15:03:07.922356Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b1c2157f-d8b4-46b3-9913-d4b52bb6acc5","year":2022},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:b2a1734d3aecfdbdc1701e0cffa51fece53d68e1d3412445b1eb3621724e47e6","observation_id":"e39f4097-4adb-442f-a6bb-c8bbc759b2d2","resolution":{"observed_at":"2026-05-12T15:03:07.926067Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"65251bad-7745-4a95-ac8f-c93daddbee5d","year":2018},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:4ceed7135f4fcd0b28d29f33b5900cbf418391bfded77490c8785d5e14047a4c","observation_id":"75222c7e-88ef-4087-bdfc-ce459d8a17e0","resolution":{"observed_at":"2026-05-12T15:03:07.929825Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d4bfa857-80bb-42bd-8eb0-67d3df3e3f78","year":null},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:8d3364271a3a1143c54549818f632e835a9a8c25a55c7d981cbd22f26ff3aa99","observation_id":"06833f31-c947-4493-95c3-cd1f6d8c7e6b","resolution":{"observed_at":"2026-05-12T15:03:07.933604Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In Proceedings of the 2021 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Tech- nologies: Industry Papers","venue":null,"work_id":"8ad32e0f-fdb4-492e-b7d9-ad57ae3803b7","year":2021},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:68218a6ecf31906e37bb5f79c559030f4c4c15786cf265bc390928e7b25e5f5f","observation_id":"4e8f5a54-6b76-468d-8568-6e67e32a93a4","resolution":{"observed_at":"2026-05-12T15:03:07.937977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10560","last_updated":"2023-05-25T23:50:07Z","snapshot_observed_at":"2026-07-06T14:33:11.945106Z","submitted_at":"2022-12-20T18:59:19Z","title":"Self-Instruct: Aligning Language Models with Self-Generated Instructions","version":2},"cited_work":{"arxiv_id":"2212.10560","doi":"10.1145/3209978.3210080","metadata_source":"pith","pith_arxiv_id":"2212.10560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Instruct: Aligning Language Models with Self-Generated Instructions","venue":"cs.CL","work_id":"d0018767-775d-406e-861d-539ed681ff73","year":2022},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"cited_paper":"/paper/2212.10560","citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:ce2ee3c81fe9587348736b695a6533925cfcef58104a337495db83ca115410bb","observation_id":"53f81328-4859-432f-9bf9-3a24ff5e5060","resolution":{"observed_at":"2026-05-13T03:14:51.325303Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T23:23:20.678+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T23:23:20.678+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ca0c49d3-e4ad-46ee-9577-859f3b5e96dd","year":2020},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:2a9290d3313811f1da5f16e3c020c049923682681fcbc25e6a33cb1be98a79b6","observation_id":"c21b7371-c2d6-4eed-8a18-faf9cb7ef895","resolution":{"observed_at":"2026-05-12T15:03:07.942106Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.08144","last_updated":"2016-10-08T19:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-26T19:59:55Z","title":"Google's Neural Machine Translation System: Bridging the Gap between Human and Machine Translation","version":2},"cited_work":{"arxiv_id":"1609.08144","doi":"10.18653/v1/2021.eacl-main.163","metadata_source":"pith","pith_arxiv_id":"1609.08144","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Google's Neural Machine Translation System: Bridging the Gap between Human and Machine Translation","venue":"cs.CL","work_id":"e294e5a1-5dd2-44a0-b348-adbd62fe1916","year":2016},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"cited_paper":"/paper/1609.08144","citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:0d93d0176cded434c6f03ab7c957cdb0b75f96c33ef5e782dd458abf708de87e","observation_id":"0bfcdb19-46a3-40da-b3db-a74e46841850","resolution":{"observed_at":"2026-05-12T15:21:29.028955Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e4337ead-0c8a-4fcc-a817-ee77a27ff10a","year":2022},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:f8c4485184910cff83e64d5cde59cf09041f2815b706610542544500bde0fbe6","observation_id":"7ff26025-541d-4a6a-90c8-18935974fb7a","resolution":{"observed_at":"2026-05-12T15:03:07.945945Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e6f45b41-a3e2-40b7-93c7-3bd0e8ab46c0","year":2023},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:2fed69c1a587857718808c4d14b6c6b9fb297135e019da9a90493c118b17cf98","observation_id":"84b51dc0-35c3-45c4-b7bc-e799058e8007","resolution":{"observed_at":"2026-05-12T15:03:07.949746Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:97cd8f802e8549c6107d623040ee93142cb40392b888703346940a71801ca212","observation_id":"75626fe5-d11e-4f77-8cd3-5785faa1cee0","resolution":{"observed_at":"2026-05-12T15:03:07.806825Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d675d3a5-fbb1-4680-a35c-659f60dec3f6","year":2022},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:08d3ddf72d8bb57e602215fd9dc0b12d789de8d79d1bd16f445448afb69a1137","observation_id":"cfb028ce-306c-4577-a080-51df01dc9fe1","resolution":{"observed_at":"2026-05-12T15:03:07.953903Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"14eec68b-a5be-4953-a471-0c3e04b43598","year":2022},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:b1ef24c593408a2d8ba327769e97068eec0ad5a4c53931dbeeafb9f2f911c3b6","observation_id":"7d18360e-836f-41ae-9d50-4b3b6f8916ca","resolution":{"observed_at":"2026-05-12T15:03:07.957425Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":45,"verified_exact":16,"verified_fuzzy":6},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 100 inbound Pith citation observations for arXiv:2309.06180."}