{"as_of":"2026-08-14T15:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7123313c607a2f31546b7c730dc7735ad1a2ec4722110af3c2abf22043af8b03","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T18:43:32.575076Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T23:16:46.161659Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T00:35:10.221606Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.04013","snapshot_observed_at":"2026-08-02T23:16:46.161659Z","title":"Augserve: Adaptive request scheduling for augmented large language model inference serving.arXiv preprint arXiv:2512.04013,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14516","last_updated":"2026-07-21T08:53:51Z","snapshot_observed_at":"2026-08-09T07:31:56.117192Z","submitted_at":"2026-02-16T07:07:30Z","title":"Efficient Multi-round LLM Inference over Disaggregated Serving","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-02T23:16:46.161659Z"},"links":{"cited_paper":"/paper/2512.04013","citing_paper":"/paper/2602.14516"},"observation_digest":"sha256:5eec24bba588952fc3611394ce4c6cd2cc285a7b896c5a3ecbde942effa0b544","observation_id":"d157a2be-c120-415b-95a0-a02d4a444cc1","resolution":{"observed_at":"2026-08-02T23:16:46.161659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.04013","snapshot_observed_at":"2026-07-13T22:20:51.838309Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.18897","last_updated":"2026-06-16T09:34:16Z","snapshot_observed_at":"2026-08-14T02:15:33.190124Z","submitted_at":"2026-03-19T13:36:50Z","title":"Parallelizing Tool Execution and LLM Generation for Low-Latency Agent Serving","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-13T22:20:51.838309Z"},"links":{"cited_paper":"/paper/2512.04013","citing_paper":"/paper/2603.18897"},"observation_digest":"sha256:23f9c0453c6a05663cb25ac05c211ea33056a67e94af49119435649199ab39c4","observation_id":"e9d5cf38-73a0-406b-97d0-83e3602788ed","resolution":{"observed_at":"2026-07-13T22:20:51.838309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"cited_work":{"arxiv_id":"2512.04013","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.04013","snapshot_observed_at":"2026-07-13T02:18:53.109644Z","title":"Augserve: Adaptive request scheduling for augmented large language model inference serving.arXiv preprint arXiv:2512.04013","venue":null,"work_id":"db9c599c-8592-4f4e-86ae-7452f2e012dd","year":null},"citing_paper":{"arxiv_id":"2605.02329","last_updated":"2026-08-11T12:56:52Z","snapshot_observed_at":"2026-08-14T14:13:59.083004Z","submitted_at":"2026-05-04T08:29:47Z","title":"Taming Request Imbalance: SLO-Aware Scheduling for Disaggregated LLM Inference","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T18:27:13.781231Z"},"links":{"cited_paper":"/paper/2512.04013","citing_paper":"/paper/2605.02329"},"observation_digest":"sha256:7ece3ead9c330b907766d783440df4b16c8563857d570ab6f74c7d8b145e3327","observation_id":"8f48c869-091a-4c5a-8dbd-9b2d05ec1801","resolution":{"observed_at":"2026-07-13T02:18:53.109644Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"cited_work":{"arxiv_id":"2512.04013","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.04013","snapshot_observed_at":"2026-07-13T02:18:53.109644Z","title":"Augserve: Adaptive request scheduling for augmented large language model inference serving.arXiv preprint arXiv:2512.04013","venue":null,"work_id":"db9c599c-8592-4f4e-86ae-7452f2e012dd","year":null},"citing_paper":{"arxiv_id":"2605.02329","last_updated":"2026-08-11T12:56:52Z","snapshot_observed_at":"2026-08-14T14:13:59.083004Z","submitted_at":"2026-05-04T08:29:47Z","title":"Taming Request Imbalance: SLO-Aware Scheduling for Disaggregated LLM Inference","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-01T00:31:12.965178Z"},"links":{"cited_paper":"/paper/2512.04013","citing_paper":"/paper/2605.02329"},"observation_digest":"sha256:0078e2f1b2dba2566ba47ebd77c86430845ce54a0388498c5a1fb55ac576f4f6","observation_id":"2ba4fdb8-0140-4635-b7dc-25b138f82528","resolution":{"observed_at":"2026-07-13T02:18:53.109644Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2512.04013/citation-record","integrity":"/paper/2512.04013/integrity","json":"/paper/2512.04013/citation-record.json","paper":"/paper/2512.04013"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:27.386587Z","title":"Infercept: efficient intercept support for augmented large language model inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:27.386587Z"},"links":{"citing_paper":"/paper/2512.04013"},"observation_digest":"sha256:9767b77bd2c234e7f31e4501dca348cdbcbe03ef3f87cbcff0595e7c95b8e8e6","observation_id":"67c303cd-ba22-4a7b-86ad-464690d13be6","resolution":{"observed_at":"2026-08-03T18:43:27.386587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:27.512933Z","title":"Taming {Throughput-Latency} tradeoff in {LLM} inference with {Sarathi-Serve}","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:27.512933Z"},"links":{"citing_paper":"/paper/2512.04013"},"observation_digest":"sha256:6c1bf8b9284c63048f7a55f65be2d331b042ce01e9ff11001b53476fdd983044","observation_id":"ff7a8620-12a5-494a-a017-a9093cbe60bc","resolution":{"observed_at":"2026-08-03T18:43:27.512933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:27.628880Z","title":"Revisiting service level objectives and system level metrics in large language model serving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:27.628880Z"},"links":{"citing_paper":"/paper/2512.04013"},"observation_digest":"sha256:4f8003519da1a769bc58c4ab401c9a1a7f8ff0f914825142a2e10e667ab1b173","observation_id":"fd4a6a13-d068-4778-b4e5-fc8fa69a3ca3","resolution":{"observed_at":"2026-08-03T18:43:27.628880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:27.736822Z","title":"Model context protocol (mcp)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:27.736822Z"},"links":{"citing_paper":"/paper/2512.04013"},"observation_digest":"sha256:cd4ff49a95608fecee7ff582c2f804e3b31b975fe9cdf22903b2f2a149ee95d3","observation_id":"e9316851-8943-49d3-9131-6e569b986d96","resolution":{"observed_at":"2026-08-03T18:43:27.736822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:27.865578Z","title":"From good to great: Improving math reasoning with tool-augmented interleaf prompting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:27.865578Z"},"links":{"citing_paper":"/paper/2512.04013"},"observation_digest":"sha256:b30d2de47e57054e7e735e82296a68536d86ddaa8c0dc0dca8bf9079b7d9275c","observation_id":"f111267d-5bb3-4e45-a2ed-af70dde5d220","resolution":{"observed_at":"2026-08-03T18:43:27.865578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:28.132979Z","title":"Advancing tool-augmented large language models: Inte- grating insights from errors in inference trees.Advances in Neural Information Processing Systems, 37:106555– 106581, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:28.132979Z"},"links":{"citing_paper":"/paper/2512.04013"},"observation_digest":"sha256:e9fe80251082e4314b4c078ac05aad5357c7730874973c3bd0bf392c30e94c04","observation_id":"ff33d1e1-b9f0-4e2a-a8d3-751b46dbf341","resolution":{"observed_at":"2026-08-03T18:43:28.132979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14323","last_updated":"2023-11-06T11:00:26Z","snapshot_observed_at":"2026-08-13T11:35:16.869290Z","submitted_at":"2023-05-23T17:54:33Z","title":"ChatCoT: Tool-Augmented Chain-of-Thought Reasoning on Chat-based Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14323","snapshot_observed_at":"2026-08-03T18:43:28.220908Z","title":"Chat- cot: Tool-augmented chain-of-thought reasoning on chat-based large language models.arXiv preprint arXiv:2305.14323, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:28.220908Z"},"links":{"cited_paper":"/paper/2305.14323","citing_paper":"/paper/2512.04013"},"observation_digest":"sha256:ef2f3089c7df981ab2a75446c59d386406eba6636a931b08bf58af80d50314eb","observation_id":"2b363ce5-31f8-477c-b737-9ecb9df569cc","resolution":{"observed_at":"2026-08-03T18:43:28.220908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:28.358990Z","title":"Detecting hallucinations in large language models using semantic entropy.Nature, 630(8017):625– 630, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:28.358990Z"},"links":{"citing_paper":"/paper/2512.04013"},"observation_digest":"sha256:03fa749f650ad2fca8eeb17d28ba0573e2f0858c34f6baa91de67397bc44870f","observation_id":"4f543e4a-108e-424c-a310-63199f4d8aa5","resolution":{"observed_at":"2026-08-03T18:43:28.358990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01056","last_updated":"2025-06-24T06:27:29Z","snapshot_observed_at":"2026-08-07T11:49:43.837276Z","submitted_at":"2025-06-01T15:48:53Z","title":"MCP-Zero: Active Tool Discovery for Autonomous LLM Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01056","snapshot_observed_at":"2026-08-03T18:43:28.515792Z","title":"Mcp-zero: Proactive toolchain construction for llm agents from scratch.arXiv preprint arXiv:2506.01056, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:28.515792Z"},"links":{"cited_paper":"/paper/2506.01056","citing_paper":"/paper/2512.04013"},"observation_digest":"sha256:ea24c104284eabc48fc83a0af3533f41e0d33a83692968f536cb82fe46e082d1","observation_id":"e0bfac4b-a9e2-4e46-b71d-eaf42f765e6d","resolution":{"observed_at":"2026-08-03T18:43:28.515792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:28.642831Z","title":"Efficient llm scheduling by learning to rank.Advances in Neural Information Processing Systems, 37:59006–59029, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:28.642831Z"},"links":{"citing_paper":"/paper/2512.04013"},"observation_digest":"sha256:69601ba370593e06726bce52fc4b0b5f8917de2f90f8cb083ace91d663e5edb1","observation_id":"50c05bb9-0fe4-4866-bb0b-8cde0a358e20","resolution":{"observed_at":"2026-08-03T18:43:28.642831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:28.718262Z","title":"Jetcheva, and Hardi Trivedi","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:28.718262Z"},"links":{"citing_paper":"/paper/2512.04013"},"observation_digest":"sha256:efd5afc9e59ed60e3151a00665109eaddee63f275efe3b6b1e658d350a60ae8a","observation_id":"066f641a-bbf7-4a02-a9f5-7308e1fa448d","resolution":{"observed_at":"2026-08-03T18:43:28.718262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:28.880808Z","title":"Apt-serve: Adaptive request scheduling on hybrid cache for scalable llm inference serving.Proceedings of the ACM on Management of Data, 3(3):1–28, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:28.880808Z"},"links":{"citing_paper":"/paper/2512.04013"},"observation_digest":"sha256:1ebfb068d68c328db9e62d3329ecd8f6f9adb669e3f88819bb5874ac10a237b3","observation_id":"b7557ef2-f386-4d82-86f8-bcdf36f92130","resolution":{"observed_at":"2026-08-03T18:43:28.880808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07017","last_updated":"2024-12-09T21:53:10Z","snapshot_observed_at":"2026-08-11T19:11:01.868140Z","submitted_at":"2024-12-09T21:53:10Z","title":"Asynchronous LLM Function Calling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07017","snapshot_observed_at":"2026-08-03T18:43:29.008241Z","title":"Asynchronous llm function calling.arXiv preprint arXiv:2412.07017, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:29.008241Z"},"links":{"cited_paper":"/paper/2412.07017","citing_paper":"/paper/2512.04013"},"observation_digest":"sha256:0ba10dadbe524da4b4468ff6e7b9701bd98f3f2882a73a9f85f53e865aefe319","observation_id":"cd7e3ae0-b221-4779-996c-64e3fa541e64","resolution":{"observed_at":"2026-08-03T18:43:29.008241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:29.138575Z","title":"A study on classi- fication based concurrent api calls and optimal model combination for tool augmented llms for ai agent.Sci- entific Reports, 15(1):20579, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:29.138575Z"},"links":{"citing_paper":"/paper/2512.04013"},"observation_digest":"sha256:44c96b70bef2f07d4f910d2b66b1792ee9f33e77ab502c0117dbb1aa7d217863","observation_id":"03f327b7-3238-4f4f-8c35-82e0b97cb622","resolution":{"observed_at":"2026-08-03T18:43:29.138575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:29.281902Z","title":"Toolkengpt: Augmenting frozen language models with massive tools via tool embeddings.Advances in neural information processing systems, 36:45870–45894, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:29.281902Z"},"links":{"citing_paper":"/paper/2512.04013"},"observation_digest":"sha256:611e1a427b8e9a199e56f141e9c1a006fb74adc9b7ade59b7c99587685485fae","observation_id":"cf67f45b-3f9e-4fbf-8534-75b8eedb9a7c","resolution":{"observed_at":"2026-08-03T18:43:29.281902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:29.481736Z","title":"Shuffleinfer: Disaggregate llm inference for mixed downstream workloads.ACM Transactions on Architecture and Code Optimization, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:29.481736Z"},"links":{"citing_paper":"/paper/2512.04013"},"observation_digest":"sha256:543346784a60dafc6afc88b086643e5896c1bb71ef8a8f26b39605157f5bce89","observation_id":"59bc1e72-68c0-48f4-a4f0-72f2ad15655a","resolution":{"observed_at":"2026-08-03T18:43:29.481736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:29.608669Z","title":"Tightllm: Maximizing throughput for llm inference via adaptive offloading policy.IEEE Transactions on Computers, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:29.608669Z"},"links":{"citing_paper":"/paper/2512.04013"},"observation_digest":"sha256:4e7e8b93a254ecb36e1c31f854c467b63e750112054cbca7ff8ae3eee6188d79","observation_id":"f02c14a8-c891-432f-9f95-b01ee43d2528","resolution":{"observed_at":"2026-08-03T18:43:29.608669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:29.714372Z","title":"Accelerating llm serving for multi-turn dialogues with efficient resource management","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:29.714372Z"},"links":{"citing_paper":"/paper/2512.04013"},"observation_digest":"sha256:410f7dd6e7758839a348246993d57660f08ee5d0758a8e5556bd9c2d42f6d1f8","observation_id":"24de9e02-25b6-469b-82f7-bc4c0ccd6b7b","resolution":{"observed_at":"2026-08-03T18:43:29.714372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:29.817105Z","title":"S3: increasing gpu utilization during generative inference for higher throughput","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:29.817105Z"},"links":{"citing_paper":"/paper/2512.04013"},"observation_digest":"sha256:b22b21ead18f56399aedd365d39742331fa22d513043b1c6e0e617ec60af99a3","observation_id":"a8d071d6-57ed-4f8f-8dd5-3ce9ab223eb4","resolution":{"observed_at":"2026-08-03T18:43:29.817105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:29.929131Z","title":"Optimizing goodput through sharing for batch analytics with deadlines","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:29.929131Z"},"links":{"citing_paper":"/paper/2512.04013"},"observation_digest":"sha256:769a7fc57ea3b44a544943f69a324bdfcba4f6cbdea8887481f9414005175c06","observation_id":"c8832e6e-db31-4eb7-8d6e-95543d8339ec","resolution":{"observed_at":"2026-08-03T18:43:29.929131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:30.046652Z","title":"Efficient memory manage- ment for large language model serving with pagedatten- tion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:30.046652Z"},"links":{"citing_paper":"/paper/2512.04013"},"observation_digest":"sha256:d3d21f2a3559b2990232425d7847b7daaeaf4ad91bb2bbc82c8ba764fcb0547a","observation_id":"314f4266-187f-4d0c-a260-22b32d2659c0","resolution":{"observed_at":"2026-08-03T18:43:30.046652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08775","last_updated":"2024-01-31T04:11:42Z","snapshot_observed_at":"2026-08-14T03:22:10.637651Z","submitted_at":"2023-07-17T18:42:05Z","title":"GEAR: Augmenting Language Models with Generalizable and Efficient Tool Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08775","snapshot_observed_at":"2026-08-03T18:43:30.156406Z","title":"Gear: Augmenting language models with generalizable and ef- ficient tool resolution.arXiv preprint arXiv:2307.08775, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:30.156406Z"},"links":{"cited_paper":"/paper/2307.08775","citing_paper":"/paper/2512.04013"},"observation_digest":"sha256:d8ccc7ded34bfd865b9ee2767ea910ae5734814c067aca843a01f7b00f7c9a5c","observation_id":"fc265919-a298-41fc-9975-27457dc032d4","resolution":{"observed_at":"2026-08-03T18:43:30.156406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07842","last_updated":"2023-02-15T18:25:52Z","snapshot_observed_at":"2026-07-30T02:11:00.198428Z","submitted_at":"2023-02-15T18:25:52Z","title":"Augmented Language Models: a Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07842","snapshot_observed_at":"2026-08-03T18:43:30.283410Z","title":"Augmented language models: a sur- vey.arXiv preprint arXiv:2302.07842, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:30.283410Z"},"links":{"cited_paper":"/paper/2302.07842","citing_paper":"/paper/2512.04013"},"observation_digest":"sha256:fb42fdfc198036867f984861beebade5aeef54156f619e7996691b40b475dd94","observation_id":"17fea0fe-b551-4dd8-a24a-e3a6176f7ac5","resolution":{"observed_at":"2026-08-03T18:43:30.283410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:30.405668Z","title":"Introducing function calling in chatgpt","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:30.405668Z"},"links":{"citing_paper":"/paper/2512.04013"},"observation_digest":"sha256:e29b756be3700f8b472a582cf7f0ccef269c31bac558daf46a20759877a80a48","observation_id":"c2596146-f0f2-4e60-97d9-32de7bad0821","resolution":{"observed_at":"2026-08-03T18:43:30.405668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:30.513540Z","title":"Splitwise: Efficient generative llm inference using phase splitting","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:30.513540Z"},"links":{"citing_paper":"/paper/2512.04013"},"observation_digest":"sha256:249f7feae9ab7428bbb27ade799bccd70425e5c31966c1f0f7a0229526596b56","observation_id":"63ab32b7-83fa-424d-880e-4ae40400bbf6","resolution":{"observed_at":"2026-08-03T18:43:30.513540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:30.592405Z","title":"WebRL: Training LLM web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:30.592405Z"},"links":{"citing_paper":"/paper/2512.04013"},"observation_digest":"sha256:51f7607b43254b7fedbac395cc3b12bc12813c0c3fc83b9e2e82f335cc815d89","observation_id":"d56e7b59-8ed3-4411-bdbd-5068a2497485","resolution":{"observed_at":"2026-08-03T18:43:30.592405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:30.703365Z","title":"Tool learning with foun- dation models.ACM Computing Surveys, 57(4):1–40, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:30.703365Z"},"links":{"citing_paper":"/paper/2512.04013"},"observation_digest":"sha256:38e8307d4f3b116d12fafc56f657bb6f03d758600f9d8db89e30cdcdf4db93d7","observation_id":"be7f0d62-8ea7-4f7c-b5be-da4706076009","resolution":{"observed_at":"2026-08-03T18:43:30.703365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:30.788942Z","title":"ToolLLM: Facilitating large lan- guage models to master 16000+ real-world APIs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:30.788942Z"},"links":{"citing_paper":"/paper/2512.04013"},"observation_digest":"sha256:79c24bb82f21f4ed923f826d41dc897468ac8994fe9bf8724bfc470bdb12f1c6","observation_id":"a85e1ebb-75a7-461b-9321-65bb6eb50b70","resolution":{"observed_at":"2026-08-03T18:43:30.788942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:30.897508Z","title":"Tool- former: Language models can teach themselves to use tools.Advances in Neural Information Processing Sys- tems, 36:68539–68551, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:30.897508Z"},"links":{"citing_paper":"/paper/2512.04013"},"observation_digest":"sha256:e83719445d2ad7f06356a799b6139fbd2879505de9a6a3837fb18f758150e4b4","observation_id":"b06a4ee4-7246-419b-afb6-62c7d28dbc26","resolution":{"observed_at":"2026-08-03T18:43:30.897508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:31.007239Z","title":"DON’t STOP ME NOW: EMBEDDING BASED SCHEDULING FOR LLMS","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:31.007239Z"},"links":{"citing_paper":"/paper/2512.04013"},"observation_digest":"sha256:0f6b825c835666562147ed731a8cde84789a45cce55177c3aea91c61327d7b88","observation_id":"6650787b-9992-4f2d-9483-c76ed4992d1f","resolution":{"observed_at":"2026-08-03T18:43:31.007239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18248","last_updated":"2024-10-25T19:18:00Z","snapshot_observed_at":"2026-08-12T22:16:25.043715Z","submitted_at":"2024-10-23T19:53:30Z","title":"Fast Inference for Augmented Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18248","snapshot_observed_at":"2026-08-03T18:43:31.141452Z","title":"Fast in- ference for augmented large language models.arXiv preprint arXiv:2410.18248, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:31.141452Z"},"links":{"cited_paper":"/paper/2410.18248","citing_paper":"/paper/2512.04013"},"observation_digest":"sha256:f07913f1e936ecd24a360a59158921b42a0e639ba8cc94dd17e3fcafede5c3e3","observation_id":"c4333ffe-36c9-4718-8fcf-4bca5319d1ed","resolution":{"observed_at":"2026-08-03T18:43:31.141452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:31.288578Z","title":"Flexgen: High-throughput generative inference of large language models with a single gpu","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:31.288578Z"},"links":{"citing_paper":"/paper/2512.04013"},"observation_digest":"sha256:22eb4a1708719c9bd108f92f802c06c424813a322d778c41a952d7750d72d2a7","observation_id":"c11fd6a3-c04c-497f-8dd2-a1f9f578d4e2","resolution":{"observed_at":"2026-08-03T18:43:31.288578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10081","last_updated":"2024-09-21T08:27:16Z","snapshot_observed_at":"2026-08-13T00:53:41.480879Z","submitted_at":"2024-03-15T07:45:37Z","title":"DRAGIN: Dynamic Retrieval Augmented Generation based on the Information Needs of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10081","snapshot_observed_at":"2026-08-03T18:43:31.398999Z","title":"Dragin: dynamic retrieval augmented gener- ation based on the information needs of large language models.arXiv preprint arXiv:2403.10081, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:31.398999Z"},"links":{"cited_paper":"/paper/2403.10081","citing_paper":"/paper/2512.04013"},"observation_digest":"sha256:2904286cf26a81a4e7675f69f10269bcbdede1e2060c7ccff4bedca00601f88e","observation_id":"a57485fd-c763-4d24-aca8-c80aab7ebf60","resolution":{"observed_at":"2026-08-03T18:43:31.398999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:31.543812Z","title":"Wang and A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:31.543812Z"},"links":{"citing_paper":"/paper/2512.04013"},"observation_digest":"sha256:819433df199966b10e077f1e0bb41e4afa7e66a0e4203f5883c972a7c7e00897","observation_id":"7aa51e48-48a6-48e3-bb39-5646e1755402","resolution":{"observed_at":"2026-08-03T18:43:31.543812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05920","last_updated":"2024-09-25T05:57:51Z","snapshot_observed_at":"2026-08-09T14:08:47.340904Z","submitted_at":"2023-05-10T06:17:50Z","title":"Fast Distributed Inference Serving for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.05920","snapshot_observed_at":"2026-08-03T18:43:31.712787Z","title":"Fast distributed inference serving for large language models.arXiv preprint arXiv:2305.05920, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:31.712787Z"},"links":{"cited_paper":"/paper/2305.05920","citing_paper":"/paper/2512.04013"},"observation_digest":"sha256:461b9e8bc11602148b2af3b0c467a298a3efac324a1ca3ec6462d1f42919ccc8","observation_id":"82bd4dbd-0214-47f3-b765-0934590afe9b","resolution":{"observed_at":"2026-08-03T18:43:31.712787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18973","last_updated":"2025-08-22T01:07:00Z","snapshot_observed_at":"2026-08-06T14:25:40.020255Z","submitted_at":"2025-07-25T05:57:47Z","title":"A Toolbox, Not a Hammer -- Multi-TAG: Scaling Math Reasoning with Multi-Tool Aggregation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18973","snapshot_observed_at":"2026-08-03T18:43:31.887361Z","title":"A toolbox, not a hammer– multi-tag: Scaling math reasoning with multi-tool aggre- gation.arXiv preprint arXiv:2507.18973, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:31.887361Z"},"links":{"cited_paper":"/paper/2507.18973","citing_paper":"/paper/2512.04013"},"observation_digest":"sha256:d96db0ae1f2f045e2a578970fd30b44017243932f8a40dc22d89b7bd5f054681","observation_id":"656bd126-cf33-4f5a-968f-a9d99d15cf4a","resolution":{"observed_at":"2026-08-03T18:43:31.887361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:32.048467Z","title":"Orca: A distributed serving system for {Transformer-Based} generative models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:32.048467Z"},"links":{"citing_paper":"/paper/2512.04013"},"observation_digest":"sha256:e9844adbeae60e52a7d3fbb2fa7361cf9160af247c0ad4264521c1e8e98f9297","observation_id":"db4ca4a5-0cef-42e8-86a2-46bcad201e81","resolution":{"observed_at":"2026-08-03T18:43:32.048467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:32.163793Z","title":"{SHEPHERD}: Serving {DNNs} in the wild","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:32.163793Z"},"links":{"citing_paper":"/paper/2512.04013"},"observation_digest":"sha256:5df1682075d8ecc8fd155a6b32b0caf789d844b6ffa9ea95cd15fc6f88196c8f","observation_id":"21731362-e518-4e15-8f5b-d16505317704","resolution":{"observed_at":"2026-08-03T18:43:32.163793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-03T18:43:32.279616Z","title":"Opt: Open pre-trained transformer language models.arXiv preprint arXiv:2205.01068, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:32.279616Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2512.04013"},"observation_digest":"sha256:026db88a61dc9ade432ddd985892d3582ee7d647b90c2d56b24a3b4aef40a7dc","observation_id":"bf4d822e-3346-4f3d-8fa1-a1fc2168bb5d","resolution":{"observed_at":"2026-08-03T18:43:32.279616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:32.371311Z","title":"Webpilot: a versatile and au- tonomous multi-agent system for web task execution with strategic exploration","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:32.371311Z"},"links":{"citing_paper":"/paper/2512.04013"},"observation_digest":"sha256:64cc748d5d9fc5dcc1ef50d9e6a17c2deee048ddfbb06e3168490c0c48d23ab8","observation_id":"c3093174-0517-4fa4-b929-d3879215e197","resolution":{"observed_at":"2026-08-03T18:43:32.371311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:32.451871Z","title":"Response length perception and sequence scheduling: an llm-empowered llm infer- ence pipeline","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:32.451871Z"},"links":{"citing_paper":"/paper/2512.04013"},"observation_digest":"sha256:1db50c5d6174fb268019b5a9047f80eac476bf4927af7631163201bc2f638ddf","observation_id":"5c9b5d6f-6bb7-494e-afd6-e67a180a207f","resolution":{"observed_at":"2026-08-03T18:43:32.451871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:32.575076Z","title":"{DistServe}: Disaggregating prefill and decoding for goodput-optimized large language model serving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:32.575076Z"},"links":{"citing_paper":"/paper/2512.04013"},"observation_digest":"sha256:2722b599e4722b30d38298de7a2748b30fc5bc564acab807fcca8c73803663db","observation_id":"57fa7e3a-34fc-44d3-8ed9-f0a0e70fc139","resolution":{"observed_at":"2026-08-03T18:43:32.575076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:43:27.933278Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T18:43:27.933278Z"},"links":{"citing_paper":"/paper/2512.04013"},"observation_digest":"sha256:8bd8b67d029b5b87cf08c92a867c769fba2d97a665477a771ab3b7a02383f576","observation_id":"b8dfccfb-94c0-42b7-b120-56c57d07f7f7","resolution":{"observed_at":"2026-08-03T18:43:27.933278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2512.04013","last_updated":"2026-07-10T15:00:48Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T06:32:13.288719Z","submitted_at":"2025-12-03T17:49:38Z","title":"AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 4 inbound Pith citation observations for arXiv:2512.04013."}