{"as_of":"2026-08-16T08:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:61c9ee2f0e8d6a4ab8ab69ad6330d90ea34a5ba27a0a9db2f7851595536a7bf4","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:43:40.034740Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2601.20408/citation-record","integrity":"/paper/2601.20408/integrity","json":"/paper/2601.20408/citation-record.json","paper":"/paper/2601.20408"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.04323","last_updated":"2025-02-20T03:57:18Z","snapshot_observed_at":"2026-08-13T23:54:41.224756Z","submitted_at":"2024-08-08T09:06:41Z","title":"SCOOT: SLO-Oriented Performance Tuning for LLM Inference Engines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04323","snapshot_observed_at":"2026-08-15T15:43:39.740486Z","title":"Cobbe, K., Kosaraju, V ., Bavarian, M., Chen, M., Jun, H., Kaiser, L., Plappert, M., Tworek, J., Hilton, J., Nakano, R., Hesse, C., and Schulman, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.20408","last_updated":"2026-06-08T09:56:22Z","snapshot_observed_at":"2026-08-16T07:43:31.132807Z","submitted_at":"2026-01-28T09:13:17Z","title":"Meeting SLOs, Slashing Hours: Automated Enterprise LLM Optimization with OptiKIT","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:39.740486Z"},"links":{"cited_paper":"/paper/2408.04323","citing_paper":"/paper/2601.20408"},"observation_digest":"sha256:73408ed32585e840a43db9d002e631dc937abdaf63cbca005352b2510877d794","observation_id":"db620c7d-7f74-4040-b393-cbad5dc1bbbe","resolution":{"observed_at":"2026-08-15T15:43:39.740486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:40.406696Z","title":"Values are normalized per-GPU RPS (SLO- compliant)","venue":null,"work_id":"f07102d8-46e4-425e-9108-e551db4c9a55","year":2000},"citing_paper":{"arxiv_id":"2601.20408","last_updated":"2026-06-08T09:56:22Z","snapshot_observed_at":"2026-08-16T07:43:31.132807Z","submitted_at":"2026-01-28T09:13:17Z","title":"Meeting SLOs, Slashing Hours: Automated Enterprise LLM Optimization with OptiKIT","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:40.031020Z"},"links":{"citing_paper":"/paper/2601.20408"},"observation_digest":"sha256:41589636286809facb5484f996ee7d32d42e5bf6a329220a20e495151c52d68b","observation_id":"dc86fafa-233b-47d3-a33b-b420c91fcf27","resolution":{"observed_at":"2026-08-15T15:43:40.410662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1510.00149","last_updated":"2016-02-15T06:25:40Z","snapshot_observed_at":"2026-08-04T16:59:47.843960Z","submitted_at":"2015-10-01T09:03:44Z","title":"Deep Compression: Compressing Deep Neural Networks with Pruning, Trained Quantization and Huffman Coding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1510.00149","snapshot_observed_at":"2026-08-15T15:43:39.752107Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.20408","last_updated":"2026-06-08T09:56:22Z","snapshot_observed_at":"2026-08-16T07:43:31.132807Z","submitted_at":"2026-01-28T09:13:17Z","title":"Meeting SLOs, Slashing Hours: Automated Enterprise LLM Optimization with OptiKIT","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:39.752107Z"},"links":{"cited_paper":"/paper/1510.00149","citing_paper":"/paper/2601.20408"},"observation_digest":"sha256:40ddb7bf3554f179c4f836286b2ca840b58f09e8345a7d073020eb963c6498e7","observation_id":"5fa9a87e-09d6-4ab2-8248-764f735a30d1","resolution":{"observed_at":"2026-08-15T15:43:39.752107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.05433","last_updated":"2022-09-29T20:47:07Z","snapshot_observed_at":"2026-08-14T05:39:52.416140Z","submitted_at":"2022-09-12T17:39:55Z","title":"FP8 Formats for Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.05433","snapshot_observed_at":"2026-08-15T15:43:39.774740Z","title":"co/datasets/neuralmagic/ LLM-compression-calibration","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.20408","last_updated":"2026-06-08T09:56:22Z","snapshot_observed_at":"2026-08-16T07:43:31.132807Z","submitted_at":"2026-01-28T09:13:17Z","title":"Meeting SLOs, Slashing Hours: Automated Enterprise LLM Optimization with OptiKIT","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:39.774740Z"},"links":{"cited_paper":"/paper/2209.05433","citing_paper":"/paper/2601.20408"},"observation_digest":"sha256:98c40eecd2109916da85443bda49f6c9953a1e7f7821179b273809542e599200","observation_id":"7a58d578-000b-4b15-8ac0-ead3955c3490","resolution":{"observed_at":"2026-08-15T15:43:39.774740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08378","last_updated":"2021-04-16T21:27:32Z","snapshot_observed_at":"2026-08-13T19:38:24.671428Z","submitted_at":"2021-04-16T21:27:32Z","title":"Accelerating Sparse Deep Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08378","snapshot_observed_at":"2026-08-15T15:43:39.831138Z","title":"Mistral AI Team","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.20408","last_updated":"2026-06-08T09:56:22Z","snapshot_observed_at":"2026-08-16T07:43:31.132807Z","submitted_at":"2026-01-28T09:13:17Z","title":"Meeting SLOs, Slashing Hours: Automated Enterprise LLM Optimization with OptiKIT","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:39.831138Z"},"links":{"cited_paper":"/paper/2104.08378","citing_paper":"/paper/2601.20408"},"observation_digest":"sha256:574e3f9be7e64a1604e622f6a96af01166b32351a348ee790d96cfd1d03b0032","observation_id":"7aca0f86-6382-4244-b211-bb5a32d3cdec","resolution":{"observed_at":"2026-08-15T15:43:39.831138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:40.418382Z","title":"Meeting SLOs, Slashing Hours: Automated Enterprise LLM Optimization with OptiKIT NVIDIA Corporation","venue":null,"work_id":"11fea300-d636-418f-8236-f5953d1b92ec","year":2024},"citing_paper":{"arxiv_id":"2601.20408","last_updated":"2026-06-08T09:56:22Z","snapshot_observed_at":"2026-08-16T07:43:31.132807Z","submitted_at":"2026-01-28T09:13:17Z","title":"Meeting SLOs, Slashing Hours: Automated Enterprise LLM Optimization with OptiKIT","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:39.935237Z"},"links":{"citing_paper":"/paper/2601.20408"},"observation_digest":"sha256:dc16b6f94375f175ebe2785e22d65354318c99a179f5ec75f039470092baf836","observation_id":"a53b15aa-46dc-4f40-8945-683477a383ed","resolution":{"observed_at":"2026-08-15T15:43:40.422056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20835","last_updated":"2024-06-05T09:53:18Z","snapshot_observed_at":"2026-08-14T13:03:43.318778Z","submitted_at":"2024-05-31T14:24:33Z","title":"Outliers and Calibration Sets have Diminishing Effect on Quantization of Modern LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20835","snapshot_observed_at":"2026-08-15T15:43:39.999023Z","title":"Outliers and calibration sets have diminishing ef- fect on quantization of modern llms.arXiv preprint arXiv:2405.20835,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.20408","last_updated":"2026-06-08T09:56:22Z","snapshot_observed_at":"2026-08-16T07:43:31.132807Z","submitted_at":"2026-01-28T09:13:17Z","title":"Meeting SLOs, Slashing Hours: Automated Enterprise LLM Optimization with OptiKIT","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:39.999023Z"},"links":{"cited_paper":"/paper/2405.20835","citing_paper":"/paper/2601.20408"},"observation_digest":"sha256:7f36acf74f061f4780c998b70c2e6d0186809042227f7ae5f664fc68a31a1948","observation_id":"b168973b-90f7-4e24-8165-29ba09525c8c","resolution":{"observed_at":"2026-08-15T15:43:39.999023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:40.003167Z","title":"A survey on inference engines for large language mod- els: Perspectives on optimization and efficiency.arXiv preprint arXiv:2505.01658,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.20408","last_updated":"2026-06-08T09:56:22Z","snapshot_observed_at":"2026-08-16T07:43:31.132807Z","submitted_at":"2026-01-28T09:13:17Z","title":"Meeting SLOs, Slashing Hours: Automated Enterprise LLM Optimization with OptiKIT","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:40.003167Z"},"links":{"citing_paper":"/paper/2601.20408"},"observation_digest":"sha256:e58813b9542736a6d535d35d52d916197e92b7fd853882fede94679dd06f343f","observation_id":"41e6031f-1b1c-4d64-8de8-6c1363ddbe83","resolution":{"observed_at":"2026-08-15T15:43:40.003167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-15T15:43:40.006956Z","title":"Sun, M., Liu, Z., Bair, A., and Kolter, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.20408","last_updated":"2026-06-08T09:56:22Z","snapshot_observed_at":"2026-08-16T07:43:31.132807Z","submitted_at":"2026-01-28T09:13:17Z","title":"Meeting SLOs, Slashing Hours: Automated Enterprise LLM Optimization with OptiKIT","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:40.006956Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2601.20408"},"observation_digest":"sha256:fcc0d1ac1bdbe6a83a008a2bab79acc74b1822e999c95133912d95ba14123d1a","observation_id":"183ffb50-63f3-45e4-a35c-21993c227f22","resolution":{"observed_at":"2026-08-15T15:43:40.006956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09748","last_updated":"2024-02-15T06:58:30Z","snapshot_observed_at":"2026-08-14T21:16:42.407609Z","submitted_at":"2024-02-15T06:58:30Z","title":"Model Compression and Efficient Inference for Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09748","snapshot_observed_at":"2026-08-15T15:43:40.010677Z","title":"Model compression and efficient inference for large language models: A survey","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.20408","last_updated":"2026-06-08T09:56:22Z","snapshot_observed_at":"2026-08-16T07:43:31.132807Z","submitted_at":"2026-01-28T09:13:17Z","title":"Meeting SLOs, Slashing Hours: Automated Enterprise LLM Optimization with OptiKIT","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:40.010677Z"},"links":{"cited_paper":"/paper/2402.09748","citing_paper":"/paper/2601.20408"},"observation_digest":"sha256:cf950e20c25dd54bbf571f7827de452cd9193f26bce1b4d9ea8016f6d05d86a3","observation_id":"2306c056-9a67-424b-802e-e303b40a6da9","resolution":{"observed_at":"2026-08-15T15:43:40.010677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09755","last_updated":"2024-08-12T17:57:00Z","snapshot_observed_at":"2026-08-15T04:16:17.835668Z","submitted_at":"2023-11-16T10:30:00Z","title":"On the Impact of Calibration Data in Post-training Quantization and Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09755","snapshot_observed_at":"2026-08-15T15:43:40.014564Z","title":"and Aletras, N","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.20408","last_updated":"2026-06-08T09:56:22Z","snapshot_observed_at":"2026-08-16T07:43:31.132807Z","submitted_at":"2026-01-28T09:13:17Z","title":"Meeting SLOs, Slashing Hours: Automated Enterprise LLM Optimization with OptiKIT","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:40.014564Z"},"links":{"cited_paper":"/paper/2311.09755","citing_paper":"/paper/2601.20408"},"observation_digest":"sha256:06746dace4a1c009ee1b95989d3ab8af2e88719defe48172873e15ddcee6b6e8","observation_id":"41730741-cd6e-472f-a00c-7fdfbb9490b4","resolution":{"observed_at":"2026-08-15T15:43:40.014564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15303","last_updated":"2025-04-18T08:59:11Z","snapshot_observed_at":"2026-08-16T02:45:04.187462Z","submitted_at":"2025-04-18T08:59:11Z","title":"High-Throughput LLM inference on Heterogeneous Clusters","version":1},"cited_work":{"arxiv_id":"2504.15303","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.15303","snapshot_observed_at":"2026-08-15T15:43:40.094814Z","title":"High-Throughput LLM inference on Heterogeneous Clusters","venue":"cs.DC","work_id":"d101cec3-db59-4c82-bf36-5d86c0ea1c14","year":2025},"citing_paper":{"arxiv_id":"2601.20408","last_updated":"2026-06-08T09:56:22Z","snapshot_observed_at":"2026-08-16T07:43:31.132807Z","submitted_at":"2026-01-28T09:13:17Z","title":"Meeting SLOs, Slashing Hours: Automated Enterprise LLM Optimization with OptiKIT","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:40.017881Z"},"links":{"cited_paper":"/paper/2504.15303","citing_paper":"/paper/2601.20408"},"observation_digest":"sha256:23cad0e71b7224b0beab25df675b876044e046e80d39f34a295c9954bc84410b","observation_id":"39c01b4e-163c-4b5e-adf0-7200a49278c6","resolution":{"observed_at":"2026-08-15T15:43:40.100630Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19720","last_updated":"2025-04-28T12:14:02Z","snapshot_observed_at":"2026-08-16T07:43:12.291655Z","submitted_at":"2025-04-28T12:14:02Z","title":"Taming the Titans: A Survey of Efficient LLM Inference Serving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19720","snapshot_observed_at":"2026-08-15T15:43:40.020798Z","title":"Taming the titans: A survey of efficient llm inference serving.arXiv preprint arXiv:2504.19720,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.20408","last_updated":"2026-06-08T09:56:22Z","snapshot_observed_at":"2026-08-16T07:43:31.132807Z","submitted_at":"2026-01-28T09:13:17Z","title":"Meeting SLOs, Slashing Hours: Automated Enterprise LLM Optimization with OptiKIT","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:40.020798Z"},"links":{"cited_paper":"/paper/2504.19720","citing_paper":"/paper/2601.20408"},"observation_digest":"sha256:6a21e5af8bb33bce540a0977e630d6ff3bd71b928662a8b8df71e5d7f85e3787","observation_id":"b8329d69-3ab0-4e7d-9cc0-4ba684ce9bfc","resolution":{"observed_at":"2026-08-15T15:43:40.020798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-08-11T10:42:54.633244Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-15T15:43:40.024288Z","title":"Zhou, J., Lu, T., Mishra, S., Brahma, S., Basu, S., Luan, Y ., Zhou, D., and Hou, L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.20408","last_updated":"2026-06-08T09:56:22Z","snapshot_observed_at":"2026-08-16T07:43:31.132807Z","submitted_at":"2026-01-28T09:13:17Z","title":"Meeting SLOs, Slashing Hours: Automated Enterprise LLM Optimization with OptiKIT","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:40.024288Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2601.20408"},"observation_digest":"sha256:5ec70a0169e65478a0d95d5732adaf9dc74048512d6dbac35ffc725798201b05","observation_id":"f6e18d0b-5288-4ca0-9daf-fc96008c04ef","resolution":{"observed_at":"2026-08-15T15:43:40.024288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14294","last_updated":"2024-07-19T04:47:36Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T15:53:08Z","title":"A Survey on Efficient Inference for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14294","snapshot_observed_at":"2026-08-15T15:43:40.027135Z","title":"A survey on effi- cient inference for large language models.arXiv preprint arXiv:2404.14294,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.20408","last_updated":"2026-06-08T09:56:22Z","snapshot_observed_at":"2026-08-16T07:43:31.132807Z","submitted_at":"2026-01-28T09:13:17Z","title":"Meeting SLOs, Slashing Hours: Automated Enterprise LLM Optimization with OptiKIT","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:40.027135Z"},"links":{"cited_paper":"/paper/2404.14294","citing_paper":"/paper/2601.20408"},"observation_digest":"sha256:bd8e45d5845446d3b81e4de45880ea4556de0304004bd6fb445b137748f8488a","observation_id":"576d568f-9d7f-4671-b22f-9c26a43edb38","resolution":{"observed_at":"2026-08-15T15:43:40.027135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:43:40.305343Z","title":"FP16 baseline across models, tensor parallelism, and bitwidths","venue":null,"work_id":"2c5335ab-d053-4227-9f45-b83279a534be","year":2000},"citing_paper":{"arxiv_id":"2601.20408","last_updated":"2026-06-08T09:56:22Z","snapshot_observed_at":"2026-08-16T07:43:31.132807Z","submitted_at":"2026-01-28T09:13:17Z","title":"Meeting SLOs, Slashing Hours: Automated Enterprise LLM Optimization with OptiKIT","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:40.034740Z"},"links":{"citing_paper":"/paper/2601.20408"},"observation_digest":"sha256:d676321fcb72e8e7c00a6cd8284bd10c9ab236c0bfc484dd16249ee99a0679b6","observation_id":"5e838d80-e8f9-4693-87c2-6e7ad83e05dc","resolution":{"observed_at":"2026-08-15T15:43:40.399156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-15T15:43:39.735588Z","title":"Chavan, A., Magazine, R., Kushwaha, S., Debbah, M., and Gupta, D","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2601.20408","last_updated":"2026-06-08T09:56:22Z","snapshot_observed_at":"2026-08-16T07:43:31.132807Z","submitted_at":"2026-01-28T09:13:17Z","title":"Meeting SLOs, Slashing Hours: Automated Enterprise LLM Optimization with OptiKIT","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:39.735588Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2601.20408"},"observation_digest":"sha256:905013065784998dcae6a8f18a8d2433506cac71ed19e656cb0e5a58d6a4d6ef","observation_id":"271f6761-79f9-4155-99ad-c7bd0d925bb8","resolution":{"observed_at":"2026-08-15T15:43:39.735588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-08-13T11:24:04.469181Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-08-15T15:43:39.744744Z","title":"Spqr: A sparse-quantized representation for near-lossless llm weight compression.arXiv preprint arXiv:2306.03078,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.20408","last_updated":"2026-06-08T09:56:22Z","snapshot_observed_at":"2026-08-16T07:43:31.132807Z","submitted_at":"2026-01-28T09:13:17Z","title":"Meeting SLOs, Slashing Hours: Automated Enterprise LLM Optimization with OptiKIT","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:39.744744Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2601.20408"},"observation_digest":"sha256:4122b8e7a31e3a4e321a9bab7e899a4ece4adb05ab683507c441861f1992d8be","observation_id":"b24b7d7e-40e5-464e-88b1-ac0fa8935649","resolution":{"observed_at":"2026-08-15T15:43:39.744744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-16T07:57:19.216626Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-15T15:43:39.748630Z","title":"Gptq: Accurate post-training quantization for generative pre- trained transformers.arXiv preprint arXiv:2210.17323,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.20408","last_updated":"2026-06-08T09:56:22Z","snapshot_observed_at":"2026-08-16T07:43:31.132807Z","submitted_at":"2026-01-28T09:13:17Z","title":"Meeting SLOs, Slashing Hours: Automated Enterprise LLM Optimization with OptiKIT","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:39.748630Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2601.20408"},"observation_digest":"sha256:559bf5bb7880dd41a89c75cc49d005607b2298e00d199b39e96ad3f73321e2a3","observation_id":"de2024b6-7be4-4441-b023-1ac803709582","resolution":{"observed_at":"2026-08-15T15:43:39.748630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T15:43:39.589707Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.20408","last_updated":"2026-06-08T09:56:22Z","snapshot_observed_at":"2026-08-16T07:43:31.132807Z","submitted_at":"2026-01-28T09:13:17Z","title":"Meeting SLOs, Slashing Hours: Automated Enterprise LLM Optimization with OptiKIT","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:39.589707Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2601.20408"},"observation_digest":"sha256:583fad9d3946a263f892d93e5991519cd960f730c8337c252c009f39ed1cbbd8","observation_id":"e892688b-f940-409e-8afb-5464599442eb","resolution":{"observed_at":"2026-08-15T15:43:39.589707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-15T15:43:39.686068Z","title":"Brown, T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.20408","last_updated":"2026-06-08T09:56:22Z","snapshot_observed_at":"2026-08-16T07:43:31.132807Z","submitted_at":"2026-01-28T09:13:17Z","title":"Meeting SLOs, Slashing Hours: Automated Enterprise LLM Optimization with OptiKIT","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T15:43:39.686068Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2601.20408"},"observation_digest":"sha256:4470595f60ff3777acd2bd01e393d11c0cc6e5a8ee7c863988bc47e1b96c0c68","observation_id":"55f68562-cf37-47ed-a205-760a352ca389","resolution":{"observed_at":"2026-08-15T15:43:39.686068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.20408","last_updated":"2026-06-08T09:56:22Z","latest_version":2,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-16T07:43:31.132807Z","submitted_at":"2026-01-28T09:13:17Z","title":"Meeting SLOs, Slashing Hours: Automated Enterprise LLM Optimization with OptiKIT"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2601.20408."}