{"as_of":"2026-08-18T07:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:893cae052f812ff49636e38d9ec77ea19608f65abfe7faf7d3706d9ca0a41a62","coverage":[{"denominator":15,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T20:34:37.733484Z","state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.05693/citation-record","integrity":"/paper/2412.05693/integrity","json":"/paper/2412.05693/citation-record.json","paper":"/paper/2412.05693"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-17T03:25:04.404839Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-11T20:34:37.662105Z","title":"A., Aneja, J., Awadallah, A., Awadalla, H., Bach, N., Bahree, A., Bakhtiari, A., Behl, H., Benhaim, A., Bilenko, M., Bjorck, J., Bubeck, S., Cai, M., Mendes, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05693","last_updated":"2025-07-03T16:06:35Z","snapshot_observed_at":"2026-08-14T18:27:08.609320Z","submitted_at":"2024-12-07T16:41:54Z","title":"Batch-Max: Higher LLM Throughput using Larger Batch Sizes and KV Cache Compression","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T20:34:37.662105Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2412.05693"},"observation_digest":"sha256:d41901cd0056c82cfa72d7c3502c8c7c161bd2d003d889da1d4d6b32ffb88e59","observation_id":"963a373e-16be-4569-9080-a6dc6da82bf7","resolution":{"observed_at":"2026-08-11T20:34:37.662105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-11T20:34:37.667150Z","title":"Training Verifiers to Solve Math Word Problems","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.05693","last_updated":"2025-07-03T16:06:35Z","snapshot_observed_at":"2026-08-14T18:27:08.609320Z","submitted_at":"2024-12-07T16:41:54Z","title":"Batch-Max: Higher LLM Throughput using Larger Batch Sizes and KV Cache Compression","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T20:34:37.667150Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2412.05693"},"observation_digest":"sha256:b8e42821f8ea7203477dc5894366647828c09c7d4fd5eb073ee66797cd4ed3a3","observation_id":"508a6444-f331-4883-9d78-7eb294fba689","resolution":{"observed_at":"2026-08-11T20:34:37.667150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:34:37.970929Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","venue":null,"work_id":"bd4f566a-d966-47d8-920c-9af7c5441d4b","year":2024},"citing_paper":{"arxiv_id":"2412.05693","last_updated":"2025-07-03T16:06:35Z","snapshot_observed_at":"2026-08-14T18:27:08.609320Z","submitted_at":"2024-12-07T16:41:54Z","title":"Batch-Max: Higher LLM Throughput using Larger Batch Sizes and KV Cache Compression","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T20:34:37.671700Z"},"links":{"citing_paper":"/paper/2412.05693"},"observation_digest":"sha256:84451bbc1f90f0b44eef8583820494934b9b6cde4a8c990c94fbc839b4e9c102","observation_id":"19a13875-65e4-463e-9e1f-3287b54e49e4","resolution":{"observed_at":"2026-08-11T20:34:37.975935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:34:37.957640Z","title":"M., Melis, G., and Grefenstette, E","venue":null,"work_id":"bc0f5555-2204-4fda-ba58-88f82ccefb9c","year":2018},"citing_paper":{"arxiv_id":"2412.05693","last_updated":"2025-07-03T16:06:35Z","snapshot_observed_at":"2026-08-14T18:27:08.609320Z","submitted_at":"2024-12-07T16:41:54Z","title":"Batch-Max: Higher LLM Throughput using Larger Batch Sizes and KV Cache Compression","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T20:34:37.675836Z"},"links":{"citing_paper":"/paper/2412.05693"},"observation_digest":"sha256:0b01d656c33ee5c4064790294041957b7ad93462727089eff48737b055fd0b4e","observation_id":"d4fbcd0c-bc39-4110-9c63-5c11a70464d3","resolution":{"observed_at":"2026-08-11T20:34:37.962138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14469","last_updated":"2024-06-17T03:01:58Z","snapshot_observed_at":"2026-08-14T12:21:04.886717Z","submitted_at":"2024-04-22T17:42:58Z","title":"SnapKV: LLM Knows What You are Looking for Before Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14469","snapshot_observed_at":"2026-08-11T20:34:37.680973Z","title":"SnapKV: LLM Knows What You are Looking for Before Generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05693","last_updated":"2025-07-03T16:06:35Z","snapshot_observed_at":"2026-08-14T18:27:08.609320Z","submitted_at":"2024-12-07T16:41:54Z","title":"Batch-Max: Higher LLM Throughput using Larger Batch Sizes and KV Cache Compression","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T20:34:37.680973Z"},"links":{"cited_paper":"/paper/2404.14469","citing_paper":"/paper/2412.05693"},"observation_digest":"sha256:eb8f0fe9a7332f6002031d9c3ed8a4c27b8f6e67b0435d1258cd8907a3dcdae7","observation_id":"8f6f03a4-cec3-4e8c-867e-d4b889a9cc9e","resolution":{"observed_at":"2026-08-11T20:34:37.680973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:34:37.943314Z","title":"Scissorhands: Exploiting the Persistence of Importance Hypothesis for LLM KV Cache Compression at Test Time","venue":null,"work_id":"84971917-8382-4ef1-a5bc-e9b2f659f3d3","year":2023},"citing_paper":{"arxiv_id":"2412.05693","last_updated":"2025-07-03T16:06:35Z","snapshot_observed_at":"2026-08-14T18:27:08.609320Z","submitted_at":"2024-12-07T16:41:54Z","title":"Batch-Max: Higher LLM Throughput using Larger Batch Sizes and KV Cache Compression","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T20:34:37.685647Z"},"links":{"citing_paper":"/paper/2412.05693"},"observation_digest":"sha256:a4dbec06c0df8305c1bae3b199b788aa48e6a9b8b4d9a1a8c64884bf4adec874","observation_id":"e2a8f24f-d5e4-433e-9aba-4eac34e30592","resolution":{"observed_at":"2026-08-11T20:34:37.947527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:34:37.929781Z","title":"N., Çaglar G \\\"u lçehre, and Xiang, B","venue":null,"work_id":"b80ab093-7c65-4032-971b-eb83869e533a","year":2016},"citing_paper":{"arxiv_id":"2412.05693","last_updated":"2025-07-03T16:06:35Z","snapshot_observed_at":"2026-08-14T18:27:08.609320Z","submitted_at":"2024-12-07T16:41:54Z","title":"Batch-Max: Higher LLM Throughput using Larger Batch Sizes and KV Cache Compression","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T20:34:37.689843Z"},"links":{"citing_paper":"/paper/2412.05693"},"observation_digest":"sha256:8f824f04428408375846b525f53a36e2db2fe7da9480368201c0154c1951d6af","observation_id":"e00cfda5-5e02-4673-87df-6db009a5884d","resolution":{"observed_at":"2026-08-11T20:34:37.933923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06104","last_updated":"2024-06-18T09:16:14Z","snapshot_observed_at":"2026-08-16T14:28:08.030037Z","submitted_at":"2024-01-11T18:35:26Z","title":"Transformers are Multi-State RNNs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06104","snapshot_observed_at":"2026-08-11T20:34:37.694365Z","title":"Transformers are Multi-State RNNs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05693","last_updated":"2025-07-03T16:06:35Z","snapshot_observed_at":"2026-08-14T18:27:08.609320Z","submitted_at":"2024-12-07T16:41:54Z","title":"Batch-Max: Higher LLM Throughput using Larger Batch Sizes and KV Cache Compression","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T20:34:37.694365Z"},"links":{"cited_paper":"/paper/2401.06104","citing_paper":"/paper/2412.05693"},"observation_digest":"sha256:c79d1bdfb7c4875b79f06fe43158d6e0ef51abaf6fdb0ac2d9b453ac9ded8a82","observation_id":"3f40174b-6fd9-4fbc-82dc-47b7f45733c4","resolution":{"observed_at":"2026-08-11T20:34:37.694365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06262","last_updated":"2024-02-17T10:08:14Z","snapshot_observed_at":"2026-08-18T02:45:23.747730Z","submitted_at":"2024-02-09T09:20:59Z","title":"On the Efficacy of Eviction Policy for Key-Value Constrained Generative Language Model Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06262","snapshot_observed_at":"2026-08-11T20:34:37.699018Z","title":"and Zhu, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05693","last_updated":"2025-07-03T16:06:35Z","snapshot_observed_at":"2026-08-14T18:27:08.609320Z","submitted_at":"2024-12-07T16:41:54Z","title":"Batch-Max: Higher LLM Throughput using Larger Batch Sizes and KV Cache Compression","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T20:34:37.699018Z"},"links":{"cited_paper":"/paper/2402.06262","citing_paper":"/paper/2412.05693"},"observation_digest":"sha256:bd5fa4afeffb1bf6f0ed1f9b607989a2b98ddc10670d75d98b208b733684adfe","observation_id":"f3a5e6ca-a5ee-4335-86df-af172c5f7409","resolution":{"observed_at":"2026-08-11T20:34:37.699018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-08-11T20:34:37.704378Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2412.05693","last_updated":"2025-07-03T16:06:35Z","snapshot_observed_at":"2026-08-14T18:27:08.609320Z","submitted_at":"2024-12-07T16:41:54Z","title":"Batch-Max: Higher LLM Throughput using Larger Batch Sizes and KV Cache Compression","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T20:34:37.704378Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2412.05693"},"observation_digest":"sha256:2c996578f8114001e1b91969dfccd45e05a5f13566fd27ddc48554ac26c27c9d","observation_id":"003183d3-cc6b-4da6-9b94-767030bda512","resolution":{"observed_at":"2026-08-11T20:34:37.704378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-11T20:34:37.709785Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05693","last_updated":"2025-07-03T16:06:35Z","snapshot_observed_at":"2026-08-14T18:27:08.609320Z","submitted_at":"2024-12-07T16:41:54Z","title":"Batch-Max: Higher LLM Throughput using Larger Batch Sizes and KV Cache Compression","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T20:34:37.709785Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2412.05693"},"observation_digest":"sha256:112f7618200c9f092160b13766b668c06f4da87b4a932a7f93f3676263fa1404","observation_id":"27f0f9fb-7aae-4a7d-844d-c4cd1e238341","resolution":{"observed_at":"2026-08-11T20:34:37.709785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04793","last_updated":"2024-10-10T05:11:52Z","snapshot_observed_at":"2026-08-17T07:10:21.158997Z","submitted_at":"2024-04-07T03:08:14Z","title":"SqueezeAttention: 2D Management of KV-Cache in LLM Inference via Layer-wise Optimal Budget","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04793","snapshot_observed_at":"2026-08-11T20:34:37.718187Z","title":"and Gan, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05693","last_updated":"2025-07-03T16:06:35Z","snapshot_observed_at":"2026-08-14T18:27:08.609320Z","submitted_at":"2024-12-07T16:41:54Z","title":"Batch-Max: Higher LLM Throughput using Larger Batch Sizes and KV Cache Compression","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T20:34:37.718187Z"},"links":{"cited_paper":"/paper/2404.04793","citing_paper":"/paper/2412.05693"},"observation_digest":"sha256:0ef80d6bd132bca041001569e342f253440f0d31ccf1779f36229eb13d7a48ae","observation_id":"a09cf4c7-5f1d-4d66-87a5-74f0953b076a","resolution":{"observed_at":"2026-08-11T20:34:37.718187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:34:37.913446Z","title":"Efficient Streaming Language Models with Attention Sinks","venue":null,"work_id":"f6fcba4a-bbc1-44d7-8ae5-04019a443614","year":2024},"citing_paper":{"arxiv_id":"2412.05693","last_updated":"2025-07-03T16:06:35Z","snapshot_observed_at":"2026-08-14T18:27:08.609320Z","submitted_at":"2024-12-07T16:41:54Z","title":"Batch-Max: Higher LLM Throughput using Larger Batch Sizes and KV Cache Compression","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T20:34:37.723302Z"},"links":{"citing_paper":"/paper/2412.05693"},"observation_digest":"sha256:607c9194adea07ea158d42d80f1579702c63b5bbe07a1500c2b2a051592294ed","observation_id":"77f3ad42-38c2-4579-8dba-43b31ac61714","resolution":{"observed_at":"2026-08-11T20:34:37.918092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13846","last_updated":"2026-05-18T05:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-17T17:58:14Z","title":"LightTransfer: Your Long-Context LLM is Secretly a Hybrid Model with Effortless Adaptation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13846","snapshot_observed_at":"2026-08-11T20:34:37.728742Z","title":"SimLayerKV: A Simple Framework for Layer-Level KV Cache Reduction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05693","last_updated":"2025-07-03T16:06:35Z","snapshot_observed_at":"2026-08-14T18:27:08.609320Z","submitted_at":"2024-12-07T16:41:54Z","title":"Batch-Max: Higher LLM Throughput using Larger Batch Sizes and KV Cache Compression","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T20:34:37.728742Z"},"links":{"cited_paper":"/paper/2410.13846","citing_paper":"/paper/2412.05693"},"observation_digest":"sha256:3904243c794d2df977369894fa1f66d8f01ca06eb7f0a765215e36226b6c4e84","observation_id":"18a88eed-9915-436d-a280-34256d028a1d","resolution":{"observed_at":"2026-08-11T20:34:37.728742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:34:37.896704Z","title":"H2O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","venue":null,"work_id":"f21d27a8-69d5-463b-b182-803bec0b4b54","year":2023},"citing_paper":{"arxiv_id":"2412.05693","last_updated":"2025-07-03T16:06:35Z","snapshot_observed_at":"2026-08-14T18:27:08.609320Z","submitted_at":"2024-12-07T16:41:54Z","title":"Batch-Max: Higher LLM Throughput using Larger Batch Sizes and KV Cache Compression","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T20:34:37.733484Z"},"links":{"citing_paper":"/paper/2412.05693"},"observation_digest":"sha256:35f0ab316318aeba61e4ad26e9acaf908625478524b720c26e7bcda04e22b74e","observation_id":"9003b91d-f4b4-4eb8-a36f-95c003c52961","resolution":{"observed_at":"2026-08-11T20:34:37.903408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.05693","last_updated":"2025-07-03T16:06:35Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-14T18:27:08.609320Z","submitted_at":"2024-12-07T16:41:54Z","title":"Batch-Max: Higher LLM Throughput using Larger Batch Sizes and KV Cache Compression"},"reference_resolution":{"displayed":15,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":6},"total_outbound_references":15},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 15 of 15 outbound references and 0 inbound Pith citation observations for arXiv:2412.05693."}