{"as_of":"2026-08-05T08:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f9985d280af074ddf1e3885e77cc2c635ea255870f8dad18fa5cbfd74febe937","coverage":[{"denominator":145,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-17T18:00:50.053377Z","state":"measured"},{"denominator":156,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":156,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":56,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T20:53:30.705096Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":28,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":"2306.14048","doi":"10.48550/arxiv.2306.14048","metadata_source":"pith","pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","venue":"cs.LG","work_id":"1ee58eaa-8aa0-4dec-8e67-6e079ad5fc13","year":2023},"citing_paper":{"arxiv_id":"2310.01801","last_updated":"2024-10-29T18:26:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T05:17:08Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","version":4},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-05-17T11:11:21.460613Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2310.01801"},"observation_digest":"sha256:a1a29e801e07d19e664be5b0c55739f0ec9abbfbada8cbd74a9e03c3eb9166bd","observation_id":"feec9525-6ab2-4663-a649-4715699ec7d0","resolution":{"observed_at":"2026-05-17T18:00:50.699870Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":"2306.14048","doi":"10.48550/arxiv.2306.14048","metadata_source":"pith","pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","venue":"cs.LG","work_id":"1ee58eaa-8aa0-4dec-8e67-6e079ad5fc13","year":2023},"citing_paper":{"arxiv_id":"2401.05459","last_updated":"2024-05-08T06:16:23Z","snapshot_observed_at":"2026-08-02T13:57:57.119489Z","submitted_at":"2024-01-10T09:25:45Z","title":"Personal LLM Agents: Insights and Survey about the Capability, Efficiency and Security","version":2},"reference_index":267,"source":"pdf_text","source_observed_at":"2026-05-17T00:57:26.303195Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2401.05459"},"observation_digest":"sha256:2a51c4a9a1c34d1d4b675152bfa9875f61ecd20f048ba9552b0ec32ce464dd92","observation_id":"4a3d8252-327e-4618-adde-2316e5aa7c97","resolution":{"observed_at":"2026-05-17T18:00:50.699870Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":"2306.14048","doi":"10.48550/arxiv.2306.14048","metadata_source":"pith","pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","venue":"cs.LG","work_id":"1ee58eaa-8aa0-4dec-8e67-6e079ad5fc13","year":2023},"citing_paper":{"arxiv_id":"2401.10774","last_updated":"2024-06-14T23:32:32Z","snapshot_observed_at":"2026-07-06T17:17:56.276857Z","submitted_at":"2024-01-19T15:48:40Z","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","version":3},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-13T10:36:17.764761Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2401.10774"},"observation_digest":"sha256:3e82d12f30e4f00ca88d57c75f80f51f6995b618f68f24f30b7caa750fdb4b43","observation_id":"4e85d65c-a956-4369-a51a-b622d8611508","resolution":{"observed_at":"2026-05-17T18:00:50.699870Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":"2306.14048","doi":"10.48550/arxiv.2306.14048","metadata_source":"pith","pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","venue":"cs.LG","work_id":"1ee58eaa-8aa0-4dec-8e67-6e079ad5fc13","year":2023},"citing_paper":{"arxiv_id":"2402.02750","last_updated":"2024-07-25T09:16:05Z","snapshot_observed_at":"2026-07-06T17:25:18.238343Z","submitted_at":"2024-02-05T06:06:47Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T08:53:12.253243Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2402.02750"},"observation_digest":"sha256:9c5647806d3e624fdc4a096cc7c3ff1093995091952e584c085eb8d388600dab","observation_id":"7ef0a24a-5659-407d-ab9e-8d7e56027071","resolution":{"observed_at":"2026-05-17T18:00:50.699870Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":"2306.14048","doi":"10.48550/arxiv.2306.14048","metadata_source":"pith","pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","venue":"cs.LG","work_id":"1ee58eaa-8aa0-4dec-8e67-6e079ad5fc13","year":2023},"citing_paper":{"arxiv_id":"2508.16703","last_updated":"2026-04-08T06:56:34Z","snapshot_observed_at":"2026-07-06T22:16:52.874707Z","submitted_at":"2025-08-22T07:41:35Z","title":"ShadowNPU: System and Algorithm Co-design for NPU-Centric On-Device LLM Inference","version":4},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-18T22:03:10.316005Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2508.16703"},"observation_digest":"sha256:9fdd0c99ed60b995340de6c8d86d50b89ebce20bea99046307ad76c57300bfca","observation_id":"e0d93067-594e-4c67-b3e8-1669083c43a0","resolution":{"observed_at":"2026-05-18T22:06:52.199866Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-04T20:53:30.705096Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-04T20:53:17.807634Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:30.705096Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:6355855e15415e0160146d15ac089aaea7c95c9e1962ee7521841c672393bd08","observation_id":"451a3792-123c-43ed-b4ce-a1a3e8bebde6","resolution":{"observed_at":"2026-08-04T20:53:30.705096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-04T17:05:55.044993Z","title":"H _2 o: Heavy-hitter oracle for efficient generative inference of large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-04T17:05:50.271239Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:55.044993Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:f2a74fdc307f5b85e80a7606a4c701a690e5d1dfcb6df6c0457e4359c0715710","observation_id":"9edb87ef-4250-4a67-a241-c844189226b9","resolution":{"observed_at":"2026-08-04T17:05:55.044993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":"2306.14048","doi":"10.48550/arxiv.2306.14048","metadata_source":"pith","pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","venue":"cs.LG","work_id":"1ee58eaa-8aa0-4dec-8e67-6e079ad5fc13","year":2023},"citing_paper":{"arxiv_id":"2510.09608","last_updated":"2025-10-10T17:59:58Z","snapshot_observed_at":"2026-07-06T22:32:22.953630Z","submitted_at":"2025-10-10T17:59:58Z","title":"StreamingVLM: Real-Time Understanding for Infinite Video Streams","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-17T11:51:33.345812Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2510.09608"},"observation_digest":"sha256:3cf57fdd043f4fea2677200b7c761761b8f1b60cffbe58f87b5f847cefc0430a","observation_id":"3fedd7ea-92bc-4172-b79e-759a2ae14825","resolution":{"observed_at":"2026-05-17T18:00:50.699870Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":"2306.14048","doi":"10.48550/arxiv.2306.14048","metadata_source":"pith","pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","venue":"cs.LG","work_id":"1ee58eaa-8aa0-4dec-8e67-6e079ad5fc13","year":2023},"citing_paper":{"arxiv_id":"2511.03092","last_updated":"2026-04-08T21:56:44Z","snapshot_observed_at":"2026-08-02T21:39:50.543195Z","submitted_at":"2025-11-05T00:38:31Z","title":"SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators","version":6},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T01:59:30.583027Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2511.03092"},"observation_digest":"sha256:0672ee05f4d3d6946b8189d4523fbbe0c08366484ef16ab3d0b7650d28a9af38","observation_id":"460379ee-66f2-47ce-81a0-e9e4a38deb76","resolution":{"observed_at":"2026-05-18T02:00:39.309134Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":"2306.14048","doi":"10.48550/arxiv.2306.14048","metadata_source":"pith","pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","venue":"cs.LG","work_id":"1ee58eaa-8aa0-4dec-8e67-6e079ad5fc13","year":2023},"citing_paper":{"arxiv_id":"2604.16864","last_updated":"2026-04-18T06:28:21Z","snapshot_observed_at":"2026-08-02T05:52:50.560554Z","submitted_at":"2026-04-18T06:28:21Z","title":"HieraSparse: Hierarchical Semi-Structured Sparse KV Attention","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T07:15:19.184970Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2604.16864"},"observation_digest":"sha256:472f7eaed0092b210e59d64123f3c642b6d07985d5f816e5cb6413ca537ab88f","observation_id":"dc8779f5-f211-470a-889f-0b7d1b844a05","resolution":{"observed_at":"2026-05-17T18:00:50.699870Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":"2306.14048","doi":"10.48550/arxiv.2306.14048","metadata_source":"pith","pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","venue":"cs.LG","work_id":"1ee58eaa-8aa0-4dec-8e67-6e079ad5fc13","year":2023},"citing_paper":{"arxiv_id":"2604.17935","last_updated":"2026-04-20T08:15:17Z","snapshot_observed_at":"2026-07-06T23:04:55.190916Z","submitted_at":"2026-04-20T08:15:17Z","title":"How Much Cache Does Reasoning Need? Depth-Cache Tradeoffs in KV-Compressed Transformers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T05:17:52.344313Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2604.17935"},"observation_digest":"sha256:1452ec2c78f63cb022be3f49f8d5ca8eb1ed09ab924c750da5cda70f760c7723","observation_id":"612e23a0-667f-4f2a-bfe7-d5a5e68a4096","resolution":{"observed_at":"2026-05-17T18:00:50.699870Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":"2306.14048","doi":"10.48550/arxiv.2306.14048","metadata_source":"pith","pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","venue":"cs.LG","work_id":"1ee58eaa-8aa0-4dec-8e67-6e079ad5fc13","year":2023},"citing_paper":{"arxiv_id":"2604.21335","last_updated":"2026-05-06T05:14:51Z","snapshot_observed_at":"2026-07-06T23:07:56.487654Z","submitted_at":"2026-04-23T06:47:33Z","title":"Sub-Token Routing in LoRA for Adaptation and Query-Aware KV Compression","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-09T22:49:19.948502Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2604.21335"},"observation_digest":"sha256:937193e38ca2dff7c5c8416970ac354adcb9100ce741756bce5b28036e5701a5","observation_id":"d9778a5d-f037-45b5-b7ed-275fd99b1dc1","resolution":{"observed_at":"2026-05-17T18:00:50.699870Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":"2306.14048","doi":"10.48550/arxiv.2306.14048","metadata_source":"pith","pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","venue":"cs.LG","work_id":"1ee58eaa-8aa0-4dec-8e67-6e079ad5fc13","year":2023},"citing_paper":{"arxiv_id":"2605.02568","last_updated":"2026-05-04T13:19:29Z","snapshot_observed_at":"2026-07-31T19:18:10.074012Z","submitted_at":"2026-05-04T13:19:29Z","title":"StreamIndex: Memory-Bounded Compressed Sparse Attention via Streaming Top-k","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-08T18:44:42.456111Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2605.02568"},"observation_digest":"sha256:c39f4c59ea96ca53abdf3c1be70f1b096b1d349bc01ecb52197ed0ef50741182","observation_id":"6dcc36c8-7868-417d-9fa1-a832b85e323b","resolution":{"observed_at":"2026-05-17T18:00:50.699870Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":"2306.14048","doi":"10.48550/arxiv.2306.14048","metadata_source":"pith","pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","venue":"cs.LG","work_id":"1ee58eaa-8aa0-4dec-8e67-6e079ad5fc13","year":2023},"citing_paper":{"arxiv_id":"2605.05219","last_updated":"2026-04-17T09:24:58Z","snapshot_observed_at":"2026-07-06T23:17:52.987860Z","submitted_at":"2026-04-17T09:24:58Z","title":"Sparse Prefix Caching for Hybrid and Recurrent LLM Serving","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T08:49:24.880528Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2605.05219"},"observation_digest":"sha256:6b380de3fe9640089186e0552a1872a10b60dad9f063ac47052fe376123cec6e","observation_id":"4d9dd0f4-fb30-44b7-9600-e0670087ea54","resolution":{"observed_at":"2026-05-17T18:00:50.699870Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":"2306.14048","doi":"10.48550/arxiv.2306.14048","metadata_source":"pith","pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","venue":"cs.LG","work_id":"1ee58eaa-8aa0-4dec-8e67-6e079ad5fc13","year":2023},"citing_paper":{"arxiv_id":"2605.06554","last_updated":"2026-05-07T16:49:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-07T16:49:28Z","title":"Long Context Pre-Training with Lighthouse Attention","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-08T10:10:38.610613Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2605.06554"},"observation_digest":"sha256:38cb2bba5f9d02d211ae70cd1b554510813aff986f7729460d5ad26990cd8720","observation_id":"f81c267e-9c5d-4df2-bddb-5efb08b6efc4","resolution":{"observed_at":"2026-05-17T18:00:50.699870Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":"2306.14048","doi":"10.48550/arxiv.2306.14048","metadata_source":"pith","pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","venue":"cs.LG","work_id":"1ee58eaa-8aa0-4dec-8e67-6e079ad5fc13","year":2023},"citing_paper":{"arxiv_id":"2605.06763","last_updated":"2026-05-11T02:30:41Z","snapshot_observed_at":"2026-07-06T23:19:10.574595Z","submitted_at":"2026-05-07T17:37:56Z","title":"Sparse Attention as a Range Searching Problem: Towards an Inference-Efficient Index for KV Cache","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-11T01:15:35.871863Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2605.06763"},"observation_digest":"sha256:1600819f804b36c464243d54e9ed6b8348cf75ac125d434ff39ce7181d8555a3","observation_id":"dfad0d42-ad98-4020-aff9-51d351f176ac","resolution":{"observed_at":"2026-05-17T18:00:50.699870Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":"2306.14048","doi":"10.48550/arxiv.2306.14048","metadata_source":"pith","pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","venue":"cs.LG","work_id":"1ee58eaa-8aa0-4dec-8e67-6e079ad5fc13","year":2023},"citing_paper":{"arxiv_id":"2605.07363","last_updated":"2026-05-08T07:19:34Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:19:34Z","title":"MISA: Mixture of Indexer Sparse Attention for Long-Context LLM Inference","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-11T02:27:55.991919Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2605.07363"},"observation_digest":"sha256:5398ab9d0cfc2f32cd1f024ee2c3dbd8ae428758f5a289cd64b7427284e34afe","observation_id":"d1d313f6-5cca-4500-9a0b-e416e8a8d1de","resolution":{"observed_at":"2026-05-17T18:00:50.699870Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":"2306.14048","doi":"10.48550/arxiv.2306.14048","metadata_source":"pith","pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","venue":"cs.LG","work_id":"1ee58eaa-8aa0-4dec-8e67-6e079ad5fc13","year":2023},"citing_paper":{"arxiv_id":"2605.08913","last_updated":"2026-05-14T11:50:32Z","snapshot_observed_at":"2026-08-02T22:02:14.182961Z","submitted_at":"2026-05-09T12:26:36Z","title":"Non-Monotonic Latency in Apple MPS Decoding: KV Cache Interactions and Execution Regimes","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-12T01:53:36.091037Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2605.08913"},"observation_digest":"sha256:7d3f2711462a50899aa9629f9b0e0295f0abe9168296fe67624e30bd7b97163e","observation_id":"8e979098-7055-442d-a249-2c94874684ca","resolution":{"observed_at":"2026-05-17T18:00:50.699870Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":"2306.14048","doi":"10.48550/arxiv.2306.14048","metadata_source":"pith","pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","venue":"cs.LG","work_id":"1ee58eaa-8aa0-4dec-8e67-6e079ad5fc13","year":2023},"citing_paper":{"arxiv_id":"2605.08913","last_updated":"2026-05-14T11:50:32Z","snapshot_observed_at":"2026-08-02T22:02:14.182961Z","submitted_at":"2026-05-09T12:26:36Z","title":"Non-Monotonic Latency in Apple MPS Decoding: KV Cache Interactions and Execution Regimes","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-15T05:05:12.267070Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2605.08913"},"observation_digest":"sha256:2a703d55275babccb5601409448032216096bc7d627285423f1e6b2eba6cf339","observation_id":"0f4dbb63-9d6e-4509-8090-2d4d91a71451","resolution":{"observed_at":"2026-05-17T18:00:50.699870Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":"2306.14048","doi":"10.48550/arxiv.2306.14048","metadata_source":"pith","pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","venue":"cs.LG","work_id":"1ee58eaa-8aa0-4dec-8e67-6e079ad5fc13","year":2023},"citing_paper":{"arxiv_id":"2605.09735","last_updated":"2026-06-30T03:39:11Z","snapshot_observed_at":"2026-07-06T23:21:49.499951Z","submitted_at":"2026-05-10T20:10:26Z","title":"KV-RM: Regularizing KV-Cache Movement for Static-Graph LLM Serving","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-12T03:57:30.104609Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2605.09735"},"observation_digest":"sha256:8fcc81908e1384ac0af19fc088d5983737234e7ce8e8beef821e1a45a3b9bda0","observation_id":"70027ab9-2e09-4423-9509-cbeefd78c14b","resolution":{"observed_at":"2026-05-17T18:00:50.699870Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":"2306.14048","doi":"10.48550/arxiv.2306.14048","metadata_source":"pith","pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","venue":"cs.LG","work_id":"1ee58eaa-8aa0-4dec-8e67-6e079ad5fc13","year":2023},"citing_paper":{"arxiv_id":"2605.09735","last_updated":"2026-06-30T03:39:11Z","snapshot_observed_at":"2026-07-06T23:21:49.499951Z","submitted_at":"2026-05-10T20:10:26Z","title":"KV-RM: Regularizing KV-Cache Movement for Static-Graph LLM Serving","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:44.256565Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2605.09735"},"observation_digest":"sha256:fb511e1608d25c00cbdb506d0f5d290d774ecd28754b93659025617847d9b853","observation_id":"dea92b0b-2cbf-4eae-b4a6-dfbcbf9ba75e","resolution":{"observed_at":"2026-07-01T08:15:32.399312Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":"2306.14048","doi":"10.48550/arxiv.2306.14048","metadata_source":"pith","pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","venue":"cs.LG","work_id":"1ee58eaa-8aa0-4dec-8e67-6e079ad5fc13","year":2023},"citing_paper":{"arxiv_id":"2605.11733","last_updated":"2026-05-12T08:15:04Z","snapshot_observed_at":"2026-07-06T23:23:30.499023Z","submitted_at":"2026-05-12T08:15:04Z","title":"Position: LLM Inference Should Be Evaluated as Energy-to-Token Production","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-13T05:17:24.147248Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2605.11733"},"observation_digest":"sha256:b9b2fa836393a7ac16b6676a2203e3a2adb25a438adce754d9c6bcce084e7403","observation_id":"8da5e788-22d0-48ef-a47e-460901d27162","resolution":{"observed_at":"2026-05-17T18:00:50.699870Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":"2306.14048","doi":"10.48550/arxiv.2306.14048","metadata_source":"pith","pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","venue":"cs.LG","work_id":"1ee58eaa-8aa0-4dec-8e67-6e079ad5fc13","year":2023},"citing_paper":{"arxiv_id":"2605.18053","last_updated":"2026-05-18T08:41:34Z","snapshot_observed_at":"2026-07-06T23:28:59.503300Z","submitted_at":"2026-05-18T08:41:34Z","title":"Protection Is (Nearly) All You Need: Structural Protection Dominates Scoring in Globally Capped KV Eviction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T12:13:14.295659Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2605.18053"},"observation_digest":"sha256:f69bdd46184fb134dc14cade76675b30338db3938562e539ba4ff705fe99ae30","observation_id":"e1d1c753-1418-44e1-8c4f-16c66ae0c223","resolution":{"observed_at":"2026-05-20T12:13:15.965477Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":"2306.14048","doi":"10.48550/arxiv.2306.14048","metadata_source":"pith","pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","venue":"cs.LG","work_id":"1ee58eaa-8aa0-4dec-8e67-6e079ad5fc13","year":2023},"citing_paper":{"arxiv_id":"2605.18856","last_updated":"2026-06-07T06:58:25Z","snapshot_observed_at":"2026-08-02T07:58:37.314471Z","submitted_at":"2026-05-13T18:48:48Z","title":"SPHERICAL KV: Angle-Domain Attention and Rate-Distortion Retention for Efficient Long-Context Inference","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T20:30:33.208386Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2605.18856"},"observation_digest":"sha256:69d3ef9c1c59b4f1476ba5c84b31c320cac462854135b8ff56210f40a2f4c94f","observation_id":"ec502985-6103-4f4b-9e68-e96be8bde6e2","resolution":{"observed_at":"2026-05-20T20:33:43.310155Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":"2306.14048","doi":"10.48550/arxiv.2306.14048","metadata_source":"pith","pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","venue":"cs.LG","work_id":"1ee58eaa-8aa0-4dec-8e67-6e079ad5fc13","year":2023},"citing_paper":{"arxiv_id":"2605.22337","last_updated":"2026-05-23T16:54:41Z","snapshot_observed_at":"2026-07-06T23:32:39.761431Z","submitted_at":"2026-05-21T11:24:46Z","title":"Meta-Soft: Leveraging Composable Meta-Tokens for Context-Preserving KV Cache Compression","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-22T05:10:53.133346Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2605.22337"},"observation_digest":"sha256:f011b7c30fce7879455642e61b979c14f5d9eddf699e8247147faf8194b92cde","observation_id":"c4e11073-0340-4e64-b1c0-b709f818a6e9","resolution":{"observed_at":"2026-05-22T05:11:06.211932Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":"2306.14048","doi":"10.48550/arxiv.2306.14048","metadata_source":"pith","pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","venue":"cs.LG","work_id":"1ee58eaa-8aa0-4dec-8e67-6e079ad5fc13","year":2023},"citing_paper":{"arxiv_id":"2605.22337","last_updated":"2026-05-23T16:54:41Z","snapshot_observed_at":"2026-07-06T23:32:39.761431Z","submitted_at":"2026-05-21T11:24:46Z","title":"Meta-Soft: Leveraging Composable Meta-Tokens for Context-Preserving KV Cache Compression","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T17:28:08.750049Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2605.22337"},"observation_digest":"sha256:a7525a86fc4a218d4290162944661cf60982cf4c5047eb1f179b100cffc29f65","observation_id":"50ad4cce-033e-47b6-893d-fc662222f88f","resolution":{"observed_at":"2026-06-30T17:34:57.893200Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":"2306.14048","doi":"10.48550/arxiv.2306.14048","metadata_source":"pith","pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","venue":"cs.LG","work_id":"1ee58eaa-8aa0-4dec-8e67-6e079ad5fc13","year":2023},"citing_paper":{"arxiv_id":"2605.22416","last_updated":"2026-05-21T12:37:34Z","snapshot_observed_at":"2026-07-06T23:32:44.699825Z","submitted_at":"2026-05-21T12:37:34Z","title":"Asymmetric Virtual Memory Paging for Hybrid Mamba-Transformer Inference","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-22T07:28:35.020478Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2605.22416"},"observation_digest":"sha256:1437b5f30dac4bfddf39f88a124306c5e4da54cd3fd7527aa038b7a4bada4ce9","observation_id":"1c2dbe2b-80bc-4848-8abb-ef09bc172cc9","resolution":{"observed_at":"2026-05-22T07:31:14.075975Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":"2306.14048","doi":"10.48550/arxiv.2306.14048","metadata_source":"pith","pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","venue":"cs.LG","work_id":"1ee58eaa-8aa0-4dec-8e67-6e079ad5fc13","year":2023},"citing_paper":{"arxiv_id":"2605.22884","last_updated":"2026-05-21T00:21:51Z","snapshot_observed_at":"2026-07-06T23:33:09.561760Z","submitted_at":"2026-05-21T00:21:51Z","title":"Tensor Cache: Eviction-conditioned Associative Memory for Transformers","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-25T05:49:43.160574Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2605.22884"},"observation_digest":"sha256:aa36fb77e92c23701672ccd012f1deed9c1f75473c6045e8576d334611f1b001","observation_id":"1603240a-9912-424e-ab77-2db49318c433","resolution":{"observed_at":"2026-05-25T05:50:23.556008Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":"2306.14048","doi":"10.48550/arxiv.2306.14048","metadata_source":"pith","pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","venue":"cs.LG","work_id":"1ee58eaa-8aa0-4dec-8e67-6e079ad5fc13","year":2023},"citing_paper":{"arxiv_id":"2606.01563","last_updated":"2026-06-01T02:08:40Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T02:08:40Z","title":"MomentKV: Closing the Directional Gap in KV Cache Eviction for Long-Context Inference","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T16:07:22.196982Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2606.01563"},"observation_digest":"sha256:82efb5da144d8093cecdb0e01f97649cd32e4caf7de3763a84a57b1b80e2f0a5","observation_id":"c04370de-e76b-4b16-8202-3badc1fea4f4","resolution":{"observed_at":"2026-07-01T21:56:15.437700Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":"2306.14048","doi":"10.48550/arxiv.2306.14048","metadata_source":"pith","pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","venue":"cs.LG","work_id":"1ee58eaa-8aa0-4dec-8e67-6e079ad5fc13","year":2023},"citing_paper":{"arxiv_id":"2606.03569","last_updated":"2026-06-02T12:36:24Z","snapshot_observed_at":"2026-08-02T13:19:20.535572Z","submitted_at":"2026-06-02T12:36:24Z","title":"When Attention Collapses: Stage-Aware Visual Token Pruning from Structure to Semantics","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T10:51:38.455604Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2606.03569"},"observation_digest":"sha256:57cbb1093e4b87d0d70df2f9cc00f3a5277d18d6da0e5542d6aaa3c9c8f497e1","observation_id":"79088eaa-ddf6-4dc8-9e64-dce54cd198cb","resolution":{"observed_at":"2026-07-02T02:36:26.502044Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":"2306.14048","doi":"10.48550/arxiv.2306.14048","metadata_source":"pith","pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","venue":"cs.LG","work_id":"1ee58eaa-8aa0-4dec-8e67-6e079ad5fc13","year":2023},"citing_paper":{"arxiv_id":"2606.08382","last_updated":"2026-06-07T00:24:02Z","snapshot_observed_at":"2026-08-01T14:25:51.066603Z","submitted_at":"2026-06-07T00:24:02Z","title":"STAR-KV: Low-Rank KV Cache Compression via Soft Thresholding for Adaptive Rank Control","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T18:34:20.645677Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2606.08382"},"observation_digest":"sha256:5787a70597bcfac1bada2456f17c88bfa1a6534e518f283f5466b5f44d356003","observation_id":"528a05d2-c0aa-4009-bd68-960d11539a7f","resolution":{"observed_at":"2026-07-02T22:57:26.313384Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":"2306.14048","doi":"10.48550/arxiv.2306.14048","metadata_source":"pith","pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","venue":"cs.LG","work_id":"1ee58eaa-8aa0-4dec-8e67-6e079ad5fc13","year":2023},"citing_paper":{"arxiv_id":"2606.09508","last_updated":"2026-06-08T14:02:18Z","snapshot_observed_at":"2026-08-03T05:12:39.957667Z","submitted_at":"2026-06-08T14:02:18Z","title":"From Rigid to Dynamic: Entropy-Guided Adaptive Inference for Long-Context LLMs","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-06-27T16:57:02.709967Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2606.09508"},"observation_digest":"sha256:3e3ee3b074933060753ba69cb81a9e198947f36deadd7f67ea069746aa86bbcd","observation_id":"e178fdff-db1e-43b1-b8e4-da8a5d514253","resolution":{"observed_at":"2026-07-03T00:57:30.007634Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":"2306.14048","doi":"10.48550/arxiv.2306.14048","metadata_source":"pith","pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","venue":"cs.LG","work_id":"1ee58eaa-8aa0-4dec-8e67-6e079ad5fc13","year":2023},"citing_paper":{"arxiv_id":"2606.09864","last_updated":"2026-06-01T02:02:20Z","snapshot_observed_at":"2026-08-03T01:43:21.917246Z","submitted_at":"2026-06-01T02:02:20Z","title":"Alignment Collapse Under KV Cache Quantization: Diagnosis and Mitigation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-06-28T15:37:34.129339Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2606.09864"},"observation_digest":"sha256:3c41dcde1f85e2bb84e463ff671a9daa02b7347ef2592f4bd8e221dfbc565f4c","observation_id":"e68c5b3e-86f5-43f5-b8a5-4fc28c006116","resolution":{"observed_at":"2026-07-01T22:16:16.031827Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":"2306.14048","doi":"10.48550/arxiv.2306.14048","metadata_source":"pith","pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","venue":"cs.LG","work_id":"1ee58eaa-8aa0-4dec-8e67-6e079ad5fc13","year":2023},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":1},"reference_index":119,"source":"pdf_text","source_observed_at":"2026-06-26T16:15:22.543601Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:a8507e066202174e98c724d9413dcdb816a24a1237209594e79e42619e090599","observation_id":"158ebb36-a992-4fba-b6c1-450109e9e29d","resolution":{"observed_at":"2026-07-04T05:09:36.855256Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-02T10:49:12.058991Z","title":"H_2O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models.Advances in Neural Information Processing Systems, 36:34661–34710, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":110,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:12.058991Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:2a14915f1e1d78da15544d9e60b6b2d85f87b81daed224c25f5d87ed7bf2a900","observation_id":"449ab3a9-829e-4209-ba79-2af93b3ce3ef","resolution":{"observed_at":"2026-08-02T10:49:12.058991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":"2306.14048","doi":"10.48550/arxiv.2306.14048","metadata_source":"pith","pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","venue":"cs.LG","work_id":"1ee58eaa-8aa0-4dec-8e67-6e079ad5fc13","year":2023},"citing_paper":{"arxiv_id":"2606.24937","last_updated":"2026-07-27T15:17:17Z","snapshot_observed_at":"2026-08-02T23:19:25.465662Z","submitted_at":"2026-06-22T17:48:54Z","title":"The Hitchhiker's Guide to Agentic AI: From Foundations to Systems","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-26T08:09:57.542558Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2606.24937"},"observation_digest":"sha256:82f23ac886b27147952045ea0dc513e87c41e5f11f9430f2f0eb5a6b05fc2c20","observation_id":"f3c1369b-9407-4761-857c-b34878ea43e1","resolution":{"observed_at":"2026-07-04T11:09:46.366239Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-02T10:27:16.272956Z","title":"H2O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.24937","last_updated":"2026-07-27T15:17:17Z","snapshot_observed_at":"2026-08-02T23:19:25.465662Z","submitted_at":"2026-06-22T17:48:54Z","title":"The Hitchhiker's Guide to Agentic AI: From Foundations to Systems","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T10:27:16.272956Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2606.24937"},"observation_digest":"sha256:d0f5e431e9385eaa3e97000f488589355b0834c747abdcdb96acbe459ecf7632","observation_id":"c2f2d99f-2b15-4d10-955b-2c12a5c545c5","resolution":{"observed_at":"2026-08-02T10:27:16.272956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":"2306.14048","doi":"10.48550/arxiv.2306.14048","metadata_source":"pith","pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","venue":"cs.LG","work_id":"1ee58eaa-8aa0-4dec-8e67-6e079ad5fc13","year":2023},"citing_paper":{"arxiv_id":"2606.27791","last_updated":"2026-06-26T07:20:23Z","snapshot_observed_at":"2026-08-03T05:34:54.121098Z","submitted_at":"2026-06-26T07:20:23Z","title":"NLL-Guided Full-Attention Layer Selection for Training-Free Sliding-Window Adaptation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T05:00:15.336703Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2606.27791"},"observation_digest":"sha256:0beebaa41aee370ca94205a3088e4dc3e9f1ab9c8ceff50341dca62d687f27eb","observation_id":"c0a77d25-2fbb-4b60-8ebd-f1a608df33a8","resolution":{"observed_at":"2026-06-29T19:03:51.729138Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":"2306.14048","doi":"10.48550/arxiv.2306.14048","metadata_source":"pith","pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","venue":"cs.LG","work_id":"1ee58eaa-8aa0-4dec-8e67-6e079ad5fc13","year":2023},"citing_paper":{"arxiv_id":"2607.00692","last_updated":"2026-07-01T09:41:54Z","snapshot_observed_at":"2026-07-07T00:06:20.346610Z","submitted_at":"2026-07-01T09:41:54Z","title":"Self-GC: Self-Governing Context for Long-Horizon LLM Agents","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-07-02T12:49:23.785904Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2607.00692"},"observation_digest":"sha256:55246178950978709c9a0c6bb90d15135a66602347a0f2bda1d522b6fecc5da7","observation_id":"caca74ed-c51c-42e8-8073-eb52580cc987","resolution":{"observed_at":"2026-07-02T12:56:56.663672Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":"2306.14048","doi":"10.48550/arxiv.2306.14048","metadata_source":"pith","pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","venue":"cs.LG","work_id":"1ee58eaa-8aa0-4dec-8e67-6e079ad5fc13","year":2023},"citing_paper":{"arxiv_id":"2607.01065","last_updated":"2026-07-01T15:25:21Z","snapshot_observed_at":"2026-07-07T00:06:39.908636Z","submitted_at":"2026-07-01T15:25:21Z","title":"GSRQ: Gain-Shape Residual Quantization for Sub-1-bit KV Cache","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-02T15:55:40.177742Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2607.01065"},"observation_digest":"sha256:96a192535a5c9b8be37f34b0be6ba3da495f68d7f89d9d54e4539a521a78fd1a","observation_id":"518fc120-1384-4891-97de-dfdf2b68554d","resolution":{"observed_at":"2026-07-02T15:57:06.413990Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":"2306.14048","doi":"10.48550/arxiv.2306.14048","metadata_source":"pith","pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","venue":"cs.LG","work_id":"1ee58eaa-8aa0-4dec-8e67-6e079ad5fc13","year":2023},"citing_paper":{"arxiv_id":"2607.02303","last_updated":"2026-07-02T15:19:49Z","snapshot_observed_at":"2026-07-07T00:07:47.719699Z","submitted_at":"2026-07-02T15:19:49Z","title":"A Hippocampus for Linear Attention: An Exact Memory for What the Recurrent State Forgets","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-03T13:46:18.862925Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2607.02303"},"observation_digest":"sha256:85fb5def4b8a34c25867321ae639704cdff5422dd6c208a3482b0b8b149c5217","observation_id":"c635fc2e-1e08-43e7-aa12-e6e9b082e89f","resolution":{"observed_at":"2026-07-03T13:48:20.293431Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-07-11T12:14:57.342551Z","title":"Gonzalez, Ion Stoica, and Matei Zaharia","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05475","last_updated":"2026-07-06T09:42:34Z","snapshot_observed_at":"2026-07-30T13:32:55.109312Z","submitted_at":"2026-07-06T09:42:34Z","title":"Is Your NPU Ready for LLMs? Dissecting the Hidden Efficiency Bottlenecks in Mobile LLM Inference","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-11T12:14:57.342551Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2607.05475"},"observation_digest":"sha256:818faff16d1bdd53598dd5d87f899f538231551b3e58982af350d442de0b249e","observation_id":"aadfd6ac-ad9f-4737-b53e-48ee66b6a92c","resolution":{"observed_at":"2026-07-11T12:14:57.342551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":"2306.14048","doi":"10.48550/arxiv.2306.14048","metadata_source":"pith","pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","venue":"cs.LG","work_id":"1ee58eaa-8aa0-4dec-8e67-6e079ad5fc13","year":2023},"citing_paper":{"arxiv_id":"2607.07144","last_updated":"2026-07-08T08:37:49Z","snapshot_observed_at":"2026-08-03T21:27:53.528630Z","submitted_at":"2026-07-08T08:37:49Z","title":"Fractal KV-Cache Archives: Lossless Symbolic Storage with In-Place Retrieval for Long-Context LLM Inference","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-09T19:13:15.765652Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2607.07144"},"observation_digest":"sha256:e0647c74d6796336a0df96c357f561d41e85ce0a6748f480c4c829ecb3e52e07","observation_id":"cbabba66-681d-49da-94ca-209ab0006f30","resolution":{"observed_at":"2026-07-09T19:16:27.755940Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-07-11T22:15:14.580916Z","title":"Zhang, Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.07724","last_updated":"2026-07-04T20:41:42Z","snapshot_observed_at":"2026-08-02T15:40:18.200445Z","submitted_at":"2026-07-04T20:41:42Z","title":"Uncertainty-gated selection for block-sparse attention","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-11T22:15:14.580916Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2607.07724"},"observation_digest":"sha256:02389b8d32ef4337d1b330d9ff2cdce2d29b191592b813e759592aa893e4fa61","observation_id":"746bd06e-4681-41d0-b4cd-74fc75a0c1c4","resolution":{"observed_at":"2026-07-11T22:15:14.580916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":"2306.14048","doi":"10.48550/arxiv.2306.14048","metadata_source":"pith","pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","venue":"cs.LG","work_id":"1ee58eaa-8aa0-4dec-8e67-6e079ad5fc13","year":2023},"citing_paper":{"arxiv_id":"2607.08032","last_updated":"2026-07-09T01:15:03Z","snapshot_observed_at":"2026-08-02T16:38:21.894642Z","submitted_at":"2026-07-09T01:15:03Z","title":"What to Keep, What to Forget: A Rate--Distortion View of Memory Compaction in LLMs and Agents","version":1},"reference_index":152,"source":"pdf_text","source_observed_at":"2026-07-10T01:26:59.421158Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2607.08032"},"observation_digest":"sha256:a2293cb90d7a3bffcc1627cd037f7ad72c4e9f27cce6ae79c80e07e95f5c67e3","observation_id":"81edba1d-7309-4633-8653-88a48aef7398","resolution":{"observed_at":"2026-07-10T01:36:44.151971Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-07-13T00:42:31.008284Z","title":"H2O: Heavy-hitter oracle for efficient generative inference of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09052","last_updated":"2026-07-10T02:48:43Z","snapshot_observed_at":"2026-08-02T02:47:56.247888Z","submitted_at":"2026-07-10T02:48:43Z","title":"COBS: Cumulant Order Block Sparse Attention","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T00:42:31.008284Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2607.09052"},"observation_digest":"sha256:79917bfb6a211d094ccc1a375776a93121a3f423ebcf4e9ebca9e6c16bcd3079","observation_id":"a0f4ba99-644a-4282-85a3-61dd127e2510","resolution":{"observed_at":"2026-07-13T00:42:31.008284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-07-14T14:50:03.831572Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09889","last_updated":"2026-07-10T18:28:21Z","snapshot_observed_at":"2026-08-02T12:00:29.141267Z","submitted_at":"2026-07-10T18:28:21Z","title":"Remembering Distinct Items, Not Tokens: A Learnable Dirichlet-Process Cache Between State-Space Models and Attention","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T14:50:03.831572Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2607.09889"},"observation_digest":"sha256:4cfce051bf682ec0a388e3a2a7dd6516cedcc910036734dedef113545afcc14d","observation_id":"0ad4a6c5-85d4-4cb3-8215-f8d4301d8a90","resolution":{"observed_at":"2026-07-14T14:50:03.831572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-07-14T11:45:09.424370Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10441","last_updated":"2026-07-11T18:58:22Z","snapshot_observed_at":"2026-08-02T12:30:31.763624Z","submitted_at":"2026-07-11T18:58:22Z","title":"Context by Distinct Information: An Auditable Dirichlet-Process Working Memory for Long, Redundant Context Streams","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-14T11:45:09.424370Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2607.10441"},"observation_digest":"sha256:d221a1e7ed6d111def55b53b84742b52e7b6b59354bb534af17d6b14aa511789","observation_id":"6b3217b3-2592-4f26-b2a9-99c0ed3ca0af","resolution":{"observed_at":"2026-07-14T11:45:09.424370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-02T09:50:33.867996Z","title":"arXiv:2306.14048","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16248","last_updated":"2026-06-27T01:22:47Z","snapshot_observed_at":"2026-08-05T04:21:35.447834Z","submitted_at":"2026-06-27T01:22:47Z","title":"High-accuracy Low-Bit KV-Cache Quantization via Local Distribution Restoration","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T09:50:33.867996Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2607.16248"},"observation_digest":"sha256:f5271d744c9938496df4ba7d87021a2fe0ebd56597d407d70326fc439e9fa32d","observation_id":"f8da6e20-ac4c-47cb-a616-0b2d1539a9c7","resolution":{"observed_at":"2026-08-02T09:50:33.867996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-02T11:37:06.681833Z","title":"H2o: Heavy-hitter oracle for efficient generative inference of large language models.arXiv preprint arXiv:2306.14048, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19368","last_updated":"2026-06-12T01:11:17Z","snapshot_observed_at":"2026-08-02T16:44:28.630046Z","submitted_at":"2026-06-12T01:11:17Z","title":"Spectral-LSH: Sub-Quadratic Prompt Compression via Krylov-Projected Locality-Sensitive Hashing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T11:37:06.681833Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2607.19368"},"observation_digest":"sha256:bb1c49617bcce51aead29097a14c1b9f4cf7983f92b60d7159783f170d3084b5","observation_id":"afda2078-55a6-4cc4-8611-c8a56bff268e","resolution":{"observed_at":"2026-08-02T11:37:06.681833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-01T07:23:41.286874Z","title":"H2O: Heavy-hitter oracle for efficient generative inference of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21475","last_updated":"2026-07-25T14:37:35Z","snapshot_observed_at":"2026-08-03T17:06:46.403546Z","submitted_at":"2026-07-23T16:16:59Z","title":"Error Certificates for KV-Cache Eviction via Randomized Design","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T07:23:41.286874Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2607.21475"},"observation_digest":"sha256:d5a327c667513fbd338623dcf63e2cdc0b785f6f07f9891b10d9da6b8b41c8f8","observation_id":"ef1acaea-990d-4edb-a626-0a6250f2280b","resolution":{"observed_at":"2026-08-01T07:23:41.286874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-07-30T15:53:12.297457Z","title":"H 2O: Heavy-hitter oracle for efficient generative inference of large language models.arXiv preprint arXiv:2306.14048,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23693","last_updated":"2026-07-26T14:37:53Z","snapshot_observed_at":"2026-08-03T11:36:02.243849Z","submitted_at":"2026-07-26T14:37:53Z","title":"Compute Globally, Materialize Locally: The Memory Contract of Sparse Event-KV","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-30T15:53:12.297457Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2607.23693"},"observation_digest":"sha256:6d0f3d2ade1d8dc6d847eb32c61b2783d7995a781a1011e406f58a24dfb5acd5","observation_id":"55408385-768d-40a8-beac-d6fba92b60d5","resolution":{"observed_at":"2026-07-30T15:53:12.297457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-07-31T19:52:42.379821Z","title":"Lianmin Zheng, Liangsheng Yin, Zhiqiang Xie, Chuyue Sun, Jeff Huang, Cody Hao Yu, Shiyi Cao, Christos Kozyrakis, Ion Stoica, Joseph E","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24260","last_updated":"2026-07-27T10:51:38Z","snapshot_observed_at":"2026-08-03T17:09:54.706842Z","submitted_at":"2026-07-27T10:51:38Z","title":"KAP: Bridging the Knowledge Selection-Runtime Consumption Gap in LLM Systems","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-31T19:52:42.379821Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2607.24260"},"observation_digest":"sha256:4584ad4cca2873f1901aed3052820067ca9b05bd0b3873bb0b65088b0da51eee","observation_id":"e8c939d8-4bd1-4484-ab15-52c782c9758d","resolution":{"observed_at":"2026-07-31T19:52:42.379821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-02T09:52:42.742462Z","title":"H2o: Heavy-hitter oracle for efficient generative inference of large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24788","last_updated":"2026-06-26T17:48:13Z","snapshot_observed_at":"2026-08-04T08:13:02.039551Z","submitted_at":"2026-06-26T17:48:13Z","title":"GLIDE: Guided Layerwise Hybrid Attention for Efficient LLM Inference","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T09:52:42.742462Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2607.24788"},"observation_digest":"sha256:fbcadd7fa1f5eb14efd53b0730931c6d7949087d3feecaa439edfbd5f1581bff","observation_id":"da916699-c32f-4568-b4f2-e95af5ce6ffa","resolution":{"observed_at":"2026-08-02T09:52:42.742462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-01T10:55:32.054239Z","title":"arXiv preprint arXiv:2306.14048 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27269","last_updated":"2026-07-29T10:54:46Z","snapshot_observed_at":"2026-08-02T23:21:49.468107Z","submitted_at":"2026-07-29T10:54:46Z","title":"Beyond KV Reconstruction: Functional Reconstruction for MLA Draft Models in Speculative Decoding","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-01T10:55:32.054239Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2607.27269"},"observation_digest":"sha256:b64b26661cc922e0d81b73f11b549bd47ee92ac04285aa7ef23f0b015ece2456","observation_id":"f88a5294-26f9-47bc-a198-3f1b586d5ccc","resolution":{"observed_at":"2026-08-01T10:55:32.054239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-03T00:43:53.157830Z","title":"H2O: Heavy-hitter oracle for efficient generative inference of LLMs","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28699","last_updated":"2026-07-30T11:04:45Z","snapshot_observed_at":"2026-08-05T07:12:29.163927Z","submitted_at":"2026-07-30T11:04:45Z","title":"WitCert: Sound Runtime Risk Observability and Gating for KV-Cache Quantization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T00:43:53.157830Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2607.28699"},"observation_digest":"sha256:bc9318fd5d752112a323938f8558c769cad0e3f03644aa4fe8fbe6718b2684e4","observation_id":"8167e744-39cf-4f6a-ae47-76757129dbbe","resolution":{"observed_at":"2026-08-03T00:43:53.157830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2306.14048/citation-record","integrity":"/paper/2306.14048/integrity","json":"/paper/2306.14048/citation-record.json","paper":"/paper/2306.14048"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2201.08239","last_updated":"2022-02-10T16:30:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-20T15:44:37Z","title":"LaMDA: Language Models for Dialog Applications","version":3},"cited_work":{"arxiv_id":"2201.08239","doi":"10.48550/arxiv.2201.08239","metadata_source":"pith","pith_arxiv_id":"2201.08239","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LaMDA: Language Models for Dialog Applications","venue":"cs.CL","work_id":"1b66d0a5-f6ae-4332-8025-c662dc64b238","year":2022},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2201.08239","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:5ecf945dcb0a600011c5dbe3885f921318cef5fa0171e7b188a0aad85dd2ade8","observation_id":"fced8819-25a8-4397-bd21-65975ce0bbf6","resolution":{"observed_at":"2026-05-17T18:00:50.150984Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wordcraft: story writing with large language models","venue":null,"work_id":"bb152c56-5310-43f0-ba5b-6ef51b9ed164","year":2022},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:c6d5f7b45911e0a3955158eeafdfc44cf4c9dcf8c90ed0598aa0f36495cff8ce","observation_id":"3723f9fa-8459-42e7-ba17-cd504a4ab633","resolution":{"observed_at":"2026-05-17T18:00:50.585642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-02T15:56:35.249569Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":"2206.07682","doi":"10.48550/arxiv.2206.07682","metadata_source":"pith","pith_arxiv_id":"2206.07682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emergent Abilities of Large Language Models","venue":"cs.CL","work_id":"6ea3375b-837c-4640-a175-be7525aa3c6d","year":2022},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2206.07682","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:0531f29eee416298cc7ee23653496872da0fb49cd1cbcafe825ba3e93802698a","observation_id":"4f5a1443-9b46-4896-ab1a-eb93dc799768","resolution":{"observed_at":"2026-05-17T18:00:50.130973Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13848","last_updated":"2023-01-31T18:46:19Z","snapshot_observed_at":"2026-07-06T14:46:45.009359Z","submitted_at":"2023-01-31T18:46:19Z","title":"Benchmarking Large Language Models for News Summarization","version":1},"cited_work":{"arxiv_id":"2301.13848","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.13848","snapshot_observed_at":"2026-07-10T10:27:02.462026Z","title":"Benchmarking large language models for news summarization","venue":"cs.CL","work_id":"1fd145fc-38ee-4d6a-b71b-fadec1a7b54b","year":2023},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2301.13848","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:105d5291cec2d35cf73ae0840babc908edd87751dfb7257fdcef0bffdc9bc68c","observation_id":"d3ac7804-4d5d-4b0a-88cc-9f74bfbf764d","resolution":{"observed_at":"2026-05-17T18:00:50.137445Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-03T21:52:33.988566Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":"2211.05102","doi":"10.48550/arxiv.2211.05102","metadata_source":"pith","pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Eﬃciently Scaling Transformer Inference","venue":"cs.LG","work_id":"89acfce1-19be-43c5-b74d-cdfe66fa10d8","year":2022},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:7ae4e92acf6c04ca2990e94222c79eb88f5e0c7710de4ac65190dddb623f1d15","observation_id":"56958681-84c9-4f80-a94e-4e5c691163df","resolution":{"observed_at":"2026-05-17T18:00:50.145712Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:15.604508+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An anomaly in space-time char- acteristics of certain programs running in a paging machine","venue":null,"work_id":"9196eebb-5c7b-4736-9c68-88465bf663ef","year":1969},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:150935efc3e013ff98545c824d796d74c5091d0661d0a1505aa8dd4c682c8e8c","observation_id":"e43b65a3-9de0-43bb-8a64-3d1a37572feb","resolution":{"observed_at":"2026-05-17T18:00:50.556288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.04451","last_updated":"2020-02-18T16:01:18Z","snapshot_observed_at":"2026-07-06T08:50:12.690900Z","submitted_at":"2020-01-13T18:38:28Z","title":"Reformer: The Efficient Transformer","version":2},"cited_work":{"arxiv_id":"2001.04451","doi":"10.48550/arxiv.2001.04451","metadata_source":"pith","pith_arxiv_id":"2001.04451","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reformer: The Efficient Transformer","venue":"cs.LG","work_id":"eb3dbae4-931f-40ab-a37b-507a35f42712","year":2020},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2001.04451","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:44720e088442a17204623c29c0537d49a8ece0fbbb1b0441ba5e414d466944b9","observation_id":"3f23259c-2217-4900-a171-ea4efa633e41","resolution":{"observed_at":"2026-05-17T18:00:50.403497Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:50:01.947571+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:50:01.947571+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness","venue":null,"work_id":"b2aec505-c300-4a61-92b3-34533a96f7ae","year":2022},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:a279231c802eedd7733a55b4ce1e02d309e6d31a3b4392372b40d8247d35102a","observation_id":"d04301a6-53f6-4b00-b006-2f96f081ba71","resolution":{"observed_at":"2026-05-17T18:00:50.562913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":"1904.10509","doi":"10.48550/arxiv.1904.10509","metadata_source":"pith","pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generating Long Sequences with Sparse Transformers","venue":"cs.LG","work_id":"c5b81688-45ee-4a9a-b095-e6290f45cb6c","year":2019},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:8f9c7deed1f135fe3f7273bcdc5a6e5e5d632fc4229b8089b89d8a3c118b61d6","observation_id":"c0d05d41-8d81-40ff-ba0f-92bab4c0557d","resolution":{"observed_at":"2026-05-17T18:00:50.407792Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:59.71041+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:59.71041+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.14794","last_updated":"2022-11-19T12:45:21Z","snapshot_observed_at":"2026-08-02T09:26:59.716070Z","submitted_at":"2020-09-30T17:09:09Z","title":"Rethinking Attention with Performers","version":4},"cited_work":{"arxiv_id":"2009.14794","doi":"10.48550/arxiv.2009.14794","metadata_source":"pith","pith_arxiv_id":"2009.14794","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rethinking Attention with Performers","venue":"cs.LG","work_id":"4c26d308-8b72-4a98-8e73-950617a75f50","year":2020},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2009.14794","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:a89bf0e5b5b16c4cf46116e3c368b7c2d3d064f8f19bd6e5997bb0fce9f86231","observation_id":"e3ff51cd-f292-404f-a82e-ff5464fed06d","resolution":{"observed_at":"2026-05-17T18:00:50.411525Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:59.959694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:59.959694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":null,"work_id":"ef55b9ff-cf6d-47aa-ad2d-1ae9447afb85","year":2020},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:197ee7d4e5632f2740b273b5073c43d3d339ced88d7fb80ed137a081414afe51","observation_id":"e29fab6c-c4d5-4e9f-9162-7fb3e13daf97","resolution":{"observed_at":"2026-05-17T18:00:50.574127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":"1911.02150","doi":"10.48550/arxiv.1911.02150","metadata_source":"pith","pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","venue":"cs.NE","work_id":"160ea164-b1d4-4adb-8ccb-a4655d8a0bb4","year":2019},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:8d5424aefe8445811688a05d4cf7d8a1778a672f5d95bbc3eefa55586e9fd25b","observation_id":"a0b8175c-e1ef-4d7f-bc10-19c7097ebbc8","resolution":{"observed_at":"2026-05-17T18:00:50.415420Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":"2204.02311","doi":"10.48550/arxiv.2204.02311","metadata_source":"pith","pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaLM: Scaling Language Modeling with Pathways","venue":"cs.CL","work_id":"a94f3ef7-2c49-4445-93fe-6ec16aafd966","year":2022},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:cfba8a78dc9b907f42308bb45011944176df5285bc3a7f997977e3df21c25398","observation_id":"b6bc521f-0fb4-4bbc-9491-7624598cf83a","resolution":{"observed_at":"2026-05-17T18:00:50.419451Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:25:21.411055+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:25:21.411055+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08467","last_updated":"2024-02-12T19:03:18Z","snapshot_observed_at":"2026-08-03T18:12:47.785090Z","submitted_at":"2023-04-17T17:47:37Z","title":"Learning to Compress Prompts with Gist Tokens","version":3},"cited_work":{"arxiv_id":"2304.08467","doi":"10.48550/arxiv.2304.08467","metadata_source":"pith","pith_arxiv_id":"2304.08467","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learning to compress prompts with gist tokens","venue":"cs.CL","work_id":"116aadc2-ec95-424b-b3f6-69a2e6ddeab0","year":2023},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2304.08467","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:5cdc859ed31d5f906303dbc653c00a5b6c25b7e3e51bfca3837c3b95dfb07be1","observation_id":"d777afda-dd71-4d88-8f07-8d34078906b2","resolution":{"observed_at":"2026-05-17T18:00:50.423410Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5281/zenodo.5371628","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A framework for few-shot language model evaluation, September 2021","venue":"Zenodo (CERN European Organization for Nuclear Research)","work_id":"27d00efc-1c8b-4af4-bd30-5dfa575d0989","year":2021},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:f77a7bd59859ac35d501686b2badfe9c21c8b5040b69712aff778b3a8ec3bf7c","observation_id":"bfe2969c-938c-4912-ad93-fad37f09316b","resolution":{"observed_at":"2026-05-17T18:00:50.125201Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T10:19:41.045161+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T10:19:41.045161+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-01T19:14:56.803459Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2211.09110","doi":"10.1007/bf01194075","metadata_source":"pith","pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Holistic Evaluation of Language Models","venue":"cs.CL","work_id":"cc02a01e-7218-47dc-8e66-3333e7e4adec","year":2022},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:39d3e8e30125797e99037ce5eb3cadeb72eab8415f885aa12f107272da16b178","observation_id":"e7f06c6e-425d-4089-b4da-5e359e40c414","resolution":{"observed_at":"2026-05-17T18:00:50.427058Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00032","last_updated":"2022-06-30T18:01:08Z","snapshot_observed_at":"2026-08-01T05:24:40.015236Z","submitted_at":"2022-06-30T18:01:08Z","title":"DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale","version":1},"cited_work":{"arxiv_id":"2207.00032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2207.00032","snapshot_observed_at":"2026-07-03T22:59:03.322421Z","title":"Deepspeed inference: Enabling efficient inference of transformer models at unprecedented scale","venue":null,"work_id":"fe39d11d-9a1a-4cf6-bda1-94e047ec6171","year":2022},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2207.00032","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:c923a583e0a771ce3d02f7c55d6f5875e0b12aef777935c6799cdae24318aa9c","observation_id":"39900118-976a-4971-8a9c-d9c4cbe878d9","resolution":{"observed_at":"2026-05-17T18:00:50.431176Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hugging face accelerate","venue":null,"work_id":"04ac981f-7897-4c3a-b432-5e8b7d646ba4","year":null},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:bb22f94740c87e47b62ecefd961a84a88ec18988cbf0758cd4b088afa3ae2d95","observation_id":"808935d7-d2ef-4e8b-bcc6-8b3a25a05233","resolution":{"observed_at":"2026-05-17T18:00:50.594043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06865","last_updated":"2023-06-12T07:48:53Z","snapshot_observed_at":"2026-07-06T15:02:25.281739Z","submitted_at":"2023-03-13T05:19:28Z","title":"FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPU","version":2},"cited_work":{"arxiv_id":"2303.06865","doi":"10.48550/arxiv.2303.06865","metadata_source":"pith","pith_arxiv_id":"2303.06865","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Xie, Z., Chen, B., Barrett, C., Gonzalez, J","venue":"cs.LG","work_id":"c99785d7-2d72-4d2f-8363-f4db53cf669f","year":2023},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2303.06865","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:a1cd26d93aed48cd2191df09d9b211f536c78f8241273fa5f7905f4e7bcf89c1","observation_id":"ad34b387-962f-4c5c-8a3c-889b798ae04d","resolution":{"observed_at":"2026-05-17T18:00:50.435347Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00774","last_updated":"2023-03-22T12:33:46Z","snapshot_observed_at":"2026-08-01T14:54:18.258666Z","submitted_at":"2023-01-02T17:48:56Z","title":"SparseGPT: Massive Language Models Can Be Accurately Pruned in One-Shot","version":3},"cited_work":{"arxiv_id":"2301.00774","doi":"10.48550/arxiv.2301.00774","metadata_source":"pith","pith_arxiv_id":"2301.00774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sparsegpt: Massive language models can be accurately pruned in one-shot","venue":"cs.LG","work_id":"c299c96a-ab17-4fd6-9c67-201f8d8f1138","year":2023},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2301.00774","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:530f8b51aea7065f110129483da4bea7c84a5baec8e9f852279baa14e7f84da2","observation_id":"c4f47523-3b41-446e-9406-cf3e323a1f4a","resolution":{"observed_at":"2026-05-17T18:00:50.439584Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11695","last_updated":"2024-05-06T17:47:01Z","snapshot_observed_at":"2026-07-06T15:44:42.776459Z","submitted_at":"2023-06-20T17:18:20Z","title":"A Simple and Effective Pruning Approach for Large Language Models","version":3},"cited_work":{"arxiv_id":"2306.11695","doi":"10.48550/arxiv.2306.11695","metadata_source":"pith","pith_arxiv_id":"2306.11695","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Simple and Effective Pruning Approach for Large Language Models","venue":"cs.CL","work_id":"e764df7f-c928-4b41-812e-352750f475c2","year":2023},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2306.11695","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:56dcc0ba88b40268006ee735ad69d964167036275b41e8fbe5815bf075d6854c","observation_id":"f6d64c80-83b1-49e1-982d-3bf2c2709cd0","resolution":{"observed_at":"2026-05-17T18:00:50.443610Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05175","last_updated":"2025-06-30T22:16:39Z","snapshot_observed_at":"2026-08-01T08:08:15.221032Z","submitted_at":"2023-10-08T14:22:58Z","title":"Outlier Weighed Layerwise Sparsity (OWL): A Missing Secret Sauce for Pruning LLMs to High Sparsity","version":4},"cited_work":{"arxiv_id":"2310.05175","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.05175","snapshot_observed_at":"2026-07-02T11:36:55.495533Z","title":"Outlier weighed layerwise sparsity (owl): A missing secret sauce for pruning llms to high sparsity","venue":null,"work_id":"30830665-b77d-4751-98dd-78af4465c909","year":2023},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2310.05175","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:10d5742319e456404763a22e9c96c6a63fc318f43e22711a18083b796ef7f2a7","observation_id":"11843369-3084-452a-be33-b5b9ae8df156","resolution":{"observed_at":"2026-05-17T18:00:50.448044Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-07-31T03:44:36.976336Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":"2210.17323","doi":"10.48550/arxiv.2210.17323","metadata_source":"pith","pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","venue":"cs.LG","work_id":"19ed8c44-202a-48f6-8169-637d5a5f2408","year":2022},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:eefadd7a4f5d80c719786fda2e182f3e19c9a37539914697c78c0e92bcf1f5b5","observation_id":"afcd2480-bf7c-4261-ae6a-cc7b2f109de8","resolution":{"observed_at":"2026-05-17T18:00:50.452114Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-17T20:22:03.028003+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-17T20:22:03.028003+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.10438","last_updated":"2024-03-29T19:21:58Z","snapshot_observed_at":"2026-08-05T00:47:41.615806Z","submitted_at":"2022-11-18T18:59:33Z","title":"SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models","version":7},"cited_work":{"arxiv_id":"2211.10438","doi":"10.48550/arxiv.2211.10438","metadata_source":"pith","pith_arxiv_id":"2211.10438","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smoothquant: Accurate and efficient post-training quantization for large language models","venue":"cs.CL","work_id":"f6c42722-63d3-433b-98d3-748754b9c451","year":2022},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2211.10438","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:4f9334e0be533992067ee791878f28776d7c2576c2f839ad9f45e15d98b4049f","observation_id":"a2561729-235e-490c-aa35-b56b9a8c7dc2","resolution":{"observed_at":"2026-05-17T18:00:50.456232Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.01861","last_updated":"2022-06-04T00:28:21Z","snapshot_observed_at":"2026-07-06T13:17:23.021615Z","submitted_at":"2022-06-04T00:28:21Z","title":"ZeroQuant: Efficient and Affordable Post-Training Quantization for Large-Scale Transformers","version":1},"cited_work":{"arxiv_id":"2206.01861","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.01861","snapshot_observed_at":"2026-07-01T22:16:16.046751Z","title":"Yu, W., Yang, Z., Li, L., Wang, J., Lin, K., Liu, Z., Wang, X., and Wang, L","venue":null,"work_id":"31ae02a0-1bff-4485-8eb1-92cf90e65c74","year":2022},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2206.01861","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:769c46e77da8eb0638ad815bb0d685c51f42c53953b3829492c371a358705f40","observation_id":"29d83d7a-d3a3-4d48-b1df-85a29bb200fd","resolution":{"observed_at":"2026-05-17T18:00:50.460651Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e7a89743-7e5f-4f99-9307-0ce85e7ae68f","year":2022},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:9d1320256e8ac1eb514dbbb8a16fc4c1aa173eccf7422de3bdd2a26e7bfb4466","observation_id":"e2894113-913a-4245-bfea-768e0d9661f8","resolution":{"observed_at":"2026-05-17T18:00:50.615585Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.07339","last_updated":"2022-11-10T18:14:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-15T17:08:50Z","title":"LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale","version":2},"cited_work":{"arxiv_id":"2208.07339","doi":"10.18653/v1/2020.findings-emnlp.314","metadata_source":"pith","pith_arxiv_id":"2208.07339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale","venue":"cs.LG","work_id":"98201f98-f4e5-4d1c-9ed7-b795e3c8f76c","year":2022},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2208.07339","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:204fb9ac1d26c2bdf7e016aa83743cc24d7003db2ec165031c816cd143b71e15","observation_id":"c79384c4-a832-403c-9ff4-e9d9df506b64","resolution":{"observed_at":"2026-05-17T18:00:50.465229Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00978","last_updated":"2026-04-25T06:58:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-01T17:59:10Z","title":"AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration","version":6},"cited_work":{"arxiv_id":"2306.00978","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.00978","snapshot_observed_at":"2026-07-10T11:17:03.640788Z","title":"AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration","venue":"cs.CL","work_id":"ea9d1d72-db24-4cae-8c89-4ecd83dd87c1","year":2023},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2306.00978","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:806673476b160aa643262b7b5cd13ddbf5c5c18c847cefb9b92505d945e5b0b5","observation_id":"1d96aeed-1f0c-4b9f-89db-bfff5098ca6f","resolution":{"observed_at":"2026-05-17T18:00:50.469602Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09752","last_updated":"2023-10-24T00:51:49Z","snapshot_observed_at":"2026-07-06T15:04:31.778399Z","submitted_at":"2023-03-17T03:28:17Z","title":"CoLT5: Faster Long-Range Transformers with Conditional Computation","version":3},"cited_work":{"arxiv_id":"2303.09752","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.09752","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ainslie, T","venue":null,"work_id":"ffe0489f-b4bb-4f0a-a69a-f7e79c161dd0","year":2023},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2303.09752","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:d0a350bb8a4c7721628fa9e1a4123f43029ed7e95e0d9284e29948c7bf0e938e","observation_id":"e171e07a-bf43-456d-94fc-05f4222d9d15","resolution":{"observed_at":"2026-05-17T18:00:50.473738Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15805","last_updated":"2024-05-31T14:02:24Z","snapshot_observed_at":"2026-07-06T15:33:06.904026Z","submitted_at":"2023-05-25T07:39:41Z","title":"Dynamic Context Pruning for Efficient and Interpretable Autoregressive Transformers","version":3},"cited_work":{"arxiv_id":"2305.15805","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.15805","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dynamic context pruning for efficient and interpretable autoregressive transformers","venue":null,"work_id":"658c3895-6829-4df7-a00b-03a2e08ad40b","year":2023},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2305.15805","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:00ee844e8a250102c01c2c6ebc5f1b6ffa7ce9735787d78311eb2cf72cecf569","observation_id":"4da32423-fa58-431f-b363-29295125d054","resolution":{"observed_at":"2026-05-17T18:00:50.478057Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.06732","last_updated":"2022-03-14T10:35:35Z","snapshot_observed_at":"2026-07-06T09:55:34.647932Z","submitted_at":"2020-09-14T20:38:14Z","title":"Efficient Transformers: A Survey","version":3},"cited_work":{"arxiv_id":"2009.06732","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2009.06732","snapshot_observed_at":"2026-07-02T02:36:26.546053Z","title":"Efﬁcient transformers: A survey","venue":null,"work_id":"c87abbd6-fe7f-42b9-8f83-f8e5e37b7cc3","year":2009},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2009.06732","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:0891d5fa4436b4a7bccfb708377f720a0b78ffc8ad3f6d7c76042168b3c2c837","observation_id":"4b4a1bac-4f88-491d-9e00-a224064295ab","resolution":{"observed_at":"2026-05-17T18:00:50.482223Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spatten: Efficient sparse attention architecture with cascade token and head pruning","venue":null,"work_id":"1c5a2b06-ed2b-472a-bca7-89693f7d36cc","year":2021},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:f5a772cd8a99a49c7f81bb03beeca38e39a8a44d188032e61056c087b21c0a01","observation_id":"4fef8ba4-b828-43a2-bc4e-ce3ab5674094","resolution":{"observed_at":"2026-05-17T18:00:50.632000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The lru-k page replacement algorithm for database disk buffering","venue":null,"work_id":"ac56a067-49ad-4e4b-9784-f458c9dc805f","year":1993},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:f5899595f5096ab2c8e73ea77986ded5c91e851d01c904ba5b1d8f28601ef590","observation_id":"124d4f2d-c709-4ef8-9a2b-68823a89fb29","resolution":{"observed_at":"2026-05-17T18:00:50.634555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lrfu: A spectrum of policies that subsumes the least recently used and least frequently used policies","venue":null,"work_id":"b1ad1b74-a59c-48e8-b45e-158a2bc759e2","year":2001},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:bb93c0c43185d4fa09629a15ef42054024591a4c7944612334d3371c90c19dff","observation_id":"a06881bd-7c08-4ab2-87c1-18cf95ca6c51","resolution":{"observed_at":"2026-05-17T18:00:50.637086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.03764","last_updated":"2021-06-08T10:02:26Z","snapshot_observed_at":"2026-07-06T11:16:46.852207Z","submitted_at":"2021-06-07T16:30:28Z","title":"On the Expressive Power of Self-Attention Matrices","version":2},"cited_work":{"arxiv_id":"2106.03764","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.03764","snapshot_observed_at":"2026-07-02T16:07:09.244510Z","title":"On the expressive power of self-attention matrices","venue":null,"work_id":"90bf1806-d608-4193-a076-0826a40dc837","year":2021},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2106.03764","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:d2f5323afd6c48267f48a6c5aa9369868e7205f9df0bfbdc0ee6535bab82594a","observation_id":"e16670d8-40d1-4f20-8134-227a63d0a8e5","resolution":{"observed_at":"2026-05-17T18:00:50.487379Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Inductive biases and variable creation in self-attention mechanisms","venue":null,"work_id":"5617ee02-e3a6-4cc3-8e00-6502c13e95f9","year":2022},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:300697e072d69c32ba3be6ca833b68c53c8590252066c6ae8bfeb9088d713424","observation_id":"3cec6851-35f7-4026-8f75-32e1079bb50d","resolution":{"observed_at":"2026-05-17T18:00:50.642232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ffadc0cb-aa51-4532-a1be-0e67e49db01b","year":1966},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:1fc5f05cadc7a2d6ae729312eefe574e2b48c30ef9fac12713b2505d032e1d87","observation_id":"adf41e20-c616-497d-973a-5514eef02777","resolution":{"observed_at":"2026-05-17T18:00:50.644639Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:acff7d4a0d2dd882e551088afb55b416ca4a95f05f77d6ec7f7629af64ee51f9","observation_id":"e4a8c8c6-f9b3-4021-aeb8-9c1db567286a","resolution":{"observed_at":"2026-05-17T18:00:50.491623Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:c4d0e44e1949d6f7ee8146a04571c66e21e4d601aa574372d34c2ef8194847a7","observation_id":"6060d875-e1e8-443b-a5fe-02b7e5d77e48","resolution":{"observed_at":"2026-05-17T18:00:50.496470Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GPT- NeoX-20B: An open-source autoregressive language model","venue":null,"work_id":"7856ab85-b2c9-4186-b9c9-6cadb39ac16e","year":2022},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:2e27058b8860517730219bf1cc65876b7ce0157996c3ccb6586f821001e79371","observation_id":"b26b22c3-052a-48b3-b637-7204475c6d8b","resolution":{"observed_at":"2026-05-17T18:00:50.652714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Choice of plausible alternatives: An evaluation of commonsense causal reasoning","venue":null,"work_id":"4256eada-1753-4a3f-ad5d-d4d7118abae4","year":2011},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:9c8b421b0dc3e8c1a89ee03d59f6d7bc4f573783f2d9b037754f9a38fe7ac396","observation_id":"757ed7cf-6910-41e4-b61c-aed7646caff4","resolution":{"observed_at":"2026-05-17T18:00:50.655275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MathQA: Towards interpretable math word problem solving with operation- based formalisms","venue":null,"work_id":"8d1f8bdb-76e2-4c05-a444-b9b778f4ce9a","year":2019},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:ff1498c8c3983c92c1d7663a848d8549b736020f4932ad897603b66cb13be5b0","observation_id":"04133704-8e88-4ac0-9c7c-4d32fde26b81","resolution":{"observed_at":"2026-05-17T18:00:50.657985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T12:46:15.045882Z","title":"Can a suit of armor conduct electricity? a new dataset for open book question answering","venue":null,"work_id":"efba341e-9173-426f-928c-b9aa410afbee","year":2018},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:ff2230a836b84e2275819e053b80651945d0b395b5cb44d8c7ffd61103014aea","observation_id":"bf96a834-9bf8-40e8-9d2d-fc2496f3bf18","resolution":{"observed_at":"2026-05-17T18:00:50.661003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Piqa: Reasoning about physical commonsense in natural language","venue":null,"work_id":"9d696e1e-4281-470f-8bac-fec4a8adfdf4","year":2020},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:557d81e1fec0fd5f7d98a4209b583c0df2bdc088ef0f47987cb297a3f23ea79a","observation_id":"cee97b64-2cea-4a2a-93ff-fc69196cea8a","resolution":{"observed_at":"2026-05-17T18:00:50.663867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.07461","last_updated":"2019-02-22T23:53:34Z","snapshot_observed_at":"2026-07-06T06:34:26.609892Z","submitted_at":"2018-04-20T06:35:04Z","title":"GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding","version":3},"cited_work":{"arxiv_id":"1804.07461","doi":null,"metadata_source":"pith","pith_arxiv_id":"1804.07461","snapshot_observed_at":"2026-07-04T09:19:44.134394Z","title":"GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding","venue":"cs.CL","work_id":"1bb6fb0c-482d-43cf-94a8-ed18f72a5563","year":2018},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/1804.07461","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:611649ed3ce684b96a65300ab7328a3c5dabea388481fc84fd8900b633cfb1f4","observation_id":"0dc83c89-93fa-4e34-895d-4a0f1158bf7a","resolution":{"observed_at":"2026-05-17T18:00:50.501846Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Winogrande: An adversarial winograd schema challenge at scale","venue":null,"work_id":"77c34b1f-a890-4ade-b1db-49d3ff74372f","year":2021},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:e90aa72064e3ee1a45927da84c2b6054532c811c4d2d056e33192d7fa3b776d9","observation_id":"8ae21149-5e5c-4a9c-9c35-e3540ed94964","resolution":{"observed_at":"2026-05-17T18:00:50.669424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.08745","last_updated":"2018-08-27T09:08:18Z","snapshot_observed_at":"2026-07-06T06:57:36.335954Z","submitted_at":"2018-08-27T09:08:18Z","title":"Don't Give Me the Details, Just the Summary! Topic-Aware Convolutional Neural Networks for Extreme Summarization","version":1},"cited_work":{"arxiv_id":"1808.08745","doi":"10.48550/arxiv.1808.08745","metadata_source":"pith","pith_arxiv_id":"1808.08745","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't Give Me the Details, Just the Summary! Topic-Aware Convolutional Neural Networks for Extreme Summarization","venue":"cs.CL","work_id":"83dfe48d-b12e-425e-a8c9-d62ac86d1373","year":2018},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/1808.08745","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:6f6db36bdeb4b09b9b158543e2deea5d68f6922de5b52a81b7a0b80adc78b69b","observation_id":"4f46ea0d-79d6-4bd0-878f-fc561fe7c2e3","resolution":{"observed_at":"2026-05-17T18:00:50.506635Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.06023","last_updated":"2016-08-26T16:13:13Z","snapshot_observed_at":"2026-07-30T19:30:50.474373Z","submitted_at":"2016-02-19T02:04:18Z","title":"Abstractive Text Summarization Using Sequence-to-Sequence RNNs and Beyond","version":5},"cited_work":{"arxiv_id":"1602.06023","doi":null,"metadata_source":"pith","pith_arxiv_id":"1602.06023","snapshot_observed_at":"2026-07-04T19:50:10.393924Z","title":"Abstractive Text Summarization Using Sequence-to-Sequence RNNs and Beyond","venue":"cs.CL","work_id":"f4b47aa4-845b-42b8-a866-e3fa85cdc379","year":2016},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/1602.06023","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:3d2e721164b737076d7041b78a91e95fa10377feabc1c42afc7946304f473e5a","observation_id":"14aa63f3-2faa-467e-902c-0a4a6c849b10","resolution":{"observed_at":"2026-05-17T18:00:50.511095Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hashimoto","venue":null,"work_id":"81d4fb36-1735-4945-bc18-f82bef0fd5db","year":2023},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:7f7e81f81c4d73694beb751a6703b7ce4d1cad395834f5ba6e297a25239a8548","observation_id":"c7a107ec-3c6d-415d-b91e-5df8870c6d2d","resolution":{"observed_at":"2026-05-17T18:00:50.677381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"P Xing, Hao Zhang, Joseph E","venue":null,"work_id":"2eedcea0-e5cc-490c-be7d-72a5ae9c31b0","year":2023},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:00b96d3212665667e2c96ddaf6ed0ecd9e6cdc9f0f4692d0ea29bc31ec7db143","observation_id":"4e444dd0-ec7e-4aef-8704-9dd9576650f9","resolution":{"observed_at":"2026-05-17T18:00:50.679904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":"2309.17453","doi":"10.48550/arxiv.2309.17453","metadata_source":"pith","pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Streaming Language Models with Attention Sinks","venue":"cs.CL","work_id":"a8d25452-c237-48c9-88a4-682717c3979a","year":2023},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:a2bd46562fdb3d7698c9d6b5a64720a48d846c9cfa1fc4840c0fedfbccdd9495","observation_id":"6b837594-07d8-4e69-a558-167ac31b889b","resolution":{"observed_at":"2026-05-17T18:00:50.515409Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16137","last_updated":"2024-06-24T21:22:00Z","snapshot_observed_at":"2026-07-31T23:13:29.378237Z","submitted_at":"2023-08-30T16:47:51Z","title":"LM-Infinite: Zero-Shot Extreme Length Generalization for Large Language Models","version":7},"cited_work":{"arxiv_id":"2308.16137","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.16137","snapshot_observed_at":"2026-07-04T16:59:58.965650Z","title":"Lm- infinite: Simple on-the-fly length generalization for large language models","venue":null,"work_id":"62f73354-8046-4134-b4e3-1bfab8df2d99","year":2023},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2308.16137","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:f835aabffcffe1aa47340023e19f4b6cf0ba624d67e63b51e1fee6964a5cde67","observation_id":"1798dffb-aa43-4817-bb5e-e033a0ad4754","resolution":{"observed_at":"2026-05-17T18:00:50.520156Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Compressive transformers for long-range sequence modelling","venue":null,"work_id":"623f8955-1579-4258-8d83-0ab58fa1ca05","year":2020},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:ba81d3f1829d5e966e443ea5bc0abaca13895e43b0d4b7d907f0e9995cc11bae","observation_id":"d338e598-f15b-4608-9ea8-b1a674e6ac14","resolution":{"observed_at":"2026-05-17T18:00:50.687807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1510.00149","last_updated":"2016-02-15T06:25:40Z","snapshot_observed_at":"2026-08-04T16:59:47.843960Z","submitted_at":"2015-10-01T09:03:44Z","title":"Deep Compression: Compressing Deep Neural Networks with Pruning, Trained Quantization and Huffman Coding","version":5},"cited_work":{"arxiv_id":"1510.00149","doi":"10.48550/arxiv.1510.00149","metadata_source":"pith","pith_arxiv_id":"1510.00149","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep Compression: Compressing Deep Neural Networks with Pruning, Trained Quantization and Huffman Coding","venue":"cs.CV","work_id":"d79f6a26-2d92-4f7c-aea0-8aabf3b668c8","year":2015},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/1510.00149","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:fea0fa03625211a7e5986a8606bd4b9cd883809e481dd8182a0c5eefe42e14aa","observation_id":"96dc0444-d38f-42ba-ad82-431d6e8032ca","resolution":{"observed_at":"2026-05-17T18:00:50.525397Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T18:20:38.506383+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T18:20:38.506383+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Quantization and training of neural networks for efficient integer-arithmetic-only inference","venue":null,"work_id":"a46d0f2b-8bb4-429b-897a-e7a530cf5f1a","year":2018},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:740d17ce310560cbfd923b20aaf47c1a7c149f217cffbdbe5d89d93880b65727","observation_id":"2bda1484-707f-48c3-a2a8-72b7f260e5a6","resolution":{"observed_at":"2026-05-17T18:00:50.693427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Data-free quantization through weight equalization and bias correction","venue":null,"work_id":"c1b2ab5a-6819-421d-b560-564a066e2cb4","year":2019},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:db55ecbffa6dcdb97e538c8cd9e6e4c1591b4c6be937f615296915da4ee8aaad","observation_id":"c604098a-7ab9-4bf8-9b79-670b776bd44a","resolution":{"observed_at":"2026-05-17T18:00:50.696167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving neural network quantization without retraining using outlier channel splitting","venue":null,"work_id":"873e574d-0a05-47d0-95bf-e075aedc107f","year":2019},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:fdc3a469853d070e51acba88844e4bb24888f20241eb2dc892ffdf7665af2403","observation_id":"1b7d9ff6-7108-46ea-a452-4c2a6d13f6bb","resolution":{"observed_at":"2026-05-17T18:00:50.698829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.06440","last_updated":"2017-06-08T19:53:26Z","snapshot_observed_at":"2026-07-06T05:19:21.142307Z","submitted_at":"2016-11-19T22:48:30Z","title":"Pruning Convolutional Neural Networks for Resource Efficient Inference","version":2},"cited_work":{"arxiv_id":"1611.06440","doi":"10.48550/arxiv.1611.06440","metadata_source":"pith","pith_arxiv_id":"1611.06440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pruning Convolutional Neural Networks for Resource Efficient Inference","venue":"cs.LG","work_id":"0da622ef-0141-4ece-b202-eab31556f979","year":2016},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/1611.06440","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:6b912ed6c7c0543a8c07b0397753befefc196407807d23caee59efe4d1d7e90f","observation_id":"87979139-e97b-4295-a87a-55ae02c0691f","resolution":{"observed_at":"2026-05-17T18:00:50.530175Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.05270","last_updated":"2019-03-05T05:58:11Z","snapshot_observed_at":"2026-07-06T07:07:34.689643Z","submitted_at":"2018-10-11T22:15:28Z","title":"Rethinking the Value of Network Pruning","version":2},"cited_work":{"arxiv_id":"1810.05270","doi":null,"metadata_source":"pith","pith_arxiv_id":"1810.05270","snapshot_observed_at":"2026-07-03T11:18:03.152459Z","title":"Rethinking the Value of Network Pruning","venue":"cs.LG","work_id":"7aeac682-38fc-456d-bd4c-79a55b393f04","year":2018},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/1810.05270","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:5051a38865bbc682d502f0570423c0e252de114e872be9e9518903347006a11c","observation_id":"25be5d4e-4748-42ae-a472-95f6c5e6d6b7","resolution":{"observed_at":"2026-05-17T18:00:50.533939Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Filter pruning via geometric median for deep convolutional neural networks acceleration","venue":null,"work_id":"4c33e9ac-89a3-4cee-8ba2-0a802d07eec5","year":2019},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:1a5541e95c858c2ecdf08302b1c4038b110c951b8c023b53ae9c2c6414f8ae1e","observation_id":"a05d7b55-b29d-4282-8852-ffbf71d4d74e","resolution":{"observed_at":"2026-05-17T18:00:50.570428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sparsity in deep learning: Pruning and growth for efficient inference and training in neural networks","venue":null,"work_id":"138df797-22bc-426e-90ac-77ab0946ee2a","year":2021},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:d70c034ea90a992257f22599c78634b4a8b3996bce5b02195dda12449fcedd94","observation_id":"98d11d86-9fde-4f7d-bfae-0aeb5bedddd1","resolution":{"observed_at":"2026-05-17T18:00:50.577163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":"1503.02531","doi":"10.1109/cvpr52733.2024.01515","metadata_source":"pith","pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Distilling the Knowledge in a Neural Network","venue":"stat.ML","work_id":"d927ab1f-17b8-4002-9d09-c3d55764fbad","year":2015},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:5e9f3d6936351e103bfc5a0b6df680502b921e89a788d7e11dd4a078035f05d6","observation_id":"a009c789-57d3-490f-bf16-f8e6b17d94bd","resolution":{"observed_at":"2026-05-17T18:00:50.537885Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the efficacy of knowledge distillation","venue":null,"work_id":"2d45db32-361e-48a6-8f96-238a6fab7674","year":2019},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:75d02a78189c5ece12f2545014b8b954b9afa41f6ad900faaef6a0b570dfa7b9","observation_id":"8aa88b96-59ea-429f-bb79-fd8912b2d21e","resolution":{"observed_at":"2026-05-17T18:00:50.582813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1903.12136","last_updated":"2019-03-28T17:23:50Z","snapshot_observed_at":"2026-07-06T07:42:21.954799Z","submitted_at":"2019-03-28T17:23:50Z","title":"Distilling Task-Specific Knowledge from BERT into Simple Neural Networks","version":1},"cited_work":{"arxiv_id":"1903.12136","doi":null,"metadata_source":"pith","pith_arxiv_id":"1903.12136","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Distilling Task-Specific Knowledge from BERT into Simple Neural Networks","venue":"cs.CL","work_id":"32132858-2bfe-4845-bba4-0df808633deb","year":2019},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/1903.12136","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:44a23177fc7ccc88fbeb27d15b8eada1659e51440281c7a141bc7d863f69bb03","observation_id":"a9712fad-1422-4898-8d0e-7367cbdc2d1b","resolution":{"observed_at":"2026-05-17T18:00:50.542178Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":"c669ceec-c3c0-4982-ba9d-8ec6a2b251ec","year":2021},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:30cad13264bd3f72c53872f2d2e970125424756ba909a57f3167f83d6a043d23","observation_id":"c2c8b5e1-66a5-4ce5-9a41-efc7531c18d1","resolution":{"observed_at":"2026-05-17T18:00:50.591420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N","venue":null,"work_id":"f9f94060-2add-4d08-972f-465c740811f8","year":2017},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:7e038632592372895b80069f4d57130e101d1a69ab86d78def4758abb856202d","observation_id":"e8390ad4-7635-44b2-8896-d1cc38e39fa3","resolution":{"observed_at":"2026-05-17T18:00:50.596617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Xlnet: Generalized autoregressive pretraining for language understanding","venue":null,"work_id":"95e394d8-aaac-4822-a05f-ad432dd3b1e7","year":2019},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:76a4776e6288a437ad74934205360c04700683a8185ba1622b08b678e159995d","observation_id":"4c65e2f0-e722-4d16-84e1-9b0103f0ab98","resolution":{"observed_at":"2026-05-17T18:00:50.599309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":"1907.11692","doi":"10.1007/s10489-02203627-9","metadata_source":"pith","pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","venue":"cs.CL","work_id":"41fe12c4-e538-4890-a244-480650ed3078","year":2019},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:ce687ed499d0eccbb0ffb256df96379a5bb9ae899fede5295fb9374e36a9eb51","observation_id":"4ab4ba32-40c3-4997-9fb8-2dd2edc23213","resolution":{"observed_at":"2026-05-17T18:00:50.545885Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00937","last_updated":"2019-03-15T18:02:58Z","snapshot_observed_at":"2026-08-04T21:50:24.483867Z","submitted_at":"2018-11-02T15:34:29Z","title":"CommonsenseQA: A Question Answering Challenge Targeting Commonsense Knowledge","version":2},"cited_work":{"arxiv_id":"1811.00937","doi":null,"metadata_source":"pith","pith_arxiv_id":"1811.00937","snapshot_observed_at":"2026-07-10T04:46:45.601872Z","title":"CommonsenseQA: A Question Answering Challenge Targeting Commonsense Knowledge","venue":"cs.CL","work_id":"8cea02ba-76c4-4dec-b914-230fd66e4eb2","year":2018},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/1811.00937","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:b56854c78e0ceb4fdcf3aa1c6327756d76b37343167b72067d2c36437a4b848a","observation_id":"703db5f6-1c1f-4b45-b083-da9089f4ab36","resolution":{"observed_at":"2026-05-17T18:00:50.549413Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Radbert-cl: Factually-aware contrastive learning for radiology report classification","venue":null,"work_id":"ee289299-b141-46fa-9dc0-687d5a383b79","year":2021},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:4e57ca373a538d4c38c9bbd2adfeac6bc49bc4afc26ba2c9f6e1a6cadbc34d72","observation_id":"efd5aa8f-f9b2-41f0-a21d-cf3c29ae43bc","resolution":{"observed_at":"2026-05-17T18:00:50.607408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1902.01718","last_updated":"2019-09-18T01:31:39Z","snapshot_observed_at":"2026-07-06T07:31:16.541264Z","submitted_at":"2019-02-05T14:50:48Z","title":"End-to-End Open-Domain Question Answering with BERTserini","version":2},"cited_work":{"arxiv_id":"1902.01718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1902.01718","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"End-to-end open-domain question answering with bertserini","venue":null,"work_id":"9f14bb21-3975-41bc-8207-1d4ac9fb4f0d","year":1902},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/1902.01718","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:6ae3475be26da1ea79196a08771351ba481a140217979ac4552c45b2bbd8a22e","observation_id":"e76e8d3a-f596-4325-90de-809355d75a96","resolution":{"observed_at":"2026-05-17T18:00:50.553208Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.05460","last_updated":"2019-06-04T09:44:29Z","snapshot_observed_at":"2026-07-06T07:52:49.134861Z","submitted_at":"2019-05-14T08:55:04Z","title":"Cognitive Graph for Multi-Hop Reading Comprehension at Scale","version":2},"cited_work":{"arxiv_id":"1905.05460","doi":null,"metadata_source":"pith","pith_arxiv_id":"1905.05460","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cognitive Graph for Multi-Hop Reading Comprehension at Scale","venue":"cs.CL","work_id":"eeba2736-24de-4bc8-bdde-569bac4e1d98","year":2019},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/1905.05460","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:d61ef9e16689f913cfdc2f41189b526547e9e34fea9efd8d5c8d7963c6d39a50","observation_id":"903a2c9d-2541-4e64-862f-7847b969b636","resolution":{"observed_at":"2026-05-17T18:00:50.157037Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":"2201.11903","doi":"10.48550/arxiv.2201.11903","metadata_source":"pith","pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","venue":"cs.CL","work_id":"d1cf6693-a082-403c-ada9-dac7b96341f9","year":2022},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:48b3072feba4956fd5422ce5d95edca6706afa72d184af52672d71d243e8b562","observation_id":"6fb9e946-9fdd-4fd8-84e5-501129283dac","resolution":{"observed_at":"2026-05-17T18:00:50.164706Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:13.648188+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:13.648188+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13712","last_updated":"2023-04-27T17:56:11Z","snapshot_observed_at":"2026-07-06T15:20:25.388057Z","submitted_at":"2023-04-26T17:52:30Z","title":"Harnessing the Power of LLMs in Practice: A Survey on ChatGPT and Beyond","version":2},"cited_work":{"arxiv_id":"2304.13712","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.13712","snapshot_observed_at":"2026-07-02T17:47:17.806699Z","title":"Harnessing the power of llms in practice: A survey on chatgpt and beyond","venue":null,"work_id":"c11b4098-7687-422d-bb4f-9e0bd3005987","year":2023},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2304.13712","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:a1984eb0fb62b0cc39519491d7c09cfdd35dfb0896c43c152ad21436cca5c2f2","observation_id":"d25f4ad0-005d-4fdc-88b0-cc0173297700","resolution":{"observed_at":"2026-05-17T18:00:50.172211Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":"1810.04805","doi":"10.1111/jofi.12885","metadata_source":"pith","pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","venue":"cs.CL","work_id":"ed240a10-5b19-406c-baa5-30803f465785","year":2018},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:03758144cb36ad915bc685fa419be2711fc9ca7d91d11db93effca0359cb0e96","observation_id":"dfeee84d-d826-487a-80c6-cc94337c6bac","resolution":{"observed_at":"2026-05-17T18:00:50.178213Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":"6be61240-2d76-4f4e-bc5c-e6915d40f1d8","year":2020},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:4d684f6b6e1440ad43ffe2d6286260e1924f62c66f011019f31069a671313668","observation_id":"7d9be3ae-ad1f-485c-92b8-b9df6d7a6523","resolution":{"observed_at":"2026-05-17T18:00:50.626351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":"5fa609b3-1203-4f0e-a526-0110cb3f8046","year":2019},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:01fb7aee0474055d764e8dd6e6e5be92854db364f9212dc9c6e2a9c911ceab54","observation_id":"16a09e60-44b7-4f4d-b57c-4a5c073adfef","resolution":{"observed_at":"2026-05-17T18:00:50.629254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":"2005.14165","doi":"10.1145/1926385.1926423","metadata_source":"pith","pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Models are Few-Shot Learners","venue":"cs.CL","work_id":"214732c0-2edd-44a0-af9e-28184a2b8279","year":2020},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:2e3efa27c12d1da1485d2343de973518db043ef4618cbd2296586813679b6e5b","observation_id":"4aab7ce4-0c33-4628-910d-f61c63394e0a","resolution":{"observed_at":"2026-05-17T18:00:50.185268Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:33.42086+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:33.42086+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05100","last_updated":"2023-06-27T09:57:58Z","snapshot_observed_at":"2026-08-04T18:56:03.233715Z","submitted_at":"2022-11-09T18:48:09Z","title":"BLOOM: A 176B-Parameter Open-Access Multilingual Language Model","version":4},"cited_work":{"arxiv_id":"2211.05100","doi":"10.48550/arxiv.2211.05100","metadata_source":"pith","pith_arxiv_id":"2211.05100","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"BLOOM: A 176B-Parameter Open-Access Multilingual Language Model","venue":"cs.CL","work_id":"337ba690-f35d-4154-9450-8edf4bc9f488","year":2022},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2211.05100","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:18e72d35cbc01155c6dde9a640782dde7f91509a48eb5d41e10bc68ef6061d51","observation_id":"d482c76c-b353-463d-9ad6-509f7517b362","resolution":{"observed_at":"2026-05-17T18:00:50.191596Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T16:25:57.975024+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T16:25:57.975024+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Why {adam} beats {sgd} for attention models","venue":null,"work_id":"87efeaa8-e823-494d-be97-d0ddb3921d6f","year":2020},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:93ff257e53c8a335d310f381425799b811464e8feca8379c25164c83e98b626c","observation_id":"6ffdfec1-49ee-4537-b1be-83306ce40955","resolution":{"observed_at":"2026-05-17T18:00:50.650074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-07-06T08:13:17.750215Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":"1908.03265","doi":"10.48550/arxiv.1908.03265","metadata_source":"arxiv_reference","pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On the variance of the adaptive learning rate and beyond.arXiv preprint arXiv:1908.03265","venue":"arXiv (Cornell University)","work_id":"7acbf612-b1e2-43af-bfe5-3a9d75e45cb6","year":1908},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:eb9dc977376ae911935480c97498b6a7ca335934fee630c4e6bacbf1e577106e","observation_id":"760fe633-d1de-41b2-9955-934cca7e5fef","resolution":{"observed_at":"2026-05-17T18:00:50.197627Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T18:08:20.655659+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.08249","last_updated":"2023-10-01T18:34:20Z","snapshot_observed_at":"2026-07-06T09:13:09.246216Z","submitted_at":"2020-04-17T13:59:07Z","title":"Understanding the Difficulty of Training Transformers","version":3},"cited_work":{"arxiv_id":"2004.08249","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2004.08249","snapshot_observed_at":"2026-07-04T05:19:34.958362Z","title":"Understanding the difficulty of training transformers","venue":null,"work_id":"4f021bf8-14ad-47fb-9645-3637f1e1b17e","year":2004},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2004.08249","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:cd09fbfac7ef8ea1fa30f90bafc73341312594948797d981969655da4c2cd8d1","observation_id":"66847ad0-6d38-4560-ae74-b30dcff183ab","resolution":{"observed_at":"2026-05-17T18:00:50.203271Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07276","last_updated":"2021-09-15T13:25:19Z","snapshot_observed_at":"2026-07-06T11:47:57.026683Z","submitted_at":"2021-09-15T13:25:19Z","title":"Sequence Length is a Domain: Length-based Overfitting in Transformer Models","version":1},"cited_work":{"arxiv_id":"2109.07276","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.07276","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sequence length is a domain: Length-based overfitting in transformer models","venue":null,"work_id":"82ea0dfc-d362-4273-bac6-56beb1a5c66d","year":2021},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2109.07276","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:1c23b98e7f1e6d40bea009c3bc979e4dc689111ec271d75244ca836887fce619","observation_id":"cce7173d-6953-47a0-a782-e30cc4dd70f2","resolution":{"observed_at":"2026-05-17T18:00:50.209655Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.11402","last_updated":"2021-02-22T23:12:35Z","snapshot_observed_at":"2026-07-06T10:43:43.208984Z","submitted_at":"2021-02-22T23:12:35Z","title":"MixUp Training Leads to Reduced Overfitting and Improved Calibration for the Transformer Architecture","version":1},"cited_work":{"arxiv_id":"2102.11402","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2102.11402","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mixup training leads to reduced overfitting and improved calibration for the transformer architecture","venue":null,"work_id":"8987c9e9-1fed-451b-9397-be87c79ad86d","year":2021},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2102.11402","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:4b74a9280f528b983ce8c77b68f699b40d5eb0acf8921a632f857d4061b4214d","observation_id":"2dbe6057-7d62-4600-8a9d-bd05107a1a9f","resolution":{"observed_at":"2026-05-17T18:00:50.214877Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.07772","last_updated":"2020-10-14T22:56:32Z","snapshot_observed_at":"2026-07-06T09:48:00.142946Z","submitted_at":"2020-08-18T07:14:54Z","title":"Very Deep Transformers for Neural Machine Translation","version":2},"cited_work":{"arxiv_id":"2008.07772","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2008.07772","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Very deep transformers for neural machine translation","venue":null,"work_id":"cbac7c49-fc0c-43c4-a6f7-570510273fd1","year":2008},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2008.07772","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:5d88b60d5a37d7ff0bb2b712e6aa74617a2fb8cac8390eb2a2afeeef6d1c21c7","observation_id":"7104600b-ecd1-47a6-b49e-23e38e36686c","resolution":{"observed_at":"2026-05-17T18:00:50.219314Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.15355","last_updated":"2021-05-31T16:45:47Z","snapshot_observed_at":"2026-07-06T10:28:50.574910Z","submitted_at":"2020-12-30T22:53:49Z","title":"Optimizing Deeper Transformers on Small Datasets","version":4},"cited_work":{"arxiv_id":"2012.15355","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2012.15355","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Optimizing deeper transformers on small datasets","venue":null,"work_id":"fe76ee97-93a6-4c08-b542-2af2b1702720","year":2012},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2012.15355","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:f87f22b5d9c8fca60b244a747ace5527bc5046b5e3d402f1f139409e42f9c8f9","observation_id":"e471c91d-0620-49ac-8792-e22d2245e466","resolution":{"observed_at":"2026-05-17T18:00:50.223556Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gradinit: Learning to initialize neural networks for stable and efficient training","venue":null,"work_id":"1ecdba1d-9f91-4ac2-a3f1-a71f4723c44d","year":2021},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:130482d75f58b5bf85a8467046c0f04bf715f105e74cda664d8bc497a6c5cb6f","observation_id":"8d5c11b2-09c0-4f78-bf7f-96fdc1b07d41","resolution":{"observed_at":"2026-05-17T18:00:50.559772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.14484","last_updated":"2024-04-15T22:52:51Z","snapshot_observed_at":"2026-07-06T13:36:37.251739Z","submitted_at":"2022-07-29T05:23:47Z","title":"Adaptive Gradient Methods at the Edge of Stability","version":2},"cited_work":{"arxiv_id":"2207.14484","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2207.14484","snapshot_observed_at":"2026-07-03T23:59:07.494142Z","title":"Alex Damian, Eshaan Nichani, and Jason D Lee","venue":null,"work_id":"6345f850-89b6-4132-b917-73c8a42770e2","year":2022},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2207.14484","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:dfd1e1589b0d7aa4956a0afc9092e3c60deca5931cbe881c099d6334eee3d142","observation_id":"0032da27-34b3-4abb-8f56-06ff0d7d7351","resolution":{"observed_at":"2026-05-17T18:00:50.228327Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.00555","last_updated":"2022-03-01T15:36:38Z","snapshot_observed_at":"2026-07-06T12:42:54.843395Z","submitted_at":"2022-03-01T15:36:38Z","title":"DeepNet: Scaling Transformers to 1,000 Layers","version":1},"cited_work":{"arxiv_id":"2203.00555","doi":"10.48550/arxiv.2203.00555","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.00555","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Xiong, R., Yang, Y ., He, D., Zheng, K., Zheng, S., Xing, C., Zhang, H., Lan, Y ., Wang, L., and Liu, T.-Y","venue":"arXiv (Cornell University)","work_id":"80d58e2d-841f-4d87-a1b6-a2b5c105498a","year":2022},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2203.00555","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:26f95213aac5c539d1922defbecb9bb7f62c90868cab6274bfc5d1904aecafd6","observation_id":"1298970c-a84f-4672-b77e-b7ccfaab61fa","resolution":{"observed_at":"2026-05-17T18:00:50.233161Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T20:54:08.912805+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T20:54:08.912805+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01313","last_updated":"2022-08-02T08:41:31Z","snapshot_observed_at":"2026-08-02T00:35:55.491353Z","submitted_at":"2022-08-02T08:41:31Z","title":"Unified Normalization for Accelerating and Stabilizing Transformers","version":1},"cited_work":{"arxiv_id":"2208.01313","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2208.01313","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unified normalization for accelerating and stabilizing transformers","venue":null,"work_id":"3eae862c-c746-4f46-886d-57de3b4f6e96","year":2022},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2208.01313","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:130a8c3fa8ab6a492576efb26a45c7db3e67c4958812e60b3d26087881c1b49c","observation_id":"9dfd760a-94af-45f0-a775-31971bab2e40","resolution":{"observed_at":"2026-05-17T18:00:50.238049Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:881dc40c8a8af184d3494c50825cea381b6422adac1e4150bb5f9a87d886459e","observation_id":"8f15ad49-108f-414b-a021-0a9611ce5088","resolution":{"observed_at":"2026-05-17T18:00:50.242148Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Texygen: A benchmarking platform for text generation models","venue":null,"work_id":"7312cdba-3065-4b1c-b8b2-c34bccbcc79f","year":2018},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:02c4dd9c60d1200161e82ea0fba8143f0042cdd87321d27a7a3aad6ccc362b81","observation_id":"79a0ca9e-7588-42ed-94d0-45a741b57356","resolution":{"observed_at":"2026-05-17T18:00:50.604446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09720","last_updated":"2023-02-28T00:12:34Z","snapshot_observed_at":"2026-07-06T14:32:33.541029Z","submitted_at":"2022-12-19T18:48:33Z","title":"The case for 4-bit precision: k-bit Inference Scaling Laws","version":2},"cited_work":{"arxiv_id":"2212.09720","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.09720","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"and Zettlemoyer, L","venue":null,"work_id":"7a30dbb3-20a7-4682-bf1b-a91aded23782","year":2022},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2212.09720","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:7ca297436bda542865f18bc5bbde8fb7dbe23612b37c39412d05af9ea5d1c45c","observation_id":"c51fca5b-dc7f-40a9-9e39-e2dbd71c9b94","resolution":{"observed_at":"2026-05-17T18:00:50.246733Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03172","last_updated":"2023-11-20T23:09:34Z","snapshot_observed_at":"2026-07-06T15:51:12.179086Z","submitted_at":"2023-07-06T17:54:11Z","title":"Lost in the Middle: How Language Models Use Long Contexts","version":3},"cited_work":{"arxiv_id":"2307.03172","doi":"10.1162/tacl","metadata_source":"pith","pith_arxiv_id":"2307.03172","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Lost in the Middle: How Language Models Use Long Contexts","venue":"cs.CL","work_id":"37c05e13-4a24-44f8-a1c4-da1bbe7223aa","year":2023},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2307.03172","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:974d7e83a640ced2e4eb6b700f545acbb4019e150d048495fdb82f1214ede874","observation_id":"74fdee36-718d-4b7e-8127-48c05911f74e","resolution":{"observed_at":"2026-05-17T18:00:50.250976Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00726","last_updated":"2023-10-01T16:57:40Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T16:57:40Z","title":"Improving Length-Generalization in Transformers via Task Hinting","version":1},"cited_work":{"arxiv_id":"2310.00726","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.00726","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving length-generalization in transformers via task hinting","venue":null,"work_id":"76045647-1cf2-440f-b061-0c7657a8623a","year":2023},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2310.00726","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:fccdcd164f26470d0baba4e4f2f25494b31e7947afdf4f1c1be1cd57467f857d","observation_id":"9fa8c444-9829-4561-96ed-f8386aa535ac","resolution":{"observed_at":"2026-05-17T18:00:50.255634Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.02451","last_updated":"2023-06-29T17:51:10Z","snapshot_observed_at":"2026-08-01T17:14:19.934588Z","submitted_at":"2023-02-05T18:23:49Z","title":"KDEformer: Accelerating Transformers via Kernel Density Estimation","version":2},"cited_work":{"arxiv_id":"2302.02451","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2302.02451","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kdeformer: Accelerating trans- formers via kernel density estimation","venue":null,"work_id":"dd919987-cbcb-4e03-bd6b-602357cef92d","year":2023},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2302.02451","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:3799cc110f855b7ace2c9f62709bad6a3bbe8122f20150029226ab20d0e2ac60","observation_id":"c781432c-cef1-452d-82e3-29929cc02250","resolution":{"observed_at":"2026-05-17T18:00:50.259821Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13214","last_updated":"2023-05-09T20:03:04Z","snapshot_observed_at":"2026-07-06T14:55:53.398088Z","submitted_at":"2023-02-26T02:42:39Z","title":"Fast Attention Requires Bounded Entries","version":2},"cited_work":{"arxiv_id":"2302.13214","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2302.13214","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fast attention requires bounded entries","venue":null,"work_id":"cdd9827f-be38-4547-b107-586aebe7e3c8","year":2023},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2302.13214","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:4178b4bb79e5e46153cb2711e490e1ff81adf605660ebf0f7beee4063eddde2d","observation_id":"8fcd0d75-f433-47f3-9578-adac114f591d","resolution":{"observed_at":"2026-05-17T18:00:50.263908Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2310.11685","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Superiority of softmax: Unveiling the perfor- mance edge over linear attention","venue":null,"work_id":"0196b84a-1212-45b7-97d1-8100a05a00c4","year":2023},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:2b52e9c3186eea13b31620a2196e96b05d48496139c19ac78c6f419856db5ecc","observation_id":"ba6430af-b61a-43c7-a14b-c1bd2c02d4b1","resolution":{"observed_at":"2026-05-17T18:00:50.268087Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02207","last_updated":"2023-04-05T03:43:38Z","snapshot_observed_at":"2026-08-03T18:18:37.399530Z","submitted_at":"2023-04-05T03:43:38Z","title":"Algorithm and Hardness for Dynamic Attention Maintenance in Large Language Models","version":1},"cited_work":{"arxiv_id":"2304.02207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.02207","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Algorithm and hardness for dynamic attention maintenance in large language models","venue":null,"work_id":"e2375fb8-aa90-467e-88c8-574e384a2daf","year":2023},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2304.02207","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:a65ce0b4bf01196b8d1635c54c348f53c937fb27885f37a9abe0cc57608a071d","observation_id":"c20b00c4-9a48-4ab4-958e-49065139ff25","resolution":{"observed_at":"2026-05-17T18:00:50.272467Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04701","last_updated":"2024-10-14T15:52:31Z","snapshot_observed_at":"2026-07-06T15:24:34.433150Z","submitted_at":"2023-05-08T13:32:41Z","title":"Differentially Private Attention Computation","version":2},"cited_work":{"arxiv_id":"2305.04701","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.04701","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Differentially private attention computation","venue":null,"work_id":"0e7dd120-362f-4207-95c2-3727002be24e","year":2023},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2305.04701","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:ebfd4fcb05b27483b4bc59dd77892b4fa375413d670579b1c0355937a70e0780","observation_id":"bda7a126-8e8f-4c3f-ab0f-1e5290c0f36f","resolution":{"observed_at":"2026-05-17T18:00:50.277018Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":6,"parse_uncertain":0,"unresolved":2,"verified_exact":59,"verified_fuzzy":33},"total_outbound_references":145},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 100 of 145 outbound references and 56 inbound Pith citation observations for arXiv:2306.14048."}