{"as_of":"2026-08-17T23:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ce7310fef2996c3440a5f0f41e7e9c4aad262f677b88b1361588cd388b1b68c6","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T17:05:55.055812Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.11155/citation-record","integrity":"/paper/2509.11155/integrity","json":"/paper/2509.11155/citation-record.json","paper":"/paper/2509.11155"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.15024","last_updated":"2024-02-09T17:59:40Z","snapshot_observed_at":"2026-08-16T14:24:10.346445Z","submitted_at":"2024-01-26T17:35:45Z","title":"SliceGPT: Compress Large Language Models by Deleting Rows and Columns","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15024","snapshot_observed_at":"2026-08-04T17:05:54.920316Z","title":"Croci, Marcelo Gennari do Nascimento, Torsten Hoefler, and James Hensman","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:54.920316Z"},"links":{"cited_paper":"/paper/2401.15024","citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:1875014d6fb5aa3b5176158a8406d68cba333a257874815037420ed523d191ec","observation_id":"93258213-1c11-4b1b-8b7a-c5439dfa1701","resolution":{"observed_at":"2026-08-04T17:05:54.920316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-04T17:05:54.924616Z","title":"Peters, and Arman Cohan","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:54.924616Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:d67f56d3bcca9f0eb429781603a8701be44f322484cb4d274adc3e62e9ea7e49","observation_id":"3068b344-1b2e-4afc-bcd8-2d5638db01b8","resolution":{"observed_at":"2026-08-04T17:05:54.924616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/s0022-0000(73)80033-9","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Floyd, Vaughan Pratt, Ronald L","venue":"Journal of Computer and System Sciences","work_id":"cbc930a6-ae09-4ae5-a909-b8ed015d6cf2","year":1973},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:54.928598Z"},"links":{"citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:f0065cf2bfa929c75d3ec4800c5bb9f04437ce6e0b16f1b9e2cc93e9f2ee3eef","observation_id":"d459326f-8f50-416d-b648-27a8bc4187c4","resolution":{"observed_at":"2026-08-04T17:08:30.591388Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-04T17:05:54.932346Z","title":"Hudson, Ehsan Adeli, Russ Altman, Simran Arora, Sydney von Arx, Michael S","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:54.932346Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:e99578eb3c1c5791a3d718ea71c4db4cbef6912e86ec1fcff94cf3b87ddc859f","observation_id":"c9f95e5c-ed68-46d4-8503-bc743d3c6970","resolution":{"observed_at":"2026-08-04T17:05:54.932346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03675","last_updated":"2024-08-08T01:20:13Z","snapshot_observed_at":"2026-08-16T13:28:00.366504Z","submitted_at":"2024-08-07T10:31:07Z","title":"NACL: A General and Effective KV Cache Eviction Framework for LLMs at Inference Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03675","snapshot_observed_at":"2026-08-04T17:05:54.935394Z","title":"Nacl: A general and effective kv cache eviction framework for llms at inference time, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:54.935394Z"},"links":{"cited_paper":"/paper/2408.03675","citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:2faf9d7f6520e2b369fe7e273dac78977af3d586b2835a3b8f5a9dd8cc3868a5","observation_id":"83258d0e-bb77-4b48-8932-691bcba3fa81","resolution":{"observed_at":"2026-08-04T17:05:54.935394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.14794","last_updated":"2022-11-19T12:45:21Z","snapshot_observed_at":"2026-08-12T04:58:34.201421Z","submitted_at":"2020-09-30T17:09:09Z","title":"Rethinking Attention with Performers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.14794","snapshot_observed_at":"2026-08-04T17:05:54.939066Z","title":"Rethinking attention with performers, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:54.939066Z"},"links":{"cited_paper":"/paper/2009.14794","citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:2d9789381d9fbfba0ec33a17a3b42fa33800e591a368d848186930f093cae994","observation_id":"32712d33-f2e2-41ca-8a62-3d2626d1bf0e","resolution":{"observed_at":"2026-08-04T17:05:54.939066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-04T17:05:54.942617Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:54.942617Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:f9de8e4db12948f193a4b87c67b314f96c92587c4333a3c56aab37ccac9d5428","observation_id":"928076d6-bbac-4a8a-83ce-ec384ae1ca19","resolution":{"observed_at":"2026-08-04T17:05:54.942617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-04T17:05:54.945381Z","title":"Training verifiers to solve math word problems, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:54.945381Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:ff01531232d2a07679a5adeeb157be9f8b1bb7810aa2364d74d95a50e7d1bb33","observation_id":"b72dc323-ea48-49b6-b2ce-a2dfc170fd58","resolution":{"observed_at":"2026-08-04T17:05:54.945381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03289","last_updated":"2025-02-28T05:35:09Z","snapshot_observed_at":"2026-08-12T18:12:56.346385Z","submitted_at":"2025-01-06T06:34:52Z","title":"Adaptive Pruning of Pretrained Transformer via Differential Inclusions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03289","snapshot_observed_at":"2026-08-04T17:05:54.948805Z","title":"Adaptive pruning of pretrained transformer via differential inclusions, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:54.948805Z"},"links":{"cited_paper":"/paper/2501.03289","citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:65674d9c54e49c991f3ab0cf63537ce2573fc7fb95232e66329f41e6bf0a3824","observation_id":"a4b44001-d106-4a33-9d79-225cde32a359","resolution":{"observed_at":"2026-08-04T17:05:54.948805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:05:54.952490Z","title":"Truth knows no language: Evaluating truthfulness beyond english, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:54.952490Z"},"links":{"citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:158da72025a5acefefd7d66d4c3ea9649b6c29182d75d78cb1af707d63ff9627","observation_id":"681293ee-ff80-4652-932b-910106da141b","resolution":{"observed_at":"2026-08-04T17:05:54.952490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:05:54.955204Z","title":"The language model evaluation harness, 07 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:54.955204Z"},"links":{"citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:4d1fd22f3528c3dcc150382f7afd755960a08a952178838bf5397d5cd1a3cc24","observation_id":"6ae6a731-bbe5-4f09-b6b4-5ccebb72c198","resolution":{"observed_at":"2026-08-04T17:05:54.955204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:05:54.957823Z","title":"Golub and Charles F","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:54.957823Z"},"links":{"citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:db6e4f464d0c3a5f4a5dd66b73f634427a63a15c60faf62b356a9b8d404735aa","observation_id":"a0d25841-e30e-4357-9079-b2337568756e","resolution":{"observed_at":"2026-08-04T17:05:54.957823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:05:54.960445Z","title":"Deep Learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:54.960445Z"},"links":{"citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:8c9db70c682a1251214e9c26291f46a62f1c68d398614f2d06e07b771fae309e","observation_id":"1cd2a967-6d22-4941-b422-aa169b0fbca9","resolution":{"observed_at":"2026-08-04T17:05:54.960445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-04T17:05:54.963867Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:54.963867Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:f21c0fc1eff784e819b84da945be3f4a6edeb7af47e756ae49e4ac2957a5dae7","observation_id":"8d8130db-1d67-4ed4-9c44-159d67edf4e2","resolution":{"observed_at":"2026-08-04T17:05:54.963867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:05:54.967207Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:54.967207Z"},"links":{"citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:2ae7b48f5c6c9fc6f35fff63dd66480ce5dcff9a753016d4b9132ceff37de11c","observation_id":"f3a389cd-f447-45f4-9016-05d4dc3b863b","resolution":{"observed_at":"2026-08-04T17:05:54.967207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:05:54.970414Z","title":"Kv caching explained: Optimizing transformer inference efficiency, Jan 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:54.970414Z"},"links":{"citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:6f1386b688f878a3ab58d7b9e8e54aaeff701143f55843e05eb3a9a99e389291","observation_id":"1169c6d5-c313-4985-82f0-b1e6f55915a4","resolution":{"observed_at":"2026-08-04T17:05:54.970414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-17T08:27:45.946180Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-04T17:05:54.973004Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:54.973004Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:b3ce30fb1c637fa8a24dcb8ee75d15151424b91313d9e73658e99913c3dd2b7d","observation_id":"ed0ab0ff-6081-457f-8c89-c47ef52b9221","resolution":{"observed_at":"2026-08-04T17:05:54.973004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:05:54.975560Z","title":"Principal component analysis: A review and recent developments","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:54.975560Z"},"links":{"citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:d00eea3fb17179d8ff249b91ddf0211c1d3c0d6e798be173386e761315252698","observation_id":"73ee96cc-d960-4ef6-bece-fc5b621ed121","resolution":{"observed_at":"2026-08-04T17:05:54.975560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.04881","last_updated":"2022-09-11T14:38:10Z","snapshot_observed_at":"2026-08-17T11:07:48.415946Z","submitted_at":"2022-09-11T14:38:10Z","title":"On The Computational Complexity of Self-Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.04881","snapshot_observed_at":"2026-08-04T17:05:54.978185Z","title":"On the computational complexity of self-attention, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:54.978185Z"},"links":{"cited_paper":"/paper/2209.04881","citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:9cd486740919984c3903d6711f7cdf8baa3d2b99ab1d188ccefac7f89268f1d8","observation_id":"c6bcbe9d-9e97-4110-91f6-33cf769d5d16","resolution":{"observed_at":"2026-08-04T17:05:54.978185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12883","last_updated":"2024-12-17T13:07:31Z","snapshot_observed_at":"2026-08-17T15:32:34.056847Z","submitted_at":"2024-12-17T13:07:31Z","title":"A Comparative Study of Pruning Methods in Transformer-based Time Series Forecasting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12883","snapshot_observed_at":"2026-08-04T17:05:54.981663Z","title":"A comparative study of pruning methods in transformer-based time series forecasting, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:54.981663Z"},"links":{"cited_paper":"/paper/2412.12883","citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:689aaf8774bd2392f7e5ff0ef0e6ca02aea2747cbfd1f183f9253fead75847bc","observation_id":"e58010b8-3eb5-4e19-a215-70c18dbe6969","resolution":{"observed_at":"2026-08-04T17:05:54.981663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.04451","last_updated":"2020-02-18T16:01:18Z","snapshot_observed_at":"2026-07-06T08:50:12.690900Z","submitted_at":"2020-01-13T18:38:28Z","title":"Reformer: The Efficient Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.04451","snapshot_observed_at":"2026-08-04T17:05:54.984317Z","title":"Reformer: The efficient transformer, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:54.984317Z"},"links":{"cited_paper":"/paper/2001.04451","citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:c3619cd39bdeee0fffd425d9b32e5a8cdfffbeba781b58553d1acd465f814a63","observation_id":"9fcd80a4-4490-4be2-8fba-487cb7b61496","resolution":{"observed_at":"2026-08-04T17:05:54.984317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:05:54.986974Z","title":"Klema and A","venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:54.986974Z"},"links":{"citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:b16c918813f6e3b002cda56ef3e3a7c870fcb63e13656cf68801335f0f149878","observation_id":"05c3b78b-2afb-4170-bb3b-b8fc2e5f8b1d","resolution":{"observed_at":"2026-08-04T17:05:54.986974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.12085","last_updated":"2019-10-14T10:44:32Z","snapshot_observed_at":"2026-08-14T16:10:42.464752Z","submitted_at":"2019-06-28T08:17:53Z","title":"Tutorial: Complexity analysis of Singular Value Decomposition and its variants","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.12085","snapshot_observed_at":"2026-08-04T17:05:54.989498Z","title":"Tutorial: Complexity analysis of singular value decomposition and its variants, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:54.989498Z"},"links":{"cited_paper":"/paper/1906.12085","citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:81b64419623821a9f8af3bdd835e09c28e3126b2746bdeb76bc33f3b926c9360","observation_id":"a77ceef9-f494-40d3-b3af-6307d68e9773","resolution":{"observed_at":"2026-08-04T17:05:54.989498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:05:54.992615Z","title":"Kivi: a tuning-free asymmetric 2bit quantization for kv cache","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:54.992615Z"},"links":{"citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:0734acb20a0002d6414d16b454c77e7157590cef35574cc4b8f39d04c800ea3a","observation_id":"0855175d-1051-4a16-9406-04a69017e4bd","resolution":{"observed_at":"2026-08-04T17:05:54.992615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:05:54.995910Z","title":"Massive multitask language understanding (mmlu) on helm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:54.995910Z"},"links":{"citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:8ae860483edb8be04d75c1464e5b943d91f8b2571d7e621cddd3d9b63b49c1dd","observation_id":"f7c6b5c8-ffce-4e42-96d8-61bb809735af","resolution":{"observed_at":"2026-08-04T17:05:54.995910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:05:54.998406Z","title":"Principal components analysis (pca)","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:54.998406Z"},"links":{"citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:4f359cf7eaa361cf0fc1b697a5ff474c0fce49aa2a5eecd2f3d3bc3ee0934710","observation_id":"e96c7a5e-4f22-4b03-9269-f2de0b7960b3","resolution":{"observed_at":"2026-08-04T17:05:54.998406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:05:55.002034Z","title":"Pointer sentinel mixture models, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:55.002034Z"},"links":{"citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:9448c027fa26ec2bffae6040bebb246c0244c96f88f73e3d7fd3fe7df455a600","observation_id":"8d05378f-68e6-457b-a989-a0d7c3366fa7","resolution":{"observed_at":"2026-08-04T17:05:55.002034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02060","last_updated":"2025-03-03T01:25:46Z","snapshot_observed_at":"2026-08-15T00:07:51.079800Z","submitted_at":"2024-09-03T17:08:20Z","title":"OLMoE: Open Mixture-of-Experts Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02060","snapshot_observed_at":"2026-08-04T17:05:55.004692Z","title":"Smith, Pang Wei Koh, Amanpreet Singh, and Hannaneh Hajishirzi","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:55.004692Z"},"links":{"cited_paper":"/paper/2409.02060","citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:92f9b7dd45367e6474f150758539311d704127400f49b3e88ead3f6df7fcdcf4","observation_id":"fb0c36db-40a2-4220-8d31-0f9d7104b207","resolution":{"observed_at":"2026-08-04T17:05:55.004692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19399","last_updated":"2025-01-31T18:55:35Z","snapshot_observed_at":"2026-08-17T08:44:55.472979Z","submitted_at":"2025-01-31T18:55:35Z","title":"Scalable-Softmax Is Superior for Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19399","snapshot_observed_at":"2026-08-04T17:05:55.007461Z","title":"Nakanishi","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:55.007461Z"},"links":{"cited_paper":"/paper/2501.19399","citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:86e93e74eac08bc5f731e0c7d2d90bca444d622e44b8d2c903f1b45cb3e1ae8f","observation_id":"ecce2904-108a-4489-bac0-607d95f91640","resolution":{"observed_at":"2026-08-04T17:05:55.007461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04985","last_updated":"2024-09-04T10:04:52Z","snapshot_observed_at":"2026-08-16T14:36:33.398897Z","submitted_at":"2023-12-08T11:47:35Z","title":"SparQ Attention: Bandwidth-Efficient LLM Inference","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04985","snapshot_observed_at":"2026-08-04T17:05:55.010618Z","title":"Sparq attention: Bandwidth-efficient llm inference, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:55.010618Z"},"links":{"cited_paper":"/paper/2312.04985","citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:b6080c1aa9b406eb99fbfa06236e145393696211974d681a5e4695d747739bef","observation_id":"f0bd9784-91ec-47c6-9db7-33bf7abcd744","resolution":{"observed_at":"2026-08-04T17:05:55.010618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.10641","last_updated":"2019-11-21T19:01:32Z","snapshot_observed_at":"2026-08-16T10:42:13.725165Z","submitted_at":"2019-07-24T18:11:59Z","title":"WinoGrande: An Adversarial Winograd Schema Challenge at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.10641","snapshot_observed_at":"2026-08-04T17:05:55.013832Z","title":"Winogrande: An adversarial winograd schema challenge at scale, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:55.013832Z"},"links":{"cited_paper":"/paper/1907.10641","citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:c9d447687b2ca0e037abf2337a0b109aa0e8d87786ccae0c8a5e783396cf2d2f","observation_id":"eaedb5fc-a1d8-4bac-81a1-a6767fe9db9f","resolution":{"observed_at":"2026-08-04T17:05:55.013832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:05:55.016714Z","title":"Roumeliotis, and Manoj Karkee","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:55.016714Z"},"links":{"citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:4bb7fbe025bb228e5c08d140a427a813426d4b7004098bb59a9b55ce94f12432","observation_id":"3ee6bd84-b9bd-4f01-9314-7740af35a0a0","resolution":{"observed_at":"2026-08-04T17:05:55.016714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05646","last_updated":"2024-11-08T16:29:33Z","snapshot_observed_at":"2026-08-16T13:27:13.762383Z","submitted_at":"2024-08-10T22:47:12Z","title":"Eigen Attention: Attention in Low-Rank Space for KV Cache Compression","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05646","snapshot_observed_at":"2026-08-04T17:05:55.019176Z","title":"Eigen attention: Attention in low-rank space for kv cache compression, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:55.019176Z"},"links":{"cited_paper":"/paper/2408.05646","citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:9fbbfec13f5bfe60dc5addac6f92bd72d9da8ccc5ec5d015f89137131e2da5e3","observation_id":"5388853c-a40a-42c0-b007-0138bf6d4b68","resolution":{"observed_at":"2026-08-04T17:05:55.019176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02542","last_updated":"2024-11-07T18:58:50Z","snapshot_observed_at":"2026-08-17T16:20:30.150779Z","submitted_at":"2024-06-04T17:58:03Z","title":"Loki: Low-rank Keys for Efficient Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02542","snapshot_observed_at":"2026-08-04T17:05:55.021776Z","title":"Loki: Low-rank keys for efficient sparse attention, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:55.021776Z"},"links":{"cited_paper":"/paper/2406.02542","citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:1b5596252e7f87516550485cfd8b27a02ac70119815b89270f927ff9db8a48d7","observation_id":"49f7425a-66a5-403d-bdf2-06b232b5d774","resolution":{"observed_at":"2026-08-04T17:05:55.021776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.06732","last_updated":"2022-03-14T10:35:35Z","snapshot_observed_at":"2026-08-14T10:35:34.660420Z","submitted_at":"2020-09-14T20:38:14Z","title":"Efficient Transformers: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.06732","snapshot_observed_at":"2026-08-04T17:05:55.024663Z","title":"Efficient transformers: A survey, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:55.024663Z"},"links":{"cited_paper":"/paper/2009.06732","citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:85a311b63857d50f72726008cfb828e9bbaf1e80280033e4be6f01f0f1a2c268","observation_id":"b87d149a-da18-4137-9bc9-9bb63f236dd8","resolution":{"observed_at":"2026-08-04T17:05:55.024663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-08-17T01:19:18.409791Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-04T17:05:55.027257Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:55.027257Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:816c548c5b1a627c4ce996b3cb54e8d99457e08d9477dfc175eba26d6338e2db","observation_id":"2526b1cd-9fd1-4bf5-8eaf-a70cb1a1c812","resolution":{"observed_at":"2026-08-04T17:05:55.027257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04768","last_updated":"2020-06-14T08:15:54Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:37:52Z","title":"Linformer: Self-Attention with Linear Complexity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04768","snapshot_observed_at":"2026-08-04T17:05:55.030959Z","title":"Li, Madian Khabsa, Han Fang, and Hao Ma","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:55.030959Z"},"links":{"cited_paper":"/paper/2006.04768","citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:f92ff482cbc023f104733138b42ca06797b96ba444626019d8ba5734637fd5a4","observation_id":"7399275e-57e3-46bf-a805-62c2ac65a583","resolution":{"observed_at":"2026-08-04T17:05:55.030959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-17T13:17:07.963143Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-04T17:05:55.034000Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:55.034000Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:1570950c1f0a2dca4e8e125cddac472389d24ccab02ffaf66e8a755128fc124e","observation_id":"41752cb9-bf29-4457-9506-43f60f78cadd","resolution":{"observed_at":"2026-08-04T17:05:55.034000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:05:55.036698Z","title":"Chi, Quoc V","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:55.036698Z"},"links":{"citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:746dad8524577e99ca8c5aa7b1e59f695392e36eebe41a7e20ce07acc4209276","observation_id":"b5c767e0-c209-4fa3-978b-bb9ab05e7a23","resolution":{"observed_at":"2026-08-04T17:05:55.036698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12450","last_updated":"2025-03-16T10:54:59Z","snapshot_observed_at":"2026-08-16T12:49:38.155494Z","submitted_at":"2025-03-16T10:54:59Z","title":"LazyMAR: Accelerating Masked Autoregressive Models via Feature Caching","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12450","snapshot_observed_at":"2026-08-04T17:05:55.039620Z","title":"Lazymar: Accelerating masked autoregressive models via feature caching, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:55.039620Z"},"links":{"cited_paper":"/paper/2503.12450","citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:aff4dec4be5cd59fcd6f144c97e6d43cbbec48baa77cd74008a41a476e91c994","observation_id":"5898bd25-447c-4626-9270-3cfb753ad702","resolution":{"observed_at":"2026-08-04T17:05:55.039620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:05:55.042420Z","title":"Hellaswag: Can a machine really finish your sentence? In Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:55.042420Z"},"links":{"citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:9c9aec13e2f8bfa733f095d77392c78bfdd9811aa3ad2ffd98e3cdb095029aee","observation_id":"da446570-6873-4af9-b485-8273b2a09827","resolution":{"observed_at":"2026-08-04T17:05:55.042420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-08-06T19:19:02.165567Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-04T17:05:55.044993Z","title":"H _2 o: Heavy-hitter oracle for efficient generative inference of large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:55.044993Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:78482a7234a90428f66baddcbbd4858d7de01ec2eb3a4c79360406e022b2941d","observation_id":"9edb87ef-4250-4a67-a241-c844189226b9","resolution":{"observed_at":"2026-08-04T17:05:55.044993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10594","last_updated":"2025-05-22T04:58:06Z","snapshot_observed_at":"2026-08-16T13:42:43.568572Z","submitted_at":"2024-06-15T11:03:33Z","title":"BlockPruner: Fine-grained Pruning for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10594","snapshot_observed_at":"2026-08-04T17:05:55.047920Z","title":"Blockpruner: Fine-grained pruning for large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:55.047920Z"},"links":{"cited_paper":"/paper/2406.10594","citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:cb80ffb845b4d4ac58bfadf781c8cfe4a2fd30e9f966b6d6fb6545e1ade4381d","observation_id":"f076a612-3a6d-4de1-9f4f-f58f04997241","resolution":{"observed_at":"2026-08-04T17:05:55.047920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:05:55.050852Z","title":"Aligning books and movies: Towards story-like visual explanations by watching movies and reading books","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:55.050852Z"},"links":{"citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:5e66859ebdac16d3201b1aac6e2f912ff8f99164297025ba186e2cca3a763102","observation_id":"7cb230c1-48d9-4d10-ae25-ca3af94e7c7a","resolution":{"observed_at":"2026-08-04T17:05:55.050852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:05:55.053441Z","title":"Wikipedia-hindi dataset","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:55.053441Z"},"links":{"citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:3cf871dd6a691f9c7467a61149e269cbd48be5446a7fdd9a421b2eda3da31616","observation_id":"29910e74-dc77-4a5e-b3fb-574c031c8c31","resolution":{"observed_at":"2026-08-04T17:05:55.053441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:05:55.055812Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:55.055812Z"},"links":{"citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:4ac748acdd958e126e9925a91bbaca966c89a639f6de25742eef23b291aaf365","observation_id":"ff8aeaf9-d3ce-4d3a-905a-a4e8f777b3fe","resolution":{"observed_at":"2026-08-04T17:05:55.055812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T10:39:27.256598Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2509.11155."}