{"as_of":"2026-08-22T20:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dc5839d2054fc916c135cd3ee9ad4b38386bb37893c45f3bea010eccbe2bf40f","coverage":[{"denominator":85,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":85,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:32:35.413009Z","state":"measured"},{"denominator":90,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":90,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T11:48:01.180107Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-11T01:57:51.329269Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21487","snapshot_observed_at":"2026-08-08T11:48:01.180107Z","title":"Hardware-efficient attention for fast decoding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.07864","last_updated":"2025-06-12T11:45:57Z","snapshot_observed_at":"2026-08-10T11:58:20.177769Z","submitted_at":"2025-02-11T18:20:18Z","title":"TransMLA: Multi-Head Latent Attention Is All You Need","version":5},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T11:48:01.180107Z"},"links":{"cited_paper":"/paper/2505.21487","citing_paper":"/paper/2502.07864"},"observation_digest":"sha256:1b4e58059d7f65388ba76976a763cd673e687ee1b2f6a158b4e78019d190e666","observation_id":"5f4dc038-a52c-45e7-8213-b076abe14c63","resolution":{"observed_at":"2026-08-08T11:48:01.180107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21487","snapshot_observed_at":"2026-08-07T05:06:32.737715Z","title":"Hardware-efficient attention for fast decoding.arXiv preprint arXiv:2505.21487, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-18T03:43:14.193832Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.737715Z"},"links":{"cited_paper":"/paper/2505.21487","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:5c96ffc2fe7f36ebedf2d5a5704523b0a9aeed263c9e110c7f094915ba41d102","observation_id":"292cce17-8c9a-4178-887e-7497c8c511e0","resolution":{"observed_at":"2026-08-07T05:06:32.737715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21487","snapshot_observed_at":"2026-08-05T17:55:08.095113Z","title":"Hardware-efficient attention for fast decoding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-19T17:54:54.763717Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:08.095113Z"},"links":{"cited_paper":"/paper/2505.21487","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:ab0c4b9297b294b7cb42317a7f36dce9edde2562b369ed8d93d1b90be7fb3b71","observation_id":"3a655ef5-cf0b-481a-a0e3-b783519b25c6","resolution":{"observed_at":"2026-08-05T17:55:08.095113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"cited_work":{"arxiv_id":"2505.21487","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.21487","snapshot_observed_at":"2026-07-11T01:57:51.329269Z","title":"Hardware-Efficient Attention for Fast Decoding","venue":"cs.LG","work_id":"ccbd4ee1-28e4-4c51-9b0a-02263df4e886","year":2025},"citing_paper":{"arxiv_id":"2607.05876","last_updated":"2026-07-08T02:47:41Z","snapshot_observed_at":"2026-08-20T02:52:02.866492Z","submitted_at":"2026-07-07T06:11:54Z","title":"Think Before You Grid-Search: Floor-First Triage for LLM Serving","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-08T22:38:12.637901Z"},"links":{"cited_paper":"/paper/2505.21487","citing_paper":"/paper/2607.05876"},"observation_digest":"sha256:a8209c9f3013455fe1be702095a142780407b5fe020a14ce51018a711ff9a403","observation_id":"c97ed32f-bce7-49e3-9860-9a60cc640eea","resolution":{"observed_at":"2026-07-08T22:45:40.085058Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"cited_work":{"arxiv_id":"2505.21487","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.21487","snapshot_observed_at":"2026-07-11T01:57:51.329269Z","title":"Hardware-Efficient Attention for Fast Decoding","venue":"cs.LG","work_id":"ccbd4ee1-28e4-4c51-9b0a-02263df4e886","year":2025},"citing_paper":{"arxiv_id":"2607.05876","last_updated":"2026-07-08T02:47:41Z","snapshot_observed_at":"2026-08-20T02:52:02.866492Z","submitted_at":"2026-07-07T06:11:54Z","title":"Think Before You Grid-Search: Floor-First Triage for LLM Serving","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-11T01:55:09.658053Z"},"links":{"cited_paper":"/paper/2505.21487","citing_paper":"/paper/2607.05876"},"observation_digest":"sha256:4a54e32b8c273cc52078630f8d2dd2829fa30be772e3fda50f75fe0441c80120","observation_id":"bc4302b9-6ff6-4770-8263-b52508b85bad","resolution":{"observed_at":"2026-07-11T01:57:51.357138Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.21487/citation-record","integrity":"/paper/2505.21487/integrity","json":"/paper/2505.21487/citation-record.json","paper":"/paper/2505.21487"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.16369","last_updated":"2023-08-31T00:03:02Z","snapshot_observed_at":"2026-08-15T04:42:28.752204Z","submitted_at":"2023-08-31T00:03:02Z","title":"SARATHI: Efficient LLM Inference by Piggybacking Decodes with Chunked Prefills","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16369","snapshot_observed_at":"2026-08-07T13:32:29.014918Z","title":"Gulavani, and Ramachandran Ramjee","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:29.014918Z"},"links":{"cited_paper":"/paper/2308.16369","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:253a5a36b2a419f4a95ba52ae80ef0c711a3ec89d1e6b22643637e03b685f899","observation_id":"43121bc2-b3cf-48bd-b5ec-d989455c453e","resolution":{"observed_at":"2026-08-07T13:32:29.014918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-08-15T06:28:09.529747Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-07T13:32:29.108759Z","title":"Gqa: Training generalized multi-query transformer models from multi-head checkpoints, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:29.108759Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:12cad33f2d495b9aba7fe60025735e89469e66599281cd97615087457f244457","observation_id":"41699e1c-1716-4d8f-90e2-d7bf64aa9f0f","resolution":{"observed_at":"2026-08-07T13:32:29.108759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00032","last_updated":"2022-06-30T18:01:08Z","snapshot_observed_at":"2026-08-16T16:49:08.285566Z","submitted_at":"2022-06-30T18:01:08Z","title":"DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00032","snapshot_observed_at":"2026-08-07T13:32:29.198408Z","title":"Deepspeed inference: Enabling efficient inference of transformer models at unprecedented scale, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:29.198408Z"},"links":{"cited_paper":"/paper/2207.00032","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:b312e5edf6b3416b5e1715abb217009b9c9e00b31b068bdf14071151c1959872","observation_id":"c8abc7c3-bda3-4139-8f81-e0cb39023140","resolution":{"observed_at":"2026-08-07T13:32:29.198408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:29.314397Z","title":"How to scale your model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:29.314397Z"},"links":{"citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:3766de734953e28b7930abb0d2014093fd4fb7714caaeb582b10d1f20f579489","observation_id":"71edab39-71ef-451a-b4ee-82e3c796a122","resolution":{"observed_at":"2026-08-07T13:32:29.314397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06205","last_updated":"2025-05-13T14:11:59Z","snapshot_observed_at":"2026-08-16T13:11:25.569465Z","submitted_at":"2024-10-08T17:07:01Z","title":"Round and Round We Go! What makes Rotary Positional Encodings useful?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06205","snapshot_observed_at":"2026-08-07T13:32:29.405631Z","title":"Round and round we go! what makes rotary positional encodings useful?, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:29.405631Z"},"links":{"cited_paper":"/paper/2410.06205","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:34ae9ba433f096557b45790d074eb155106e599220ff1aad4c5ef90086aa3116","observation_id":"006a6026-b703-4b2a-9bb7-af46222eabbe","resolution":{"observed_at":"2026-08-07T13:32:29.405631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:29.516253Z","title":"Singe: Leveraging warp specialization for high performance on gpus","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:29.516253Z"},"links":{"citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:b29ed26363edad0368691ef25b2f9b3beef35d45b52dfd86e440e92dfcdffa8d","observation_id":"0705c79f-e322-49e3-8af2-b710e8b0cbde","resolution":{"observed_at":"2026-08-07T13:32:29.516253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:29.606445Z","title":"Cosmopedia, February 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:29.606445Z"},"links":{"citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:d03d292e8bf94e41fb0d9ced64dee09c64c4cc4912ee59eef81ca33db13f27d8","observation_id":"7c62b84a-73c0-4045-b3a2-e4789ca473d8","resolution":{"observed_at":"2026-08-07T13:32:29.606445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:29.689226Z","title":"PIQA : reasoning about physical commonsense in natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:29.689226Z"},"links":{"citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:3c2131d315210c7c3150ca1bcd5b1fdca0b43168e209dd7bf02c653e76cf40d0","observation_id":"52226de7-e862-4371-ba00-cd0cd4de1039","resolution":{"observed_at":"2026-08-07T13:32:29.689226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06745","last_updated":"2022-04-14T04:00:27Z","snapshot_observed_at":"2026-08-13T14:54:27.001192Z","submitted_at":"2022-04-14T04:00:27Z","title":"GPT-NeoX-20B: An Open-Source Autoregressive Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06745","snapshot_observed_at":"2026-08-07T13:32:29.758624Z","title":"Gpt-neox-20b: An open-source autoregressive language model, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:29.758624Z"},"links":{"cited_paper":"/paper/2204.06745","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:573b4c69056e89a602b2d0f202b29d68cd6362f4c08b84654d96d95d757ab396","observation_id":"53b89d84-b0e0-4fb9-b254-9faf7d4b55d3","resolution":{"observed_at":"2026-08-07T13:32:29.758624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12981","last_updated":"2024-05-21T17:59:29Z","snapshot_observed_at":"2026-08-20T10:03:23.466960Z","submitted_at":"2024-05-21T17:59:29Z","title":"Reducing Transformer Key-Value Cache Size with Cross-Layer Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12981","snapshot_observed_at":"2026-08-07T13:32:29.855424Z","title":"Reducing transformer key-value cache size with cross-layer attention, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:29.855424Z"},"links":{"cited_paper":"/paper/2405.12981","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:2b36d024a39ed9a01d519465a907da89ec69c5cb7f285b4dfcc59ec90e321095","observation_id":"cd97bfa7-81dd-4579-b112-b259b2a85479","resolution":{"observed_at":"2026-08-07T13:32:29.855424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-07T13:32:29.964527Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:29.964527Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:6daecd309860adb42ae2a9d65bf299f38897e95226700eb1e6b96d118a3e438c","observation_id":"e6dc91aa-aca2-434d-bc3b-409bccdb244c","resolution":{"observed_at":"2026-08-07T13:32:29.964527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-08-16T13:29:46.132956Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-08-07T13:32:30.031025Z","title":"Abdelfattah, and Kai-Chiang Wu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:30.031025Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:300c3eb079dfbb363306d584cd7bf657b1590065a8795b3977980fa030c0bf67","observation_id":"7e5ea5fb-a49e-40fb-b73a-2d4c9cb73d6a","resolution":{"observed_at":"2026-08-07T13:32:30.031025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:30.124285Z","title":"What rotary position embedding can tell us: Identifying query and key weights corresponding to basic syntactic or high-level semantic information","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:30.124285Z"},"links":{"citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:f4e4969326b951cb15f4aa0fb864cdeca4a137fd2735b1e952b4ac0a39e261f9","observation_id":"6bd2ed83-9ca6-45b0-9e61-9a775d604bad","resolution":{"observed_at":"2026-08-07T13:32:30.124285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16179","last_updated":"2024-12-18T17:36:36Z","snapshot_observed_at":"2026-08-16T13:07:19.528168Z","submitted_at":"2024-10-21T16:44:51Z","title":"MagicPIG: LSH Sampling for Efficient LLM Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16179","snapshot_observed_at":"2026-08-07T13:32:30.213422Z","title":"Magicpig: Lsh sampling for efficient llm generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:30.213422Z"},"links":{"cited_paper":"/paper/2410.16179","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:937a507753843bd7d186ad0e481da9a229b32b40f5995ed6a8fdca40ef98b4d9","observation_id":"ab1256f6-b547-4074-af20-9c032096d05d","resolution":{"observed_at":"2026-08-07T13:32:30.213422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-07T13:32:30.282299Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:30.282299Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:4129e88b6eae24635b018ae57aa87af4e7b6a4ca4f455c18635e3bbeb0d4cecc","observation_id":"be7ee620-6b3d-4922-8314-c5a0505f2535","resolution":{"observed_at":"2026-08-07T13:32:30.282299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21060","snapshot_observed_at":"2026-08-07T13:32:30.361518Z","title":"Transformers are ssms: Generalized models and efficient algorithms through structured state space duality, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:30.361518Z"},"links":{"cited_paper":"/paper/2405.21060","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:9822299f3c61f79538d97c2e3c81cfdf5813fe2fed6b8217fbbb8f5cea4ca048","observation_id":"95c9086a-1c49-4563-97dd-31c451a00e4d","resolution":{"observed_at":"2026-08-07T13:32:30.361518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14135","last_updated":"2022-06-23T17:53:32Z","snapshot_observed_at":"2026-07-06T13:14:48.753329Z","submitted_at":"2022-05-27T17:53:09Z","title":"FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14135","snapshot_observed_at":"2026-08-07T13:32:30.427540Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher Ré","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:30.427540Z"},"links":{"cited_paper":"/paper/2205.14135","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:99cbb640d022554d585edf6d061617b86ecf7571f5364391221e12dad3a3ff6f","observation_id":"a3c6219a-08ae-40e7-996d-9744c11d397f","resolution":{"observed_at":"2026-08-07T13:32:30.427540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-07T13:32:30.499057Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:30.499057Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:6b79145410de9bed1b25133c65f068564ac8a4eb08a9867ae99a07f44c1483f3","observation_id":"d7970ad1-5764-47cf-ab55-18c67e2fed42","resolution":{"observed_at":"2026-08-07T13:32:30.499057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T13:32:30.545757Z","title":"Deepseek-v3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:30.545757Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:1731af0bf8ec8fc0a2dfc484c761094145454a5e1bb97408203700f8e5834d68","observation_id":"67e5787e-a7a4-4627-a326-c57ad1e02fa2","resolution":{"observed_at":"2026-08-07T13:32:30.545757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T13:32:30.660022Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:30.660022Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:bc5b1fc875ed9b138532ac48965637ad06315860535aebd372ea9b730602021f","observation_id":"7968316b-9305-4349-8005-76947f67185c","resolution":{"observed_at":"2026-08-07T13:32:30.660022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-07T13:32:30.694921Z","title":"The pile: An 800gb dataset of diverse text for language modeling, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:30.694921Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:02d74954d0200dee8b4306b4ec2dd2c2d6d1f2b4b8aa37a5e7316116f4858591","observation_id":"2b8ea07b-7e80-4384-8a62-49119f32b53c","resolution":{"observed_at":"2026-08-07T13:32:30.694921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14123","last_updated":"2024-03-21T04:31:59Z","snapshot_observed_at":"2026-08-21T00:18:24.826014Z","submitted_at":"2024-03-21T04:31:59Z","title":"AI and Memory Wall","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14123","snapshot_observed_at":"2026-08-07T13:32:30.729115Z","title":"Mahoney, and Kurt Keutzer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:30.729115Z"},"links":{"cited_paper":"/paper/2403.14123","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:0d67ae0ee7dc309b5652e5ee3d94ae2542046689ed6121d0f7964094e11cf184","observation_id":"139f2bc8-0929-4599-b437-cfbf0a2f0cfd","resolution":{"observed_at":"2026-08-07T13:32:30.729115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.05102","last_updated":"2018-07-13T14:22:09Z","snapshot_observed_at":"2026-08-14T18:52:16.544745Z","submitted_at":"2018-07-13T14:22:09Z","title":"What Your DRAM Power Models Are Not Telling You: Lessons from a Detailed Experimental Study","version":1},"cited_work":{"arxiv_id":"1807.05102","doi":null,"metadata_source":"pith","pith_arxiv_id":"1807.05102","snapshot_observed_at":"2026-08-07T13:32:36.621449Z","title":"What Your DRAM Power Models Are Not Telling You: Lessons from a Detailed Experimental Study","venue":"cs.AR","work_id":"d4909f3e-5b73-4784-b441-fda1218b77da","year":2018},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:30.766151Z"},"links":{"cited_paper":"/paper/1807.05102","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:35277cbacecae48a77549e2c7a3c9c34c23e9908e71d89aaa7c52b95d84abc85","observation_id":"ff636470-7567-4fcc-aacd-2e29786a2d98","resolution":{"observed_at":"2026-08-07T13:32:36.701141Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05840","last_updated":"2025-06-03T03:04:10Z","snapshot_observed_at":"2026-08-16T12:52:19.103757Z","submitted_at":"2025-03-07T01:44:52Z","title":"Slim attention: cut your context memory in half without loss -- K-cache is all you need for MHA","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05840","snapshot_observed_at":"2026-08-07T13:32:30.813413Z","title":"Slim attention: cut your context memory in half without loss of accuracy -- k-cache is all you need for mha, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:30.813413Z"},"links":{"cited_paper":"/paper/2503.05840","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:a7419f5b0546c9c82e8ee4d6629800ecc5927683c8922405d63317af9c948d96","observation_id":"d741e4a5-9158-4ac3-a163-4c04e4e0f317","resolution":{"observed_at":"2026-08-07T13:32:30.813413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T13:32:30.846409Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:30.846409Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:0164239d64c1dfa1bfbda298da5f8a40d69f100710b4819c448a7a2d1b64b296","observation_id":"0c615176-c5f5-4637-b98a-a7516149c1d0","resolution":{"observed_at":"2026-08-07T13:32:30.846409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:39.066819Z","title":null,"venue":null,"work_id":"ac601958-14f3-4c1f-ac4e-739f93e39ad4","year":2024},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:30.889776Z"},"links":{"citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:c41e7a2f640716c4bcfc0b73bbb097d57fb69f1ea5a617106e471b0548fe473f","observation_id":"2955cf70-99a0-4063-95b3-5f8086e443cc","resolution":{"observed_at":"2026-08-07T13:32:39.162151Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-08-17T20:47:46.242385Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-07T13:32:30.925220Z","title":"Mamba: Linear-time sequence modeling with selective state spaces, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:30.925220Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:3d4b294c47f4c622d74eba0f070486d085f0bd836fb3e47a6719d17eb2e518fc","observation_id":"9f7dd2d3-10c8-40d3-a70c-dec91328cd2a","resolution":{"observed_at":"2026-08-07T13:32:30.925220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11421","last_updated":"2024-03-18T02:30:23Z","snapshot_observed_at":"2026-08-20T04:11:41.116251Z","submitted_at":"2024-03-18T02:30:23Z","title":"FastDecode: High-Throughput GPU-Efficient LLM Serving using Heterogeneous Pipelines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11421","snapshot_observed_at":"2026-08-07T13:32:30.932279Z","title":"Fastdecode: High-throughput gpu-efficient llm serving using heterogeneous pipelines, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:30.932279Z"},"links":{"cited_paper":"/paper/2403.11421","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:2fa5fb9de5cf16d3cb2fffa38d04a75ff25ac2e56cfe460cbfa8d389ef267a72","observation_id":"f576932a-1cf8-4630-82db-d0af173eecb0","resolution":{"observed_at":"2026-08-07T13:32:30.932279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:38.883839Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":"9ff5d412-421f-4526-9a47-a45212a1e1bd","year":2021},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:30.938181Z"},"links":{"citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:0481d8887238fdeb46b8c651fe8cca5ae75b3faef3274b9d506102f151fd8c3f","observation_id":"944ab807-ae86-4bad-a3b8-b1eb23e8c927","resolution":{"observed_at":"2026-08-07T13:32:38.970755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-20T02:16:11.463896Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-07T13:32:30.954664Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:30.954664Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:2b3a140733689f9d574190f2f981641d68d73c34daa1006b400d289f3f32cb48","observation_id":"b846c7a3-8c26-4820-9f30-fd34b7596dbf","resolution":{"observed_at":"2026-08-07T13:32:30.954664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-14T11:12:42.419587Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"cited_work":{"arxiv_id":"2412.19255","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.19255","snapshot_observed_at":"2026-08-07T13:32:36.395278Z","title":"Multi-matrix Factorization Attention","venue":"cs.LG","work_id":"8fb87a74-f9c6-440c-852e-e41506b27e1e","year":2024},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:30.968649Z"},"links":{"cited_paper":"/paper/2412.19255","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:c5bbad41b1f47ba6589c38cf9ffb4100a6ef3e6269c9c303028df417df73939e","observation_id":"52e12996-15d3-485f-bf64-f646d8edfe21","resolution":{"observed_at":"2026-08-07T13:32:36.488542Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00072","last_updated":"2021-11-08T12:43:08Z","snapshot_observed_at":"2026-08-13T21:11:11.537872Z","submitted_at":"2020-06-30T19:26:36Z","title":"Data Movement Is All You Need: A Case Study on Optimizing Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.00072","snapshot_observed_at":"2026-08-07T13:32:30.978625Z","title":"Data movement is all you need: A case study on optimizing transformers, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:30.978625Z"},"links":{"cited_paper":"/paper/2007.00072","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:9ed1b3831d546d498667d40a64f6cfc0d77fa68b6bbe66168204a59beed9d2a7","observation_id":"1be02b3e-8259-4ea6-94a7-4198e332a6e4","resolution":{"observed_at":"2026-08-07T13:32:30.978625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:30.994451Z","title":"Towards economical inference: Enabling deepseek's multi-head latent attention in any transformer-based llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:30.994451Z"},"links":{"citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:9b971cc9a45cf8828bcc6aed7f914916fbcdd1e7da4e1f781b29fc9c0d3060fc","observation_id":"2bfcb9ad-1b43-4722-8b3f-0c50f89efe30","resolution":{"observed_at":"2026-08-07T13:32:30.994451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23819","last_updated":"2024-10-31T11:04:07Z","snapshot_observed_at":"2026-08-16T13:04:12.266013Z","submitted_at":"2024-10-31T11:04:07Z","title":"Weight decay induces low-rank attention layers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23819","snapshot_observed_at":"2026-08-07T13:32:31.007337Z","title":"Weight decay induces low-rank attention layers, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:31.007337Z"},"links":{"cited_paper":"/paper/2410.23819","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:730abe716a1fbf7abcd0e4365e2ffc20a6781f5b3258aa6af662287f27729c34","observation_id":"e5f0562a-5d2d-4c4f-aa66-386544c71ac7","resolution":{"observed_at":"2026-08-07T13:32:31.007337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-07T13:32:31.026027Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:31.026027Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:5070eb610e8da266472c2d0601db166fe086197e581dde0721464a0313ef87b0","observation_id":"661446ef-c137-4989-9696-e2e1da24b08f","resolution":{"observed_at":"2026-08-07T13:32:31.026027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:38.709440Z","title":"Software pipelining: An effective scheduling technique for vliw machines","venue":null,"work_id":"e09340d3-c600-4c69-b85a-0b37b143b729","year":1988},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:31.043180Z"},"links":{"citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:ac8e7ba1dbc9507f8c4a6c8678c3cdbf27d84c0243252e9c4237697a10a5f03d","observation_id":"21995711-3da1-4c6a-8a20-0e9cfaadaa91","resolution":{"observed_at":"2026-08-07T13:32:38.784872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:38.542013Z","title":"Flashmla: Efficient mla decoding kernels","venue":null,"work_id":"6a2a8074-a2ad-493c-9571-d6909c6dd8f8","year":2025},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:31.061293Z"},"links":{"citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:f98cf18a4340955ef9a17891f8380ae3ed0f53de36fec1849c21b641e8bf2e51","observation_id":"f71a8029-0f86-4186-8e08-25c87f10d93e","resolution":{"observed_at":"2026-08-07T13:32:38.627480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.15704","last_updated":"2020-06-28T20:39:45Z","snapshot_observed_at":"2026-08-17T18:55:29.627886Z","submitted_at":"2020-06-28T20:39:45Z","title":"PyTorch Distributed: Experiences on Accelerating Data Parallel Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.15704","snapshot_observed_at":"2026-08-07T13:32:31.080828Z","title":"Pytorch distributed: Experiences on accelerating data parallel training, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:31.080828Z"},"links":{"cited_paper":"/paper/2006.15704","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:42e3a19daa841b437643da86839f64f77b1722cb17c666267a1e73881bd33fdd","observation_id":"eff9c8b8-d14c-434b-b783-8a38e6bee5b5","resolution":{"observed_at":"2026-08-07T13:32:31.080828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-16T15:30:42.801825Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13629","snapshot_observed_at":"2026-08-07T13:32:31.119922Z","title":"Sigma: Differential rescaling of query, key and value for efficient language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:31.119922Z"},"links":{"cited_paper":"/paper/2501.13629","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:9ced9d430c7621ad29c45fcc52aaaecc6925fa721794b087ee199d6bb8ec2263","observation_id":"8e4c7db0-b686-4cbb-8373-b9af37adc193","resolution":{"observed_at":"2026-08-07T13:32:31.119922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T13:32:31.164678Z","title":"Decoupled weight decay regularization, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:31.164678Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:87e520813f300a2c03b715541a7164c93b6bb26a91f944485ce2edcee6021b52","observation_id":"f701fc1d-ca5f-4519-8b73-65db4e436b18","resolution":{"observed_at":"2026-08-07T13:32:31.164678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:38.350968Z","title":"Fineweb-edu: The finest collection of educational content, 2024","venue":null,"work_id":"57367024-259f-4055-bb4d-4b188ac87f7f","year":2024},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:31.215706Z"},"links":{"citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:1ff4f9e99e67a478299877526d8ea8edff5c7e0afcfc3f463302c0d4e07bb37f","observation_id":"503095d2-ec09-4a0f-a98b-a455f59f9589","resolution":{"observed_at":"2026-08-07T13:32:38.436599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07864","last_updated":"2025-06-12T11:45:57Z","snapshot_observed_at":"2026-08-10T11:58:20.177769Z","submitted_at":"2025-02-11T18:20:18Z","title":"TransMLA: Multi-Head Latent Attention Is All You Need","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07864","snapshot_observed_at":"2026-08-07T13:32:31.245399Z","title":"Transmla: Multi-head latent attention is all you need, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:31.245399Z"},"links":{"cited_paper":"/paper/2502.07864","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:538ca77d6fd04b1b4bc9db9a1b7da1adda0fde1aa331c196a2a121e7b7040f4b","observation_id":"638a7032-594d-4b74-9745-4f0ad845af01","resolution":{"observed_at":"2026-08-07T13:32:31.245399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:38.195420Z","title":"The Llama 4 Herd: The Beginning of a New Era of Natively Multimodal AI Innovation , 2025","venue":null,"work_id":"88b4ca16-59f6-42c3-81e5-8103b750a785","year":2025},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:31.277572Z"},"links":{"citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:dd9023801149cb4bcd822b6af289530906ce08f79f7f222b1d206d4483cafaff","observation_id":"8135a6be-8134-4eaf-b8c6-15fbe0896b87","resolution":{"observed_at":"2026-08-07T13:32:38.252804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:31.323457Z","title":"Can a suit of armor conduct electricity? a new dataset for open book question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:31.323457Z"},"links":{"citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:1735f3fa2900d76357c29052d4caf9b87b56c75e49c7c9233eebd59deaa46170","observation_id":"09bf71be-fb68-43d3-8ab1-3211e8692aa4","resolution":{"observed_at":"2026-08-07T13:32:31.323457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02707","last_updated":"2023-06-05T08:58:39Z","snapshot_observed_at":"2026-08-09T03:29:22.849759Z","submitted_at":"2023-06-05T08:58:39Z","title":"Orca: Progressive Learning from Complex Explanation Traces of GPT-4","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02707","snapshot_observed_at":"2026-08-07T13:32:31.382482Z","title":"Orca: Progressive learning from complex explanation traces of gpt-4, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:31.382482Z"},"links":{"cited_paper":"/paper/2306.02707","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:900a255ce20469a25426c91bc3b9d1c92733379bf76e1c29cb15da1df9fcbe99","observation_id":"7c0562cb-be3a-4f63-ab2d-2bbf53aedc0b","resolution":{"observed_at":"2026-08-07T13:32:31.382482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-21T22:18:44.715830Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-07T13:32:31.424098Z","title":"Efficient large-scale language model training on gpu clusters using megatron-lm, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:31.424098Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:2f2cb549c60223c26af8ee0db002cdad653655319719b69c18ac00a9ad2c6add","observation_id":"b98d2e69-c40f-4c0f-a376-a80a2b2b4410","resolution":{"observed_at":"2026-08-07T13:32:31.424098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:38.006482Z","title":"NVIDIA H100 tensor core gpu architecture","venue":null,"work_id":"e57c45d6-a3cd-4a25-8f4f-20ee5a0e16d5","year":2022},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:31.475639Z"},"links":{"citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:d0b8e3ed0f234ea6d55fbfb5a386e42e830d13d49df820374f1a9b8fe91a9dda","observation_id":"6f0e748c-836d-45c4-a33c-a574081d2c92","resolution":{"observed_at":"2026-08-07T13:32:38.088689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:37.854374Z","title":"NVIDIA Blackwell architecture technical brief","venue":null,"work_id":"7c13b412-00e9-47da-b6cd-a846ccfed61e","year":2024},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:31.582198Z"},"links":{"citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:e138ac47ff5287b7ccf7ea4daec5384d2f1e034deb84018b83820176e595dd55","observation_id":"5d24c8e9-66ce-43f3-ae8d-bca541d95507","resolution":{"observed_at":"2026-08-07T13:32:37.939319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:37.693376Z","title":"Nvlink, 2024","venue":null,"work_id":"2ccc4094-9ea0-4e24-bcbd-1709771b5fc4","year":2024},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:31.690658Z"},"links":{"citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:d0d79dc6526094ed4f09ddbea376f3d8c8b05a178674e25b0f7b786d1eab644e","observation_id":"ad2625d0-5d63-4535-ab96-701d522e82d1","resolution":{"observed_at":"2026-08-07T13:32:37.755767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.15152","last_updated":"2023-08-29T09:34:18Z","snapshot_observed_at":"2026-08-18T22:46:32.253082Z","submitted_at":"2023-08-29T09:34:18Z","title":"Reducing shared memory footprint to leverage high throughput on Tensor Cores and its flexible API extension library","version":1},"cited_work":{"arxiv_id":"2308.15152","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.15152","snapshot_observed_at":"2026-08-07T13:32:36.129326Z","title":"Reducing shared memory footprint to leverage high throughput on Tensor Cores and its flexible API extension library","venue":"cs.DC","work_id":"0897d657-e4ce-4587-b58c-ba11115129ba","year":2023},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:31.812951Z"},"links":{"cited_paper":"/paper/2308.15152","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:d5e64ddf5db2e7da11fafffcf4f114e23e03636304cbdb7457c935cb15a2039b","observation_id":"96183437-57c5-4352-a08c-630affcfbdf6","resolution":{"observed_at":"2026-08-07T13:32:36.174838Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-08-19T11:46:55.171293Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T13:32:31.887862Z","title":"Openai o1 system card, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:31.887862Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:64c5605db6a2c2ba53a8d9fb2cd732721ab63a32bc947194ffc7270b0a3d05c0","observation_id":"2915d83a-6956-42af-aa26-f424888facb7","resolution":{"observed_at":"2026-08-07T13:32:31.887862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-07T13:32:31.926378Z","title":"Efficiently scaling transformer inference, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:31.926378Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:ba7ac882957a8135e167ecc13f90add204bdb0de53910766e2e7b893e66d0d9c","observation_id":"1702db5c-1acd-43d7-b486-f84714a7ed3b","resolution":{"observed_at":"2026-08-07T13:32:31.926378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08311","last_updated":"2025-07-11T14:23:16Z","snapshot_observed_at":"2026-08-21T15:16:11.336528Z","submitted_at":"2025-03-11T11:21:35Z","title":"Mind the Memory Gap: Unveiling GPU Bottlenecks in Large-Batch LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08311","snapshot_observed_at":"2026-08-07T13:32:31.995104Z","title":"Recasens, Ferran Agullo, Yue Zhu, Chen Wang, Eun Kyung Lee, Olivier Tardieu, Jordi Torres, and Josep Ll","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:31.995104Z"},"links":{"cited_paper":"/paper/2503.08311","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:1359d73f632f3bef4fa41119656b2fcef7cb75836081a5c519044516972346ae","observation_id":"0bcb144d-aa00-4007-b461-f4a2a6e581ba","resolution":{"observed_at":"2026-08-07T13:32:31.995104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:37.551188Z","title":"Winogrande : An adversarial winograd schema challenge at scale","venue":null,"work_id":"ccaf6bf8-b09e-44f3-a482-43530bfbc908","year":2020},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:32.090714Z"},"links":{"citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:332d6172d4ace586c4159f36572e286c38547a8702c4d10066237f302f8fa720","observation_id":"788ca0a5-0716-46b8-891c-d7d56a934921","resolution":{"observed_at":"2026-08-07T13:32:37.608442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05646","last_updated":"2024-11-08T16:29:33Z","snapshot_observed_at":"2026-08-20T04:12:10.084313Z","submitted_at":"2024-08-10T22:47:12Z","title":"Eigen Attention: Attention in Low-Rank Space for KV Cache Compression","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05646","snapshot_observed_at":"2026-08-07T13:32:32.138676Z","title":"Eigen attention: Attention in low-rank space for kv cache compression, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:32.138676Z"},"links":{"cited_paper":"/paper/2408.05646","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:dcb2497527ede9fa74d853091a65bec9b26a4db7420c588c4ee8945c70413160","observation_id":"ead51bd7-7598-479f-a897-c57912814f90","resolution":{"observed_at":"2026-08-07T13:32:32.138676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:37.423883Z","title":"Flashattention-3: Fast and accurate attention with asynchrony and low-precision","venue":null,"work_id":"27e68a16-1a02-43cb-99b2-531b23f0878b","year":2024},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:32.189674Z"},"links":{"citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:c791552482ed45da99e7a633bae7eb4c5e8552df043c771159294c0a605ebe0c","observation_id":"3e3fdf22-8490-4f41-8d96-586d4a78f0f0","resolution":{"observed_at":"2026-08-07T13:32:37.483734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08608","last_updated":"2024-07-12T22:15:02Z","snapshot_observed_at":"2026-08-21T17:06:41.051723Z","submitted_at":"2024-07-11T15:44:48Z","title":"FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08608","snapshot_observed_at":"2026-08-07T13:32:32.266167Z","title":"Flashattention-3: Fast and accurate attention with asynchrony and low-precision, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:32.266167Z"},"links":{"cited_paper":"/paper/2407.08608","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:785c88255e761720f65776a97979f6c7169331990fb8f3592358c0650770fbb3","observation_id":"6f1e4605-2836-4295-a4ac-b2b98d1da2b0","resolution":{"observed_at":"2026-08-07T13:32:32.266167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-08-07T13:32:32.363913Z","title":"Fast transformer decoding: One write-head is all you need, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:32.363913Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:878ad4f0bb7c79f084e2f7c635d615248253f4afde6594252fb60fc196442227","observation_id":"e5b00151-640b-42bb-9877-83f742b3eea4","resolution":{"observed_at":"2026-08-07T13:32:32.363913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06865","last_updated":"2023-06-12T07:48:53Z","snapshot_observed_at":"2026-08-21T02:05:16.996073Z","submitted_at":"2023-03-13T05:19:28Z","title":"FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPU","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.06865","snapshot_observed_at":"2026-08-07T13:32:32.440200Z","title":"Fu, Zhiqiang Xie, Beidi Chen, Clark Barrett, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:32.440200Z"},"links":{"cited_paper":"/paper/2303.06865","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:a332c410ebd78c019a1c30ff0f0c3c102374d178c2136b1fb9b8ab5b039e0edc","observation_id":"62940194-287f-414c-bdc0-0abb9eb19d8f","resolution":{"observed_at":"2026-08-07T13:32:32.440200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02542","last_updated":"2024-11-07T18:58:50Z","snapshot_observed_at":"2026-08-17T23:57:41.888384Z","submitted_at":"2024-06-04T17:58:03Z","title":"Loki: Low-rank Keys for Efficient Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02542","snapshot_observed_at":"2026-08-07T13:32:32.523852Z","title":"Loki: Low-rank keys for efficient sparse attention, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:32.523852Z"},"links":{"cited_paper":"/paper/2406.02542","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:a9a460fb038deebf426d6883c39323ec82a82a81d15a8a2bb98cb9d6c874db64","observation_id":"5adf0400-21db-4fc6-8c8a-0c87a08d3785","resolution":{"observed_at":"2026-08-07T13:32:32.523852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-07T13:32:32.582152Z","title":"Scaling llm test-time compute optimally can be more effective than scaling model parameters, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:32.582152Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:b40ffd475ef09e1b23625ec5c2fe03c3fcc8decca608c08ce721678a05bf887f","observation_id":"5153ecd2-bccb-4103-b046-66d22c674311","resolution":{"observed_at":"2026-08-07T13:32:32.582152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-08-17T06:56:20.644738Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-07T13:32:32.701752Z","title":"Roformer: Enhanced transformer with rotary position embedding, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:32.701752Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:51319d0d71a1969e40317742afc6fd5eb2987988f62376896316b0554f502eeb","observation_id":"19705616-bf2d-4dd9-9de1-b0e7f5552dd9","resolution":{"observed_at":"2026-08-07T13:32:32.701752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06433","last_updated":"2025-03-09T04:14:06Z","snapshot_observed_at":"2026-08-18T10:32:31.251683Z","submitted_at":"2025-03-09T04:14:06Z","title":"Seesaw: High-throughput LLM Inference via Model Re-sharding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06433","snapshot_observed_at":"2026-08-07T13:32:32.805859Z","title":"Seesaw: High-throughput llm inference via model re-sharding, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:32.805859Z"},"links":{"cited_paper":"/paper/2503.06433","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:3f610703aa07d18c0530f10feb6e0a93b97cbfc71f6c061e4f1f67fe7ce649ff","observation_id":"97826bf4-382f-47e4-a23f-1c48ba6253a6","resolution":{"observed_at":"2026-08-07T13:32:32.805859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21465","last_updated":"2025-04-25T19:40:54Z","snapshot_observed_at":"2026-08-19T20:01:29.403616Z","submitted_at":"2024-10-28T19:08:12Z","title":"ShadowKV: KV Cache in Shadows for High-Throughput Long-Context LLM Inference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21465","snapshot_observed_at":"2026-08-07T13:32:32.885907Z","title":"Shadowkv: Kv cache in shadows for high-throughput long-context llm inference, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:32.885907Z"},"links":{"cited_paper":"/paper/2410.21465","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:9acb2fb3672e8b0c4d78bbf637ae046b2c8459a65ba48ef4ddd9746d7cbcb137","observation_id":"2393bfa6-f739-4a74-81c7-0b8bee2b5202","resolution":{"observed_at":"2026-08-07T13:32:32.885907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:37.285084Z","title":"CUTLASS , January 2023","venue":null,"work_id":"2157cb15-64e8-487d-ba02-d481e89383c7","year":2023},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:32.996785Z"},"links":{"citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:5daaa5cf04357461762c9983916ca9f3f989139664d585c87f4373507b69c28e","observation_id":"f5d19750-7ca1-40a7-8855-f457f13434a0","resolution":{"observed_at":"2026-08-07T13:32:37.348425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T13:32:33.058043Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:33.058043Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:bfb05c093dc54b13ecbd5932589059fd12a0e6518492376b4c6a02b960b9051f","observation_id":"d1c09476-aaa9-4969-8441-a25821869572","resolution":{"observed_at":"2026-08-07T13:32:33.058043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:33.173385Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:33.173385Z"},"links":{"citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:39268615f7c922c3ebb0735bed82145ac3b5051c5536b6f5a7cdf1fc1f3ee4b1","observation_id":"24488eff-f07b-4f01-9b36-09c7b3a08eb1","resolution":{"observed_at":"2026-08-07T13:32:33.173385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:37.109292Z","title":"Gpt-j-6b: a 6 billion parameter autoregressive language model, 2021","venue":null,"work_id":"b300b455-f1b4-4c4b-b30b-0f65fa3d618d","year":2021},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:33.282513Z"},"links":{"citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:c0938cd0dc3115f2e2e7ce9b0924bce2f53dd4eb930eb601fd84b528715826f6","observation_id":"d11f10f8-e395-435c-9a61-dbafc7f0840d","resolution":{"observed_at":"2026-08-07T13:32:37.172316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12372","last_updated":"2024-11-19T09:35:28Z","snapshot_observed_at":"2026-08-14T07:55:53.745138Z","submitted_at":"2024-11-19T09:35:28Z","title":"RedPajama: an Open Dataset for Training Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12372","snapshot_observed_at":"2026-08-07T13:32:33.391740Z","title":"Redpajama: an open dataset for training large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:33.391740Z"},"links":{"cited_paper":"/paper/2411.12372","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:a00d817ae4a23b755240810a2b980e0a765cc627b297c87d5dbb8f55d88aa5b0","observation_id":"e15629f2-7a49-41eb-85b5-df5ef3621fc5","resolution":{"observed_at":"2026-08-07T13:32:33.391740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06209","last_updated":"2017-07-19T17:28:46Z","snapshot_observed_at":"2026-08-17T19:08:01.495561Z","submitted_at":"2017-07-19T17:28:46Z","title":"Crowdsourcing Multiple Choice Science Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06209","snapshot_observed_at":"2026-08-07T13:32:33.520521Z","title":"Liu, and Matt Gardner","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:33.520521Z"},"links":{"cited_paper":"/paper/1707.06209","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:6778415cd92840a45ee04b24b26622fe541c09b2e46393ad72678a02611d6515","observation_id":"f2c4e85d-efab-4fde-a5a5-a4e3263c2ed7","resolution":{"observed_at":"2026-08-07T13:32:33.520521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:33.655981Z","title":"Roofline: an insightful visual performance model for multicore architectures","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:33.655981Z"},"links":{"citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:9f4138056124dae55914d97e18ab47d032327b0a03bfce1173afc40b8a9a29c1","observation_id":"90e3223e-4804-4ed6-bc09-e0459f95b255","resolution":{"observed_at":"2026-08-07T13:32:33.655981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15754","last_updated":"2024-07-22T16:00:55Z","snapshot_observed_at":"2026-08-15T01:28:11.776642Z","submitted_at":"2024-07-22T16:00:55Z","title":"LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15754","snapshot_observed_at":"2026-08-07T13:32:33.762529Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:33.762529Z"},"links":{"cited_paper":"/paper/2407.15754","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:3f4f92848219d79cc45ceee8d8c2fdceb3587247383cf6bf2f25eb2dc51e06f9","observation_id":"692ab0ed-be0c-493f-b724-84e4e1f72e74","resolution":{"observed_at":"2026-08-07T13:32:33.762529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16487","last_updated":"2023-10-30T01:36:06Z","snapshot_observed_at":"2026-08-18T12:36:12.725901Z","submitted_at":"2022-03-30T17:27:09Z","title":"Speculative Decoding: Exploiting Speculative Execution for Accelerating Seq2seq Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.16487","snapshot_observed_at":"2026-08-07T13:32:33.884257Z","title":"Speculative decoding: Exploiting speculative execution for accelerating seq2seq generation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:33.884257Z"},"links":{"cited_paper":"/paper/2203.16487","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:9283d3d98910f34139d6b7fa5751675655e7cf192fd2e0c9db0be0b4e38b155b","observation_id":"9110ff98-fbaa-4836-9a8b-59490b1c9cd7","resolution":{"observed_at":"2026-08-07T13:32:33.884257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-08-20T09:03:18.402041Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-07T13:32:33.994365Z","title":"Efficient streaming language models with attention sinks, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:33.994365Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:fca1e689a33947bcb7a8fc3926007085bd037b08ec8a911f7ed3d81a9ad120be","observation_id":"6d6193d9-49dc-49f7-887e-729b9f1582cb","resolution":{"observed_at":"2026-08-07T13:32:33.994365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:34.109663Z","title":"Quick and (not so) dirty: Unsupervised selection of justification sentences for multi-hop question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:34.109663Z"},"links":{"citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:e951e1ef3693ecec63d6eb7b522b9025c807c14b5450035b0a2b7d647ab68726","observation_id":"3f9dcf9c-f951-456e-8398-1e779737b3f8","resolution":{"observed_at":"2026-08-07T13:32:34.109663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:34.255027Z","title":"Rope to nope and back again: A new hybrid attention strategy, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:34.255027Z"},"links":{"citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:e5e5476f62961de2901f7f1488f3c08c6b660062638ea688c37599c6baa82be9","observation_id":"b6fa272e-353d-4eda-b049-f0269a2789eb","resolution":{"observed_at":"2026-08-07T13:32:34.255027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06635","last_updated":"2024-08-27T01:27:29Z","snapshot_observed_at":"2026-08-21T01:26:32.098232Z","submitted_at":"2023-12-11T18:51:59Z","title":"Gated Linear Attention Transformers with Hardware-Efficient Training","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06635","snapshot_observed_at":"2026-08-07T13:32:34.407299Z","title":"Gated linear attention transformers with hardware-efficient training, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:34.407299Z"},"links":{"cited_paper":"/paper/2312.06635","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:8c5df75409e9e916ed3a26819879b04bd810f1391aecf83443016851b4c74b18","observation_id":"8006c060-ad31-4f82-9c8d-43160b9684fa","resolution":{"observed_at":"2026-08-07T13:32:34.407299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07056","last_updated":"2024-06-11T08:37:33Z","snapshot_observed_at":"2026-08-16T13:44:16.024792Z","submitted_at":"2024-06-11T08:37:33Z","title":"Effectively Compress KV Heads for LLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07056","snapshot_observed_at":"2026-08-07T13:32:34.524396Z","title":"Effectively compress kv heads for llm, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:34.524396Z"},"links":{"cited_paper":"/paper/2406.07056","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:cff6e7c0598d8ea98db6d8d934dda335cc8b9dfe1771130971895d4162a27760","observation_id":"d5467938-fa24-4ea2-884c-4e003de5fc59","resolution":{"observed_at":"2026-08-07T13:32:34.524396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02053","last_updated":"2024-08-28T04:04:45Z","snapshot_observed_at":"2026-08-16T14:21:55.195670Z","submitted_at":"2024-02-03T06:16:28Z","title":"Affordable Generative Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02053","snapshot_observed_at":"2026-08-07T13:32:34.655835Z","title":"Affordable generative agents, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:34.655835Z"},"links":{"cited_paper":"/paper/2402.02053","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:49c269b5d043530d5622a82713dbb6c866a31167742732c340e9d6cf86cf4796","observation_id":"8762b690-7f6b-45bc-9cdc-fcf2bc0739ca","resolution":{"observed_at":"2026-08-07T13:32:34.655835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11089","last_updated":"2025-02-27T09:01:21Z","snapshot_observed_at":"2026-08-21T11:05:34.442985Z","submitted_at":"2025-02-16T11:53:44Z","title":"Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11089","snapshot_observed_at":"2026-08-07T13:32:34.791543Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:34.791543Z"},"links":{"cited_paper":"/paper/2502.11089","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:854362bfc5a18afefc379d7f690323441ab62242fc55e867791d954ec6c0fafe","observation_id":"65eb3793-a028-4e6d-9bba-e34299118ba5","resolution":{"observed_at":"2026-08-07T13:32:34.791543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:34.945787Z","title":"HellaSwag : Can a machine really finish your sentence? In Anna Korhonen, David R","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:34.945787Z"},"links":{"citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:5e1a556665f3cee1b2ade9d06d81010a03a4c70b696af12e582a6e2800f392a3","observation_id":"77a7190d-872d-4076-96af-5d8ba2eb9908","resolution":{"observed_at":"2026-08-07T13:32:34.945787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:35.042714Z","title":"Tensor product attention is all you need, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:35.042714Z"},"links":{"citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:33d1c57274413244d126e7d4b6911a65a4864d8ad35f389e96accea08c9d1054","observation_id":"58724d79-09c6-4ab7-8ef7-da461af97e40","resolution":{"observed_at":"2026-08-07T13:32:35.042714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-08-20T21:36:51.212852Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-07T13:32:35.147561Z","title":"H _2 o: Heavy-hitter oracle for efficient generative inference of large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:35.147561Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:1d1160650c64926ae5683e98a34e7c36ca2f9c035e22a301479447f37786a9ef","observation_id":"b36fd59c-01be-41ec-84e9-33fb8e59e3e3","resolution":{"observed_at":"2026-08-07T13:32:35.147561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-08-18T16:18:58.765617Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-07T13:32:35.275765Z","title":"Gonzalez, Clark Barrett, and Ying Sheng","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:35.275765Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:3d34873e0657da319d6429258e53b8bce8ba723cb20a7d202bad36d48435defb","observation_id":"2144f0f0-0145-4270-afb6-4cc0b32e59be","resolution":{"observed_at":"2026-08-07T13:32:35.275765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:32:36.951473Z","title":"Sglang: Efficient execution of structured language model programs","venue":null,"work_id":"2bc620ad-d57c-4541-895d-721d1e0cc2d6","year":2024},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:35.413009Z"},"links":{"citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:70a52d83617f37078ab3868983ec9c069672f14e99e6606d59774be629e4b19b","observation_id":"830b33b4-b87e-4a4d-a26e-bfd33221fa38","resolution":{"observed_at":"2026-08-07T13:32:36.995246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding"},"reference_resolution":{"displayed":85,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":69,"verified_exact":2,"verified_fuzzy":13},"total_outbound_references":85},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 85 of 85 outbound references and 5 inbound Pith citation observations for arXiv:2505.21487."}