{"as_of":"2026-08-09T05:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f94006fb6a1b7bba8f519fc60efa9a2b718250c955ff906a7317631801b8d096","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T05:56:55.205911Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:30:34.307068Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T06:26:27.473700Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.08246","last_updated":"2025-06-03T10:07:35Z","snapshot_observed_at":"2026-08-08T05:49:05.821041Z","submitted_at":"2025-02-12T09:39:54Z","title":"Inference-time sparse attention with asymmetric indexing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08246","snapshot_observed_at":"2026-08-07T10:30:34.307068Z","title":"Pierre-Emmanuel Mazar´ e, Gergely Szilvasy, Maria Lomeli, Francisco Massa, Naila Murray, Herv´ e J´ egou, and Matthijs Douze","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05333","last_updated":"2025-06-20T01:25:25Z","snapshot_observed_at":"2026-08-07T10:18:59.977399Z","submitted_at":"2025-06-05T17:59:24Z","title":"Kinetics: Rethinking Test-Time Scaling Laws","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:30:34.307068Z"},"links":{"cited_paper":"/paper/2502.08246","citing_paper":"/paper/2506.05333"},"observation_digest":"sha256:55d9aeccfc4db333a31384d47e5be6380b3f328bc24bc415229a7bc343c9611b","observation_id":"327fddec-e36e-4899-b590-8eb377646723","resolution":{"observed_at":"2026-08-07T10:30:34.307068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08246","last_updated":"2025-06-03T10:07:35Z","snapshot_observed_at":"2026-08-08T05:49:05.821041Z","submitted_at":"2025-02-12T09:39:54Z","title":"Inference-time sparse attention with asymmetric indexing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08246","snapshot_observed_at":"2026-08-07T05:06:32.671170Z","title":"Inference-time sparse attention with asymmetric indexing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.671170Z"},"links":{"cited_paper":"/paper/2502.08246","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:bb7ed7139ca7ba4109479d730f214e8260826af680be439e379a4ec2281c0df2","observation_id":"7a362d9b-f617-41b7-bbf1-6fb73bd032fe","resolution":{"observed_at":"2026-08-07T05:06:32.671170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08246","last_updated":"2025-06-03T10:07:35Z","snapshot_observed_at":"2026-08-08T05:49:05.821041Z","submitted_at":"2025-02-12T09:39:54Z","title":"Inference-time sparse attention with asymmetric indexing","version":2},"cited_work":{"arxiv_id":"2502.08246","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08246","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2502.08246 (2025) 7, 9 11","venue":null,"work_id":"65d9cdc5-1d38-40b7-8195-b3c2839f46b0","year":2025},"citing_paper":{"arxiv_id":"2604.17147","last_updated":"2026-04-18T21:00:26Z","snapshot_observed_at":"2026-07-06T23:04:19.063534Z","submitted_at":"2026-04-18T21:00:26Z","title":"ScenarioControl: Vision-Language Controllable Vectorized Latent Scenario Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T06:23:22.058330Z"},"links":{"cited_paper":"/paper/2502.08246","citing_paper":"/paper/2604.17147"},"observation_digest":"sha256:f54c905159be3fe09d0ef7fade60dc470a49f281790cf50a6eae6f7359195069","observation_id":"5e9aa857-0624-49f5-97cb-93f7d82b8e16","resolution":{"observed_at":"2026-05-10T06:26:27.475026Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08246","last_updated":"2025-06-03T10:07:35Z","snapshot_observed_at":"2026-08-08T05:49:05.821041Z","submitted_at":"2025-02-12T09:39:54Z","title":"Inference-time sparse attention with asymmetric indexing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08246","snapshot_observed_at":"2026-08-02T04:16:16.178633Z","title":"Inference-time sparse attention with asymmetric indexing, 2025.https://arxiv.org/abs/2502.08246","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13728","last_updated":"2026-07-15T11:42:07Z","snapshot_observed_at":"2026-08-02T04:16:11.998045Z","submitted_at":"2026-07-15T11:42:07Z","title":"Cluster with Auctions for Vector Search","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-02T04:16:16.178633Z"},"links":{"cited_paper":"/paper/2502.08246","citing_paper":"/paper/2607.13728"},"observation_digest":"sha256:50fbfe77a05932ba6f5cbdbce195168f3816055bf85e46216b44ccec0ba8b253","observation_id":"c0e25e1c-d8e2-4586-bc1b-de89745c62a9","resolution":{"observed_at":"2026-08-02T04:16:16.178633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.08246/citation-record","integrity":"/paper/2502.08246/integrity","json":"/paper/2502.08246/citation-record.json","paper":"/paper/2502.08246"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.06082","last_updated":"2024-07-31T05:59:31Z","snapshot_observed_at":"2026-08-08T01:38:35.796518Z","submitted_at":"2024-03-10T04:01:49Z","title":"FrameQuant: Flexible Low-Bit Quantization for Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06082","snapshot_observed_at":"2026-08-08T05:56:55.058667Z","title":"Framequant: Flexible low-bit quantization for trans- formers.arXiv preprint arXiv:2403.06082,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08246","last_updated":"2025-06-03T10:07:35Z","snapshot_observed_at":"2026-08-08T05:49:05.821041Z","submitted_at":"2025-02-12T09:39:54Z","title":"Inference-time sparse attention with asymmetric indexing","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T05:56:55.058667Z"},"links":{"cited_paper":"/paper/2403.06082","citing_paper":"/paper/2502.08246"},"observation_digest":"sha256:533b376469a56f3622d5acd28c28f6788fa1cc628b8392443fcda24835dd7990","observation_id":"07dff465-6a1d-475b-b7c1-595a1fb78750","resolution":{"observed_at":"2026-08-08T05:56:55.058667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T05:56:55.097815Z","title":"The llama 3 herd of models, 2024.https://arxiv.org/abs/2407.21783","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08246","last_updated":"2025-06-03T10:07:35Z","snapshot_observed_at":"2026-08-08T05:49:05.821041Z","submitted_at":"2025-02-12T09:39:54Z","title":"Inference-time sparse attention with asymmetric indexing","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T05:56:55.097815Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.08246"},"observation_digest":"sha256:3110717dbe9e783089e8b8b414abe755ffa2366af379901ac42cb22f8d89220b","observation_id":"f67d35da-1b5b-415a-8202-fdc7447fb3e4","resolution":{"observed_at":"2026-08-08T05:56:55.097815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05869","last_updated":"2023-12-01T17:43:06Z","snapshot_observed_at":"2026-07-06T16:29:55.892584Z","submitted_at":"2023-10-09T17:05:25Z","title":"HyperAttention: Long-context Attention in Near-Linear Time","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05869","snapshot_observed_at":"2026-08-08T05:56:55.108746Z","title":"Hyperattention: Long-context attention in near-linear time.arXiv preprint arXiv:2310.05869,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08246","last_updated":"2025-06-03T10:07:35Z","snapshot_observed_at":"2026-08-08T05:49:05.821041Z","submitted_at":"2025-02-12T09:39:54Z","title":"Inference-time sparse attention with asymmetric indexing","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T05:56:55.108746Z"},"links":{"cited_paper":"/paper/2310.05869","citing_paper":"/paper/2502.08246"},"observation_digest":"sha256:cb513eb74cba97b335f6239a1b5fb88191c076cf75f5046e2e651baf6538bacc","observation_id":"15a9ccc8-b0d2-472b-9a6d-516d0b0bc9bb","resolution":{"observed_at":"2026-08-08T05:56:55.108746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1510.00149","last_updated":"2016-02-15T06:25:40Z","snapshot_observed_at":"2026-08-04T16:59:47.843960Z","submitted_at":"2015-10-01T09:03:44Z","title":"Deep Compression: Compressing Deep Neural Networks with Pruning, Trained Quantization and Huffman Coding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1510.00149","snapshot_observed_at":"2026-08-08T05:56:55.114423Z","title":"Deep compression: Compressing deep neural networks with pruning, trained quan- tization and huffman coding.arXiv preprint arXiv:1510.00149,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08246","last_updated":"2025-06-03T10:07:35Z","snapshot_observed_at":"2026-08-08T05:49:05.821041Z","submitted_at":"2025-02-12T09:39:54Z","title":"Inference-time sparse attention with asymmetric indexing","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T05:56:55.114423Z"},"links":{"cited_paper":"/paper/1510.00149","citing_paper":"/paper/2502.08246"},"observation_digest":"sha256:28b19ae74d1ecb66c490187560683bbc851fbdad7fa3b3247769386913040552","observation_id":"2ae5d067-cf72-4d99-8dbe-5217f50746ea","resolution":{"observed_at":"2026-08-08T05:56:55.114423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-08-08T05:56:55.130242Z","title":"Hao Kang, Qingru Zhang, Souvik Kundu, Geonhwa Jeong, Zaox- ing Liu, Tushar Krishna, and Tuo Zhao","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08246","last_updated":"2025-06-03T10:07:35Z","snapshot_observed_at":"2026-08-08T05:49:05.821041Z","submitted_at":"2025-02-12T09:39:54Z","title":"Inference-time sparse attention with asymmetric indexing","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T05:56:55.130242Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2502.08246"},"observation_digest":"sha256:fcbdeaf84327677ad3c393990cc4ffdc8c32967f1bdbccafab6ca0f06f0506be","observation_id":"5d3def96-2c07-4025-8407-26f66ab15109","resolution":{"observed_at":"2026-08-08T05:56:55.130242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.04451","last_updated":"2020-02-18T16:01:18Z","snapshot_observed_at":"2026-07-06T08:50:12.690900Z","submitted_at":"2020-01-13T18:38:28Z","title":"Reformer: The Efficient Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.04451","snapshot_observed_at":"2026-08-08T05:56:55.135227Z","title":"Reformer: The efficient transformer.arXiv preprint arXiv:2001.04451,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2502.08246","last_updated":"2025-06-03T10:07:35Z","snapshot_observed_at":"2026-08-08T05:49:05.821041Z","submitted_at":"2025-02-12T09:39:54Z","title":"Inference-time sparse attention with asymmetric indexing","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T05:56:55.135227Z"},"links":{"cited_paper":"/paper/2001.04451","citing_paper":"/paper/2502.08246"},"observation_digest":"sha256:62cead75f672712c31c7e61ca74499dc797a124993068e91ca925547f4cde710","observation_id":"52d670ad-7df4-43db-8848-d81d2bf2fceb","resolution":{"observed_at":"2026-08-08T05:56:55.135227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:56:55.721391Z","title":"Cagra: Highly parallel graph construc- 9 tion and approximate nearest neighbor search for gpus","venue":null,"work_id":"e4f33970-39a3-4918-ac90-c11ab7ede7cc","year":2024},"citing_paper":{"arxiv_id":"2502.08246","last_updated":"2025-06-03T10:07:35Z","snapshot_observed_at":"2026-08-08T05:49:05.821041Z","submitted_at":"2025-02-12T09:39:54Z","title":"Inference-time sparse attention with asymmetric indexing","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T05:56:55.145453Z"},"links":{"citing_paper":"/paper/2502.08246"},"observation_digest":"sha256:4322418986ff6728ff4eae785513967db1189e21386583098de547b620c440ba","observation_id":"70f87da6-4f86-4c26-898f-2b6ad05b7a0b","resolution":{"observed_at":"2026-08-08T05:56:55.726260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:56:55.704792Z","title":"Improving regularized singular value decom- position for collaborative filtering","venue":null,"work_id":"89d4c11d-cd09-4830-b939-ef1c4550e85b","year":2007},"citing_paper":{"arxiv_id":"2502.08246","last_updated":"2025-06-03T10:07:35Z","snapshot_observed_at":"2026-08-08T05:49:05.821041Z","submitted_at":"2025-02-12T09:39:54Z","title":"Inference-time sparse attention with asymmetric indexing","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T05:56:55.150220Z"},"links":{"citing_paper":"/paper/2502.08246"},"observation_digest":"sha256:8249d6cb8500a56d00ae04b2ef255cb31ea83f0b785c84187b3304bfa2851a86","observation_id":"6ead6b36-324d-4e29-adee-57887e3ebe89","resolution":{"observed_at":"2026-08-08T05:56:55.709797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-08T05:56:55.160423Z","title":"Jay Shah, Ganesh Bikshandi, Ying Zhang, Vijay Thakkar, Pradeep Ramani, and Tri Dao","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2502.08246","last_updated":"2025-06-03T10:07:35Z","snapshot_observed_at":"2026-08-08T05:49:05.821041Z","submitted_at":"2025-02-12T09:39:54Z","title":"Inference-time sparse attention with asymmetric indexing","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T05:56:55.160423Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2502.08246"},"observation_digest":"sha256:04e4c2a64d776d9c1edcc474d5713dbc94ccc9b70d6aff03c6901ce96d69b95c","observation_id":"8f22ad8a-55cf-4403-ae56-74e0b55c3d61","resolution":{"observed_at":"2026-08-08T05:56:55.160423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08608","last_updated":"2024-07-12T22:15:02Z","snapshot_observed_at":"2026-07-06T18:44:53.587276Z","submitted_at":"2024-07-11T15:44:48Z","title":"FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08608","snapshot_observed_at":"2026-08-08T05:56:55.165619Z","title":"Luohe Shi, Hongyi Zhang, Yao Yao, Zuchao Li, and Hai Zhao","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08246","last_updated":"2025-06-03T10:07:35Z","snapshot_observed_at":"2026-08-08T05:49:05.821041Z","submitted_at":"2025-02-12T09:39:54Z","title":"Inference-time sparse attention with asymmetric indexing","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T05:56:55.165619Z"},"links":{"cited_paper":"/paper/2407.08608","citing_paper":"/paper/2502.08246"},"observation_digest":"sha256:fb9835b46529bcde7bc331ce05685f992e20fe2ce7f4a1818c1bcadac8512f51","observation_id":"2a58cc39-dc3f-4447-a71d-14b5c9ba66dd","resolution":{"observed_at":"2026-08-08T05:56:55.165619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17424","last_updated":"2024-09-25T23:24:56Z","snapshot_observed_at":"2026-08-02T09:28:14.540794Z","submitted_at":"2024-09-25T23:24:56Z","title":"Results of the Big ANN: NeurIPS'23 competition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17424","snapshot_observed_at":"2026-08-08T05:56:55.170777Z","title":"Results of the big ann: Neurips’23 competition.arXiv preprint arXiv:2409.17424,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08246","last_updated":"2025-06-03T10:07:35Z","snapshot_observed_at":"2026-08-08T05:49:05.821041Z","submitted_at":"2025-02-12T09:39:54Z","title":"Inference-time sparse attention with asymmetric indexing","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T05:56:55.170777Z"},"links":{"cited_paper":"/paper/2409.17424","citing_paper":"/paper/2502.08246"},"observation_digest":"sha256:16ff6f889a8efe048d2223ca6e3194fd0d2bb306f1a01ce1193633d96352ce6a","observation_id":"1b6c9067-deb7-41ba-aab3-d2b37d61a8a3","resolution":{"observed_at":"2026-08-08T05:56:55.170777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10774","last_updated":"2024-08-26T21:01:02Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-16T01:33:02Z","title":"Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10774","snapshot_observed_at":"2026-08-08T05:56:55.176049Z","title":"Roformer: Enhanced transformer with rotary position embedding, 2023.https://arxiv.org/abs/2104","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08246","last_updated":"2025-06-03T10:07:35Z","snapshot_observed_at":"2026-08-08T05:49:05.821041Z","submitted_at":"2025-02-12T09:39:54Z","title":"Inference-time sparse attention with asymmetric indexing","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T05:56:55.176049Z"},"links":{"cited_paper":"/paper/2406.10774","citing_paper":"/paper/2502.08246"},"observation_digest":"sha256:a29a0e4f86a85521bede427d057cd85dbfc09c9da890247c3e27a887618ac97f","observation_id":"957e5b3b-3e0f-4ac3-9c16-2bf706c27f9f","resolution":{"observed_at":"2026-08-08T05:56:55.176049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.06394","last_updated":"2025-02-27T21:46:01Z","snapshot_observed_at":"2026-07-06T18:12:34.664133Z","submitted_at":"2024-05-10T11:08:20Z","title":"Memory Mosaics","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.06394","snapshot_observed_at":"2026-08-08T05:56:55.181350Z","title":"Memory mosaics.arXiv preprint arXiv:2405.06394, 2024a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08246","last_updated":"2025-06-03T10:07:35Z","snapshot_observed_at":"2026-08-08T05:49:05.821041Z","submitted_at":"2025-02-12T09:39:54Z","title":"Inference-time sparse attention with asymmetric indexing","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T05:56:55.181350Z"},"links":{"cited_paper":"/paper/2405.06394","citing_paper":"/paper/2502.08246"},"observation_digest":"sha256:7997750d3428b32bbfc4c2b55808511689a46133d96c3067fe5fff8219fe722e","observation_id":"b36221c6-b8e9-4290-ae1a-ac94fbaaae00","resolution":{"observed_at":"2026-08-08T05:56:55.181350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:56:55.687880Z","title":"Appendix A pro- vides details regarding the training procedure","venue":null,"work_id":"e8d5241d-4481-4891-9166-436ef2fb3a82","year":2024},"citing_paper":{"arxiv_id":"2502.08246","last_updated":"2025-06-03T10:07:35Z","snapshot_observed_at":"2026-08-08T05:49:05.821041Z","submitted_at":"2025-02-12T09:39:54Z","title":"Inference-time sparse attention with asymmetric indexing","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T05:56:55.186438Z"},"links":{"citing_paper":"/paper/2502.08246"},"observation_digest":"sha256:4dbc21a0af35b0ef31f9c83c1442eb065fb4095c8f43c4d0ca7903ccaf9adc7f","observation_id":"880b302c-31ea-4bae-ac32-f47341b6bd03","resolution":{"observed_at":"2026-08-08T05:56:55.692959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:56:55.654598Z","title":null,"venue":null,"work_id":"3e4f339d-ba63-4230-bbc0-2924981747a0","year":null},"citing_paper":{"arxiv_id":"2502.08246","last_updated":"2025-06-03T10:07:35Z","snapshot_observed_at":"2026-08-08T05:49:05.821041Z","submitted_at":"2025-02-12T09:39:54Z","title":"Inference-time sparse attention with asymmetric indexing","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T05:56:55.196425Z"},"links":{"citing_paper":"/paper/2502.08246"},"observation_digest":"sha256:d9f70bd6ee72c5567cb5831d1cd65c081e24901d4d44db84698f1f43dd6e18c6","observation_id":"bf00e82f-bebe-4867-8ca2-e55be2557d8e","resolution":{"observed_at":"2026-08-08T05:56:55.659412Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:56:55.622305Z","title":"selectivity for three LSH variants, compared to a random selection and a partition based on k-means (the baseline forSaap), on 4 representative heads","venue":null,"work_id":"9837a52e-f3e9-42f5-958d-b228959cfd31","year":null},"citing_paper":{"arxiv_id":"2502.08246","last_updated":"2025-06-03T10:07:35Z","snapshot_observed_at":"2026-08-08T05:49:05.821041Z","submitted_at":"2025-02-12T09:39:54Z","title":"Inference-time sparse attention with asymmetric indexing","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T05:56:55.205911Z"},"links":{"citing_paper":"/paper/2502.08246"},"observation_digest":"sha256:d7ba1c06a38b8b4fe29c33bc35f626bd31a083ec74d3f04d135acf4e3ed4fc77","observation_id":"f587cec1-80df-40f6-baa4-a41073328b53","resolution":{"observed_at":"2026-08-08T05:56:55.627616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:56:55.638878Z","title":"Q-model short-range","venue":null,"work_id":"ffe253d1-1f36-4b62-9804-7bcf230615bf","year":2024},"citing_paper":{"arxiv_id":"2502.08246","last_updated":"2025-06-03T10:07:35Z","snapshot_observed_at":"2026-08-08T05:49:05.821041Z","submitted_at":"2025-02-12T09:39:54Z","title":"Inference-time sparse attention with asymmetric indexing","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T05:56:55.201153Z"},"links":{"citing_paper":"/paper/2502.08246"},"observation_digest":"sha256:7b6fcf8815780123766946ce644fc48f0279b876cf88d60fc0dce9bf0dc51979","observation_id":"b27fd103-0123-4524-b3c6-4b94fc8848a0","resolution":{"observed_at":"2026-08-08T05:56:55.643796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:56:55.670615Z","title":"The vector search relies on collisions between the buckets: a key is considered only if it is hashed together with the query in at least two hash tables","venue":null,"work_id":"0e1a72a3-e17e-4dbf-b916-6db8ff71177f","year":2023},"citing_paper":{"arxiv_id":"2502.08246","last_updated":"2025-06-03T10:07:35Z","snapshot_observed_at":"2026-08-08T05:49:05.821041Z","submitted_at":"2025-02-12T09:39:54Z","title":"Inference-time sparse attention with asymmetric indexing","version":2},"reference_index":200,"source":"pdf_text","source_observed_at":"2026-08-08T05:56:55.191167Z"},"links":{"citing_paper":"/paper/2502.08246"},"observation_digest":"sha256:e239e32c3da3658d138e6865bcde62fd3e2b18e0047cdfd83e7fa97151d0b207","observation_id":"7ab0b21a-dc05-4bdb-a7a9-b5a3fe17e800","resolution":{"observed_at":"2026-08-08T05:56:55.676201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-08T05:56:55.081609Z","title":"Bert: Pre-training of deep bidirectional trans- formers for language understanding, 2019.https://arxiv.org/ abs/1810.04805","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.08246","last_updated":"2025-06-03T10:07:35Z","snapshot_observed_at":"2026-08-08T05:49:05.821041Z","submitted_at":"2025-02-12T09:39:54Z","title":"Inference-time sparse attention with asymmetric indexing","version":2},"reference_index":2004,"source":"pdf_text","source_observed_at":"2026-08-08T05:56:55.081609Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2502.08246"},"observation_digest":"sha256:37bd1ec3650a01bc1c007a391cdc761f94b7bbe1a89c8fdf3a4732996585d91b","observation_id":"fd2966b4-0405-4e31-8e01-e223895c1542","resolution":{"observed_at":"2026-08-08T05:56:55.081609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00071","last_updated":"2026-02-06T19:40:50Z","snapshot_observed_at":"2026-08-01T02:15:47.181936Z","submitted_at":"2023-08-31T18:18:07Z","title":"YaRN: Efficient Context Window Extension of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00071","snapshot_observed_at":"2026-08-08T05:56:55.155299Z","title":"Yarn: Efficient context window extension of large language models, 2023.https://arxiv.org/abs/2309.00071","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08246","last_updated":"2025-06-03T10:07:35Z","snapshot_observed_at":"2026-08-08T05:49:05.821041Z","submitted_at":"2025-02-12T09:39:54Z","title":"Inference-time sparse attention with asymmetric indexing","version":2},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-08T05:56:55.155299Z"},"links":{"cited_paper":"/paper/2309.00071","citing_paper":"/paper/2502.08246"},"observation_digest":"sha256:6f3b9ab27e929162000aa2df6c873f39501727258c28e918591ba6706a8f031d","observation_id":"fa5d188f-de7d-4b6b-aa76-4402a1476d37","resolution":{"observed_at":"2026-08-08T05:56:55.155299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.08544","last_updated":"2020-09-29T02:50:54Z","snapshot_observed_at":"2026-08-02T03:18:12.303328Z","submitted_at":"2019-01-24T18:07:59Z","title":"Learning Space Partitions for Nearest Neighbor Search","version":4},"cited_work":{"arxiv_id":"1901.08544","doi":null,"metadata_source":"pith","pith_arxiv_id":"1901.08544","snapshot_observed_at":"2026-08-08T05:56:55.520989Z","title":"Learning Space Partitions for Nearest Neighbor Search","venue":"cs.LG","work_id":"249f1841-f739-44bf-9517-37c2f999a3b7","year":2019},"citing_paper":{"arxiv_id":"2502.08246","last_updated":"2025-06-03T10:07:35Z","snapshot_observed_at":"2026-08-08T05:49:05.821041Z","submitted_at":"2025-02-12T09:39:54Z","title":"Inference-time sparse attention with asymmetric indexing","version":2},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-08T05:56:55.087110Z"},"links":{"cited_paper":"/paper/1901.08544","citing_paper":"/paper/2502.08246"},"observation_digest":"sha256:e78139e1dbfa5eb33f8635cc231a3435ead16426206a63d6d8eaa598baad40f7","observation_id":"f49897ef-7688-4d8c-b9ef-022941e30786","resolution":{"observed_at":"2026-08-08T05:56:55.528000Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-08T05:56:55.119683Z","title":"Ruler: What’s the real context size of your long-context language models?, 2024.https://arxiv.org/abs/2404.06654","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08246","last_updated":"2025-06-03T10:07:35Z","snapshot_observed_at":"2026-08-08T05:49:05.821041Z","submitted_at":"2025-02-12T09:39:54Z","title":"Inference-time sparse attention with asymmetric indexing","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-08T05:56:55.119683Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2502.08246"},"observation_digest":"sha256:8eb704a5ed23841f585b258f66548840a5535ece8f330f4e74130b057bbd3a41","observation_id":"c3d0a53a-70c3-43a8-b47b-2fab036689a1","resolution":{"observed_at":"2026-08-08T05:56:55.119683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01801","last_updated":"2024-10-29T18:26:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T05:17:08Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01801","snapshot_observed_at":"2026-08-08T05:56:55.103328Z","title":"Model tells you what to discard: Adaptive kv cache compression for llms.arXiv preprint arXiv:2310.01801,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08246","last_updated":"2025-06-03T10:07:35Z","snapshot_observed_at":"2026-08-08T05:49:05.821041Z","submitted_at":"2025-02-12T09:39:54Z","title":"Inference-time sparse attention with asymmetric indexing","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-08T05:56:55.103328Z"},"links":{"cited_paper":"/paper/2310.01801","citing_paper":"/paper/2502.08246"},"observation_digest":"sha256:c8d99a86587494f9401ce1208a1eac059f8ff8523716d59f1791dc71450f814e","observation_id":"04bebca2-fadd-4861-85d6-2318b7ea14c0","resolution":{"observed_at":"2026-08-08T05:56:55.103328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12850","last_updated":"2022-11-30T11:14:07Z","snapshot_observed_at":"2026-07-31T18:00:43.513660Z","submitted_at":"2022-10-22T21:22:50Z","title":"OOD-DiskANN: Efficient and Scalable Graph ANNS for Out-of-Distribution Queries","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.12850","snapshot_observed_at":"2026-08-08T05:56:55.124568Z","title":"Ood-diskann: Efficientandscalablegraphannsforout-of-distributionqueries","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08246","last_updated":"2025-06-03T10:07:35Z","snapshot_observed_at":"2026-08-08T05:49:05.821041Z","submitted_at":"2025-02-12T09:39:54Z","title":"Inference-time sparse attention with asymmetric indexing","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-08T05:56:55.124568Z"},"links":{"cited_paper":"/paper/2211.12850","citing_paper":"/paper/2502.08246"},"observation_digest":"sha256:10cf4412ffd912ea8068c0a34517701bb80c50fe401cf3ef6ef57cb51dff5872","observation_id":"ca8c305b-3815-450c-b9de-c8e2612b4d7c","resolution":{"observed_at":"2026-08-08T05:56:55.124568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08281","last_updated":"2025-10-23T09:36:08Z","snapshot_observed_at":"2026-07-31T05:45:37.385210Z","submitted_at":"2024-01-16T11:12:36Z","title":"The Faiss library","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08281","snapshot_observed_at":"2026-08-08T05:56:55.092546Z","title":"The faiss library.arXiv preprint arXiv:2401.08281,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08246","last_updated":"2025-06-03T10:07:35Z","snapshot_observed_at":"2026-08-08T05:49:05.821041Z","submitted_at":"2025-02-12T09:39:54Z","title":"Inference-time sparse attention with asymmetric indexing","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-08T05:56:55.092546Z"},"links":{"cited_paper":"/paper/2401.08281","citing_paper":"/paper/2502.08246"},"observation_digest":"sha256:f167b6434d6cdcb2e572a409af1a34fb64670812cc279fbd599178cd844760e3","observation_id":"3f6969a0-7d36-472b-8b0c-b0c42d4ca5e8","resolution":{"observed_at":"2026-08-08T05:56:55.092546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08933","last_updated":"2024-08-16T06:48:16Z","snapshot_observed_at":"2026-08-05T00:14:38.964661Z","submitted_at":"2024-08-16T06:48:16Z","title":"RoarGraph: A Projected Bipartite Graph for Efficient Cross-Modal Approximate Nearest Neighbor Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08933","snapshot_observed_at":"2026-08-08T05:56:55.076094Z","title":"Roargraph: A projected bipartite graph for efficient cross-modal approximate nearest neighbor search.arXiv preprint arXiv:2408.08933, 2024a","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08246","last_updated":"2025-06-03T10:07:35Z","snapshot_observed_at":"2026-08-08T05:49:05.821041Z","submitted_at":"2025-02-12T09:39:54Z","title":"Inference-time sparse attention with asymmetric indexing","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-08T05:56:55.076094Z"},"links":{"cited_paper":"/paper/2408.08933","citing_paper":"/paper/2502.08246"},"observation_digest":"sha256:0ae52d28fedb6acdaeae5d2ee0e2ffbddc693200b5c049b90cae5e6763e1254c","observation_id":"434c7a4e-1764-49e0-a228-6388ec9b18d4","resolution":{"observed_at":"2026-08-08T05:56:55.076094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18158","last_updated":"2024-06-06T07:30:44Z","snapshot_observed_at":"2026-08-09T04:52:58.527696Z","submitted_at":"2024-02-28T08:43:05Z","title":"Evaluating Quantized Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18158","snapshot_observed_at":"2026-08-08T05:56:55.140233Z","title":"Evaluating quantized large language models.arXiv preprint arXiv:2402.18158, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08246","last_updated":"2025-06-03T10:07:35Z","snapshot_observed_at":"2026-08-08T05:49:05.821041Z","submitted_at":"2025-02-12T09:39:54Z","title":"Inference-time sparse attention with asymmetric indexing","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-08T05:56:55.140233Z"},"links":{"cited_paper":"/paper/2402.18158","citing_paper":"/paper/2502.08246"},"observation_digest":"sha256:8581f61a69f23ead993f36e7db42b78f1bfe3c576f6b2f83c0bf2d08169e68c4","observation_id":"f2a28fcf-820d-414d-baf0-d4d999d9731b","resolution":{"observed_at":"2026-08-08T05:56:55.140233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-08T05:56:55.070660Z","title":"Language models are few-shot learners.arXiv preprint arXiv:2005.14165,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2502.08246","last_updated":"2025-06-03T10:07:35Z","snapshot_observed_at":"2026-08-08T05:49:05.821041Z","submitted_at":"2025-02-12T09:39:54Z","title":"Inference-time sparse attention with asymmetric indexing","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T05:56:55.070660Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2502.08246"},"observation_digest":"sha256:4cdddb494153364a410a6150d9cc329e28ac4491ce06c752b3fa17db1ac73561","observation_id":"363f83c3-97ca-4007-9339-510daa08ff7d","resolution":{"observed_at":"2026-08-08T05:56:55.070660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-08T05:56:55.064747Z","title":"Gqa: Train- ing generalized multi-query transformer models from multi- head checkpoints, 2023.https://arxiv.org/abs/2305.13245","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08246","last_updated":"2025-06-03T10:07:35Z","snapshot_observed_at":"2026-08-08T05:49:05.821041Z","submitted_at":"2025-02-12T09:39:54Z","title":"Inference-time sparse attention with asymmetric indexing","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T05:56:55.064747Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2502.08246"},"observation_digest":"sha256:a67a647df7d5a72825ae29e67d431df00ebf7cd5e6e01292c1cc161edc0040dd","observation_id":"afbf3ce5-af35-4ce4-afb4-183f17ebfceb","resolution":{"observed_at":"2026-08-08T05:56:55.064747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.08246","last_updated":"2025-06-03T10:07:35Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T05:49:05.821041Z","submitted_at":"2025-02-12T09:39:54Z","title":"Inference-time sparse attention with asymmetric indexing"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":1,"verified_fuzzy":6},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 4 inbound Pith citation observations for arXiv:2502.08246."}