{"as_of":"2026-08-09T16:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2ce3e95a08ea19de125cc959863fd67d8a640367e69d6729779379f9f8c1d3eb","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T05:29:16.784078Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:24:27.792499Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T10:24:28.112713Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.08363","last_updated":"2026-06-16T14:51:28Z","snapshot_observed_at":"2026-08-08T05:20:34.050192Z","submitted_at":"2025-02-12T12:50:15Z","title":"Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding","version":3},"cited_work":{"arxiv_id":"2502.08363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.08363","snapshot_observed_at":"2026-08-07T10:24:28.112713Z","title":"Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding","venue":"cs.CL","work_id":"96d2d400-2c68-4a65-835a-2eacffbe2ba5","year":2025},"citing_paper":{"arxiv_id":"2506.05300","last_updated":"2025-06-05T17:50:32Z","snapshot_observed_at":"2026-08-07T10:19:13.309866Z","submitted_at":"2025-06-05T17:50:32Z","title":"Power Law Guided Dynamic Sifting for Efficient Attention","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:27.792499Z"},"links":{"cited_paper":"/paper/2502.08363","citing_paper":"/paper/2506.05300"},"observation_digest":"sha256:553664023733da045c53985365965561c0502d040a8ea28e936898ba2389af74","observation_id":"ebca9c3e-09b4-4cd2-b792-5828cdc7c8a8","resolution":{"observed_at":"2026-08-07T10:24:28.119897Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.08363/citation-record","integrity":"/paper/2502.08363/integrity","json":"/paper/2502.08363/citation-record.json","paper":"/paper/2502.08363"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:29:17.784247Z","title":"Attention is all you need","venue":null,"work_id":"6e1a9197-8d30-4c92-ad00-c10bf596a397","year":2017},"citing_paper":{"arxiv_id":"2502.08363","last_updated":"2026-06-16T14:51:28Z","snapshot_observed_at":"2026-08-08T05:20:34.050192Z","submitted_at":"2025-02-12T12:50:15Z","title":"Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T05:29:16.605900Z"},"links":{"citing_paper":"/paper/2502.08363"},"observation_digest":"sha256:62f095d5009b44082354cf0fa52c93fb416cb4be0f069a3119d82d5e060a14ef","observation_id":"3ce9d62a-20b7-4a70-b208-94c4bba7ea07","resolution":{"observed_at":"2026-08-08T05:29:17.789630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-08T05:29:16.610936Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.08363","last_updated":"2026-06-16T14:51:28Z","snapshot_observed_at":"2026-08-08T05:20:34.050192Z","submitted_at":"2025-02-12T12:50:15Z","title":"Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T05:29:16.610936Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2502.08363"},"observation_digest":"sha256:90c497a07a886b7d5b9f6ec6cc3f10dc42e9b4941ef7cbd3358f850762d04777","observation_id":"19137237-9b8f-4934-9001-9d42ebcc97e4","resolution":{"observed_at":"2026-08-08T05:29:16.610936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:29:17.768452Z","title":"On the com- putational complexity of self-attention","venue":null,"work_id":"81f940fb-ec77-46ad-b041-8b880af7f48e","year":2023},"citing_paper":{"arxiv_id":"2502.08363","last_updated":"2026-06-16T14:51:28Z","snapshot_observed_at":"2026-08-08T05:20:34.050192Z","submitted_at":"2025-02-12T12:50:15Z","title":"Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T05:29:16.615998Z"},"links":{"citing_paper":"/paper/2502.08363"},"observation_digest":"sha256:6350f6395e5aa29403b19e9c4cefd9ecba64587489923961017a1eb91886aea5","observation_id":"98c36a40-4c8c-4f14-898e-9ce732a67f41","resolution":{"observed_at":"2026-08-08T05:29:17.774304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01801","last_updated":"2024-10-29T18:26:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T05:17:08Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01801","snapshot_observed_at":"2026-08-08T05:29:16.621528Z","title":"Model tells you what to discard: Adaptive KV cache compression for llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08363","last_updated":"2026-06-16T14:51:28Z","snapshot_observed_at":"2026-08-08T05:20:34.050192Z","submitted_at":"2025-02-12T12:50:15Z","title":"Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T05:29:16.621528Z"},"links":{"cited_paper":"/paper/2310.01801","citing_paper":"/paper/2502.08363"},"observation_digest":"sha256:cc6469b62325a881cbf9ec8dfd3eea49ce3f9c217924e2f4448d3bb5bcf22b03","observation_id":"b62c9e13-2e56-4fd5-a6bb-8626fc00aa5a","resolution":{"observed_at":"2026-08-08T05:29:16.621528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02244","last_updated":"2024-05-29T13:38:25Z","snapshot_observed_at":"2026-08-09T04:38:56.380418Z","submitted_at":"2024-02-03T19:20:02Z","title":"Beyond the Limits: A Survey of Techniques to Extend the Context Length in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02244","snapshot_observed_at":"2026-08-08T05:29:16.626580Z","title":"Beyond the limits: A survey of techniques to extend the context length in large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08363","last_updated":"2026-06-16T14:51:28Z","snapshot_observed_at":"2026-08-08T05:20:34.050192Z","submitted_at":"2025-02-12T12:50:15Z","title":"Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T05:29:16.626580Z"},"links":{"cited_paper":"/paper/2402.02244","citing_paper":"/paper/2502.08363"},"observation_digest":"sha256:1a813ded3122ac2987858c52c0c5bd09464f23c6ac0e7fa7401116129ad83067","observation_id":"637844f6-9885-48c7-8893-86eeffabef29","resolution":{"observed_at":"2026-08-08T05:29:16.626580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:29:17.753073Z","title":"A survey on sparsity exploration in transformer- based accelerators","venue":null,"work_id":"cc25efd6-072a-4677-ad7e-4d5cc1b78af3","year":2023},"citing_paper":{"arxiv_id":"2502.08363","last_updated":"2026-06-16T14:51:28Z","snapshot_observed_at":"2026-08-08T05:20:34.050192Z","submitted_at":"2025-02-12T12:50:15Z","title":"Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T05:29:16.631655Z"},"links":{"citing_paper":"/paper/2502.08363"},"observation_digest":"sha256:0ef2d48680c7403fb5b9262628fb05b9c4f22424b199e9119877230acbd6a731","observation_id":"601a47ac-df43-41d3-9936-3a96800a11a5","resolution":{"observed_at":"2026-08-08T05:29:17.758528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06899","last_updated":"2021-06-13T02:30:23Z","snapshot_observed_at":"2026-08-08T01:15:11.346221Z","submitted_at":"2021-06-13T02:30:23Z","title":"Memory-efficient Transformers via Top-$k$ Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06899","snapshot_observed_at":"2026-08-08T05:29:16.636662Z","title":"Memory-efficient transformers via Top-k attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.08363","last_updated":"2026-06-16T14:51:28Z","snapshot_observed_at":"2026-08-08T05:20:34.050192Z","submitted_at":"2025-02-12T12:50:15Z","title":"Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T05:29:16.636662Z"},"links":{"cited_paper":"/paper/2106.06899","citing_paper":"/paper/2502.08363"},"observation_digest":"sha256:4375b1d13ba098beba7e7b7746c64d842d6b4d37927654a65a829580459288bc","observation_id":"7071b526-fca2-4e43-b591-d3875491b258","resolution":{"observed_at":"2026-08-08T05:29:16.636662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05832","last_updated":"2022-04-12T14:19:49Z","snapshot_observed_at":"2026-08-08T21:21:45.167487Z","submitted_at":"2022-04-12T14:19:49Z","title":"What Language Model Architecture and Pretraining Objective Work Best for Zero-Shot Generalization?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05832","snapshot_observed_at":"2026-08-08T05:29:16.641264Z","title":"What language model architecture and pretraining objective work best for zero-shot generalization?, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08363","last_updated":"2026-06-16T14:51:28Z","snapshot_observed_at":"2026-08-08T05:20:34.050192Z","submitted_at":"2025-02-12T12:50:15Z","title":"Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T05:29:16.641264Z"},"links":{"cited_paper":"/paper/2204.05832","citing_paper":"/paper/2502.08363"},"observation_digest":"sha256:69f4e02505d147a075d3d65790a03341cbf7bf0a79a1338073a786d8ca473839","observation_id":"dabb081f-ce5f-4125-99cb-800643504c8b","resolution":{"observed_at":"2026-08-08T05:29:16.641264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:29:17.474060Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":"1eb7c82b-d3bf-4512-9a03-a6fedf3ca995","year":2024},"citing_paper":{"arxiv_id":"2502.08363","last_updated":"2026-06-16T14:51:28Z","snapshot_observed_at":"2026-08-08T05:20:34.050192Z","submitted_at":"2025-02-12T12:50:15Z","title":"Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T05:29:16.646023Z"},"links":{"citing_paper":"/paper/2502.08363"},"observation_digest":"sha256:f7c8bb8ea8cbb21e1c874f122eda183626c59abc449bb10577fc8e2b1fafdb16","observation_id":"7ba39910-acde-41cc-a940-f8fb3a597d4e","resolution":{"observed_at":"2026-08-08T05:29:17.478688Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.04284","last_updated":"2019-06-18T19:42:31Z","snapshot_observed_at":"2026-07-06T07:59:23.899551Z","submitted_at":"2019-06-07T13:58:49Z","title":"Analyzing the Structure of Attention in a Transformer Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.04284","snapshot_observed_at":"2026-08-08T05:29:16.650454Z","title":"Analyzing the structure of attention in a transformer language model, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.08363","last_updated":"2026-06-16T14:51:28Z","snapshot_observed_at":"2026-08-08T05:20:34.050192Z","submitted_at":"2025-02-12T12:50:15Z","title":"Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T05:29:16.650454Z"},"links":{"cited_paper":"/paper/1906.04284","citing_paper":"/paper/2502.08363"},"observation_digest":"sha256:8bb845b1082e56df7c6f2019a8615f7eb1f765cac80a2d148b47a5085caa372e","observation_id":"615264ff-5416-4099-a9c5-46e13a6d8cfd","resolution":{"observed_at":"2026-08-08T05:29:16.650454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13541","last_updated":"2024-02-26T08:40:50Z","snapshot_observed_at":"2026-08-08T23:10:16.347515Z","submitted_at":"2023-11-22T17:30:41Z","title":"Linear Log-Normal Attention with Unbiased Concentration","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13541","snapshot_observed_at":"2026-08-08T05:29:16.655553Z","title":"Linear log-normal attention with unbiased concentration, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08363","last_updated":"2026-06-16T14:51:28Z","snapshot_observed_at":"2026-08-08T05:20:34.050192Z","submitted_at":"2025-02-12T12:50:15Z","title":"Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T05:29:16.655553Z"},"links":{"cited_paper":"/paper/2311.13541","citing_paper":"/paper/2502.08363"},"observation_digest":"sha256:510806ac3a811cbac63381e7d9015e249d3863e6ec65cfeb9bc84aeac9cbda17","observation_id":"728b6bad-1804-42b4-8bc9-ac2a2d11eee7","resolution":{"observed_at":"2026-08-08T05:29:16.655553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18003","last_updated":"2024-11-20T02:04:10Z","snapshot_observed_at":"2026-07-06T18:51:49.871551Z","submitted_at":"2024-07-25T12:56:22Z","title":"Keep the Cost Down: A Review on Methods to Optimize LLM' s KV-Cache Consumption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18003","snapshot_observed_at":"2026-08-08T05:29:16.660204Z","title":"Keep the cost down: A review on methods to optimize LLM’s KV-cache consumption, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08363","last_updated":"2026-06-16T14:51:28Z","snapshot_observed_at":"2026-08-08T05:20:34.050192Z","submitted_at":"2025-02-12T12:50:15Z","title":"Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T05:29:16.660204Z"},"links":{"cited_paper":"/paper/2407.18003","citing_paper":"/paper/2502.08363"},"observation_digest":"sha256:278d3c568b004ff8bfe54358a3b6cfb7db15f9d04122241d8b824f49e5fd21f0","observation_id":"b92d5962-84f4-4bbe-a72c-02ea9c1698b1","resolution":{"observed_at":"2026-08-08T05:29:16.660204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-08T05:29:16.665033Z","title":"GQA: Training generalized multi-query transformer models from multi-head checkpoints","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08363","last_updated":"2026-06-16T14:51:28Z","snapshot_observed_at":"2026-08-08T05:20:34.050192Z","submitted_at":"2025-02-12T12:50:15Z","title":"Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T05:29:16.665033Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2502.08363"},"observation_digest":"sha256:e1378015d9c34d92e42bd3b3d58bfed360a6e9065db10037cf83a92f81ab60ac","observation_id":"639b9220-0392-43b8-9a64-11d00946dc34","resolution":{"observed_at":"2026-08-08T05:29:16.665033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:29:17.738455Z","title":"Parallel Top-K algorithms on GPU: A comprehensive study and new methods","venue":null,"work_id":"725b6058-416d-473a-93a1-bb1934dcfc9f","year":null},"citing_paper":{"arxiv_id":"2502.08363","last_updated":"2026-06-16T14:51:28Z","snapshot_observed_at":"2026-08-08T05:20:34.050192Z","submitted_at":"2025-02-12T12:50:15Z","title":"Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T05:29:16.669735Z"},"links":{"citing_paper":"/paper/2502.08363"},"observation_digest":"sha256:4a5d0b5daefe89ae2d7209f34731bed37b55d90a59bc251603a1d5f3772e078a","observation_id":"6c6494eb-a38d-4549-9439-d9fea5712613","resolution":{"observed_at":"2026-08-08T05:29:17.743078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15234","last_updated":"2025-07-23T10:11:55Z","snapshot_observed_at":"2026-08-05T06:23:34.302204Z","submitted_at":"2023-12-23T11:57:53Z","title":"Towards Efficient Generative Large Language Model Serving: A Survey from Algorithms to Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15234","snapshot_observed_at":"2026-08-08T05:29:16.679116Z","title":"Towards efficient generative large language model serving: A survey from algorithms to systems, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08363","last_updated":"2026-06-16T14:51:28Z","snapshot_observed_at":"2026-08-08T05:20:34.050192Z","submitted_at":"2025-02-12T12:50:15Z","title":"Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T05:29:16.679116Z"},"links":{"cited_paper":"/paper/2312.15234","citing_paper":"/paper/2502.08363"},"observation_digest":"sha256:9d275edd105342db409607d185e2c98f509f46ed46f59ab23237d54313dd66a4","observation_id":"aa2206f7-abf5-495f-a5f3-94092c85929c","resolution":{"observed_at":"2026-08-08T05:29:16.679116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:29:17.723225Z","title":"FlashAttention: Fast and memory-efficient exact attention with io-awareness","venue":null,"work_id":"71d92c58-bbeb-4d35-ae59-f8d50dc4eeeb","year":2022},"citing_paper":{"arxiv_id":"2502.08363","last_updated":"2026-06-16T14:51:28Z","snapshot_observed_at":"2026-08-08T05:20:34.050192Z","submitted_at":"2025-02-12T12:50:15Z","title":"Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T05:29:16.683766Z"},"links":{"citing_paper":"/paper/2502.08363"},"observation_digest":"sha256:bc4294be6d22c9b6fc83ef5d6b8e0d50e7e73c6da84b993b9b43ca90b584b410","observation_id":"a09db41a-2dcb-4fa4-b7d8-1e02dd5cdab8","resolution":{"observed_at":"2026-08-08T05:29:17.727900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:29:16.688092Z","title":"A framework for few-shot language model evaluation, 07 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08363","last_updated":"2026-06-16T14:51:28Z","snapshot_observed_at":"2026-08-08T05:20:34.050192Z","submitted_at":"2025-02-12T12:50:15Z","title":"Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T05:29:16.688092Z"},"links":{"citing_paper":"/paper/2502.08363"},"observation_digest":"sha256:7458b56c993e04de2c14e8e871810aa1b892e7e67ae2c0d1f837a6cc7feb55f8","observation_id":"b26ea330-fbae-4c81-b355-2e528e481900","resolution":{"observed_at":"2026-08-08T05:29:16.688092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-08T05:29:16.692548Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.08363","last_updated":"2026-06-16T14:51:28Z","snapshot_observed_at":"2026-08-08T05:20:34.050192Z","submitted_at":"2025-02-12T12:50:15Z","title":"Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T05:29:16.692548Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2502.08363"},"observation_digest":"sha256:6d5678f066a38730ee51b426d56b4d66c9e3ad073116dfe4191f1f3e027e606b","observation_id":"ca32d981-743b-460b-a7a4-0186541da4ee","resolution":{"observed_at":"2026-08-08T05:29:16.692548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:29:16.696976Z","title":"LongBench: A bilingual, multitask benchmark for long context understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08363","last_updated":"2026-06-16T14:51:28Z","snapshot_observed_at":"2026-08-08T05:20:34.050192Z","submitted_at":"2025-02-12T12:50:15Z","title":"Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T05:29:16.696976Z"},"links":{"citing_paper":"/paper/2502.08363"},"observation_digest":"sha256:bbc2d0e86f2b8feeee1aaaffd9feee66343abc0b0e88e61d61dc03d9d29a48d6","observation_id":"9107e1b7-5994-47dd-876b-5d94b8cfb40b","resolution":{"observed_at":"2026-08-08T05:29:16.696976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-08T05:29:16.701409Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08363","last_updated":"2026-06-16T14:51:28Z","snapshot_observed_at":"2026-08-08T05:20:34.050192Z","submitted_at":"2025-02-12T12:50:15Z","title":"Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T05:29:16.701409Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2502.08363"},"observation_digest":"sha256:1c0bf632977f7ee020b5339ccefa14319ec618a24aa73272ac4e473fd6367931","observation_id":"26fa3b79-a1e5-404a-8f79-51db2044e5b5","resolution":{"observed_at":"2026-08-08T05:29:16.701409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T05:29:16.706212Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08363","last_updated":"2026-06-16T14:51:28Z","snapshot_observed_at":"2026-08-08T05:20:34.050192Z","submitted_at":"2025-02-12T12:50:15Z","title":"Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T05:29:16.706212Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.08363"},"observation_digest":"sha256:b0da73d799b649e2ea755fc1fe95328aee39dfc876a9f0b6e8db372afc2e9794","observation_id":"9fcd8ac7-c9ec-48d4-a579-585da0a813c6","resolution":{"observed_at":"2026-08-08T05:29:16.706212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10774","last_updated":"2024-08-26T21:01:02Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-16T01:33:02Z","title":"Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10774","snapshot_observed_at":"2026-08-08T05:29:16.710874Z","title":"Quest: Query-aware sparsity for efficient long-context LLM inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08363","last_updated":"2026-06-16T14:51:28Z","snapshot_observed_at":"2026-08-08T05:20:34.050192Z","submitted_at":"2025-02-12T12:50:15Z","title":"Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T05:29:16.710874Z"},"links":{"cited_paper":"/paper/2406.10774","citing_paper":"/paper/2502.08363"},"observation_digest":"sha256:d9f0874748ffc3896d5bb1973072d44bc06ff4d754ad479a4429bbf17dfc96d5","observation_id":"264105b2-83a2-467e-be50-61ae338de677","resolution":{"observed_at":"2026-08-08T05:29:16.710874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:29:17.695975Z","title":"Quantization variation: A new perspective on training transformers with low-bit precision","venue":null,"work_id":"2a658c3e-0088-41f0-bd7c-f14fc85548cf","year":2024},"citing_paper":{"arxiv_id":"2502.08363","last_updated":"2026-06-16T14:51:28Z","snapshot_observed_at":"2026-08-08T05:20:34.050192Z","submitted_at":"2025-02-12T12:50:15Z","title":"Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T05:29:16.715346Z"},"links":{"citing_paper":"/paper/2502.08363"},"observation_digest":"sha256:12d8579a5b229b67e436a017040e7e6af82b949470152e05df9155c4765a2dd3","observation_id":"ee629974-95d3-4019-977e-6b6c8c24f1ed","resolution":{"observed_at":"2026-08-08T05:29:17.703856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:29:17.680717Z","title":"Energon: Toward efficient acceleration of transformers using dynamic sparse attention","venue":null,"work_id":"780edb7a-a9db-426d-81c2-d7ac5d7de75f","year":2022},"citing_paper":{"arxiv_id":"2502.08363","last_updated":"2026-06-16T14:51:28Z","snapshot_observed_at":"2026-08-08T05:20:34.050192Z","submitted_at":"2025-02-12T12:50:15Z","title":"Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T05:29:16.719664Z"},"links":{"citing_paper":"/paper/2502.08363"},"observation_digest":"sha256:8bf9b11f36715b5371ae3b57cf41393207ad6c57875a43cfb28f26790fc5cdd4","observation_id":"1c365f05-9bc0-496c-9586-1a2cb3541729","resolution":{"observed_at":"2026-08-08T05:29:17.686058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:29:17.665753Z","title":"SpAtten: Efficient sparse attention architecture with cascade token and head pruning","venue":null,"work_id":"0a18c934-30c0-49de-84aa-aa765acd73f9","year":2021},"citing_paper":{"arxiv_id":"2502.08363","last_updated":"2026-06-16T14:51:28Z","snapshot_observed_at":"2026-08-08T05:20:34.050192Z","submitted_at":"2025-02-12T12:50:15Z","title":"Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T05:29:16.723911Z"},"links":{"citing_paper":"/paper/2502.08363"},"observation_digest":"sha256:c66bfe367b3848be1f06be057e29d841c62366fd6d09de222fa60302aaf1588a","observation_id":"367c63e0-033b-49dc-916d-c7ac9784b4bc","resolution":{"observed_at":"2026-08-08T05:29:17.670534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.10941","last_updated":"2020-02-22T02:09:21Z","snapshot_observed_at":"2026-08-09T11:22:06.603025Z","submitted_at":"2020-02-22T02:09:21Z","title":"A$^3$: Accelerating Attention Mechanisms in Neural Networks with Approximation","version":1},"cited_work":{"arxiv_id":"2002.10941","doi":null,"metadata_source":"pith","pith_arxiv_id":"2002.10941","snapshot_observed_at":"2026-08-08T05:29:16.906275Z","title":"A$^3$: Accelerating Attention Mechanisms in Neural Networks with Approximation","venue":"cs.DC","work_id":"0a7717ae-2d33-43a3-8e1a-ffb7b1b00331","year":2020},"citing_paper":{"arxiv_id":"2502.08363","last_updated":"2026-06-16T14:51:28Z","snapshot_observed_at":"2026-08-08T05:20:34.050192Z","submitted_at":"2025-02-12T12:50:15Z","title":"Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T05:29:16.728480Z"},"links":{"cited_paper":"/paper/2002.10941","citing_paper":"/paper/2502.08363"},"observation_digest":"sha256:f789aa4b6155b1abb04ed63bc3eac330c2ba62356690af582dd7b00733a8e0cd","observation_id":"91512def-a04d-4598-85eb-60786a70ca1c","resolution":{"observed_at":"2026-08-08T05:29:16.912922Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04985","last_updated":"2024-09-04T10:04:52Z","snapshot_observed_at":"2026-07-06T16:58:47.790985Z","submitted_at":"2023-12-08T11:47:35Z","title":"SparQ Attention: Bandwidth-Efficient LLM Inference","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04985","snapshot_observed_at":"2026-08-08T05:29:16.733334Z","title":"SparQ attention: Bandwidth-efficient LLM inference","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08363","last_updated":"2026-06-16T14:51:28Z","snapshot_observed_at":"2026-08-08T05:20:34.050192Z","submitted_at":"2025-02-12T12:50:15Z","title":"Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T05:29:16.733334Z"},"links":{"cited_paper":"/paper/2312.04985","citing_paper":"/paper/2502.08363"},"observation_digest":"sha256:001a20ca86764ec01548d4f48b1ab67663d48af4985595f4b078a933384fe0a3","observation_id":"9892386f-9661-4b1d-80ec-97f60e102f1a","resolution":{"observed_at":"2026-08-08T05:29:16.733334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:29:16.738176Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.08363","last_updated":"2026-06-16T14:51:28Z","snapshot_observed_at":"2026-08-08T05:20:34.050192Z","submitted_at":"2025-02-12T12:50:15Z","title":"Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T05:29:16.738176Z"},"links":{"citing_paper":"/paper/2502.08363"},"observation_digest":"sha256:c00cdcf167042513d903520447a014bffd280751180032fa5f71be5801bd7352","observation_id":"212781a5-ae7d-45fd-8a50-adc79ec400e0","resolution":{"observed_at":"2026-08-08T05:29:16.738176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:29:17.639564Z","title":"Learned token pruning for transformers","venue":null,"work_id":"36e8bbc1-61b9-4a79-bdc9-707a04c4436f","year":2022},"citing_paper":{"arxiv_id":"2502.08363","last_updated":"2026-06-16T14:51:28Z","snapshot_observed_at":"2026-08-08T05:20:34.050192Z","submitted_at":"2025-02-12T12:50:15Z","title":"Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T05:29:16.742544Z"},"links":{"citing_paper":"/paper/2502.08363"},"observation_digest":"sha256:56fa8a57ba5db2f59bb3aa58c6b497e78d18a9fcba0e0a1d03d95a0ae5c736ad","observation_id":"01f7a4d1-21bc-4eda-83aa-084d997c6cb6","resolution":{"observed_at":"2026-08-08T05:29:17.645070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:29:17.623839Z","title":"Sparser is faster and less is more: Efficient sparse attention for long-range transformers, 2024","venue":null,"work_id":"7ad0967e-43f3-4ad0-b83c-24b601a3b782","year":2024},"citing_paper":{"arxiv_id":"2502.08363","last_updated":"2026-06-16T14:51:28Z","snapshot_observed_at":"2026-08-08T05:20:34.050192Z","submitted_at":"2025-02-12T12:50:15Z","title":"Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T05:29:16.746867Z"},"links":{"citing_paper":"/paper/2502.08363"},"observation_digest":"sha256:e372ee53c35be947262b693dd9db28dffba9467f3f81ca746b28603ccd6a3f7c","observation_id":"cb67c1a9-6f11-4b12-a3a9-65ab31363235","resolution":{"observed_at":"2026-08-08T05:29:17.628531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:29:17.608843Z","title":"From softmax to sparsemax: A sparse model of attention and multi-label classification","venue":null,"work_id":"0142a892-cca4-4366-8323-832887f8e1c1","year":2016},"citing_paper":{"arxiv_id":"2502.08363","last_updated":"2026-06-16T14:51:28Z","snapshot_observed_at":"2026-08-08T05:20:34.050192Z","submitted_at":"2025-02-12T12:50:15Z","title":"Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T05:29:16.751123Z"},"links":{"citing_paper":"/paper/2502.08363"},"observation_digest":"sha256:945138341593b5bcb9e736a4032e0ea3a5ac1b8718935dac214a2974d2e28256","observation_id":"da3bffc8-1db2-4d0b-85d0-ec7434f2e2eb","resolution":{"observed_at":"2026-08-08T05:29:17.613503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.05702","last_updated":"2019-06-12T18:20:25Z","snapshot_observed_at":"2026-08-06T10:52:04.671805Z","submitted_at":"2019-05-14T16:21:34Z","title":"Sparse Sequence-to-Sequence Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.05702","snapshot_observed_at":"2026-08-08T05:29:16.755455Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.08363","last_updated":"2026-06-16T14:51:28Z","snapshot_observed_at":"2026-08-08T05:20:34.050192Z","submitted_at":"2025-02-12T12:50:15Z","title":"Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T05:29:16.755455Z"},"links":{"cited_paper":"/paper/1905.05702","citing_paper":"/paper/2502.08363"},"observation_digest":"sha256:038978361119040e04e3ed0e8237ebf703462dc101559c9842edd7a3a07d41ec","observation_id":"1b3555f9-10c0-4b32-90e3-ac2169f76169","resolution":{"observed_at":"2026-08-08T05:29:16.755455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.07012","last_updated":"2021-10-06T14:04:59Z","snapshot_observed_at":"2026-08-01T20:50:32.439945Z","submitted_at":"2021-04-14T17:52:38Z","title":"Sparse Attention with Linear Units","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.07012","snapshot_observed_at":"2026-08-08T05:29:16.760019Z","title":"Sparse attention with linear units, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.08363","last_updated":"2026-06-16T14:51:28Z","snapshot_observed_at":"2026-08-08T05:20:34.050192Z","submitted_at":"2025-02-12T12:50:15Z","title":"Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T05:29:16.760019Z"},"links":{"cited_paper":"/paper/2104.07012","citing_paper":"/paper/2502.08363"},"observation_digest":"sha256:c2f834154ba57978c0fd292991f3068ec818fe5381b808f9c17b4d9fa9f2ee15","observation_id":"e453c126-8e4f-44f8-8a04-502487eb7702","resolution":{"observed_at":"2026-08-08T05:29:16.760019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-08T05:29:16.765072Z","title":"Peters, and Arman Cohan","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2502.08363","last_updated":"2026-06-16T14:51:28Z","snapshot_observed_at":"2026-08-08T05:20:34.050192Z","submitted_at":"2025-02-12T12:50:15Z","title":"Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T05:29:16.765072Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2502.08363"},"observation_digest":"sha256:e65a83a5c32d99547c11e0d6d57cc1786b669ee51daba536cc058dfab0ecadf2","observation_id":"41b0355e-a9fd-443e-ae94-37c77c7b91df","resolution":{"observed_at":"2026-08-08T05:29:16.765072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07003","last_updated":"2021-06-11T20:00:20Z","snapshot_observed_at":"2026-08-09T12:17:39.728276Z","submitted_at":"2020-10-14T12:28:08Z","title":"Length-Adaptive Transformer: Train Once with Length Drop, Use Anytime with Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.07003","snapshot_observed_at":"2026-08-08T05:29:16.769723Z","title":"Multi-k Cumulative","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.08363","last_updated":"2026-06-16T14:51:28Z","snapshot_observed_at":"2026-08-08T05:20:34.050192Z","submitted_at":"2025-02-12T12:50:15Z","title":"Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T05:29:16.769723Z"},"links":{"cited_paper":"/paper/2010.07003","citing_paper":"/paper/2502.08363"},"observation_digest":"sha256:6cccfd90ee6dbec403f617e38458784416b920d281792d91e6ca87b3abada1b3","observation_id":"42c88afe-2acb-4fed-bbfd-833d130dcbb1","resolution":{"observed_at":"2026-08-08T05:29:16.769723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:29:17.594169Z","title":"They are conditionally independent given the input X from which they were originally computed via V = XW V","venue":null,"work_id":"d5890992-cf10-4397-ad40-911dd6626e47","year":null},"citing_paper":{"arxiv_id":"2502.08363","last_updated":"2026-06-16T14:51:28Z","snapshot_observed_at":"2026-08-08T05:20:34.050192Z","submitted_at":"2025-02-12T12:50:15Z","title":"Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T05:29:16.774739Z"},"links":{"citing_paper":"/paper/2502.08363"},"observation_digest":"sha256:c527ff8db4ba6a31139415ced5e71864a918dcef814bc0381fc08a009987a18a","observation_id":"8851141e-3791-4767-bf7a-2031d042e8f8","resolution":{"observed_at":"2026-08-08T05:29:17.598968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:29:17.578550Z","title":null,"venue":null,"work_id":"8aa662cf-4894-4d87-b974-89e160586ab6","year":null},"citing_paper":{"arxiv_id":"2502.08363","last_updated":"2026-06-16T14:51:28Z","snapshot_observed_at":"2026-08-08T05:20:34.050192Z","submitted_at":"2025-02-12T12:50:15Z","title":"Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T05:29:16.779490Z"},"links":{"citing_paper":"/paper/2502.08363"},"observation_digest":"sha256:5be6b7daf3b93f4507c5746f2de194add8e398e0d5c72c1c76ae33ca60ba8750","observation_id":"037690e9-96df-49fb-83e6-f4c63908990c","resolution":{"observed_at":"2026-08-08T05:29:17.583556Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:29:17.562746Z","title":"F Evaluation statistics In this section, we present again the experimental results from Section 4.1; however, to demonstrate statistical significance, we show the error bars","venue":null,"work_id":"3a809848-75cb-43c7-8f71-8d3f26c3117d","year":null},"citing_paper":{"arxiv_id":"2502.08363","last_updated":"2026-06-16T14:51:28Z","snapshot_observed_at":"2026-08-08T05:20:34.050192Z","submitted_at":"2025-02-12T12:50:15Z","title":"Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T05:29:16.784078Z"},"links":{"citing_paper":"/paper/2502.08363"},"observation_digest":"sha256:b8fc476c4b07bcf4ecf47439d81599114db9f09203e3d325cf8c3ed431e7f2b4","observation_id":"f81260cb-9103-4e1a-b13d-90a6c94cb1dc","resolution":{"observed_at":"2026-08-08T05:29:17.567937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:29:17.210820Z","title":"ISBN 9798400701092","venue":null,"work_id":"37bfde46-991f-4f94-89d1-cad7397ed6b2","year":null},"citing_paper":{"arxiv_id":"2502.08363","last_updated":"2026-06-16T14:51:28Z","snapshot_observed_at":"2026-08-08T05:20:34.050192Z","submitted_at":"2025-02-12T12:50:15Z","title":"Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T05:29:16.674444Z"},"links":{"citing_paper":"/paper/2502.08363"},"observation_digest":"sha256:3619ed7fd3e12e0029b380e50f842428d98140d930fcd58761f6263702640a3e","observation_id":"4496d8bb-58b6-4e44-98d1-55bc911016f7","resolution":{"observed_at":"2026-08-08T05:29:17.231661Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.08363","last_updated":"2026-06-16T14:51:28Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T05:20:34.050192Z","submitted_at":"2025-02-12T12:50:15Z","title":"Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":23,"verified_exact":2,"verified_fuzzy":13},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 1 inbound Pith citation observation for arXiv:2502.08363."}