{"as_of":"2026-08-07T21:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:988c0f86e1f2bf6ae53a015064ff5b163d795b7f232610edf42e18e6c2f68004","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:39:10.193536Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.24179/citation-record","integrity":"/paper/2505.24179/integrity","json":"/paper/2505.24179/citation-record.json","paper":"/paper/2505.24179"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:26.947338Z","title":"Booksum: A collection of datasets for long-form narrative summarization,","venue":null,"work_id":"13c7cd1b-e589-4d1b-ac05-1c976349a1da","year":2022},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:01.544466Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:1ba7857f008b4b1dda9a92f65853d4cd573be4c3e349c718e0d6d6a2e3983722","observation_id":"f1181232-b07a-4c73-a2fe-3033e696e651","resolution":{"observed_at":"2026-08-07T12:39:27.136294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.07057","last_updated":"2023-01-17T18:18:51Z","snapshot_observed_at":"2026-07-06T14:42:07.292110Z","submitted_at":"2023-01-17T18:18:51Z","title":"Transformer Based Implementation for Automatic Book Summarization","version":1},"cited_work":{"arxiv_id":"2301.07057","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.07057","snapshot_observed_at":"2026-08-07T12:39:12.015624Z","title":"Transformer Based Implementation for Automatic Book Summarization","venue":"cs.CL","work_id":"85b53d41-53d8-49a7-af61-8758dac3bfff","year":2023},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:01.698014Z"},"links":{"cited_paper":"/paper/2301.07057","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:400ca9fc7445d423851e81eea9d6fdfdcbc18ccbc7c85ee163cd4df3cf63f800","observation_id":"b13ab18e-98c6-42c3-beed-4206e077c3af","resolution":{"observed_at":"2026-08-07T12:39:12.172785Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:26.727940Z","title":"Booookscore: A systematic exploration of book-length summarization in the era of LLMs,","venue":null,"work_id":"3ee9875f-1228-4f9f-8db0-d6730e8716ef","year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:01.862280Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:1f204393a9a43091014f91a2df8a24db1262f9a1a0cf23e70ff875cafe32caf5","observation_id":"512c5be2-fb3e-47e2-8561-02f765bf403d","resolution":{"observed_at":"2026-08-07T12:39:26.814959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:26.474067Z","title":"Peek across: Improving multi-document modeling via cross-document question-answering,","venue":null,"work_id":"aae011c1-9621-4337-b27b-cdc77ecd4855","year":1970},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:01.995486Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:d16df2ac6eef68d2090ef475a07b7cc0bf260d543b36224a1b3edab6a6907ddb","observation_id":"8d871b43-4e3d-458f-adad-b036b31dd6f2","resolution":{"observed_at":"2026-08-07T12:39:26.607039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:26.235579Z","title":"Quality: Question answering with long input texts, yes!,","venue":null,"work_id":"0bb4d4db-80d4-4836-9c23-edcc956ab142","year":2022},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:02.119346Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:a46c4055ca9b6de51aeaa7664052047b64a3486b09de347e9e8d164a6b57e3b3","observation_id":"0492a883-5869-4d00-b33a-23eaf3cf4da0","resolution":{"observed_at":"2026-08-07T12:39:26.360575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:26.079482Z","title":"Eli5: Long form question answering,","venue":null,"work_id":"566b8261-1676-41c7-8d56-459029444b4e","year":2019},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:02.225120Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:c49b3b2c8653f9845d6b0c6600f2dd1c558cbd298718b34afedc8b668098a1c1","observation_id":"51bd3625-2748-411d-8673-c8a17d439cb9","resolution":{"observed_at":"2026-08-07T12:39:26.148743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:24.302391Z","title":"Teaching code llms to use autocompletion tools in repository-level code generation,","venue":null,"work_id":"ecb9288f-df63-42ee-a823-51d019fd1041","year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:02.354328Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:29e92137bb94f88e92a8ac10f29ae256fee8a92c61d9d50687539f8cf67b5f3f","observation_id":"11e139f6-855e-441e-9eb1-dee98a1dcd55","resolution":{"observed_at":"2026-08-07T12:39:25.930551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:23.284835Z","title":"Rlcoder: Reinforcement learning for repository-level code completion,","venue":null,"work_id":"3c23c241-a4b1-45fc-9a87-05c98afa7450","year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:02.439280Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:290990c274cec70e92294783f94cec9cd978fdb502588e676891d4f5f2cf8763","observation_id":"d394e65c-6b84-4b07-85e6-84e86266e87e","resolution":{"observed_at":"2026-08-07T12:39:23.459473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:19.124796Z","title":"The llama 3 herd of models,","venue":null,"work_id":"8542a403-0569-4e55-844e-89351c1fbb74","year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:02.540264Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:64225a1a1a6f5b6e64b7c63b835b45333a6e05028d51d38b1abde507bd48f543","observation_id":"cd7e2f28-2281-477c-ae9e-67a4033939f2","resolution":{"observed_at":"2026-08-07T12:39:21.967928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15383","last_updated":"2025-01-26T03:47:25Z","snapshot_observed_at":"2026-07-31T01:49:29.562668Z","submitted_at":"2025-01-26T03:47:25Z","title":"Qwen2.5-1M Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15383","snapshot_observed_at":"2026-08-07T12:39:02.628737Z","title":"Qwen2. 5-1m technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:02.628737Z"},"links":{"cited_paper":"/paper/2501.15383","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:055a185ebffbba3c708e5bf78bd0eaeaae7317f2a40611262b30423bc4ce2c09","observation_id":"3dbd470f-d605-4360-a5f6-439816f638b5","resolution":{"observed_at":"2026-08-07T12:39:02.628737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:18.718269Z","title":"Gemma 3 technical report,","venue":null,"work_id":"fe568a44-9f3c-4a9e-bf3e-4b3a07021996","year":2025},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:02.777619Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:894d2786475129fe2099dfa443b10718fe594087e79cd3da0324d17744532d3e","observation_id":"7024eba2-1cc9-4e41-8937-4623bc89b760","resolution":{"observed_at":"2026-08-07T12:39:18.840840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:18.480378Z","title":"Deepseek-v3 technical report,","venue":null,"work_id":"371c2263-81b1-4c2f-a620-a62363d78dd8","year":2025},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:02.883538Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:ecc08f3fef1613ac6d5532c01efc70fb88f2eaa3d1d048e3962a943a1a87835f","observation_id":"e6c144f1-0568-490a-8e08-926250a7c254","resolution":{"observed_at":"2026-08-07T12:39:18.572954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:02.961058Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:02.961058Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:2d3a4f713a66b40864f8c18c2e67368eb94fcf7838e96b4c9eae3002577c76c8","observation_id":"3ebd4d0b-4c23-4611-a066-be719b0961b9","resolution":{"observed_at":"2026-08-07T12:39:02.961058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:18.220573Z","title":"Challenges in deploying long-context transformers: A theoretical peak performance analysis,","venue":null,"work_id":"ad1bf2a5-d445-4a5b-ba8d-4061a4f5ea7a","year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:03.066855Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:93f1acb1c6bdfda9161acfd94984949a137ea6ed44aa4de5511768c3c75c67df","observation_id":"e8d31f66-3863-43e5-8cba-31d97e3a4ff1","resolution":{"observed_at":"2026-08-07T12:39:18.317295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:17.836819Z","title":"Minference 1.0: Accelerating pre-filling for long-context llms via dynamic sparse attention,","venue":null,"work_id":"5aa31dbe-16f6-4ebe-bc00-be6e26e26319","year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:03.195707Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:ffc407450a760a54f5ed16693aef1fedbb31d4006b8ee3abecfea4172fbf2616","observation_id":"dc30b61e-5109-45e4-afa2-82763aa26a9e","resolution":{"observed_at":"2026-08-07T12:39:18.087881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02690","last_updated":"2025-02-12T14:32:46Z","snapshot_observed_at":"2026-07-06T17:55:03.561275Z","submitted_at":"2024-04-03T12:37:34Z","title":"How Sparse Attention Approximates Exact Attention? Your Attention is Naturally $n^C$-Sparse","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02690","snapshot_observed_at":"2026-08-07T12:39:03.324221Z","title":"Attention is naturally sparse with gaussian distributed input,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:03.324221Z"},"links":{"cited_paper":"/paper/2404.02690","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:b99f1988afbb2b1393e320e16da95bccccb2044cae13977868b0f9662802250f","observation_id":"9b8de900-60eb-4bab-8ac4-71d127049db3","resolution":{"observed_at":"2026-08-07T12:39:03.324221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-06T08:05:35.311510Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-07T12:39:03.429468Z","title":"Generating long sequences with sparse transformers,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:03.429468Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:8083e3efab0e2775ba129c12236f7186155980d9d15488e6e868e88d96e8b1e2","observation_id":"f1fbed45-88d9-46ac-9bde-e090760fa7d3","resolution":{"observed_at":"2026-08-07T12:39:03.429468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:17.600124Z","title":"Big bird: Transformers for longer sequences,","venue":null,"work_id":"2d17a5b2-be45-4b7a-bf04-6bc4b182807e","year":2020},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:03.569330Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:3dd8b29e0461b6a1899a9c8a012e5cd38bbe7a79f4d1051ac0993fc002d3cc9e","observation_id":"3fb3dcee-4063-43f4-9f7a-9f4a119ed900","resolution":{"observed_at":"2026-08-07T12:39:17.709833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-07T12:39:03.743592Z","title":"Longformer: The long-document transformer,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:03.743592Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:7bed3f5104e07bb2dc9bc0060db18a4edf44da79662e19d730f5cdf08dd95f98","observation_id":"1077f3fa-2255-4a52-aecf-c71753c526b4","resolution":{"observed_at":"2026-08-07T12:39:03.743592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:17.357721Z","title":"Efficient streaming language models with attention sinks,","venue":null,"work_id":"7a042444-2001-42ae-9890-5b12133ad7e8","year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:03.876438Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:7ddd53d94f34cb508d496dec4eb31c688b3aaa440dc534c05c48f4dcfd5f143b","observation_id":"dd0ba8b8-d185-4029-98eb-6479edf9cd5d","resolution":{"observed_at":"2026-08-07T12:39:17.413962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16137","last_updated":"2024-06-24T21:22:00Z","snapshot_observed_at":"2026-08-07T16:57:45.872655Z","submitted_at":"2023-08-30T16:47:51Z","title":"LM-Infinite: Zero-Shot Extreme Length Generalization for Large Language Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16137","snapshot_observed_at":"2026-08-07T12:39:03.996288Z","title":"Lm-infinite: Zero-shot extreme length generalization for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:03.996288Z"},"links":{"cited_paper":"/paper/2308.16137","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:46135c0b0835d87b06360704140139bfb6716d679a4e6206841528e1147fe8da","observation_id":"9c1f97f4-31be-47bf-a7e4-89aa14373d90","resolution":{"observed_at":"2026-08-07T12:39:03.996288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15486","last_updated":"2025-09-03T02:11:32Z","snapshot_observed_at":"2026-07-06T18:35:08.874127Z","submitted_at":"2024-06-17T11:05:15Z","title":"SampleAttention: Near-Lossless Acceleration of Long Context LLM Inference with Adaptive Structured Sparse Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15486","snapshot_observed_at":"2026-08-07T12:39:04.130346Z","title":"Sampleat- tention: Near-lossless acceleration of long context llm inference with adaptive structured sparse attention,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:04.130346Z"},"links":{"cited_paper":"/paper/2406.15486","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:9327af75c214a7ae5a3a0e361076df15ef8a34803f7a4112682a1a04cf8051b8","observation_id":"880c0f54-d757-48f2-b888-07afa42268bf","resolution":{"observed_at":"2026-08-07T12:39:04.130346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:16.990235Z","title":"Flexprefill: A context-aware sparse attention mechanism for ef- ficient long-sequence inference,","venue":null,"work_id":"24b1ac07-69f5-4630-b7cd-ab31a8d14761","year":2025},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:04.292807Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:ca08d092597955b3eaa8b256c228f51983c26d176e4aff0e6290e68b89f8282d","observation_id":"23c86693-7505-4dfc-ab59-2ab4c6e8a005","resolution":{"observed_at":"2026-08-07T12:39:17.203121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:04.457185Z","title":"Spargeattn: Accurate sparse attention accelerating any model inference,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:04.457185Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:82f8517d4a1adbf91e8f3f1774c50eb4342c0162143f59138ca9d1a705815b3b","observation_id":"c91011ad-266a-48c1-a33f-3149672e4140","resolution":{"observed_at":"2026-08-07T12:39:04.457185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:16.653496Z","title":"A training-free sub-quadratic cost transformer model serving framework with hierarchically pruned attention,","venue":null,"work_id":"de0d885c-4733-4c03-a950-0ac058190db8","year":2025},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:04.564148Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:667bd2ed18de23f7539f92a5912de6ce7ba7e69cc590759edb7fc3139887fcab","observation_id":"c552fb85-094a-49c9-ab38-0dc97356c943","resolution":{"observed_at":"2026-08-07T12:39:16.819110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:16.344359Z","title":"When attention sink emerges in language models: An empirical view,","venue":null,"work_id":"2163edae-5bd7-40ac-b698-01cf9fe16009","year":2025},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:04.678368Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:9e406a12cc8a84be0a4eb21196c2eca87b67e8caee424bbabea2925202d56f2a","observation_id":"4d02b2b5-2c14-4ecb-9d69-11e44e8a1782","resolution":{"observed_at":"2026-08-07T12:39:16.468229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:16.069942Z","title":"H2o: Heavy-hitter oracle for efficient generative inference of large language models,","venue":null,"work_id":"66089d60-72bd-4765-ac27-ce78318cdda1","year":2023},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:04.867954Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:4f021ceea3a6fc998e3b44b96679f2db49cd35bdfe0cd08404b4537f3dc25f44","observation_id":"777fd1ba-d746-48d0-8058-35432def5b16","resolution":{"observed_at":"2026-08-07T12:39:16.209941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:15.755021Z","title":"Snapkv: Llm knows what you are looking for before generation,","venue":null,"work_id":"767b6d6e-62cd-4877-aa3e-f3e9035e1a7c","year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:05.026810Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:406900a5423f683806339ff64e93e0d7ae1181c1a4db305d230481d39ce62258","observation_id":"0b2391d7-3bc3-4e6a-9457-1abb8c98786d","resolution":{"observed_at":"2026-08-07T12:39:15.903699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12820","last_updated":"2025-03-30T08:13:50Z","snapshot_observed_at":"2026-07-06T18:48:00.070861Z","submitted_at":"2024-07-01T13:05:42Z","title":"PQCache: Product Quantization-based KVCache for Long Context LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12820","snapshot_observed_at":"2026-08-07T12:39:05.152541Z","title":"Pqcache: Product quantization- based kvcache for long context llm inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:05.152541Z"},"links":{"cited_paper":"/paper/2407.12820","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:13f84c0d400ebbf8e920e739b738797db90aca26a1f9098f6a7bcc57bac59be9","observation_id":"f0d3eeb6-e310-4965-99c8-b85aa2d41096","resolution":{"observed_at":"2026-08-07T12:39:05.152541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-07-06T20:31:17.809419Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02789","snapshot_observed_at":"2026-08-07T12:39:05.263720Z","title":"Speculative prefill: Turbocharging ttft with lightweight and training-free token importance estimation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:05.263720Z"},"links":{"cited_paper":"/paper/2502.02789","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:a98a9c9001cbcabef3525345fb92b17c2894d04cae7484b7a653900687c658d9","observation_id":"68f5277a-7d78-4afb-813e-57c80128c8d0","resolution":{"observed_at":"2026-08-07T12:39:05.263720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T12:39:05.385233Z","title":"Qwen2. 5 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:05.385233Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:282d06a3922ad21c5a878fb5f2d6a17406a863144ac0bbe7deccaba48dfd069e","observation_id":"d099f893-9734-41ba-994f-43a4a313878a","resolution":{"observed_at":"2026-08-07T12:39:05.385233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08892","last_updated":"2024-07-11T23:34:32Z","snapshot_observed_at":"2026-08-05T23:46:03.101237Z","submitted_at":"2024-07-11T23:34:32Z","title":"Characterizing Prompt Compression Methods for Long Context Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08892","snapshot_observed_at":"2026-08-07T12:39:05.504381Z","title":"Characterizing prompt compression methods for long context inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:05.504381Z"},"links":{"cited_paper":"/paper/2407.08892","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:182f1b821a96d943ed2ecdb1c2c961af212f2a64a42ebfb832e994975907c3a2","observation_id":"8fbdeb21-5945-4ade-a74b-dfe82e553374","resolution":{"observed_at":"2026-08-07T12:39:05.504381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17422","last_updated":"2024-09-25T23:14:47Z","snapshot_observed_at":"2026-07-31T19:09:24.701982Z","submitted_at":"2024-09-25T23:14:47Z","title":"Discovering the Gems in Early Layers: Accelerating Long-Context LLMs with 1000x Input Token Reduction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17422","snapshot_observed_at":"2026-08-07T12:39:05.601985Z","title":"Discovering the gems in early layers: Accelerating long-context llms with 1000x input token reduction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:05.601985Z"},"links":{"cited_paper":"/paper/2409.17422","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:73f8b032304faeffe4e28b02dbe86bbf71236f0f1b292aaf195302a15a2b310c","observation_id":"0e17897b-9f3b-4af4-bd78-0b15be0fe53d","resolution":{"observed_at":"2026-08-07T12:39:05.601985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05736","last_updated":"2023-12-06T17:02:25Z","snapshot_observed_at":"2026-08-06T08:38:21.368130Z","submitted_at":"2023-10-09T14:10:21Z","title":"LLMLingua: Compressing Prompts for Accelerated Inference of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05736","snapshot_observed_at":"2026-08-07T12:39:05.729533Z","title":"Llmlingua: Compressing prompts for accelerated inference of large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:05.729533Z"},"links":{"cited_paper":"/paper/2310.05736","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:97671be4391dbfc99cb15a92d5e59ecdedec50679b0c7e670732da00771f4603","observation_id":"7fb1ec33-d153-40f9-9093-18fd3a040d60","resolution":{"observed_at":"2026-08-07T12:39:05.729533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06201","last_updated":"2023-10-09T23:03:24Z","snapshot_observed_at":"2026-08-06T01:26:00.668084Z","submitted_at":"2023-10-09T23:03:24Z","title":"Compressing Context to Enhance Inference Efficiency of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06201","snapshot_observed_at":"2026-08-07T12:39:05.895555Z","title":"Compressing context to enhance inference efficiency of large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:05.895555Z"},"links":{"cited_paper":"/paper/2310.06201","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:f118d6db306394a03304786c3234b22ecc611445c6b6cd86fa3f492271a4e03a","observation_id":"8677bee6-8834-4439-a1f5-446277b5db5b","resolution":{"observed_at":"2026-08-07T12:39:05.895555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01527","last_updated":"2024-10-08T19:34:03Z","snapshot_observed_at":"2026-07-06T18:39:43.472708Z","submitted_at":"2024-07-01T17:59:47Z","title":"KV Cache Compression, But What Must We Give in Return? A Comprehensive Benchmark of Long Context Capable Approaches","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01527","snapshot_observed_at":"2026-08-07T12:39:06.015867Z","title":"Kv cache compression, but what must we give in return? a comprehensive benchmark of long context capable approaches,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:06.015867Z"},"links":{"cited_paper":"/paper/2407.01527","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:bf94dee80e57b764a1152284e0d8073284367f0c2da80d4a6fdc060a1d5e80c6","observation_id":"54ad1def-52a4-41d4-9065-0738cec69d22","resolution":{"observed_at":"2026-08-07T12:39:06.015867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:06.153339Z","title":"Moa: Mix- ture of sparse attention for automatic large language model compression,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:06.153339Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:29e8fb8b136a9e4588855c1258e85962876ba1742e691ad40ee224caf935b2ef","observation_id":"73c9d2ff-0379-4a51-80bc-4a1411f3cd37","resolution":{"observed_at":"2026-08-07T12:39:06.153339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10819","last_updated":"2024-10-14T17:59:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-14T17:59:58Z","title":"DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10819","snapshot_observed_at":"2026-08-07T12:39:06.317237Z","title":"Duoattention: Efficient long-context llm inference with retrieval and streaming heads,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:06.317237Z"},"links":{"cited_paper":"/paper/2410.10819","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:67479cf1b2d76f6e7e6b2c388d32a3e435d028d6af08468576db95311231571b","observation_id":"a9985a76-0204-4317-95d5-3abf1cd66568","resolution":{"observed_at":"2026-08-07T12:39:06.317237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13276","last_updated":"2025-02-17T02:24:47Z","snapshot_observed_at":"2026-08-05T05:19:17.395325Z","submitted_at":"2024-10-17T07:07:09Z","title":"SeerAttention: Learning Intrinsic Sparse Attention in Your LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13276","snapshot_observed_at":"2026-08-07T12:39:06.471625Z","title":"Seerattention: Learning intrinsic sparse attention in your llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:06.471625Z"},"links":{"cited_paper":"/paper/2410.13276","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:54a9f0931f630709e657cc1ff2c76e67f9c4eb09b25b29aea5300ae49341f057","observation_id":"783534c0-5b4b-49b8-bff0-f2b48d7627f8","resolution":{"observed_at":"2026-08-07T12:39:06.471625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11089","last_updated":"2025-02-27T09:01:21Z","snapshot_observed_at":"2026-08-07T14:17:15.942844Z","submitted_at":"2025-02-16T11:53:44Z","title":"Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11089","snapshot_observed_at":"2026-08-07T12:39:06.633344Z","title":"Native sparse attention: Hardware-aligned and natively trainable sparse attention,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:06.633344Z"},"links":{"cited_paper":"/paper/2502.11089","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:840adb258b91943762edd7888a3a2cbe48ff6fdf8f4f40cca370d21966908576","observation_id":"cb1b6144-7239-4bab-a852-bd4d7f9f8a3e","resolution":{"observed_at":"2026-08-07T12:39:06.633344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-08-07T12:39:06.783759Z","title":"Moba: Mixture of block attention for long-context llms,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:06.783759Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:67943a7ad5ac6ce6314c99446733ceb56b29ed3eb3003943e464dec24df1c9b5","observation_id":"52639c41-fccf-42ba-a00f-b3047216356f","resolution":{"observed_at":"2026-08-07T12:39:06.783759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13048","last_updated":"2023-12-11T03:58:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T13:57:41Z","title":"RWKV: Reinventing RNNs for the Transformer Era","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13048","snapshot_observed_at":"2026-08-07T12:39:06.925763Z","title":"Rwkv: Reinventing rnns for the transformer era,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:06.925763Z"},"links":{"cited_paper":"/paper/2305.13048","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:5339ec79939e984e8303cbeb6b93735e829d6cfa47fe81ef9aad09fc0b11352f","observation_id":"122136bc-932d-4d23-a356-0c9231bfa3bc","resolution":{"observed_at":"2026-08-07T12:39:06.925763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06635","last_updated":"2024-08-27T01:27:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-11T18:51:59Z","title":"Gated Linear Attention Transformers with Hardware-Efficient Training","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06635","snapshot_observed_at":"2026-08-07T12:39:07.074760Z","title":"Gated linear attention transformers with hardware- efficient training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:07.074760Z"},"links":{"cited_paper":"/paper/2312.06635","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:e9bdca45b70e42bc871da55bc817a04da433d9c7fc6a876fc45d0d0281ce2d5a","observation_id":"9ffea3ab-fd1e-43dd-ac41-cd4805e84c8e","resolution":{"observed_at":"2026-08-07T12:39:07.074760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:15.426767Z","title":"Mamba: Linear-time sequence modeling with selective state spaces,","venue":null,"work_id":"a375d4b9-795c-4f8f-8af3-e234e73a2d8b","year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:07.195393Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:8116b9f1c9d7d1896886671533e492e69e547949d4e46de94c8842440a690f8c","observation_id":"072a6031-85e0-4157-9026-1e82c3954bfd","resolution":{"observed_at":"2026-08-07T12:39:15.549430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:15.106236Z","title":"Transformers are ssms: generalized models and efficient algorithms through structured state space duality,","venue":null,"work_id":"a46aa87a-3117-4121-91f2-d67f01a8420a","year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:07.353698Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:cba8f5c874d5cc37abb2294ba414d3b8fc2ce0c68e005d96c2ed269e6088be1f","observation_id":"656dcb64-0540-4ede-b338-6e62a40d085d","resolution":{"observed_at":"2026-08-07T12:39:15.233636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04985","last_updated":"2024-09-04T10:04:52Z","snapshot_observed_at":"2026-07-06T16:58:47.790985Z","submitted_at":"2023-12-08T11:47:35Z","title":"SparQ Attention: Bandwidth-Efficient LLM Inference","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04985","snapshot_observed_at":"2026-08-07T12:39:07.482431Z","title":"Sparq attention: Bandwidth- efficient llm inference,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:07.482431Z"},"links":{"cited_paper":"/paper/2312.04985","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:f87598b95b039afcb6dd01d32617c677ca081268aab2151b9d1d2a14263feca7","observation_id":"8094898b-a09f-4271-ac6e-1e47a32bf967","resolution":{"observed_at":"2026-08-07T12:39:07.482431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:14.782342Z","title":"{InfiniGen}: Efficient generative inference of large language models with dynamic {KV} cache management,","venue":null,"work_id":"1e6d3737-a004-48b7-9d9a-552ef1c2a9b7","year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:07.591420Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:45ec977e68ed77b1c9cd4268e644b1cb79ab19362b31e8f21eb2c6a9364cf30f","observation_id":"c1ede19b-d24e-4f37-9da5-4551d0f4b7eb","resolution":{"observed_at":"2026-08-07T12:39:14.895773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:14.620873Z","title":"MagicPIG: LSH sampling for efficient LLM generation,","venue":null,"work_id":"3ce645c7-ffc5-4f2f-985a-8970feb1339c","year":2025},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:07.803444Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:707ea34724e9f845cfc945bedd670970b03f901db7039d6bbbdb44d690d7483a","observation_id":"c8b8f53b-8397-443e-8325-0edc21cec549","resolution":{"observed_at":"2026-08-07T12:39:14.691354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-08-07T09:13:28.333702Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10516","snapshot_observed_at":"2026-08-07T12:39:07.925816Z","title":"Retrievalattention: Accelerating long-context llm inference via vector retrieval,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:07.925816Z"},"links":{"cited_paper":"/paper/2409.10516","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:85beef808c747ab136714cd1aaff2e5ec325f99a599b1470b404f5a0617feee9","observation_id":"421f902d-d766-48e5-9a7c-159250df986e","resolution":{"observed_at":"2026-08-07T12:39:07.925816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:14.460083Z","title":"Scissorhands: Exploiting the persistence of importance hypothesis for llm kv cache compression at test time,","venue":null,"work_id":"cb60c92c-c38e-4cb0-aada-91dce00057d6","year":2023},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:08.057556Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:7830e90171184745b3a3e29ece103ca00ba4ed77e952280b82409837f80bdfcc","observation_id":"05e50e07-b88e-4883-b6a4-fc715debffd4","resolution":{"observed_at":"2026-08-07T12:39:14.514745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01801","last_updated":"2024-10-29T18:26:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T05:17:08Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01801","snapshot_observed_at":"2026-08-07T12:39:08.191015Z","title":"Model tells you what to discard: Adaptive kv cache compression for llms,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:08.191015Z"},"links":{"cited_paper":"/paper/2310.01801","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:8b29dffff2dbf959fa5d2057455a9ea2767555adbba8458e228db894bacfe5b3","observation_id":"815689dc-7de3-4398-8a7d-9d441cf63646","resolution":{"observed_at":"2026-08-07T12:39:08.191015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11430","last_updated":"2024-11-03T09:42:35Z","snapshot_observed_at":"2026-08-07T19:20:38.764086Z","submitted_at":"2024-06-17T11:35:16Z","title":"A Simple and Effective $L_2$ Norm-Based Strategy for KV Cache Compression","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11430","snapshot_observed_at":"2026-08-07T12:39:08.367652Z","title":"A simple and effectivel_2 norm-based strategy for kv cache compression,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:08.367652Z"},"links":{"cited_paper":"/paper/2406.11430","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:4883dfe66a9e679a664a6a01c5848298fa13e212a56f39afc47dc0975013f4d8","observation_id":"dbc3a49e-e94f-44ed-96cd-72c9db4abe33","resolution":{"observed_at":"2026-08-07T12:39:08.367652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:14.313647Z","title":"Cam: Cache merging for memory-efficient llms inference,","venue":null,"work_id":"e6d41042-0f80-44a0-a742-391a2fb04641","year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:08.545492Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:f8653ac932f945c5e736c51305e30eb8350aae1e4b7bc84a8e067643b983b2ff","observation_id":"7771ceee-8c80-42c4-ab8e-5e1c995482d3","resolution":{"observed_at":"2026-08-07T12:39:14.395429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06082","last_updated":"2024-02-08T22:17:40Z","snapshot_observed_at":"2026-08-06T22:51:31.251662Z","submitted_at":"2024-02-08T22:17:40Z","title":"SubGen: Token Generation in Sublinear Time and Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06082","snapshot_observed_at":"2026-08-07T12:39:08.668655Z","title":"Subgen: Token generation in sublinear time and memory,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:08.668655Z"},"links":{"cited_paper":"/paper/2402.06082","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:9ba1926d173b819592612dc41fe9e778ee91eb69fc7c49b4a1d7359f273a3c91","observation_id":"cc45d404-06d6-4b1f-b8bb-d6a0af867bdd","resolution":{"observed_at":"2026-08-07T12:39:08.668655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:14.080301Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness,","venue":null,"work_id":"18232260-0ca2-4942-84e9-0d20f0904f09","year":2022},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:08.838348Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:1915101798434951ad19dc5a9983a355ed8bf1ce5fd23cf7a25f850dfad61055","observation_id":"7d3e88fc-7553-4943-bd0e-8208da72cbd5","resolution":{"observed_at":"2026-08-07T12:39:14.199089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-07T12:39:08.999098Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:08.999098Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:d03d687516be03e564d9441e5640bf77decccd5936e1dcf8f45d87e715bd9b0d","observation_id":"cc81e05c-8df2-4ac4-9c0f-1c127d93a221","resolution":{"observed_at":"2026-08-07T12:39:08.999098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:13.880239Z","title":"Flashattention-3: Fast and accurate attention with asynchrony and low-precision,","venue":null,"work_id":"ec88b74b-e082-41d8-8836-62df04fca373","year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:09.165987Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:c1b492cc087f713e29018a3bd09f479de8e94f6917abb525f92fad35a024a563","observation_id":"0a37b6a5-5f58-4758-9f2b-8da82c070851","resolution":{"observed_at":"2026-08-07T12:39:13.945945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10480","last_updated":"2025-01-14T05:00:34Z","snapshot_observed_at":"2026-08-01T17:48:06.147538Z","submitted_at":"2024-05-17T00:52:39Z","title":"Lean Attention: Hardware-Aware Scalable Attention Mechanism for the Decode-Phase of Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10480","snapshot_observed_at":"2026-08-07T12:39:09.239572Z","title":"Lean attention: Hardware-aware scalable attention mechanism for the decode-phase of transformers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:09.239572Z"},"links":{"cited_paper":"/paper/2405.10480","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:4ad51db6f7e724cdf85d90965f5cdc3cf9794130b02b1dccd3d2ccc1bf0b67bd","observation_id":"d15aa6d2-c9ba-4662-8b4f-9464d76ad745","resolution":{"observed_at":"2026-08-07T12:39:09.239572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:09.376740Z","title":"Sageattention2 technical report: Accurate 4 bit attention for plug-and-play inference acceleration,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:09.376740Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:732e11bc7938844f8e95e7ba8555a7de84fb2ec2900bd9cb290c208a31442c5c","observation_id":"b210d8f7-8e27-4561-b883-0e2d0f162c3c","resolution":{"observed_at":"2026-08-07T12:39:09.376740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:13.716477Z","title":"Sageattention: Accurate 8-bit attention for plug-and-play inference acceleration,","venue":null,"work_id":"9922390a-f7bc-4c35-9201-ec4f34b6af87","year":2025},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:09.493235Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:59f4449630c1c5fdc0d79bc6010c1595798b6976665b3735158552b01232ba0e","observation_id":"fb3fe215-278a-4b2a-a516-3d74a2c82088","resolution":{"observed_at":"2026-08-07T12:39:13.794860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:13.486079Z","title":"Triton: an intermediate language and compiler for tiled neural network computations,","venue":null,"work_id":"f747ba6f-7a11-4c36-afe9-e35e0e43d490","year":2019},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:09.618175Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:cd1e961308849c020fbff7e1fd9e4c47f541de159bf0cddeed861119f91793a3","observation_id":"0a3992ac-f256-4aa1-87be-50971fe84b26","resolution":{"observed_at":"2026-08-07T12:39:13.573170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:13.162496Z","title":"Transformers: State-of-the-art natural language processing,","venue":null,"work_id":"8424353c-fc10-43ee-bb3a-bbef445c2dc3","year":2020},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:09.724622Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:13fa96f8bede3eb2c91eced69fdd88754883812b54bd87f0e121b98615c9bd78","observation_id":"b2475b7e-d19d-470d-bab2-1864008f8952","resolution":{"observed_at":"2026-08-07T12:39:13.287003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-07T12:39:09.826529Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:09.826529Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:46b80590c8648501ec52a04eea21cc23ac9efcc40474805c5676c08752c021d3","observation_id":"b7f2c074-e5c4-4711-9955-6e96db117fca","resolution":{"observed_at":"2026-08-07T12:39:09.826529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03294","last_updated":"2024-03-31T21:11:08Z","snapshot_observed_at":"2026-08-07T06:18:54.374420Z","submitted_at":"2023-10-05T03:47:57Z","title":"DISTFLASHATTN: Distributed Memory-efficient Attention for Long-context LLMs Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03294","snapshot_observed_at":"2026-08-07T12:39:09.890077Z","title":"Distflashattn: Distributed memory-efficient attention for long-context llms training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:09.890077Z"},"links":{"cited_paper":"/paper/2310.03294","citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:14721defc69776b139ddf3ad1ba39f1da3855be8e77eb7d369aea565ec246eab","observation_id":"b44475d5-4d5b-4b6a-aa3b-fe28cae2bbc4","resolution":{"observed_at":"2026-08-07T12:39:09.890077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:12.874287Z","title":"LongBench: A bilingual, multitask benchmark for long context understanding,","venue":null,"work_id":"4ca06036-71ff-4bc0-b295-695ac05b7ab2","year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:09.973087Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:9cb3d2042b62dcfa977812c05479c842f2464a366ad90bffbbb9df702aaf9134","observation_id":"3b2b6213-5e68-4e18-8bb8-1ed454617470","resolution":{"observed_at":"2026-08-07T12:39:12.976678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:12.545602Z","title":"∞bench: Extending long context evaluation beyond 100k tokens,","venue":null,"work_id":"81e9d330-b412-46cc-8579-5546633660f1","year":2024},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:10.082023Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:abbd9c519a740c6ef9a519a4390fe7b1375eee360f2d87b6476858c23fbc5d03","observation_id":"01963edd-4a23-4919-b6cd-d2123191a12a","resolution":{"observed_at":"2026-08-07T12:39:12.732486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:12.345939Z","title":"Needle in a haystack - pressure testing llms,","venue":null,"work_id":"ce2819f5-b6cb-4049-834f-fddc8d2a476b","year":2023},"citing_paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:10.193536Z"},"links":{"citing_paper":"/paper/2505.24179"},"observation_digest":"sha256:a9da9fb22aed385f70fd91bbd4b72cdc07b7a66e3251796751c4f2a915876585","observation_id":"a29cb238-8b36-448d-a202-e4a809b09dea","resolution":{"observed_at":"2026-08-07T12:39:12.426025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24179","last_updated":"2025-05-30T03:40:24Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T12:28:26.705118Z","submitted_at":"2025-05-30T03:40:24Z","title":"SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":1,"verified_fuzzy":33},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 0 inbound Pith citation observations for arXiv:2505.24179."}