{"as_of":"2026-08-11T11:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1912f21cd8226e4597e3d84874c3f8276ac339d60ebcd62d85ebb4341c6eef89","coverage":[{"denominator":78,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":78,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:06:32.755775Z","state":"measured"},{"denominator":90,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":90,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:11:48.900029Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T13:36:59.523914Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"cited_work":{"arxiv_id":"2506.08889","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08889","snapshot_observed_at":"2026-07-02T13:36:59.523914Z","title":"Seerattention-r: Sparse attention adaptation for long reasoning","venue":null,"work_id":"5cd68498-f613-4fa1-a51f-eae46c0c6d2d","year":2025},"citing_paper":{"arxiv_id":"2510.09883","last_updated":"2026-05-02T01:10:22Z","snapshot_observed_at":"2026-08-02T19:55:25.209109Z","submitted_at":"2025-10-10T21:37:49Z","title":"DELTA: Dynamic Layer-Aware Token Attention for Efficient Long-Context Reasoning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T07:25:56.953876Z"},"links":{"cited_paper":"/paper/2506.08889","citing_paper":"/paper/2510.09883"},"observation_digest":"sha256:fef09452bccde1b82ae66459d58988d5dc7f9d3d345d1822c28cecfd3d3c8dbf","observation_id":"9efce4c6-ac26-4d67-b107-bec22e6a9b2e","resolution":{"observed_at":"2026-05-18T07:26:02.860786Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"cited_work":{"arxiv_id":"2506.08889","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08889","snapshot_observed_at":"2026-07-02T13:36:59.523914Z","title":"Seerattention-r: Sparse attention adaptation for long reasoning","venue":null,"work_id":"5cd68498-f613-4fa1-a51f-eae46c0c6d2d","year":2025},"citing_paper":{"arxiv_id":"2512.12087","last_updated":"2026-04-28T06:58:25Z","snapshot_observed_at":"2026-07-06T22:38:54.914862Z","submitted_at":"2025-12-12T23:30:43Z","title":"BLASST: Dynamic BLocked Attention Sparsity via Softmax Thresholding","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T22:20:53.856657Z"},"links":{"cited_paper":"/paper/2506.08889","citing_paper":"/paper/2512.12087"},"observation_digest":"sha256:aaaefc515431221826c0f24b959148fe28cc88c0d4f9278304abd57106681066","observation_id":"b4a83254-06b0-4481-9dd6-7cc3af0c7330","resolution":{"observed_at":"2026-05-16T22:21:18.608942Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"cited_work":{"arxiv_id":"2506.08889","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08889","snapshot_observed_at":"2026-07-02T13:36:59.523914Z","title":"Seerattention-r: Sparse attention adaptation for long reasoning","venue":null,"work_id":"5cd68498-f613-4fa1-a51f-eae46c0c6d2d","year":2025},"citing_paper":{"arxiv_id":"2603.29002","last_updated":"2026-05-30T00:45:53Z","snapshot_observed_at":"2026-08-11T01:56:08.452383Z","submitted_at":"2026-03-30T21:03:39Z","title":"Understand and Accelerate Memory Processing Pipeline for Large Language Model Inference","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-14T00:25:49.807277Z"},"links":{"cited_paper":"/paper/2506.08889","citing_paper":"/paper/2603.29002"},"observation_digest":"sha256:1b450321585514f2152f02652fedcc3b6fd2cb1b130db4d1418603b5cba96176","observation_id":"1e34d13a-9f28-459a-b6b1-af2ff9ee8997","resolution":{"observed_at":"2026-05-14T00:28:29.860253Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"cited_work":{"arxiv_id":"2506.08889","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08889","snapshot_observed_at":"2026-07-02T13:36:59.523914Z","title":"Seerattention-r: Sparse attention adaptation for long reasoning","venue":null,"work_id":"5cd68498-f613-4fa1-a51f-eae46c0c6d2d","year":2025},"citing_paper":{"arxiv_id":"2604.14922","last_updated":"2026-04-16T12:06:59Z","snapshot_observed_at":"2026-08-11T06:42:04.240807Z","submitted_at":"2026-04-16T12:06:59Z","title":"LongAct: Harnessing Intrinsic Activation Patterns for Long-Context Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-10T11:17:43.769244Z"},"links":{"cited_paper":"/paper/2506.08889","citing_paper":"/paper/2604.14922"},"observation_digest":"sha256:4b66b44137cdbfeed283bf72ff1ea2d4d7115b07700df66ab9dab2b5fe76c849","observation_id":"3772f3b3-2b63-4da8-a594-fef652386ee2","resolution":{"observed_at":"2026-05-10T11:20:10.553722Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"cited_work":{"arxiv_id":"2506.08889","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08889","snapshot_observed_at":"2026-07-02T13:36:59.523914Z","title":"Seerattention-r: Sparse attention adaptation for long reasoning","venue":null,"work_id":"5cd68498-f613-4fa1-a51f-eae46c0c6d2d","year":2025},"citing_paper":{"arxiv_id":"2604.26837","last_updated":"2026-04-29T16:02:00Z","snapshot_observed_at":"2026-08-11T10:04:20.893138Z","submitted_at":"2026-04-29T16:02:00Z","title":"Unifying Sparse Attention with Hierarchical Memory for Scalable Long-Context LLM Serving","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-07T13:15:21.201950Z"},"links":{"cited_paper":"/paper/2506.08889","citing_paper":"/paper/2604.26837"},"observation_digest":"sha256:77399745d54a8babbf14c6a75f10eb3cb98ec2ce5c6c89c47d1505c9de462ddd","observation_id":"7e737445-b0fd-423c-8c2c-b47f79990846","resolution":{"observed_at":"2026-05-12T09:01:25.896526Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"cited_work":{"arxiv_id":"2506.08889","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08889","snapshot_observed_at":"2026-07-02T13:36:59.523914Z","title":"Seerattention-r: Sparse attention adaptation for long reasoning","venue":null,"work_id":"5cd68498-f613-4fa1-a51f-eae46c0c6d2d","year":2025},"citing_paper":{"arxiv_id":"2605.07719","last_updated":"2026-05-08T13:24:39Z","snapshot_observed_at":"2026-07-31T02:35:55.019423Z","submitted_at":"2026-05-08T13:24:39Z","title":"An Efficient Hybrid Sparse Attention with CPU-GPU Parallelism for Long-Context Inference","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-11T02:56:28.828593Z"},"links":{"cited_paper":"/paper/2506.08889","citing_paper":"/paper/2605.07719"},"observation_digest":"sha256:9da5592af711d0c1f9431ac7f0e7ca899503d6e29f8fa82fa8e709cf69328817","observation_id":"ea5e97a0-7941-4c73-84d0-4223c643f029","resolution":{"observed_at":"2026-05-11T03:05:54.140296Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"cited_work":{"arxiv_id":"2506.08889","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08889","snapshot_observed_at":"2026-07-02T13:36:59.523914Z","title":"Seerattention-r: Sparse attention adaptation for long reasoning","venue":null,"work_id":"5cd68498-f613-4fa1-a51f-eae46c0c6d2d","year":2025},"citing_paper":{"arxiv_id":"2605.09649","last_updated":"2026-05-10T16:47:50Z","snapshot_observed_at":"2026-07-06T23:21:44.900680Z","submitted_at":"2026-05-10T16:47:50Z","title":"Make Each Token Count: Towards Improving Long-Context Performance with KV Cache Eviction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T05:02:25.513351Z"},"links":{"cited_paper":"/paper/2506.08889","citing_paper":"/paper/2605.09649"},"observation_digest":"sha256:ada4df7bfd0bbc291a8f0b600c2a1bea83afe6e9524e2f4bde5d59b30d53be4e","observation_id":"4e375f8d-a619-4f26-8b6a-d8c8893f666e","resolution":{"observed_at":"2026-05-12T05:41:26.703884Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"cited_work":{"arxiv_id":"2506.08889","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08889","snapshot_observed_at":"2026-07-02T13:36:59.523914Z","title":"Seerattention-r: Sparse attention adaptation for long reasoning","venue":null,"work_id":"5cd68498-f613-4fa1-a51f-eae46c0c6d2d","year":2025},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-02T11:52:59.734226Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"cited_paper":"/paper/2506.08889","citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:b8169f1b7e3a2198b32e98ea9bc057343e576b11571e2ad59f703b48894fc4b6","observation_id":"015213c6-84eb-4fbb-bb4f-1b04d4a97998","resolution":{"observed_at":"2026-05-20T10:53:13.586873Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"cited_work":{"arxiv_id":"2506.08889","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08889","snapshot_observed_at":"2026-07-02T13:36:59.523914Z","title":"Seerattention-r: Sparse attention adaptation for long reasoning","venue":null,"work_id":"5cd68498-f613-4fa1-a51f-eae46c0c6d2d","year":2025},"citing_paper":{"arxiv_id":"2606.06467","last_updated":"2026-06-04T17:54:04Z","snapshot_observed_at":"2026-08-08T09:09:14.963315Z","submitted_at":"2026-06-04T17:54:04Z","title":"You Only Index Once: Cross-Layer Sparse Attention with Shared Routing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T01:06:04.896501Z"},"links":{"cited_paper":"/paper/2506.08889","citing_paper":"/paper/2606.06467"},"observation_digest":"sha256:37abbbf43bc42c2b6ebb0778d00321bd4be1ef84054f82000de4b910f149e185","observation_id":"25b2bac7-6670-42dc-a6cd-e008de0a2d35","resolution":{"observed_at":"2026-07-02T13:36:59.525347Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08889","snapshot_observed_at":"2026-07-31T11:04:04.584216Z","title":"arXiv preprint arXiv:2506.08889 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24593","last_updated":"2026-07-27T15:58:07Z","snapshot_observed_at":"2026-08-04T16:51:01.691381Z","submitted_at":"2026-07-27T15:58:07Z","title":"PIVOT: Efficient Query-Group Indexing for Token-Level Sparse Attention","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-31T11:04:04.584216Z"},"links":{"cited_paper":"/paper/2506.08889","citing_paper":"/paper/2607.24593"},"observation_digest":"sha256:4642d34c9176daa277c96ed05194c0073e79de7de82e93c868a838e94458ce57","observation_id":"5ee18d25-c704-4b04-9543-64c33b112150","resolution":{"observed_at":"2026-07-31T11:04:04.584216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08889","snapshot_observed_at":"2026-08-04T13:43:53.318889Z","title":"arXiv preprint arXiv:2506.08889 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02150","last_updated":"2026-08-05T06:57:37Z","snapshot_observed_at":"2026-08-09T07:46:30.048448Z","submitted_at":"2026-08-03T12:34:31Z","title":"PhyCheck: Fine-Grained Evidence-Grounded Dataset for Physical Law Understanding in Video-LLMs","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T13:43:53.318889Z"},"links":{"cited_paper":"/paper/2506.08889","citing_paper":"/paper/2608.02150"},"observation_digest":"sha256:94fa604e71193b9bac3423b7353f7c333731b32c3c6a6a796cdf9713dfe75d7b","observation_id":"dac1432e-871b-4332-b81a-15b0cca4a735","resolution":{"observed_at":"2026-08-04T13:43:53.318889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08889","snapshot_observed_at":"2026-08-07T00:11:48.900029Z","title":"arXiv preprint arXiv:2506.08889 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02150","last_updated":"2026-08-05T06:57:37Z","snapshot_observed_at":"2026-08-09T07:46:30.048448Z","submitted_at":"2026-08-03T12:34:31Z","title":"PhyCheck: Fine-Grained Evidence-Grounded Dataset for Physical Law Understanding in Video-LLMs","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T00:11:48.900029Z"},"links":{"cited_paper":"/paper/2506.08889","citing_paper":"/paper/2608.02150"},"observation_digest":"sha256:69a8a959dfc39c412c2f7c367cb0b0e29014bbb6344e914ddd273a1cb0b566bd","observation_id":"5ba11f5f-1fb7-44d2-be6d-de0d04b20416","resolution":{"observed_at":"2026-08-07T00:11:48.900029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.08889/citation-record","integrity":"/paper/2506.08889/integrity","json":"/paper/2506.08889/citation-record.json","paper":"/paper/2506.08889"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:33.678067Z","title":"URLhttps://github.com/tile-ai/tilelang","venue":null,"work_id":"a1f8d374-2dd8-4b39-872c-e69be4aba4fd","year":null},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.546420Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:655ca7ae79a7ffc8502c71dc3559862789b754407f88e2d18f4ce5e1df96101b","observation_id":"603767e6-da74-41e3-9625-00bbc598aeab","resolution":{"observed_at":"2026-08-07T05:06:33.702936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:33.628253Z","title":"Keyformer: Kv cache reduction through key tokens selection for efficient generative inference.Proceedings of Machine Learning and Systems, 6:114–127, 2024","venue":null,"work_id":"61bae224-b9f6-4424-8ee6-de7fe068a3b1","year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.550117Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:23708fef664d076a46fe543288000f1651cd80faeeced5a7b501dc7d8fb5497b","observation_id":"3fca4ecb-e378-4f01-908d-ef2b18764eae","resolution":{"observed_at":"2026-08-07T05:06:33.644684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-07T05:06:32.553125Z","title":"Gqa: Training generalized multi-query transformer models from multi-head checkpoints.arXiv preprint arXiv:2305.13245, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.553125Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:85f4eed11f94390f6cef1a4b82a5bf59a4863cab0a704461792f6cfd60417cdc","observation_id":"7f5078a8-1d1e-4198-979f-7049585bdb4c","resolution":{"observed_at":"2026-08-07T05:06:32.553125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04517","last_updated":"2024-12-06T15:42:07Z","snapshot_observed_at":"2026-08-07T15:21:45.322877Z","submitted_at":"2024-05-07T17:50:21Z","title":"xLSTM: Extended Long Short-Term Memory","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04517","snapshot_observed_at":"2026-08-07T05:06:32.556320Z","title":"xlstm: Extended long short-term memory.arXiv preprint arXiv:2405.04517, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.556320Z"},"links":{"cited_paper":"/paper/2405.04517","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:4f48d2f58d0a93c1730e6759473ca02b139f7f44c8f490b3a82ac28617e96c10","observation_id":"283fb409-0322-4c71-9453-dd78c3e8b1cb","resolution":{"observed_at":"2026-08-07T05:06:32.556320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14051","last_updated":"2025-08-13T17:55:58Z","snapshot_observed_at":"2026-08-11T00:54:58.705708Z","submitted_at":"2025-02-19T19:12:46Z","title":"RocketKV: Accelerating Long-Context LLM Inference via Two-Stage KV Cache Compression","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14051","snapshot_observed_at":"2026-08-07T05:06:32.559683Z","title":"Rocketkv: Accelerating long-context llm inference via two-stage kv cache compression.arXiv preprint arXiv:2502.14051, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.559683Z"},"links":{"cited_paper":"/paper/2502.14051","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:b745157384b2a8fcfb040cbaaa94734b97c401b686d3228b12ca4e033d52be61","observation_id":"09743327-ca1d-4c10-b8f3-6af12b746a81","resolution":{"observed_at":"2026-08-07T05:06:32.559683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-07T05:06:32.563190Z","title":"Longformer: The long-document transformer","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.563190Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:696042768bfc56b77f14567f9f3d44d33093cf87992781adb8c216267d34a540","observation_id":"6000f946-9a71-4274-9b21-340fc650a4f6","resolution":{"observed_at":"2026-08-07T05:06:32.563190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:33.594310Z","title":"Reducing transformer key-value cache size with cross-layer attention","venue":null,"work_id":"d7e88efd-b770-4b50-b20a-30725e58fe7c","year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.566599Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:a69981632b2b91906ba21d513315b132b38fe44f399a5addeec38e7048dde840","observation_id":"0181f93e-8425-4ed1-a1f6-06a70775a97f","resolution":{"observed_at":"2026-08-07T05:06:33.609507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:32.569593Z","title":"R-kv: Redundancy-aware kv cache compression for training-free reasoning models acceleration.arXiv preprint arXiv:2505.24133, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.569593Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:a6061cacd9bc5b43e67e9e38488dd1f4f642b2a555849f3fa023f10127020f43","observation_id":"4815cf23-38f5-4b5a-ba4e-31639b59f255","resolution":{"observed_at":"2026-08-07T05:06:32.569593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12094","last_updated":"2025-06-02T11:46:43Z","snapshot_observed_at":"2026-08-10T07:43:34.982470Z","submitted_at":"2024-12-16T18:58:57Z","title":"SepLLM: Accelerate Large Language Models by Compressing One Segment into One Separator","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12094","snapshot_observed_at":"2026-08-07T05:06:32.572234Z","title":"Sepllm: Accelerate large language models by compressing one segment into one separator.arXiv preprint arXiv:2412.12094, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.572234Z"},"links":{"cited_paper":"/paper/2412.12094","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:57cd72fdde81b312b736b0629b47f4547bd4028279db6d387621a3cb5a6bc610","observation_id":"8f496848-d855-4471-8142-2c892c297b6b","resolution":{"observed_at":"2026-08-07T05:06:32.572234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02922","last_updated":"2026-04-27T10:13:35Z","snapshot_observed_at":"2026-08-02T06:23:14.961990Z","submitted_at":"2025-05-05T18:01:17Z","title":"RetroInfer: A Vector Storage Engine for Scalable Long-Context LLM Inference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02922","snapshot_observed_at":"2026-08-07T05:06:32.575162Z","title":"Retroinfer: A vector-storage approach for scalable long-context llm inference, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.575162Z"},"links":{"cited_paper":"/paper/2505.02922","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:983be678932e3ca221a93e9ac97f0cbbcad699feb0fbef83ec96b22d5ddeb9cb","observation_id":"44a057aa-bae1-493a-bc57-03ec9dab8d18","resolution":{"observed_at":"2026-08-07T05:06:32.575162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16179","last_updated":"2024-12-18T17:36:36Z","snapshot_observed_at":"2026-08-10T11:58:24.979199Z","submitted_at":"2024-10-21T16:44:51Z","title":"MagicPIG: LSH Sampling for Efficient LLM Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16179","snapshot_observed_at":"2026-08-07T05:06:32.577962Z","title":"Magicpig: Lsh sampling for efficient llm generation.arXiv preprint arXiv:2410.16179, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.577962Z"},"links":{"cited_paper":"/paper/2410.16179","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:69c43e95731a9ecb413fd96b134ff10095f537a99285dfb10ffc5628e8d77e26","observation_id":"bfb725fa-9e3e-45ef-80a5-30ddc1b6c7da","resolution":{"observed_at":"2026-08-07T05:06:32.577962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:33.558150Z","title":"PipeThreader: Software-defined pipelining for efficient dnn execution","venue":null,"work_id":"70e4dba4-9cd3-48de-b824-a238fc1cfcf1","year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.580743Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:9ea479cd1e48cc982163d8ad4a41ae3904255f28ace34b43d81f5e32346581f4","observation_id":"2bf6d40a-4219-422e-b3fc-64ba19b1d892","resolution":{"observed_at":"2026-08-07T05:06:33.570272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-09T19:46:04.857927Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-07T05:06:32.583149Z","title":"Generating long sequences with sparse transformers.arXiv preprint arXiv:1904.10509, 2019","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.583149Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:15d6f7a9de2c968be6f33a5396fd079218bfd1886521aad295ffe5f1e90eab5e","observation_id":"3abc9a08-dfa0-4a4e-b361-d1f14374e254","resolution":{"observed_at":"2026-08-07T05:06:32.583149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-07T05:06:32.585847Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.585847Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:91a48562590de099796b588d67e370f813bbaa3cf08129be55b91393533664a8","observation_id":"8673676c-8c53-4f7c-a57a-84f2dca653bf","resolution":{"observed_at":"2026-08-07T05:06:32.585847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21060","snapshot_observed_at":"2026-08-07T05:06:32.588405Z","title":"Transformers are ssms: Generalized models and efficient algorithms through structured state space duality.arXiv preprint arXiv:2405.21060, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.588405Z"},"links":{"cited_paper":"/paper/2405.21060","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:4db88f51bcecae9fa16c36bfe281ba64d2594854c0b7abe1ab8fbcb1889abd2d","observation_id":"97b6ae02-56b1-4b19-9cf1-daf8bc52f13f","resolution":{"observed_at":"2026-08-07T05:06:32.588405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-02T12:55:25.835610Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-07T05:06:32.591124Z","title":"Hymba: A hybrid-head architecture for small language models.arXiv preprint arXiv:2411.13676, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.591124Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:43cb4c624d1ebd15110f8d18b14f550736f91177b230d632b5759274c721d8f9","observation_id":"5d536d28-56ee-48fd-98f7-a858af3525ea","resolution":{"observed_at":"2026-08-07T05:06:32.591124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:32.594106Z","title":"Open r1: A fully open reproduction of deepseek-r1, January 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.594106Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:7205857328a5fca9b85ad2366bf2508aeb3462b6f0a7ad7f6e51d2034f13a21f","observation_id":"e4e97183-6acd-47af-9892-7ea5a68e7b7b","resolution":{"observed_at":"2026-08-07T05:06:32.594106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:32.596786Z","title":"Moa: Mixture of sparse attention for automatic large language model compression.arXiv preprint arXiv:2406.14909, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.596786Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:30ac0777921259701b844aa66784d45a0b2df39cc91fed4bfa287b0c083be1a2","observation_id":"ec087002-3424-487c-802c-c6f20a8d8573","resolution":{"observed_at":"2026-08-07T05:06:32.596786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13276","last_updated":"2025-02-17T02:24:47Z","snapshot_observed_at":"2026-08-05T05:19:17.395325Z","submitted_at":"2024-10-17T07:07:09Z","title":"SeerAttention: Learning Intrinsic Sparse Attention in Your LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13276","snapshot_observed_at":"2026-08-07T05:06:32.599244Z","title":"Seerattention: Learning intrinsic sparse attention in your llms.arXiv preprint arXiv:2410.13276, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.599244Z"},"links":{"cited_paper":"/paper/2410.13276","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:717888f15793854f0d355ef0360da5f23727425ffa6883455ea86a5b3146b54a","observation_id":"59d96b03-d758-480d-8dea-c50af189e0f7","resolution":{"observed_at":"2026-08-07T05:06:32.599244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01801","last_updated":"2024-10-29T18:26:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T05:17:08Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01801","snapshot_observed_at":"2026-08-07T05:06:32.602023Z","title":"Model tells you what to discard: Adaptive kv cache compression for llms.arXiv preprint arXiv:2310.01801, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.602023Z"},"links":{"cited_paper":"/paper/2310.01801","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:cf3c6a3e9319592044e1e9d2bd291925d7b65c33b970f7e4f67da627def3f916","observation_id":"6574c471-194b-4c87-9736-87f3e24d4f67","resolution":{"observed_at":"2026-08-07T05:06:32.602023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19737","last_updated":"2024-04-30T17:33:57Z","snapshot_observed_at":"2026-08-11T07:49:29.158475Z","submitted_at":"2024-04-30T17:33:57Z","title":"Better & Faster Large Language Models via Multi-token Prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19737","snapshot_observed_at":"2026-08-07T05:06:32.604608Z","title":"Better & faster large language models via multi-token prediction.arXiv preprint arXiv:2404.19737, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.604608Z"},"links":{"cited_paper":"/paper/2404.19737","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:66f6fe597b4fe867ff008537b50e79002f2839f89f254021c68bbfd32e9d646b","observation_id":"f3700472-5d13-4c40-a724-ad7110675c01","resolution":{"observed_at":"2026-08-07T05:06:32.604608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-07T05:06:32.607376Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.607376Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:f105d9c2e2504e5cbd3ebd391c7bf5ce304bb4189a02eee6f33e9bc4a285b14d","observation_id":"3d1573ba-6df3-4109-8a22-a7c0cb30fbfb","resolution":{"observed_at":"2026-08-07T05:06:32.607376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T05:06:32.610150Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.610150Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:acbdb0a5c0f3b0513161c571e3f09931d9f84a87af30931bec29d6fba9742387","observation_id":"9fafa75e-6103-4783-8a4f-1d254ddb0115","resolution":{"observed_at":"2026-08-07T05:06:32.610150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:33.530852Z","title":"Omnikv: Dynamic context selection for efficient long-context llms","venue":null,"work_id":"e588d6ce-1e14-48d6-a9c9-7cc8b00b0396","year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.612606Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:5e60b1ed04f9117c15704fe9175cc5d0db6c7b1b7552118f538dc37507f4f748","observation_id":"f224880f-aba3-45d4-b743-5c6e89313233","resolution":{"observed_at":"2026-08-07T05:06:33.538895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-10T12:35:09.020030Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T05:06:32.615350Z","title":"Measuring massive multitask language understanding.arXiv preprint arXiv:2009.03300, 2020","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.615350Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:7459de0e2b6c791464b93b605b7d2f02d6afa7416c9996078194b1e8f394340d","observation_id":"26d5b8c7-b6ca-4bdb-b8bb-248d491e1837","resolution":{"observed_at":"2026-08-07T05:06:32.615350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:32.618100Z","title":"Squeezed attention: Accelerating long context length llm inference.arXiv preprint arXiv:2411.09688, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.618100Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:96a84e5abe929856796eeed674fa758c8fb8f419adedd661b7de8b73c4c496b8","observation_id":"a125b793-69f1-4931-b3c5-c781c13f3bc4","resolution":{"observed_at":"2026-08-07T05:06:32.618100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11147","last_updated":"2025-05-30T11:43:48Z","snapshot_observed_at":"2026-08-07T18:14:42.386201Z","submitted_at":"2025-02-16T14:28:52Z","title":"RaaS: Reasoning-Aware Attention Sparsity for Efficient LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11147","snapshot_observed_at":"2026-08-07T05:06:32.620481Z","title":"Efficient long-decoding inference with reasoning-aware attention sparsity.arXiv preprint arXiv:2502.11147, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.620481Z"},"links":{"cited_paper":"/paper/2502.11147","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:aebb71256c3def1434433b6a78a278538377f9209620ec75b750669841c51835","observation_id":"e30bed75-7a91-4ce3-afde-a4304d5cc93a","resolution":{"observed_at":"2026-08-07T05:06:32.620481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T05:06:32.622907Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.622907Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:74dfd42b015b8d4063d326b484c650e5fa865856595ebb8abcb84d5a1cc41c3a","observation_id":"f630c6ae-6e46-4b5c-bb03-cf706b18b457","resolution":{"observed_at":"2026-08-07T05:06:32.622907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-08-07T20:59:29.819833Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-08-07T05:06:32.625484Z","title":"Minference 1.0: Accelerating pre-filling for long-context llms via dynamic sparse attention.arXiv preprint arXiv:2407.02490, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.625484Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:46881d22e76ab90f744c53c0e627d60aa9d30dc4c48b0177ec70b6baa72ecb60","observation_id":"4999cafd-4f82-4a86-8e13-90bd51e734a5","resolution":{"observed_at":"2026-08-07T05:06:32.625484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:33.508595Z","title":"Kullback-leibler divergence","venue":null,"work_id":"3eee1cd5-3a47-49d9-800f-b9cf0f0a10f0","year":2011},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.628140Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:228e903fa925b8bb58b602d1948a163b395781a2cd9b34a5e712efbb4eea9491","observation_id":"e755f89d-3c32-44d1-89a3-42874f1b507c","resolution":{"observed_at":"2026-08-07T05:06:33.518944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:32.630511Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.630511Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:5b99ec677e408130a1cd58fd8bd136b588a546419a9fdcd1a1434f9f2d4114ec","observation_id":"6ebb34e9-7d68-4134-a99f-d5fbb211f785","resolution":{"observed_at":"2026-08-07T05:06:32.630511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:32.632901Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.632901Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:de0aad432c6ce4a5d584802a1b4d3978921e73dd09ed3c82e921140a1fbaa46d","observation_id":"bcbff325-2586-45a4-86c8-cc1488914b75","resolution":{"observed_at":"2026-08-07T05:06:32.632901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20766","last_updated":"2025-02-28T06:34:53Z","snapshot_observed_at":"2026-08-07T17:40:46.337382Z","submitted_at":"2025-02-28T06:34:53Z","title":"FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20766","snapshot_observed_at":"2026-08-07T05:06:32.635500Z","title":"Flexprefill: A context- aware sparse attention mechanism for efficient long-sequence inference.arXiv preprint arXiv:2502.20766, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.635500Z"},"links":{"cited_paper":"/paper/2502.20766","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:f69f6b75b0f2f1dbaf31805b1fa3a6713ea42d6ac0ab125bfcd6f5440b9d9c2a","observation_id":"94ff5f04-9d57-4434-b600-a547ef219e7c","resolution":{"observed_at":"2026-08-07T05:06:32.635500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:32.637982Z","title":"Fast inference from transformers via speculative decoding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.637982Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:11592dbb60560a39ca4ccdf9fe36ee6ca138507972b98b933a36aec241a45a6c","observation_id":"7879778f-56b8-4abc-885c-8df83eb59889","resolution":{"observed_at":"2026-08-07T05:06:32.637982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-07T05:06:32.640407Z","title":"Minimax-01: Scaling foundation models with lightning attention.arXiv preprint arXiv:2501.08313, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.640407Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:0cc6ff1e176b811d99b349163ab9177f3d8d76f644d7d24a6fba2d0b4f4d3145","observation_id":"67473948-fa99-448e-bea7-ef575a77dd23","resolution":{"observed_at":"2026-08-07T05:06:32.640407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-06T07:50:40.568356Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10319","snapshot_observed_at":"2026-08-07T05:06:32.642988Z","title":"Scbench: A kv cache-centric analysis of long-context methods.arXiv preprint arXiv:2412.10319, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.642988Z"},"links":{"cited_paper":"/paper/2412.10319","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:8f63a400f3cbdb8de20b592b1f396b2bad84ae14823f77f0f6d7794fb35339ed","observation_id":"1d7ae517-d409-4357-b5c4-6d3b18cdd479","resolution":{"observed_at":"2026-08-07T05:06:32.642988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:32.645647Z","title":"Snapkv: Llm knows what you are looking for before generation.Advances in Neural Information Processing Systems, 37:22947–22970, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.645647Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:00ff11e0ea54e865aebb2a6d4d3772f0c26213213bcba03a7b54f3ee989f5b7f","observation_id":"03f08edf-0805-4bd4-9d62-5ae7f5e8cf61","resolution":{"observed_at":"2026-08-07T05:06:32.645647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:32.648079Z","title":"Twilight: Adaptive attention sparsity with hierarchical top- p pruning.arXiv preprint arXiv:2502.02770, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.648079Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:a689d2fd3e0c1be4693df3d0e749d0b1b203172a7634bc0aeefaa40a70e211ff","observation_id":"f3838f42-b8e1-41e0-8dfb-6e1323801559","resolution":{"observed_at":"2026-08-07T05:06:32.648079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06949","last_updated":"2025-08-11T19:43:22Z","snapshot_observed_at":"2026-08-07T16:07:09.405454Z","submitted_at":"2025-04-09T14:57:55Z","title":"Adaptive Computation Pruning for the Forgetting Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06949","snapshot_observed_at":"2026-08-07T05:06:32.650507Z","title":"Adaptive computation pruning for the forgetting transformer.arXiv preprint arXiv:2504.06949, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.650507Z"},"links":{"cited_paper":"/paper/2504.06949","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:cd321a7003fe8fbb74be995c89acafcb3bf865c0fc458d9e06eb0d952d5470c4","observation_id":"babc598e-3810-4f5a-bff9-881b61898fe8","resolution":{"observed_at":"2026-08-07T05:06:32.650507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-07T05:06:32.652878Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model.arXiv preprint arXiv:2405.04434, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.652878Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:1b691702e846183fc987375527894039ee52f2f21a6e8f1b3f6a88d590b4f806","observation_id":"0ff6959f-9958-4507-a9ec-1f287dd68ea6","resolution":{"observed_at":"2026-08-07T05:06:32.652878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-11T01:48:59.557045Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T05:06:32.655660Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.655660Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:c085134362b6b15d52f3a16580f64a743def26882a940e9976116f2a4012fbe0","observation_id":"c219a013-8686-4648-8283-db95ac9584b7","resolution":{"observed_at":"2026-08-07T05:06:32.655660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-08-07T09:13:28.333702Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10516","snapshot_observed_at":"2026-08-07T05:06:32.658257Z","title":"Retrievalattention: Accelerating long- context llm inference via vector retrieval.arXiv preprint arXiv:2409.10516, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.658257Z"},"links":{"cited_paper":"/paper/2409.10516","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:987eb388b91e7893ec5299936be6a252a541ec7d55140166534bcd427e9f7790","observation_id":"2608c643-fffb-422b-877e-691614308d6c","resolution":{"observed_at":"2026-08-07T05:06:32.658257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04823","last_updated":"2025-08-18T16:06:09Z","snapshot_observed_at":"2026-08-08T03:19:58.705742Z","submitted_at":"2025-04-07T08:22:45Z","title":"Quantization Hurts Reasoning? An Empirical Study on Quantized Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04823","snapshot_observed_at":"2026-08-07T05:06:32.660824Z","title":"Quantization hurts reasoning? an empirical study on quantized reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.660824Z"},"links":{"cited_paper":"/paper/2504.04823","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:0855adba60a8870794e0cb53022370aa9d05ce966ce36da970e986ec188313ac","observation_id":"3530e94f-8a37-4537-b556-73ba454253da","resolution":{"observed_at":"2026-08-07T05:06:32.660824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:32.663343Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.663343Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:eb7f1dde43f9037565a5eeb8c14185c056d37c0881b2adf5de833b715448cb8c","observation_id":"5e68eb24-e125-495b-beec-fbcb87c254a1","resolution":{"observed_at":"2026-08-07T05:06:32.663343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-08-07T05:06:32.665648Z","title":"Moba: Mixture of block attention for long-context llms.arXiv preprint arXiv:2502.13189, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.665648Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:42342f9ba2dbef54b16fa0cbd090c89f94c1a03b1fe5d75091eb99bf5b07b12b","observation_id":"293d79b4-1d15-40dc-a4f6-305781561c89","resolution":{"observed_at":"2026-08-07T05:06:32.665648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08246","last_updated":"2025-06-03T10:07:35Z","snapshot_observed_at":"2026-08-09T15:11:46.240343Z","submitted_at":"2025-02-12T09:39:54Z","title":"Inference-time sparse attention with asymmetric indexing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08246","snapshot_observed_at":"2026-08-07T05:06:32.671170Z","title":"Inference-time sparse attention with asymmetric indexing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.671170Z"},"links":{"cited_paper":"/paper/2502.08246","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:5c46f02c5684808b674e22ddfa3f41622a47849f12a90df39e7abf13b7009a0d","observation_id":"7a362d9b-f617-41b7-bbf1-6fb73bd032fe","resolution":{"observed_at":"2026-08-07T05:06:32.671170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:33.463465Z","title":"Aime problems and solutions","venue":null,"work_id":"610883e8-163a-4277-9317-7847900638a6","year":null},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.673524Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:5783cfd09a9fbe12995842b6e7d4636ee2aa8427e60849499c6bf5c81a7563a6","observation_id":"d667d25b-3933-414d-a5b6-143357e4e96c","resolution":{"observed_at":"2026-08-07T05:06:33.472215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13048","last_updated":"2023-12-11T03:58:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T13:57:41Z","title":"RWKV: Reinventing RNNs for the Transformer Era","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13048","snapshot_observed_at":"2026-08-07T05:06:32.676223Z","title":"Rwkv: Reinventing rnns for the transformer era.arXiv preprint arXiv:2305.13048, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.676223Z"},"links":{"cited_paper":"/paper/2305.13048","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:1f28ff109e0476ea27658e1b1f72af3bdecd4c9c166615764e54b9eea42cdc3e","observation_id":"c01b0e2c-6de0-4f45-ad94-953af6858da4","resolution":{"observed_at":"2026-08-07T05:06:32.676223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:32.678846Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.678846Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:5c5c1538be9cfe4e391c2e049fb53befdb0c8333a09487266f8cf63f7092fac5","observation_id":"0cf432c8-7479-46db-b6a4-144757bb9505","resolution":{"observed_at":"2026-08-07T05:06:32.678846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:32.681295Z","title":"Flashattention-3: Fast and accurate attention with asynchrony and low-precision.Advances in Neural Information Processing Systems, 37:68658–68685, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.681295Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:410c8be8cee152e47a5904a2442a12beb8b962e1c046f763049d37e3a856f324","observation_id":"d49d1105-3f23-496a-83b3-036244b4a626","resolution":{"observed_at":"2026-08-07T05:06:32.681295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-08-07T05:06:32.683732Z","title":"Fast transformer decoding: One write-head is all you need.arXiv preprint arXiv:1911.02150, 2019","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.683732Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:43e168d82ff602905f54b0b9206bda1fdc85dca4ab4680a026be628b325140b0","observation_id":"8b4bec04-2885-409e-a38b-b7d3854429c1","resolution":{"observed_at":"2026-08-07T05:06:32.683732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:32.686218Z","title":"Roformer: Enhanced transformer with rotary position embedding.Neurocomputing, 568:127063, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.686218Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:d43eb5aec8040cebca49d3204895277c6459dba16dd2a64f2354a196b9c1f065","observation_id":"d984e696-1486-4856-95d9-d4a857901aa0","resolution":{"observed_at":"2026-08-07T05:06:32.686218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-02T13:21:32.251959Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-08-07T05:06:32.688555Z","title":"Retentive network: A successor to transformer for large language models.arXiv preprint arXiv:2307.08621, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.688555Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:6432ba14a310cf71e3e152bf421df18b642f0dc26b21a688efb1349d4b8bb186","observation_id":"e4e05d7f-6813-44c6-813c-7b8878ce31b7","resolution":{"observed_at":"2026-08-07T05:06:32.688555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:32.691080Z","title":"You only cache once: Decoder-decoder architectures for language models.Advances in Neural Information Processing Systems, 37:7339–7361, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.691080Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:c49099aca1c5c3b993a93d6688a4870e658640ea471fc974cae6bf37c0fa52a8","observation_id":"fd83167e-1222-400d-8695-d27c9f5de1de","resolution":{"observed_at":"2026-08-07T05:06:32.691080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04108","last_updated":"2025-06-05T05:39:48Z","snapshot_observed_at":"2026-08-10T12:09:42.684962Z","submitted_at":"2025-06-04T16:01:48Z","title":"Rectified Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04108","snapshot_observed_at":"2026-08-07T05:06:32.693476Z","title":"Rectified sparse attention.arXiv preprint arXiv:2506.04108, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.693476Z"},"links":{"cited_paper":"/paper/2506.04108","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:d1008a645876704c4d763238dc0083c691eeeeaf2027eb9bdb5ff495a2eb357d","observation_id":"973f0b67-f390-49b2-b41c-433cfb715649","resolution":{"observed_at":"2026-08-07T05:06:32.693476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10774","last_updated":"2024-08-26T21:01:02Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-16T01:33:02Z","title":"Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10774","snapshot_observed_at":"2026-08-07T05:06:32.696425Z","title":"Quest: Query-aware sparsity for efficient long-context llm inference.arXiv preprint arXiv:2406.10774, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.696425Z"},"links":{"cited_paper":"/paper/2406.10774","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:c3523a44cc2c2ada690a74b9845bb7f498b1ef3e45cdbc577265f5cb146b4419","observation_id":"e7e5477f-7825-4fd7-9640-a0efa6e1f46c","resolution":{"observed_at":"2026-08-07T05:06:32.696425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:33.425527Z","title":"Minicpm4: Ultra-efficient llms on end devices","venue":null,"work_id":"d733986f-49e3-42a3-b7a7-5fdd1dceeefd","year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.699380Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:9c682d885910663f0f2043528ea0004a04655addd1a46812839531f62b473aa9","observation_id":"a67b2b37-dab9-4ff1-a390-54ec09637381","resolution":{"observed_at":"2026-08-07T05:06:33.432664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:32.701827Z","title":"Triton: an intermediate language and compiler for tiled neural network computations","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.701827Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:0ab736877195ba5ad7c44252b0854c1c67a45e4acf5107a18aba5eb149561098","observation_id":"cd3ca030-3cf0-40aa-a4f0-706877f84057","resolution":{"observed_at":"2026-08-07T05:06:32.701827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:33.407121Z","title":"Attention is all you need.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":"a60e99c0-6974-4047-9230-8e19b84a025b","year":2017},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.704664Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:49672652186d0ef482182d5e57d77b24efde910fab768b561f1205ce11c39bbe","observation_id":"6ac5c415-4962-4918-ba04-6d5b0b62b380","resolution":{"observed_at":"2026-08-07T05:06:33.411160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:33.397942Z","title":"Ladder: Enabling efficient low-precision deep learning computing through hardware-aware tensor transformation","venue":null,"work_id":"ba61e929-0e24-4be9-bac9-88695145c928","year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.707584Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:b105815f8f3b222dcfab6bb849332093a4c0ec0857387b3239bdb35a581ae616","observation_id":"a4ba9d5f-4361-4aed-88d1-e2f654aeaaf8","resolution":{"observed_at":"2026-08-07T05:06:33.401791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04617","last_updated":"2024-05-28T12:05:12Z","snapshot_observed_at":"2026-08-10T19:46:44.950253Z","submitted_at":"2024-02-07T06:50:42Z","title":"InfLLM: Training-Free Long-Context Extrapolation for LLMs with an Efficient Context Memory","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04617","snapshot_observed_at":"2026-08-07T05:06:32.710225Z","title":"Infllm: Training-free long-context extrapolation for llms with an efficient context memory.arXiv preprint arXiv:2402.04617, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.710225Z"},"links":{"cited_paper":"/paper/2402.04617","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:83a7022ec40bc4d02832713c19ed571ede653e4001de8548fc67ad86c19c5b06","observation_id":"e51bd4e9-f1ae-497b-b21f-cb827e7bdd73","resolution":{"observed_at":"2026-08-07T05:06:32.710225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-07T05:06:32.712682Z","title":"Efficient streaming language models with attention sinks.arXiv preprint arXiv:2309.17453, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.712682Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:c2fa19fae43d931c65a61215e6e016ceff46abcb339749776eca17ebabab1dc7","observation_id":"0da04754-dc55-459a-abb4-c029a17bb797","resolution":{"observed_at":"2026-08-07T05:06:32.712682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10819","last_updated":"2024-10-14T17:59:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-14T17:59:58Z","title":"DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10819","snapshot_observed_at":"2026-08-07T05:06:32.715316Z","title":"Duoattention: Efficient long-context llm inference with retrieval and streaming heads.arXiv preprint arXiv:2410.10819, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.715316Z"},"links":{"cited_paper":"/paper/2410.10819","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:b39cc521bf92349231216320df881fe2c1d4885fcaa120d88c97d3f75a755dd3","observation_id":"af72d851-2eef-4c38-93dc-e2ca446dc95f","resolution":{"observed_at":"2026-08-07T05:06:32.715316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16428","last_updated":"2025-03-20T17:59:58Z","snapshot_observed_at":"2026-08-07T16:48:20.217813Z","submitted_at":"2025-03-20T17:59:58Z","title":"XAttention: Block Sparse Attention with Antidiagonal Scoring","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16428","snapshot_observed_at":"2026-08-07T05:06:32.718359Z","title":"Xattention: Block sparse attention with antidiagonal scoring.arXiv preprint arXiv:2503.16428, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.718359Z"},"links":{"cited_paper":"/paper/2503.16428","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:28d2718b110d4709837ba370314d16062cb8f2ed6a4fc7bf72b3dbe8240167e0","observation_id":"c1f77f0b-62cc-436f-a5a8-9fb99f5859c8","resolution":{"observed_at":"2026-08-07T05:06:32.718359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-07T05:06:32.721183Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.721183Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:4e9c7a0c76a2c9ef6028c4b4d632972284950b57bcf0bf9f6f37df3739220865","observation_id":"c2b5e48b-48d0-4ef7-8fc6-80bd77976df3","resolution":{"observed_at":"2026-08-07T05:06:32.721183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14866","last_updated":"2025-04-21T15:13:44Z","snapshot_observed_at":"2026-08-07T18:00:57.140205Z","submitted_at":"2025-02-20T18:59:52Z","title":"LServe: Efficient Long-sequence LLM Serving with Unified Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14866","snapshot_observed_at":"2026-08-07T05:06:32.724124Z","title":"Lserve: Efficient long-sequence llm serving with unified sparse attention.arXiv preprint arXiv:2502.14866, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.724124Z"},"links":{"cited_paper":"/paper/2502.14866","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:77e2c1b969e71384d32d138c8aab94d471d30c564a41c8479f75c6416aecee84","observation_id":"e6a73f34-695e-4872-ae7d-4196c0ddbddb","resolution":{"observed_at":"2026-08-07T05:06:32.724124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07092","last_updated":"2024-08-18T17:27:17Z","snapshot_observed_at":"2026-08-05T16:40:54.770070Z","submitted_at":"2024-08-11T18:40:36Z","title":"Post-Training Sparse Attention with Double Sparsity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.07092","snapshot_observed_at":"2026-08-07T05:06:32.726866Z","title":"Post-training sparse attention with double sparsity.arXiv preprint arXiv:2408.07092, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.726866Z"},"links":{"cited_paper":"/paper/2408.07092","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:7309b36fa46a7ca39bf2704e2928d138dfbee3ba13c6d7ceeeb1df7e858a187b","observation_id":"bab96539-ebe4-47de-8355-181e7446dd8d","resolution":{"observed_at":"2026-08-07T05:06:32.726866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06635","last_updated":"2024-08-27T01:27:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-11T18:51:59Z","title":"Gated Linear Attention Transformers with Hardware-Efficient Training","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06635","snapshot_observed_at":"2026-08-07T05:06:32.729535Z","title":"Gated linear attention transformers with hardware-efficient training.arXiv preprint arXiv:2312.06635, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.729535Z"},"links":{"cited_paper":"/paper/2312.06635","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:9671af6fe5fd715aec63fee27316df636b33f5cbbd88ea18a0713224b34784c4","observation_id":"95dfe03b-fd92-4e07-8d3f-2a2c169094e6","resolution":{"observed_at":"2026-08-07T05:06:32.729535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-08-07T05:06:32.732274Z","title":"Parallelizing linear transformers with the delta rule over sequence length.arXiv preprint arXiv:2406.06484, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.732274Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:3189d5064febe9226b8129874447f0be3eff48c00e89de69285125b8eacc43b6","observation_id":"ba368b4c-83f6-4f2c-9b86-76d1891b91af","resolution":{"observed_at":"2026-08-07T05:06:32.732274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11089","last_updated":"2025-02-27T09:01:21Z","snapshot_observed_at":"2026-08-07T14:17:15.942844Z","submitted_at":"2025-02-16T11:53:44Z","title":"Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11089","snapshot_observed_at":"2026-08-07T05:06:32.735020Z","title":"Native sparse attention: Hardware-aligned and natively trainable sparse attention.arXiv preprint arXiv:2502.11089, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.735020Z"},"links":{"cited_paper":"/paper/2502.11089","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:f658238b6c3dcf999fde18f1f9b817e2262ae9821a245b9301e01ae60eb65913","observation_id":"92fa3dfc-1f8d-4cf3-90db-dd119862ed8b","resolution":{"observed_at":"2026-08-07T05:06:32.735020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21487","snapshot_observed_at":"2026-08-07T05:06:32.737715Z","title":"Hardware-efficient attention for fast decoding.arXiv preprint arXiv:2505.21487, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.737715Z"},"links":{"cited_paper":"/paper/2505.21487","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:c8972568a50f7ba51ba1704dc9cb9189bb284732a2cd66e9c0dca0c234b85228","observation_id":"292cce17-8c9a-4178-887e-7497c8c511e0","resolution":{"observed_at":"2026-08-07T05:06:32.737715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:32.740450Z","title":"Big bird: Transformers for longer sequences.Advances in neural information processing systems, 33: 17283–17297, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.740450Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:cdb1cf628e88debda3e52faddca7fd9faa087cafc6ee16a75ecf33e2f39574ca","observation_id":"563df4f2-cca6-45f9-a9b7-96a0005e3186","resolution":{"observed_at":"2026-08-07T05:06:32.740450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12876","last_updated":"2025-04-17T03:51:06Z","snapshot_observed_at":"2026-08-07T17:32:42.485958Z","submitted_at":"2024-10-15T05:01:19Z","title":"In-context KV-Cache Eviction for LLMs via Attention-Gate","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12876","snapshot_observed_at":"2026-08-07T05:06:32.742963Z","title":"In-context kv-cache eviction for llms via attention-gate.arXiv preprint arXiv:2410.12876, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.742963Z"},"links":{"cited_paper":"/paper/2410.12876","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:1ad004e66ed9a14929cae4cd19a3010468fae75d246d84d7f73085d7bc75356b","observation_id":"ce549a7a-91ea-40a8-b8bd-ec2b2a44d192","resolution":{"observed_at":"2026-08-07T05:06:32.742963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12820","last_updated":"2025-03-30T08:13:50Z","snapshot_observed_at":"2026-08-11T04:38:02.937490Z","submitted_at":"2024-07-01T13:05:42Z","title":"PQCache: Product Quantization-based KVCache for Long Context LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12820","snapshot_observed_at":"2026-08-07T05:06:32.745585Z","title":"Pqcache: Product quantization-based kvcache for long context llm inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.745585Z"},"links":{"cited_paper":"/paper/2407.12820","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:d8c67dc2e72dcf80ccd99222bbe7aca56712aa71f8e62c6936e34ed2bd5219d1","observation_id":"506d2d3c-2bcb-4aea-9efb-b6071374512a","resolution":{"observed_at":"2026-08-07T05:06:32.745585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:33.384228Z","title":"Spargeattn: Accurate sparse attention accelerating any model inference","venue":null,"work_id":"1d6f8963-aa67-4674-b832-d8c823b0020e","year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.748548Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:560190525eaa77da34bfba591b5780500e8f28c81f6326cc0245ff475b8ba138","observation_id":"f109a2ac-2869-4b5e-9f1b-2099b952ac7d","resolution":{"observed_at":"2026-08-07T05:06:33.387280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:33.376358Z","title":"H2o: Heavy-hitter oracle for efficient generative inference of large language models","venue":null,"work_id":"9a0dbb63-614f-45fb-bebc-fe1156f4bf3d","year":2023},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.751054Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:47e798e6a4aa1f4b2e14492212ac343f60f495966019bbb2a1a5a8ca4076ec54","observation_id":"ab92dd5a-4c2b-42ca-936f-3deb329e8c07","resolution":{"observed_at":"2026-08-07T05:06:33.379076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:33.368280Z","title":"Sglang: Efficient execution of structured language model programs.Advances in Neural Information Processing Systems, 37:62557–62583, 2024","venue":null,"work_id":"7374e48b-6552-47b6-9618-03cda1891ff4","year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.753405Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:502b75112aa0df72e6cf328a2821b9480d5751b4dc55280fc0797f51ded4d0b3","observation_id":"0e4c6dc1-84ad-4eee-897e-4fe0150e1e66","resolution":{"observed_at":"2026-08-07T05:06:33.371151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:06:33.358149Z","title":"ROLLER: Fast and efficient tensor compilation for deep learning","venue":null,"work_id":"a36a06ef-2191-4a56-9591-e3f2e10bc2ee","year":2022},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.755775Z"},"links":{"citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:30067a0bb8df68f23b030879ffce844dc5531a908d74f3153e79c4eac87488dd","observation_id":"53b8b144-c7aa-40e1-9c49-15a0541be264","resolution":{"observed_at":"2026-08-07T05:06:33.362723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning"},"reference_resolution":{"displayed":78,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":64,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":78},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 78 of 78 outbound references and 12 inbound Pith citation observations for arXiv:2506.08889."}