{"as_of":"2026-08-08T11:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3b66d17c6730954d44f1b2ec45efc84f24f938d57cd2c9f4061de4376f2c0c43","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:10:50.032662Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.11498/citation-record","integrity":"/paper/2506.11498/integrity","json":"/paper/2506.11498/citation-record.json","paper":"/paper/2506.11498"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-07T04:10:45.390155Z","title":"arXiv preprint arXiv:2004.05150 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-08T10:44:40.108788Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:45.390155Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:c5e873fc052de7cf7c5334293a10606722ecbf1372f6901947a3ad184ebca024","observation_id":"8e0c89a8-6963-4fab-8847-878f1383cd32","resolution":{"observed_at":"2026-08-07T04:10:45.390155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:45.442228Z","title":"ACM transactions on intelligent systems and technology15(3), 1–45 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-08T10:44:40.108788Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:45.442228Z"},"links":{"citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:63bee0b3d8e107684f9f4b6a3335258a155127de0a6c1cc4e11aa37ee2072e71","observation_id":"99f00575-4a14-4f4f-b684-39292ea5e963","resolution":{"observed_at":"2026-08-07T04:10:45.442228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-06T08:05:35.311510Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-07T04:10:45.518337Z","title":"arXiv preprint arXiv:1904.10509 (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-08T10:44:40.108788Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:45.518337Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:a27a939715abcb0e5740525c033da0419df469cd126937e3a871340dc5bbd4ec","observation_id":"9858e872-dc4e-49fb-acb1-162b3f78f323","resolution":{"observed_at":"2026-08-07T04:10:45.518337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:45.598331Z","title":"Advances in neural information pro- cessing systems35, 16344–16359 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-08T10:44:40.108788Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:45.598331Z"},"links":{"citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:a0337380bd18614002996c3d308665b9a77a9498586015a87349aac8e3cc599e","observation_id":"660f74f3-918e-4453-87f1-ee55c3ffde2f","resolution":{"observed_at":"2026-08-07T04:10:45.598331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13753","last_updated":"2024-02-21T12:30:33Z","snapshot_observed_at":"2026-08-02T12:47:57.325302Z","submitted_at":"2024-02-21T12:30:33Z","title":"LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13753","snapshot_observed_at":"2026-08-07T04:10:45.692174Z","title":"arXiv preprint arXiv:2402.13753 (2024) Lag-Relative Sparse Attention In Long Context Training 11","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-08T10:44:40.108788Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:45.692174Z"},"links":{"cited_paper":"/paper/2402.13753","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:50c14ffdc381bc46d640715b6d2bf59af40cf8cb4db9a744669d3a48b8f39e7e","observation_id":"a11b3d47-cc92-4d8e-833a-c9f2cb615b2c","resolution":{"observed_at":"2026-08-07T04:10:45.692174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-07T04:10:45.799671Z","title":"arXiv preprint arXiv:2407.11550 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-08T10:44:40.108788Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:45.799671Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:3972418dedefbece81aebf8b7ecab16a362b249682c784de97668eb69ae707e2","observation_id":"951d4d05-8915-4e9d-8769-0451d3550c08","resolution":{"observed_at":"2026-08-07T04:10:45.799671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01801","last_updated":"2024-10-29T18:26:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T05:17:08Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01801","snapshot_observed_at":"2026-08-07T04:10:45.945773Z","title":"arXiv preprint arXiv:2310.01801 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-08T10:44:40.108788Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:45.945773Z"},"links":{"cited_paper":"/paper/2310.01801","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:097ca2defb6bbb0490391241413839eda613303acc76e784ae5d9e3f2f5e8d0e","observation_id":"453bb1dc-f0de-4956-8038-2d0652d1c99a","resolution":{"observed_at":"2026-08-07T04:10:45.945773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-07T04:10:46.033655Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-08T10:44:40.108788Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:46.033655Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:37b402992e1b257e6a83dc8a90aba7060b23dc0f6966928e842797b9018aad94","observation_id":"072bec5e-41b3-4ba7-987b-b09d19c14c40","resolution":{"observed_at":"2026-08-07T04:10:46.033655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:51.181631Z","title":null,"venue":null,"work_id":"b531a5ae-3617-4df0-8c13-464473ed3a65","year":2024},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-08T10:44:40.108788Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:46.135214Z"},"links":{"citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:28e60c38b507c16529ff78c6b8322e2bb526866367f455fcbd9b4aa2e99514f1","observation_id":"fd22ae9b-fc94-4c64-b8be-ada4766b70af","resolution":{"observed_at":"2026-08-07T04:10:51.186709Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20766","last_updated":"2025-02-28T06:34:53Z","snapshot_observed_at":"2026-08-07T17:40:46.337382Z","submitted_at":"2025-02-28T06:34:53Z","title":"FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20766","snapshot_observed_at":"2026-08-07T04:10:46.279283Z","title":"arXiv preprint arXiv:2502.20766 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-08T10:44:40.108788Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:46.279283Z"},"links":{"cited_paper":"/paper/2502.20766","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:d8fb678240e73e7f5a142c8923b4ab21d95592a5f480c2c4a2016197ea7778d5","observation_id":"17a278f5-ba27-41f6-b918-962f6bd530f4","resolution":{"observed_at":"2026-08-07T04:10:46.279283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:51.163271Z","title":"In: Proceedings of the AAAI Conference on Artificial Intelligence","venue":null,"work_id":"c857a121-5184-4fc6-856b-ad58c4daafc7","year":2025},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-08T10:44:40.108788Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:46.387353Z"},"links":{"citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:30c63ac8018edabd7103cab285f20172b72adae0cedca83faa681c0b6aa425a2","observation_id":"95d69890-e773-4016-9ffe-e21d987ac112","resolution":{"observed_at":"2026-08-07T04:10:51.168669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19442","last_updated":"2025-07-30T05:24:46Z","snapshot_observed_at":"2026-08-07T06:25:14.802049Z","submitted_at":"2024-12-27T04:17:57Z","title":"A Survey on Large Language Model Acceleration based on KV Cache Management","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19442","snapshot_observed_at":"2026-08-07T04:10:46.494111Z","title":"arXiv preprint arXiv:2412.19442 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-08T10:44:40.108788Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:46.494111Z"},"links":{"cited_paper":"/paper/2412.19442","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:6d5b036d7c997d17b0db080d9464d8713bee1e313af6f51d28c1d0a7e9cbc1b9","observation_id":"f1ade16f-2c92-4fc1-b178-ac781e464afe","resolution":{"observed_at":"2026-08-07T04:10:46.494111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:51.130288Z","title":"In: International Conference on Machine Learning","venue":null,"work_id":"a6bd873e-6bb7-4446-91cf-18c410314609","year":2023},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-08T10:44:40.108788Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:46.603238Z"},"links":{"citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:c0253d47db914d040b258f010f3529cd89fe7defa34b1aec1ad8f13ad4d3f8d8","observation_id":"7901cc6a-1c85-4958-89de-9a23092d9d9e","resolution":{"observed_at":"2026-08-07T04:10:51.135416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10319","last_updated":"2025-03-11T14:02:04Z","snapshot_observed_at":"2026-08-06T07:50:40.568356Z","submitted_at":"2024-12-13T17:59:52Z","title":"SCBench: A KV Cache-Centric Analysis of Long-Context Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10319","snapshot_observed_at":"2026-08-07T04:10:46.759948Z","title":"arXiv preprint arXiv:2412.10319 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-08T10:44:40.108788Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:46.759948Z"},"links":{"cited_paper":"/paper/2412.10319","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:2d13e3149f6bbade55af92f5f06a6ed95714ef78a3b3b3688e5046f32c675fa1","observation_id":"e5d9f31e-b613-4a3c-8b4c-a3c8fbe621df","resolution":{"observed_at":"2026-08-07T04:10:46.759948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:46.915070Z","title":"Advances in Neural Information Processing Systems37, 22947–22970 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-08T10:44:40.108788Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:46.915070Z"},"links":{"citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:28a1ae4cc85f41ec95ffb4ec4330f915060c8c0d22d7b0f83d0ebd30c94cad14","observation_id":"1a340d0c-bd4d-4793-811b-b66cfa7953fb","resolution":{"observed_at":"2026-08-07T04:10:46.915070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04704","last_updated":"2025-07-24T16:25:51Z","snapshot_observed_at":"2026-08-07T16:08:06.904769Z","submitted_at":"2025-04-07T03:22:15Z","title":"LagKV: Lag-Relative Information of the KV Cache Tells Which Tokens Are Important","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04704","snapshot_observed_at":"2026-08-07T04:10:46.987437Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-08T10:44:40.108788Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:46.987437Z"},"links":{"cited_paper":"/paper/2504.04704","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:ddbdf5e6ac621862ff3f96824c213f8c8c00932a0770e532f1fba65e29bee8bd","observation_id":"0d54b903-c43e-4757-82b3-b28368f6f2de","resolution":{"observed_at":"2026-08-07T04:10:46.987437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:51.105156Z","title":"Advances in Neural Information Processing Systems36, 52342–52364 (2023)","venue":null,"work_id":"fc455a24-9218-4c45-bbff-ab7bb2a92220","year":2023},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-08T10:44:40.108788Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:47.139536Z"},"links":{"citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:b2373527491c8fa3aad55b778a01102f181ab24ea54f883c5fb6cd3f4e7d0796","observation_id":"74c5279a-4547-4804-89d1-cc6e734aca02","resolution":{"observed_at":"2026-08-07T04:10:51.109431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T04:10:47.302052Z","title":"arXiv preprint arXiv:1711.05101 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-08T10:44:40.108788Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:47.302052Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:064806046b81f96560bc754525593e82c8b615137e3ac64c44098fdad8d07f9b","observation_id":"f8b4264f-0eee-4127-9039-d2956b12d165","resolution":{"observed_at":"2026-08-07T04:10:47.302052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16747","last_updated":"2024-06-24T15:55:59Z","snapshot_observed_at":"2026-08-06T03:54:10.668995Z","submitted_at":"2024-06-24T15:55:59Z","title":"Sparser is Faster and Less is More: Efficient Sparse Attention for Long-Range Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16747","snapshot_observed_at":"2026-08-07T04:10:47.490600Z","title":"arXiv preprint arXiv:2406.16747 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-08T10:44:40.108788Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:47.490600Z"},"links":{"cited_paper":"/paper/2406.16747","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:a6647fa76b06193f189cfbf41af2231f6ca8c01a721af2513a7bf8bd2788f582","observation_id":"b7b9b8d8-57db-4204-8c37-c22797ae4e76","resolution":{"observed_at":"2026-08-07T04:10:47.490600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06435","last_updated":"2024-10-17T01:10:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-12T20:01:52Z","title":"A Comprehensive Overview of Large Language Models","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06435","snapshot_observed_at":"2026-08-07T04:10:47.680043Z","title":"arXiv preprint arXiv:2307.06435 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-08T10:44:40.108788Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:47.680043Z"},"links":{"cited_paper":"/paper/2307.06435","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:e615eecb85ef5184763139588214126f06108243506dd1cf3b2bee04b5c035fe","observation_id":"7d81b4e5-93ba-42e7-82ec-1d5060865a47","resolution":{"observed_at":"2026-08-07T04:10:47.680043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:51.090910Z","title":null,"venue":null,"work_id":"3d71e979-7383-452b-a423-1255cdd90a81","year":2024},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-08T10:44:40.108788Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:47.810410Z"},"links":{"citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:3c338c33e71342537e5e61a05a3f8f30c2ccce756e1673562b7efdb16618b449","observation_id":"9ee3ff58-ddc7-43ba-affe-fd86f9d17363","resolution":{"observed_at":"2026-08-07T04:10:51.095216Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:51.042291Z","title":null,"venue":null,"work_id":"963ce4cd-6898-4596-8cbd-437ba3029c6f","year":2024},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-08T10:44:40.108788Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:47.981499Z"},"links":{"citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:e4a124cc32ec758dc02e776278c1d720140d6f4443dae8903eef8d71133fc759","observation_id":"43ee4ba6-d273-4641-aa4f-ee72187c57da","resolution":{"observed_at":"2026-08-07T04:10:51.076910Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00071","last_updated":"2026-02-06T19:40:50Z","snapshot_observed_at":"2026-08-01T02:15:47.181936Z","submitted_at":"2023-08-31T18:18:07Z","title":"YaRN: Efficient Context Window Extension of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00071","snapshot_observed_at":"2026-08-07T04:10:48.191985Z","title":"arXiv preprint arXiv:2309.00071 (2023) 12 Manlal Liang, Wanyi Huang, Mandi Liu, Huaijun Li, and Jinlong Li","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-08T10:44:40.108788Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:48.191985Z"},"links":{"cited_paper":"/paper/2309.00071","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:bfb5c5753d30e5281d076c36397f3e1e2c973b91e67b2e0eabd56dcfe6ceafc5","observation_id":"49707010-7876-4cd1-8929-f6a69f522c32","resolution":{"observed_at":"2026-08-07T04:10:48.191985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T04:10:48.330610Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-08T10:44:40.108788Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:48.330610Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:3a808b4d4e28c0cbc84d6e82c4cd87783ea1002c8f3a5dc0284426679e4b32ff","observation_id":"cf6665d2-74a0-4dc7-b880-d861afc4a0dc","resolution":{"observed_at":"2026-08-07T04:10:48.330610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-07T04:10:48.406540Z","title":"arXiv preprint arXiv:1909.08053 (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-08T10:44:40.108788Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:48.406540Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:99f8a6397638f49a5450c10318c2b94baa7e30dd13c0d7ae25937bb1599c2fa7","observation_id":"2af3c4f5-3cbd-4259-842a-853b4e637f71","resolution":{"observed_at":"2026-08-07T04:10:48.406540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:48.509422Z","title":"Neurocomputing568, 127063 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-08T10:44:40.108788Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:48.509422Z"},"links":{"citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:64db0c650227fab32505752b0c88611e207e1e54f874a8abdd86e9d14aa363e4","observation_id":"8c335968-fa1d-4fa6-b2bd-1cc67049f5a7","resolution":{"observed_at":"2026-08-07T04:10:48.509422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10501","last_updated":"2025-03-13T16:04:31Z","snapshot_observed_at":"2026-08-07T17:06:38.892486Z","submitted_at":"2025-03-13T16:04:31Z","title":"TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10501","snapshot_observed_at":"2026-08-07T04:10:48.606851Z","title":"arXiv preprint arXiv:2503.10501 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-08T10:44:40.108788Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:48.606851Z"},"links":{"cited_paper":"/paper/2503.10501","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:0949512ce57feff10907e6b2835b110b0f38aa824a67b67e0eb4094b9228e4b6","observation_id":"7498beaa-71fc-4113-8280-c9aa8c69579d","resolution":{"observed_at":"2026-08-07T04:10:48.606851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15891","last_updated":"2024-07-22T01:12:23Z","snapshot_observed_at":"2026-07-06T18:50:13.559866Z","submitted_at":"2024-07-22T01:12:23Z","title":"RazorAttention: Efficient KV Cache Compression Through Retrieval Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15891","snapshot_observed_at":"2026-08-07T04:10:48.721531Z","title":"arXiv preprint arXiv:2407.15891 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-08T10:44:40.108788Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:48.721531Z"},"links":{"cited_paper":"/paper/2407.15891","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:fa00da687b0d734ae20029beb47ddbeb8aa6aacf7b67e8eee9617dbb8ec759cb","observation_id":"49883b0e-1ec7-4da8-8c75-11935e0ed8b1","resolution":{"observed_at":"2026-08-07T04:10:48.721531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:50.829840Z","title":"In: Proceedings of the 41st Inter- national Conference on Machine Learning","venue":null,"work_id":"6faeb78c-c6c9-4f7b-af2a-31964f80e0c9","year":2024},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-08T10:44:40.108788Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:48.760326Z"},"links":{"citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:0a8c4fa9411a6578ec2b0437e8832fb527548c0e5211d5e3174bc0c7f604ac9b","observation_id":"f95ac60f-4d6d-42e5-bc00-ac612b3132e9","resolution":{"observed_at":"2026-08-07T04:10:50.944929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:48.854820Z","title":"Advances in neural information pro- cessing systems30(2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-08T10:44:40.108788Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:48.854820Z"},"links":{"citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:5c6a28841d523588a96ecc7e54b50f1060ef0f8644aea4a8a7b1b5fadd538e8e","observation_id":"4a43fa87-0313-4e3c-bc61-5b1fe083beee","resolution":{"observed_at":"2026-08-07T04:10:48.854820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:50.679878Z","title":"Neurocomputing 639, 130193 (2025)","venue":null,"work_id":"4b5820a6-b230-4f44-bf0d-f6c553791f7b","year":2025},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-08T10:44:40.108788Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:48.977954Z"},"links":{"citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:798a25b1711c878ccc21f41229280e7e7fbfe756869de48bec9355a9dd5b5976","observation_id":"2d0b8531-07fd-4d2b-9e1f-5acb8da24bb2","resolution":{"observed_at":"2026-08-07T04:10:50.762890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07378","last_updated":"2025-03-16T03:27:33Z","snapshot_observed_at":"2026-07-06T17:43:05.793351Z","submitted_at":"2024-03-12T07:31:18Z","title":"SVD-LLM: Truncation-aware Singular Value Decomposition for Large Language Model Compression","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07378","snapshot_observed_at":"2026-08-07T04:10:49.095108Z","title":"arXiv preprint arXiv:2403.07378 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-08T10:44:40.108788Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:49.095108Z"},"links":{"cited_paper":"/paper/2403.07378","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:cae4422c8946d47f813cec1c234c7ab55425734707bb7451f6c93adb2699bc43","observation_id":"425cc9a5-9881-41dc-83e2-a397465c72f0","resolution":{"observed_at":"2026-08-07T04:10:49.095108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02244","last_updated":"2024-05-29T13:38:25Z","snapshot_observed_at":"2026-07-06T17:24:53.368337Z","submitted_at":"2024-02-03T19:20:02Z","title":"Beyond the Limits: A Survey of Techniques to Extend the Context Length in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02244","snapshot_observed_at":"2026-08-07T04:10:49.229617Z","title":"arXiv preprint arXiv:2402.02244 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-08T10:44:40.108788Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:49.229617Z"},"links":{"cited_paper":"/paper/2402.02244","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:65ed6c374516aa23e654c2237e46213a10198aec32403d139bf08955c295881d","observation_id":"d1134c5e-e1ca-476f-8ab7-1c9149894f03","resolution":{"observed_at":"2026-08-07T04:10:49.229617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-07T04:10:49.389953Z","title":"arXiv preprint arXiv:2309.17453 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-08T10:44:40.108788Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:49.389953Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:89d0e79370d1b0330ed6b795d1645e52b1135ec62edf831660fda2f76c27af0c","observation_id":"c9863385-8ff4-48f3-abdb-17f30cb769db","resolution":{"observed_at":"2026-08-07T04:10:49.389953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11089","last_updated":"2025-02-27T09:01:21Z","snapshot_observed_at":"2026-08-07T14:17:15.942844Z","submitted_at":"2025-02-16T11:53:44Z","title":"Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11089","snapshot_observed_at":"2026-08-07T04:10:49.560520Z","title":"arXiv preprint arXiv:2502.11089 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-08T10:44:40.108788Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:49.560520Z"},"links":{"cited_paper":"/paper/2502.11089","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:7dd84b40a0eb49fd133e0cdbc8c308209b341fac44d4538993d8453743cd8c76","observation_id":"7d858341-c554-4867-83dc-9affe32268aa","resolution":{"observed_at":"2026-08-07T04:10:49.560520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:49.778422Z","title":"Advances in neural information processing systems33, 17283–17297 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-08T10:44:40.108788Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:49.778422Z"},"links":{"citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:004e8274649d0d4c392c92919a4a3c39bebfc916a58c1a44ee9471871c0aa753","observation_id":"56f79d8c-4bff-4689-b515-d04403ebe265","resolution":{"observed_at":"2026-08-07T04:10:49.778422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23520","last_updated":"2025-05-29T14:59:06Z","snapshot_observed_at":"2026-08-07T12:42:08.849043Z","submitted_at":"2025-05-29T14:59:06Z","title":"AnchorAttention: Difference-Aware Sparse Attention with Stripe Granularity","version":1},"cited_work":{"arxiv_id":"2505.23520","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23520","snapshot_observed_at":"2026-08-07T04:10:50.173158Z","title":"AnchorAttention: Difference-Aware Sparse Attention with Stripe Granularity","venue":"cs.LG","work_id":"14cddf77-91fd-4dce-80f8-89370a48c6b5","year":2025},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-08T10:44:40.108788Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:49.923424Z"},"links":{"cited_paper":"/paper/2505.23520","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:329f4aa3dd0be10333ae5e258612f865d85e3e0fe7715f0f0afa921f0eab87aa","observation_id":"f075099b-2eb5-4225-88f1-5d9e0ed8b034","resolution":{"observed_at":"2026-08-07T04:10:50.229411Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:10:50.032662Z","title":"Advances in Neural Information Processing Systems36, 34661–34710 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-08T10:44:40.108788Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:50.032662Z"},"links":{"citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:b7ec93469c503b82714ff68699dc09b4229e4121936aa06a5e55c38049dd776c","observation_id":"2d1b7631-13f6-487b-b674-6251e5079563","resolution":{"observed_at":"2026-08-07T04:10:50.032662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T10:44:40.108788Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":32,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2506.11498."}