{"as_of":"2026-08-09T03:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e3094b70187c4f99381bc35a08c954d5539bb912249c1ee452fb9685433ae169","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":35,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T23:42:35.360123Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.20766","last_updated":"2025-02-28T06:34:53Z","snapshot_observed_at":"2026-08-07T17:40:46.337382Z","submitted_at":"2025-02-28T06:34:53Z","title":"FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20766","snapshot_observed_at":"2026-08-07T12:50:53.833323Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23520","last_updated":"2025-05-29T14:59:06Z","snapshot_observed_at":"2026-08-07T12:42:08.849043Z","submitted_at":"2025-05-29T14:59:06Z","title":"AnchorAttention: Difference-Aware Sparse Attention with Stripe Granularity","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:53.833323Z"},"links":{"cited_paper":"/paper/2502.20766","citing_paper":"/paper/2505.23520"},"observation_digest":"sha256:8cea8a1988a7f130adea2b720d75ad8caa383c6faf6258261693932cc0eba3e9","observation_id":"4e55e330-e88d-4e8e-bf2a-f6e8cf2c29fa","resolution":{"observed_at":"2026-08-07T12:50:53.833323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20766","last_updated":"2025-02-28T06:34:53Z","snapshot_observed_at":"2026-08-07T17:40:46.337382Z","submitted_at":"2025-02-28T06:34:53Z","title":"FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20766","snapshot_observed_at":"2026-08-07T11:15:15.864790Z","title":"Flexprefill: A context- aware sparse attention mechanism for efficient long-sequence inference.arXiv preprint arXiv:2502.20766, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-08T23:56:38.842535Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:15.864790Z"},"links":{"cited_paper":"/paper/2502.20766","citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:36ffa31e138c7ccc78aa7230c7d6ff963739177cffe2a74ab149fc5eb14505d6","observation_id":"5bfbc421-98c1-467d-a47e-8c7bdcfe314a","resolution":{"observed_at":"2026-08-07T11:15:15.864790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20766","last_updated":"2025-02-28T06:34:53Z","snapshot_observed_at":"2026-08-07T17:40:46.337382Z","submitted_at":"2025-02-28T06:34:53Z","title":"FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20766","snapshot_observed_at":"2026-08-07T05:06:32.635500Z","title":"Flexprefill: A context- aware sparse attention mechanism for efficient long-sequence inference.arXiv preprint arXiv:2502.20766, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-07T11:00:03.513055Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.635500Z"},"links":{"cited_paper":"/paper/2502.20766","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:f69f6b75b0f2f1dbaf31805b1fa3a6713ea42d6ac0ab125bfcd6f5440b9d9c2a","observation_id":"94ff5f04-9d57-4434-b600-a547ef219e7c","resolution":{"observed_at":"2026-08-07T05:06:32.635500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20766","last_updated":"2025-02-28T06:34:53Z","snapshot_observed_at":"2026-08-07T17:40:46.337382Z","submitted_at":"2025-02-28T06:34:53Z","title":"FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20766","snapshot_observed_at":"2026-08-07T04:10:46.279283Z","title":"arXiv preprint arXiv:2502.20766 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11498","last_updated":"2025-06-13T06:49:53Z","snapshot_observed_at":"2026-08-08T21:48:05.242025Z","submitted_at":"2025-06-13T06:49:53Z","title":"Lag-Relative Sparse Attention In Long Context Training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:10:46.279283Z"},"links":{"cited_paper":"/paper/2502.20766","citing_paper":"/paper/2506.11498"},"observation_digest":"sha256:d964fc5bbb6849b52c3194e35e04202c29bc82419b77786c1f7f3a08cf5e6f6d","observation_id":"17a278f5-ba27-41f6-b918-962f6bd530f4","resolution":{"observed_at":"2026-08-07T04:10:46.279283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20766","last_updated":"2025-02-28T06:34:53Z","snapshot_observed_at":"2026-08-07T17:40:46.337382Z","submitted_at":"2025-02-28T06:34:53Z","title":"FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20766","snapshot_observed_at":"2026-08-06T17:30:14.855194Z","title":"Flexprefill: A context-aware sparse attention mech- anism for efficient long-sequence inference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10855","last_updated":"2025-07-14T23:03:24Z","snapshot_observed_at":"2026-08-08T10:53:46.330154Z","submitted_at":"2025-07-14T23:03:24Z","title":"Sparse Fine-Tuning of Transformers for Generative Tasks","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T17:30:14.855194Z"},"links":{"cited_paper":"/paper/2502.20766","citing_paper":"/paper/2507.10855"},"observation_digest":"sha256:6461b831a01c8c6d01e602550015c9b69f3393f8955727f3f4f09fe5841406d5","observation_id":"da99d513-7753-4c4a-9aec-2bf4bf27ee7d","resolution":{"observed_at":"2026-08-06T17:30:14.855194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20766","last_updated":"2025-02-28T06:34:53Z","snapshot_observed_at":"2026-08-07T17:40:46.337382Z","submitted_at":"2025-02-28T06:34:53Z","title":"FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20766","snapshot_observed_at":"2026-08-06T14:17:44.573805Z","title":"Flexprefill: A context-aware sparse attention mechanism for efficient long-sequence inference,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19608","last_updated":"2025-07-25T18:23:18Z","snapshot_observed_at":"2026-08-06T14:17:43.357204Z","submitted_at":"2025-07-25T18:23:18Z","title":"DeltaLLM: A Training-Free Framework Exploiting Temporal Sparsity for Efficient Edge LLM Inference","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T14:17:44.573805Z"},"links":{"cited_paper":"/paper/2502.20766","citing_paper":"/paper/2507.19608"},"observation_digest":"sha256:af81838940b2268c96b83c0b2ac59faccc39ce7161f83052a70fadcfa7889828","observation_id":"d4be6df4-9618-4fd4-9dac-81eac982d980","resolution":{"observed_at":"2026-08-06T14:17:44.573805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20766","last_updated":"2025-02-28T06:34:53Z","snapshot_observed_at":"2026-08-07T17:40:46.337382Z","submitted_at":"2025-02-28T06:34:53Z","title":"FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference","version":1},"cited_work":{"arxiv_id":"2502.20766","doi":"10.48550/arxiv.2502.20766","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.20766","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flex- prefill: A context-aware sparse attention mechanism for efficient long-sequence inference.arXiv preprint arXiv:2502.20766","venue":"ArXiv.org","work_id":"0cb1c44c-efb7-45c0-aee5-f6032ae66a8b","year":2025},"citing_paper":{"arxiv_id":"2507.21526","last_updated":"2026-04-21T03:10:04Z","snapshot_observed_at":"2026-07-06T22:04:20.800847Z","submitted_at":"2025-07-29T06:28:23Z","title":"Accelerating Prefilling via Decoding-time Contribution Sparsity","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-19T03:05:34.843274Z"},"links":{"cited_paper":"/paper/2502.20766","citing_paper":"/paper/2507.21526"},"observation_digest":"sha256:c6580c23f62bd3cca8718c42dd23fa791fc1886ff51dad047406b7b8fea60b52","observation_id":"fe522093-4b58-4108-9d8d-c7eacb0b20b3","resolution":{"observed_at":"2026-05-19T03:06:59.904965Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20766","last_updated":"2025-02-28T06:34:53Z","snapshot_observed_at":"2026-08-07T17:40:46.337382Z","submitted_at":"2025-02-28T06:34:53Z","title":"FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference","version":1},"cited_work":{"arxiv_id":"2502.20766","doi":"10.48550/arxiv.2502.20766","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.20766","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flex- prefill: A context-aware sparse attention mechanism for efficient long-sequence inference.arXiv preprint arXiv:2502.20766","venue":"ArXiv.org","work_id":"0cb1c44c-efb7-45c0-aee5-f6032ae66a8b","year":2025},"citing_paper":{"arxiv_id":"2508.16703","last_updated":"2026-04-08T06:56:34Z","snapshot_observed_at":"2026-07-06T22:16:52.874707Z","submitted_at":"2025-08-22T07:41:35Z","title":"ShadowNPU: System and Algorithm Co-design for NPU-Centric On-Device LLM Inference","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-18T22:03:10.316005Z"},"links":{"cited_paper":"/paper/2502.20766","citing_paper":"/paper/2508.16703"},"observation_digest":"sha256:41f7a540c579d2e1ee35b7e994b8b67bbb9d66a9b428470d2cd3be821379e343","observation_id":"b099f32b-71b1-4685-95ba-b605fdd08fd1","resolution":{"observed_at":"2026-05-18T22:06:52.158913Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20766","last_updated":"2025-02-28T06:34:53Z","snapshot_observed_at":"2026-08-07T17:40:46.337382Z","submitted_at":"2025-02-28T06:34:53Z","title":"FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20766","snapshot_observed_at":"2026-08-04T09:20:06.613749Z","title":"Flexprefill: A context-aware sparse attention mechanism for efficient long-sequence inference.arXiv preprint arXiv:2502.20766,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.16325","last_updated":"2026-07-01T00:44:38Z","snapshot_observed_at":"2026-08-07T11:01:31.595493Z","submitted_at":"2025-10-18T03:15:26Z","title":"UltraImageGen: Efficient Ultra-High-Resolution Image Generation with Hierarchical Local Attention","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T09:20:06.613749Z"},"links":{"cited_paper":"/paper/2502.20766","citing_paper":"/paper/2510.16325"},"observation_digest":"sha256:d74b561d8ba454f5765130ac431617912e263c0fbab63e126ff940c11bb77c08","observation_id":"041c5d06-2132-4dee-89d7-aaed139c5a31","resolution":{"observed_at":"2026-08-04T09:20:06.613749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20766","last_updated":"2025-02-28T06:34:53Z","snapshot_observed_at":"2026-08-07T17:40:46.337382Z","submitted_at":"2025-02-28T06:34:53Z","title":"FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference","version":1},"cited_work":{"arxiv_id":"2502.20766","doi":"10.48550/arxiv.2502.20766","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.20766","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flex- prefill: A context-aware sparse attention mechanism for efficient long-sequence inference.arXiv preprint arXiv:2502.20766","venue":"ArXiv.org","work_id":"0cb1c44c-efb7-45c0-aee5-f6032ae66a8b","year":2025},"citing_paper":{"arxiv_id":"2512.12087","last_updated":"2026-04-28T06:58:25Z","snapshot_observed_at":"2026-07-06T22:38:54.914862Z","submitted_at":"2025-12-12T23:30:43Z","title":"BLASST: Dynamic BLocked Attention Sparsity via Softmax Thresholding","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T22:20:53.856657Z"},"links":{"cited_paper":"/paper/2502.20766","citing_paper":"/paper/2512.12087"},"observation_digest":"sha256:3397600828dc1776319cbe389d6bd9bd1e03275b29ac3bca50e51d60fb8f085d","observation_id":"1efe3e05-b733-407c-9421-0bd925bc76f0","resolution":{"observed_at":"2026-05-16T22:21:18.631790Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20766","last_updated":"2025-02-28T06:34:53Z","snapshot_observed_at":"2026-08-07T17:40:46.337382Z","submitted_at":"2025-02-28T06:34:53Z","title":"FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20766","snapshot_observed_at":"2026-08-03T03:37:50.122140Z","title":"Flex- prefill: A context-aware sparse attention mechanism for efficient long-sequence inference.arXiv preprint arXiv:2502.20766,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07721","last_updated":"2026-05-28T23:34:23Z","snapshot_observed_at":"2026-08-03T03:37:48.402653Z","submitted_at":"2026-02-07T22:26:45Z","title":"ParisKV: Fast and Drift-Robust KV-Cache Retrieval for Long-Context LLMs","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T03:37:50.122140Z"},"links":{"cited_paper":"/paper/2502.20766","citing_paper":"/paper/2602.07721"},"observation_digest":"sha256:bff42501b9db51bb86ac2a64abf658141ca5dafd90cd6032273e09fcf696178a","observation_id":"a8ba8449-c17d-4dc4-b904-6eca1fe3294d","resolution":{"observed_at":"2026-08-03T03:37:50.122140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20766","last_updated":"2025-02-28T06:34:53Z","snapshot_observed_at":"2026-08-07T17:40:46.337382Z","submitted_at":"2025-02-28T06:34:53Z","title":"FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20766","snapshot_observed_at":"2026-08-03T03:22:54.033487Z","title":"Flexprefill: A context-aware sparse attention mechanism for efficient long-sequence inference, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.08426","last_updated":"2026-05-25T11:18:29Z","snapshot_observed_at":"2026-08-03T03:22:52.672693Z","submitted_at":"2026-02-09T09:31:06Z","title":"Prism: Spectral-Aware Block-Sparse Attention","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T03:22:54.033487Z"},"links":{"cited_paper":"/paper/2502.20766","citing_paper":"/paper/2602.08426"},"observation_digest":"sha256:96e3dcca81cce7eb8b4a0664ddcd6bcd13ec3d8313296329b873551a54baf33c","observation_id":"2ab1a122-93ed-4304-8588-665627252c4a","resolution":{"observed_at":"2026-08-03T03:22:54.033487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20766","last_updated":"2025-02-28T06:34:53Z","snapshot_observed_at":"2026-08-07T17:40:46.337382Z","submitted_at":"2025-02-28T06:34:53Z","title":"FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference","version":1},"cited_work":{"arxiv_id":"2502.20766","doi":"10.48550/arxiv.2502.20766","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.20766","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flex- prefill: A context-aware sparse attention mechanism for efficient long-sequence inference.arXiv preprint arXiv:2502.20766","venue":"ArXiv.org","work_id":"0cb1c44c-efb7-45c0-aee5-f6032ae66a8b","year":2025},"citing_paper":{"arxiv_id":"2602.18196","last_updated":"2026-05-28T10:28:00Z","snapshot_observed_at":"2026-08-02T22:05:41.622495Z","submitted_at":"2026-02-20T13:09:49Z","title":"RAT+: Train Dense, Infer Sparse -- Recurrence Augmented Attention for Dilated Inference","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T20:59:33.902420Z"},"links":{"cited_paper":"/paper/2502.20766","citing_paper":"/paper/2602.18196"},"observation_digest":"sha256:5845adb534facc252bc187696d18f12d67a190475e5d8b03d5a0014d16db217f","observation_id":"4097eb8f-ba2f-4c77-b234-586b7e982609","resolution":{"observed_at":"2026-05-15T21:00:17.890303Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20766","last_updated":"2025-02-28T06:34:53Z","snapshot_observed_at":"2026-08-07T17:40:46.337382Z","submitted_at":"2025-02-28T06:34:53Z","title":"FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference","version":1},"cited_work":{"arxiv_id":"2502.20766","doi":"10.48550/arxiv.2502.20766","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.20766","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flex- prefill: A context-aware sparse attention mechanism for efficient long-sequence inference.arXiv preprint arXiv:2502.20766","venue":"ArXiv.org","work_id":"0cb1c44c-efb7-45c0-aee5-f6032ae66a8b","year":2025},"citing_paper":{"arxiv_id":"2602.18196","last_updated":"2026-05-28T10:28:00Z","snapshot_observed_at":"2026-08-02T22:05:41.622495Z","submitted_at":"2026-02-20T13:09:49Z","title":"RAT+: Train Dense, Infer Sparse -- Recurrence Augmented Attention for Dilated Inference","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T12:45:27.150368Z"},"links":{"cited_paper":"/paper/2502.20766","citing_paper":"/paper/2602.18196"},"observation_digest":"sha256:fa8c97febc7b2e501f794bf8688f8377edfc45d53c15fe444d6e7a66b37202da","observation_id":"7d49031b-1479-480a-9a3c-491dd2765964","resolution":{"observed_at":"2026-05-21T12:50:09.505344Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20766","last_updated":"2025-02-28T06:34:53Z","snapshot_observed_at":"2026-08-07T17:40:46.337382Z","submitted_at":"2025-02-28T06:34:53Z","title":"FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20766","snapshot_observed_at":"2026-08-02T22:05:43.018334Z","title":"Flex- prefill: A context-aware sparse attention mechanism for efficient long-sequence inference.arXiv preprint arXiv:2502.20766,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.18196","last_updated":"2026-05-28T10:28:00Z","snapshot_observed_at":"2026-08-02T22:05:41.622495Z","submitted_at":"2026-02-20T13:09:49Z","title":"RAT+: Train Dense, Infer Sparse -- Recurrence Augmented Attention for Dilated Inference","version":5},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T22:05:43.018334Z"},"links":{"cited_paper":"/paper/2502.20766","citing_paper":"/paper/2602.18196"},"observation_digest":"sha256:06c7c31d5fbdcb98d713b2e988a0a5a96e80c8bff9c37852ad099040998aa8de","observation_id":"a7b82960-56e5-44b9-8d0e-709c3268313c","resolution":{"observed_at":"2026-08-02T22:05:43.018334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20766","last_updated":"2025-02-28T06:34:53Z","snapshot_observed_at":"2026-08-07T17:40:46.337382Z","submitted_at":"2025-02-28T06:34:53Z","title":"FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20766","snapshot_observed_at":"2026-08-03T02:39:28.798730Z","title":"Flex- prefill: A context-aware sparse attention mechanism for efficient long-sequence inference.arXiv preprint arXiv:2502.20766,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.06274","last_updated":"2026-07-31T10:15:33Z","snapshot_observed_at":"2026-08-08T03:34:36.285584Z","submitted_at":"2026-03-06T13:33:29Z","title":"Stem: Rethinking Causal Information Flow in Sparse Attention","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T02:39:28.798730Z"},"links":{"cited_paper":"/paper/2502.20766","citing_paper":"/paper/2603.06274"},"observation_digest":"sha256:e1c04d965ab242e0b55b0ca009379b3442a4c8944fdc04953751bba54cc9e44c","observation_id":"40daa6a6-231c-4877-b494-10baa294ce7a","resolution":{"observed_at":"2026-08-03T02:39:28.798730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20766","last_updated":"2025-02-28T06:34:53Z","snapshot_observed_at":"2026-08-07T17:40:46.337382Z","submitted_at":"2025-02-28T06:34:53Z","title":"FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference","version":1},"cited_work":{"arxiv_id":"2502.20766","doi":"10.48550/arxiv.2502.20766","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.20766","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flex- prefill: A context-aware sparse attention mechanism for efficient long-sequence inference.arXiv preprint arXiv:2502.20766","venue":"ArXiv.org","work_id":"0cb1c44c-efb7-45c0-aee5-f6032ae66a8b","year":2025},"citing_paper":{"arxiv_id":"2604.24820","last_updated":"2026-04-27T14:06:21Z","snapshot_observed_at":"2026-07-31T06:39:38.066325Z","submitted_at":"2026-04-27T14:06:21Z","title":"Salca: A Sparsity-Aware Hardware Accelerator for Efficient Long-Context Attention Decoding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-07T17:56:39.124969Z"},"links":{"cited_paper":"/paper/2502.20766","citing_paper":"/paper/2604.24820"},"observation_digest":"sha256:7dd70c23baf3efe50e581b6c1642599939113e405c0d616f6532c87055dafbf9","observation_id":"70435810-0bee-42cc-8d50-8281bf98cce0","resolution":{"observed_at":"2026-05-11T23:11:18.913894Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20766","last_updated":"2025-02-28T06:34:53Z","snapshot_observed_at":"2026-08-07T17:40:46.337382Z","submitted_at":"2025-02-28T06:34:53Z","title":"FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference","version":1},"cited_work":{"arxiv_id":"2502.20766","doi":"10.48550/arxiv.2502.20766","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.20766","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flex- prefill: A context-aware sparse attention mechanism for efficient long-sequence inference.arXiv preprint arXiv:2502.20766","venue":"ArXiv.org","work_id":"0cb1c44c-efb7-45c0-aee5-f6032ae66a8b","year":2025},"citing_paper":{"arxiv_id":"2605.06763","last_updated":"2026-05-11T02:30:41Z","snapshot_observed_at":"2026-07-06T23:19:10.574595Z","submitted_at":"2026-05-07T17:37:56Z","title":"Sparse Attention as a Range Searching Problem: Towards an Inference-Efficient Index for KV Cache","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-11T01:15:35.871863Z"},"links":{"cited_paper":"/paper/2502.20766","citing_paper":"/paper/2605.06763"},"observation_digest":"sha256:f40dad90fcf9ce80268f77d9f36fbb779c967ef2ccd7011422e89fca02391cd7","observation_id":"956182f1-e1bb-406d-b559-7b64a421254f","resolution":{"observed_at":"2026-05-11T01:15:50.421216Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20766","last_updated":"2025-02-28T06:34:53Z","snapshot_observed_at":"2026-08-07T17:40:46.337382Z","submitted_at":"2025-02-28T06:34:53Z","title":"FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference","version":1},"cited_work":{"arxiv_id":"2502.20766","doi":"10.48550/arxiv.2502.20766","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.20766","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flex- prefill: A context-aware sparse attention mechanism for efficient long-sequence inference.arXiv preprint arXiv:2502.20766","venue":"ArXiv.org","work_id":"0cb1c44c-efb7-45c0-aee5-f6032ae66a8b","year":2025},"citing_paper":{"arxiv_id":"2605.07719","last_updated":"2026-05-08T13:24:39Z","snapshot_observed_at":"2026-07-31T02:35:55.019423Z","submitted_at":"2026-05-08T13:24:39Z","title":"An Efficient Hybrid Sparse Attention with CPU-GPU Parallelism for Long-Context Inference","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-11T02:56:28.828593Z"},"links":{"cited_paper":"/paper/2502.20766","citing_paper":"/paper/2605.07719"},"observation_digest":"sha256:97d4ee39aa0981100f007463a1ff65f674fef2a1b57d10a0036abbbca2c0bf11","observation_id":"96c16d51-7e17-4785-b372-5c58b88a422f","resolution":{"observed_at":"2026-05-11T03:05:54.249978Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20766","last_updated":"2025-02-28T06:34:53Z","snapshot_observed_at":"2026-08-07T17:40:46.337382Z","submitted_at":"2025-02-28T06:34:53Z","title":"FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference","version":1},"cited_work":{"arxiv_id":"2502.20766","doi":"10.48550/arxiv.2502.20766","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.20766","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flex- prefill: A context-aware sparse attention mechanism for efficient long-sequence inference.arXiv preprint arXiv:2502.20766","venue":"ArXiv.org","work_id":"0cb1c44c-efb7-45c0-aee5-f6032ae66a8b","year":2025},"citing_paper":{"arxiv_id":"2605.08840","last_updated":"2026-05-09T09:49:32Z","snapshot_observed_at":"2026-07-06T23:21:02.177557Z","submitted_at":"2026-05-09T09:49:32Z","title":"ReST-KV: Robust KV Cache Eviction with Layer-wise Output Reconstruction and Spatial-Temporal Smoothing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T02:52:33.076123Z"},"links":{"cited_paper":"/paper/2502.20766","citing_paper":"/paper/2605.08840"},"observation_digest":"sha256:6553f3aa37cad668957d8e081f3528fa8d639abe3d0f2071862ba44f149a57da","observation_id":"5f47c392-359e-47ba-872e-b937bd6e455c","resolution":{"observed_at":"2026-05-12T07:26:30.101043Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20766","last_updated":"2025-02-28T06:34:53Z","snapshot_observed_at":"2026-08-07T17:40:46.337382Z","submitted_at":"2025-02-28T06:34:53Z","title":"FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference","version":1},"cited_work":{"arxiv_id":"2502.20766","doi":"10.48550/arxiv.2502.20766","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.20766","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flex- prefill: A context-aware sparse attention mechanism for efficient long-sequence inference.arXiv preprint arXiv:2502.20766","venue":"ArXiv.org","work_id":"0cb1c44c-efb7-45c0-aee5-f6032ae66a8b","year":2025},"citing_paper":{"arxiv_id":"2605.16839","last_updated":"2026-05-16T06:47:41Z","snapshot_observed_at":"2026-07-06T23:27:57.805018Z","submitted_at":"2026-05-16T06:47:41Z","title":"CompactAttention: Accelerating Chunked Prefill with Block-Union KV Selection","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-19T21:19:31.263068Z"},"links":{"cited_paper":"/paper/2502.20766","citing_paper":"/paper/2605.16839"},"observation_digest":"sha256:83733b3a109af368220f991304d843e89d6dfefcf97a537f3d6ef4b3de411aa7","observation_id":"691d2615-4b55-4092-9f23-e629ebced8cf","resolution":{"observed_at":"2026-05-19T21:22:47.999879Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20766","last_updated":"2025-02-28T06:34:53Z","snapshot_observed_at":"2026-08-07T17:40:46.337382Z","submitted_at":"2025-02-28T06:34:53Z","title":"FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference","version":1},"cited_work":{"arxiv_id":"2502.20766","doi":"10.48550/arxiv.2502.20766","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.20766","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flex- prefill: A context-aware sparse attention mechanism for efficient long-sequence inference.arXiv preprint arXiv:2502.20766","venue":"ArXiv.org","work_id":"0cb1c44c-efb7-45c0-aee5-f6032ae66a8b","year":2025},"citing_paper":{"arxiv_id":"2605.18071","last_updated":"2026-05-18T08:54:16Z","snapshot_observed_at":"2026-08-02T15:32:20.092680Z","submitted_at":"2026-05-18T08:54:16Z","title":"KVDrive: A Holistic Multi-Tier KV Cache Management System for Long-Context LLM Inference","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T11:13:46.098095Z"},"links":{"cited_paper":"/paper/2502.20766","citing_paper":"/paper/2605.18071"},"observation_digest":"sha256:2e1afff761829854415079cca7f13d8beac2dde31e3ec915209bbccfce11db49","observation_id":"9df60470-ba16-4bd9-9fa3-769b49d555f1","resolution":{"observed_at":"2026-05-20T11:18:13.988453Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20766","last_updated":"2025-02-28T06:34:53Z","snapshot_observed_at":"2026-08-07T17:40:46.337382Z","submitted_at":"2025-02-28T06:34:53Z","title":"FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference","version":1},"cited_work":{"arxiv_id":"2502.20766","doi":"10.48550/arxiv.2502.20766","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.20766","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flex- prefill: A context-aware sparse attention mechanism for efficient long-sequence inference.arXiv preprint arXiv:2502.20766","venue":"ArXiv.org","work_id":"0cb1c44c-efb7-45c0-aee5-f6032ae66a8b","year":2025},"citing_paper":{"arxiv_id":"2605.19893","last_updated":"2026-05-20T15:53:57Z","snapshot_observed_at":"2026-08-01T18:25:14.648621Z","submitted_at":"2026-05-19T14:24:27Z","title":"SSV: Sparse Speculative Verification for Efficient LLM Inference","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T07:14:04.899063Z"},"links":{"cited_paper":"/paper/2502.20766","citing_paper":"/paper/2605.19893"},"observation_digest":"sha256:7ce282ee3a4bab300f1611797ef0171d46a5072b8830776e3a1fc7d432b70175","observation_id":"45c82e97-281a-475d-9fd9-670ff0b15d49","resolution":{"observed_at":"2026-05-21T07:14:45.989128Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20766","last_updated":"2025-02-28T06:34:53Z","snapshot_observed_at":"2026-08-07T17:40:46.337382Z","submitted_at":"2025-02-28T06:34:53Z","title":"FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference","version":1},"cited_work":{"arxiv_id":"2502.20766","doi":"10.48550/arxiv.2502.20766","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.20766","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flex- prefill: A context-aware sparse attention mechanism for efficient long-sequence inference.arXiv preprint arXiv:2502.20766","venue":"ArXiv.org","work_id":"0cb1c44c-efb7-45c0-aee5-f6032ae66a8b","year":2025},"citing_paper":{"arxiv_id":"2605.20813","last_updated":"2026-05-20T07:06:54Z","snapshot_observed_at":"2026-08-02T08:54:20.689265Z","submitted_at":"2026-05-20T07:06:54Z","title":"PulseCol: Periodically Refreshed Column-Sparse Attention for Accelerating Diffusion Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T05:05:55.767705Z"},"links":{"cited_paper":"/paper/2502.20766","citing_paper":"/paper/2605.20813"},"observation_digest":"sha256:c54b97d3ae3a8ff0b8f45f5c668deff309bb6b0e988ae4b48081e25874865594","observation_id":"d00311f8-5d3e-4a4d-9470-d7e43812f682","resolution":{"observed_at":"2026-05-21T05:09:38.711780Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20766","last_updated":"2025-02-28T06:34:53Z","snapshot_observed_at":"2026-08-07T17:40:46.337382Z","submitted_at":"2025-02-28T06:34:53Z","title":"FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference","version":1},"cited_work":{"arxiv_id":"2502.20766","doi":"10.48550/arxiv.2502.20766","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.20766","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flex- prefill: A context-aware sparse attention mechanism for efficient long-sequence inference.arXiv preprint arXiv:2502.20766","venue":"ArXiv.org","work_id":"0cb1c44c-efb7-45c0-aee5-f6032ae66a8b","year":2025},"citing_paper":{"arxiv_id":"2605.23445","last_updated":"2026-05-22T09:58:23Z","snapshot_observed_at":"2026-08-03T04:13:05.122168Z","submitted_at":"2026-05-22T09:58:23Z","title":"DFSAttn: Dynamic Fine-grained Sparse Attention for Efficient Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-25T04:44:19.628926Z"},"links":{"cited_paper":"/paper/2502.20766","citing_paper":"/paper/2605.23445"},"observation_digest":"sha256:e169e8b303ea693ac78092fd52b060d90632211565745d358edcc5e2b5a0f8f0","observation_id":"c47c37df-1e68-4dfd-8707-18e5f507d54d","resolution":{"observed_at":"2026-05-25T04:45:20.108521Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20766","last_updated":"2025-02-28T06:34:53Z","snapshot_observed_at":"2026-08-07T17:40:46.337382Z","submitted_at":"2025-02-28T06:34:53Z","title":"FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference","version":1},"cited_work":{"arxiv_id":"2502.20766","doi":"10.48550/arxiv.2502.20766","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.20766","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flex- prefill: A context-aware sparse attention mechanism for efficient long-sequence inference.arXiv preprint arXiv:2502.20766","venue":"ArXiv.org","work_id":"0cb1c44c-efb7-45c0-aee5-f6032ae66a8b","year":2025},"citing_paper":{"arxiv_id":"2606.09441","last_updated":"2026-06-08T12:50:13Z","snapshot_observed_at":"2026-08-03T04:43:09.780812Z","submitted_at":"2026-06-08T12:50:13Z","title":"SIFT: Selective-Index For Fast Compute of RAG Prefill by Exploiting Attention Invariance","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T16:24:31.109508Z"},"links":{"cited_paper":"/paper/2502.20766","citing_paper":"/paper/2606.09441"},"observation_digest":"sha256:3ea447ecd52ec6bf8d993a9b35c3d103cadf34bd22cad2c36b8a9e1913255d33","observation_id":"132123ff-4f1b-4575-9f2d-4375c6e787aa","resolution":{"observed_at":"2026-07-03T01:37:31.238420Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20766","last_updated":"2025-02-28T06:34:53Z","snapshot_observed_at":"2026-08-07T17:40:46.337382Z","submitted_at":"2025-02-28T06:34:53Z","title":"FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference","version":1},"cited_work":{"arxiv_id":"2502.20766","doi":"10.48550/arxiv.2502.20766","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.20766","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flex- prefill: A context-aware sparse attention mechanism for efficient long-sequence inference.arXiv preprint arXiv:2502.20766","venue":"ArXiv.org","work_id":"0cb1c44c-efb7-45c0-aee5-f6032ae66a8b","year":2025},"citing_paper":{"arxiv_id":"2606.10537","last_updated":"2026-06-09T08:06:22Z","snapshot_observed_at":"2026-08-06T08:45:04.024766Z","submitted_at":"2026-06-09T08:06:22Z","title":"Prefilling-dLLM: Predictive Prefilling for Long-Context Inference in Diffusion Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-27T13:30:19.620692Z"},"links":{"cited_paper":"/paper/2502.20766","citing_paper":"/paper/2606.10537"},"observation_digest":"sha256:256c06cc8d28dca9840503223a6f1746ebcce932e0d4247b96c99fa9899dadf9","observation_id":"52f26710-85f6-4606-9141-17a1b7facdf3","resolution":{"observed_at":"2026-07-03T04:57:38.696659Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20766","last_updated":"2025-02-28T06:34:53Z","snapshot_observed_at":"2026-08-07T17:40:46.337382Z","submitted_at":"2025-02-28T06:34:53Z","title":"FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference","version":1},"cited_work":{"arxiv_id":"2502.20766","doi":"10.48550/arxiv.2502.20766","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.20766","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flex- prefill: A context-aware sparse attention mechanism for efficient long-sequence inference.arXiv preprint arXiv:2502.20766","venue":"ArXiv.org","work_id":"0cb1c44c-efb7-45c0-aee5-f6032ae66a8b","year":2025},"citing_paper":{"arxiv_id":"2606.28379","last_updated":"2026-06-19T17:35:05Z","snapshot_observed_at":"2026-07-07T00:02:29.000757Z","submitted_at":"2026-06-19T17:35:05Z","title":"LEDGER: Scaling Agentic Document Editing with Dependency-aware Graph Retrieval","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T10:32:09.554608Z"},"links":{"cited_paper":"/paper/2502.20766","citing_paper":"/paper/2606.28379"},"observation_digest":"sha256:f9dab4786bf0008bce2fe7275b68b561963651d87ebbf9ac0eddad4d2f5ca255","observation_id":"34acb13f-32eb-42b8-ac10-087a2646c71b","resolution":{"observed_at":"2026-06-30T10:34:36.227719Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20766","last_updated":"2025-02-28T06:34:53Z","snapshot_observed_at":"2026-08-07T17:40:46.337382Z","submitted_at":"2025-02-28T06:34:53Z","title":"FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20766","snapshot_observed_at":"2026-07-12T01:12:13.747675Z","title":"arXiv preprint arXiv:2502.20766 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03612","last_updated":"2026-07-03T22:01:35Z","snapshot_observed_at":"2026-08-03T07:17:39.441528Z","submitted_at":"2026-07-03T22:01:35Z","title":"SAF3R: Dynamic Sparse Attention for Feed-Forward 3D Reconstruction Transformers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-12T01:12:13.747675Z"},"links":{"cited_paper":"/paper/2502.20766","citing_paper":"/paper/2607.03612"},"observation_digest":"sha256:4939b3b4080f6adb51ef10bd2fcea88de412109c7339286f17ce0f5f71009b1e","observation_id":"d930d33b-b247-4e1f-8498-963cfe56059b","resolution":{"observed_at":"2026-07-12T01:12:13.747675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20766","last_updated":"2025-02-28T06:34:53Z","snapshot_observed_at":"2026-08-07T17:40:46.337382Z","submitted_at":"2025-02-28T06:34:53Z","title":"FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20766","snapshot_observed_at":"2026-08-01T13:25:54.951687Z","title":"Flexprefill: A context-aware sparse attention mechanism for efficient long-sequence inference.arXiv preprint arXiv:2502.20766, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19139","last_updated":"2026-07-30T16:07:04Z","snapshot_observed_at":"2026-08-03T13:02:29.806237Z","submitted_at":"2026-07-21T14:29:59Z","title":"Text Template Tokens Are Implicit Semantic Registers in Diffusion Transformers","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T13:25:54.951687Z"},"links":{"cited_paper":"/paper/2502.20766","citing_paper":"/paper/2607.19139"},"observation_digest":"sha256:92686388da1a35873c089085860080ccf87e29d86c4b5fef2aa2395d0c316b72","observation_id":"04cc3de6-669c-4141-a719-37c79c982594","resolution":{"observed_at":"2026-08-01T13:25:54.951687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20766","last_updated":"2025-02-28T06:34:53Z","snapshot_observed_at":"2026-08-07T17:40:46.337382Z","submitted_at":"2025-02-28T06:34:53Z","title":"FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20766","snapshot_observed_at":"2026-08-02T14:02:40.838142Z","title":"Flex- prefill: A context-aware sparse attention mechanism for efficient long-sequence inference.arXiv preprint arXiv:2502.20766,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20457","last_updated":"2026-05-14T23:43:35Z","snapshot_observed_at":"2026-08-08T13:40:26.764919Z","submitted_at":"2026-05-14T23:43:35Z","title":"Dropping the Anchor: Statistical Context Summarization for Distributed Systems via Pulsar Attention","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T14:02:40.838142Z"},"links":{"cited_paper":"/paper/2502.20766","citing_paper":"/paper/2607.20457"},"observation_digest":"sha256:536a69ab9f89440af54631e274d049f48dceaaf3a901de5c80d522ed34610268","observation_id":"a2f80cf7-bab2-4401-ada4-f300e1b68339","resolution":{"observed_at":"2026-08-02T14:02:40.838142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20766","last_updated":"2025-02-28T06:34:53Z","snapshot_observed_at":"2026-08-07T17:40:46.337382Z","submitted_at":"2025-02-28T06:34:53Z","title":"FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20766","snapshot_observed_at":"2026-07-31T11:04:04.526969Z","title":"arXiv preprint arXiv:2502.20766 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24593","last_updated":"2026-07-27T15:58:07Z","snapshot_observed_at":"2026-08-04T16:51:01.691381Z","submitted_at":"2026-07-27T15:58:07Z","title":"PIVOT: Efficient Query-Group Indexing for Token-Level Sparse Attention","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-31T11:04:04.526969Z"},"links":{"cited_paper":"/paper/2502.20766","citing_paper":"/paper/2607.24593"},"observation_digest":"sha256:ef2f3a6d02a3118b6c4be1537676d5dbd96a1d24323140097dc9f5be93ae436a","observation_id":"615534be-7122-4418-8206-4f466bc122a5","resolution":{"observed_at":"2026-07-31T11:04:04.526969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20766","last_updated":"2025-02-28T06:34:53Z","snapshot_observed_at":"2026-08-07T17:40:46.337382Z","submitted_at":"2025-02-28T06:34:53Z","title":"FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20766","snapshot_observed_at":"2026-08-01T02:55:46.301880Z","title":"arXiv preprint arXiv:2502.20766 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-07T07:57:40.290101Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:46.301880Z"},"links":{"cited_paper":"/paper/2502.20766","citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:117705d4c2a0f58ceaece5225f6196f685a5c5df8499e4ddbe49dc253e65587e","observation_id":"ba7fe839-b193-4471-a8cc-6705ae71df6c","resolution":{"observed_at":"2026-08-01T02:55:46.301880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20766","last_updated":"2025-02-28T06:34:53Z","snapshot_observed_at":"2026-08-07T17:40:46.337382Z","submitted_at":"2025-02-28T06:34:53Z","title":"FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20766","snapshot_observed_at":"2026-08-05T20:50:03.984247Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03335","last_updated":"2026-08-04T08:47:57Z","snapshot_observed_at":"2026-08-08T15:40:55.073428Z","submitted_at":"2026-08-04T08:47:57Z","title":"SPADE: An Input-Adaptive Sparse Attention Engine for Fast Video Diffusion Models Inference","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T20:50:03.984247Z"},"links":{"cited_paper":"/paper/2502.20766","citing_paper":"/paper/2608.03335"},"observation_digest":"sha256:cb816767590d7c1a37c7daefed19ec85e939a7e5dbc0a9080987a54b0b1bf04b","observation_id":"0380e261-edaa-46d6-8086-6632893ec8f6","resolution":{"observed_at":"2026-08-05T20:50:03.984247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20766","last_updated":"2025-02-28T06:34:53Z","snapshot_observed_at":"2026-08-07T17:40:46.337382Z","submitted_at":"2025-02-28T06:34:53Z","title":"FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20766","snapshot_observed_at":"2026-08-07T23:42:35.360123Z","title":"arXiv preprint arXiv:2502.20766 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-09T03:10:56.361894Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.360123Z"},"links":{"cited_paper":"/paper/2502.20766","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:53e7d42fa00199340c33774c8cf12e5b16f8cbfaddaeb3a98c7aaf4af04cd1fc","observation_id":"6083fe37-9c5f-40e6-97e3-d61f110a605a","resolution":{"observed_at":"2026-08-07T23:42:35.360123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.20766/citation-record","integrity":"/paper/2502.20766/integrity","json":"/paper/2502.20766/citation-record.json","paper":"/paper/2502.20766"},"outbound":[],"paper":{"arxiv_id":"2502.20766","last_updated":"2025-02-28T06:34:53Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T17:40:46.337382Z","submitted_at":"2025-02-28T06:34:53Z","title":"FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 35 inbound Pith citation observations for arXiv:2502.20766."}