{"as_of":"2026-08-05T14:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ca99fe726b2bb429cf41d2999099a0a3e5a9bad63a40f2a202d7829a54c72955","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T02:55:55.511467Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.25291/citation-record","integrity":"/paper/2607.25291/integrity","json":"/paper/2607.25291/citation-record.json","paper":"/paper/2607.25291"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:55:46.003957Z","title":"2024 , journal=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:46.003957Z"},"links":{"citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:2642dccacebc660a1f3214578c89195cec5e0c5f717aa091b63f43f0a1bc5988","observation_id":"c6473973-a10f-4e0a-936b-8028a4469081","resolution":{"observed_at":"2026-08-01T02:55:46.003957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13276","last_updated":"2025-02-17T02:24:47Z","snapshot_observed_at":"2026-08-05T05:19:17.395325Z","submitted_at":"2024-10-17T07:07:09Z","title":"SeerAttention: Learning Intrinsic Sparse Attention in Your LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13276","snapshot_observed_at":"2026-08-01T02:55:46.085046Z","title":"arXiv preprint arXiv:2410.13276 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:46.085046Z"},"links":{"cited_paper":"/paper/2410.13276","citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:7831b3c9d072dc33c5ea9db48c7ee0fcd3250d8ef03c91f87ea249ed49a02489","observation_id":"57b10020-c421-416a-b7fc-22318a361253","resolution":{"observed_at":"2026-08-01T02:55:46.085046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16428","last_updated":"2025-03-20T17:59:58Z","snapshot_observed_at":"2026-07-06T20:56:14.017923Z","submitted_at":"2025-03-20T17:59:58Z","title":"XAttention: Block Sparse Attention with Antidiagonal Scoring","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16428","snapshot_observed_at":"2026-08-01T02:55:46.171852Z","title":"arXiv preprint arXiv:2503.16428 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:46.171852Z"},"links":{"cited_paper":"/paper/2503.16428","citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:6da27ff08d0ccca66c8b1e181c050d9063a527917d123f0cafd86a9a112171a4","observation_id":"fdcc76a3-7adf-4d1d-bc3a-d79ce20d39ec","resolution":{"observed_at":"2026-08-01T02:55:46.171852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:55:46.233049Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:46.233049Z"},"links":{"citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:0456b7f216ccd22b0c9d9953af2b1908a4d350ec2a74e24da8813ea350b35abb","observation_id":"5b93182a-78a7-444f-a9d4-cc2e587f5eaa","resolution":{"observed_at":"2026-08-01T02:55:46.233049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20766","last_updated":"2025-02-28T06:34:53Z","snapshot_observed_at":"2026-07-06T20:44:13.353359Z","submitted_at":"2025-02-28T06:34:53Z","title":"FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20766","snapshot_observed_at":"2026-08-01T02:55:46.301880Z","title":"arXiv preprint arXiv:2502.20766 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:46.301880Z"},"links":{"cited_paper":"/paper/2502.20766","citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:3a8efab24197eabcce0f79c741815f10ec902c9614c6eec9b234cf1f62eec45c","observation_id":"ba7fe839-b193-4471-a8cc-6705ae71df6c","resolution":{"observed_at":"2026-08-01T02:55:46.301880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:55:46.413649Z","title":"arXiv preprint arXiv:2503.17407 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:46.413649Z"},"links":{"citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:ca62ae2674ec7a6e3227f16cd20b87bfc5ff368f5f56bf25fd24e8613b0956a2","observation_id":"5a1b6b55-8db0-4bee-b50a-90fe5400569d","resolution":{"observed_at":"2026-08-01T02:55:46.413649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13299","last_updated":"2025-07-08T06:24:53Z","snapshot_observed_at":"2026-08-03T14:50:04.556577Z","submitted_at":"2025-03-17T15:44:09Z","title":"A Survey on Transformer Context Extension: Approaches and Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13299","snapshot_observed_at":"2026-08-01T02:55:46.497701Z","title":"arXiv preprint arXiv:2503.13299 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:46.497701Z"},"links":{"cited_paper":"/paper/2503.13299","citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:81c80d717f9cef92666292323d41d8f83242e6cc6a64338b037aca2088d49fd3","observation_id":"12acc1de-2857-4e70-beac-b9d2a4576739","resolution":{"observed_at":"2026-08-01T02:55:46.497701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-08-01T02:55:46.633183Z","title":"arXiv preprint arXiv:2310.06770 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:46.633183Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:ac6a74bc3808b3dfa4f912f7e381a06a85d6538af405bf00ff8f2112403f9d66","observation_id":"edb776b5-be67-4fe6-a1a9-5b6c0b60fb7e","resolution":{"observed_at":"2026-08-01T02:55:46.633183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-01T02:55:46.766469Z","title":"arXiv preprint arXiv:2505.09388 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:46.766469Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:08cc329b38550efcf355cd69a80076df1fa671dfb8b9723b059cde3814ed6e47","observation_id":"c77a66cd-3940-4284-b563-85501e99e149","resolution":{"observed_at":"2026-08-01T02:55:46.766469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09567","snapshot_observed_at":"2026-08-01T02:55:46.880834Z","title":"arXiv preprint arXiv:2503.09567 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:46.880834Z"},"links":{"cited_paper":"/paper/2503.09567","citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:ac738332aaa4be9e0d7dceafb9396f9aaa60d568e35b24fb963b8dfed32d7bab","observation_id":"bd45346f-5472-44fe-adb1-259727119d52","resolution":{"observed_at":"2026-08-01T02:55:46.880834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-01T02:55:46.966133Z","title":"arXiv preprint arXiv:2501.12948 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:46.966133Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:d6f25bf209c75ea6c6ff9f9e748105d70b0850d634ac53a1f156def9fb28e04b","observation_id":"4cfa87f5-f21f-45a5-8e30-1ff8bdefe454","resolution":{"observed_at":"2026-08-01T02:55:46.966133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:55:47.098123Z","title":"IEEE transactions on knowledge and data engineering , volume=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:47.098123Z"},"links":{"citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:e402b4b56c94ff29ca1403825e2e78970f20fc165c9b34e85d91995aa2e4b483","observation_id":"99dc8954-2bc6-4890-b367-eb0b7806cd9d","resolution":{"observed_at":"2026-08-01T02:55:47.098123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:55:47.202653Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:47.202653Z"},"links":{"citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:3b772d5fddd08023256968160165a31622810f2a2e137d1df9692ec790bea3aa","observation_id":"3bc2cc2f-e686-4e2f-8e31-2970e4db5c73","resolution":{"observed_at":"2026-08-01T02:55:47.202653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-01T02:55:47.329691Z","title":"arXiv preprint arXiv:2004.05150 , year=","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:47.329691Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:7d375a5c86a08c662fb2bc1224402aa0ca19a1468f6fd3689763abb6798e4f4f","observation_id":"73aa13b8-b2ee-4221-bf90-e162ad4030f7","resolution":{"observed_at":"2026-08-01T02:55:47.329691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:55:47.480738Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:47.480738Z"},"links":{"citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:02c70c16cf4dbb3bd4aea5baa4630330890878f8fb5ea47f395733a145f3136e","observation_id":"bda7806e-3f46-4b92-a9ac-182ee6c5fe41","resolution":{"observed_at":"2026-08-01T02:55:47.480738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15204","last_updated":"2025-01-03T11:44:51Z","snapshot_observed_at":"2026-08-04T21:07:04.238345Z","submitted_at":"2024-12-19T18:59:17Z","title":"LongBench v2: Towards Deeper Understanding and Reasoning on Realistic Long-context Multitasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15204","snapshot_observed_at":"2026-08-01T02:55:47.646679Z","title":"arXiv preprint arXiv:2412.15204 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:47.646679Z"},"links":{"cited_paper":"/paper/2412.15204","citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:d7eb03f6932533b8d472cf8466cbe3d05c98a09f930f73357f3896452377ca38","observation_id":"40e78ac4-1092-4d7b-8755-6881fb3e07e1","resolution":{"observed_at":"2026-08-01T02:55:47.646679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:55:47.843533Z","title":"L ong B ench: A Bilingual, Multitask Benchmark for Long Context Understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:47.843533Z"},"links":{"citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:a95e5190c79bad3b657959d81ddc67d887c5538349380dbc46835c82038d2242","observation_id":"7ea9e06b-6ef6-466d-98fd-33cc72dc3340","resolution":{"observed_at":"2026-08-01T02:55:47.843533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-01T02:55:47.941934Z","title":"arXiv preprint arXiv:2407.21783 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:47.941934Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:71a0dca8731993bcb617a458e13ba6fad8756f4c018071a368b23699420b96d2","observation_id":"de651917-7dbf-4ac3-ae8c-a2aa712174d8","resolution":{"observed_at":"2026-08-01T02:55:47.941934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10819","last_updated":"2024-10-14T17:59:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-14T17:59:58Z","title":"DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10819","snapshot_observed_at":"2026-08-01T02:55:48.085704Z","title":"arXiv preprint arXiv:2410.10819 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:48.085704Z"},"links":{"cited_paper":"/paper/2410.10819","citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:b58aaecb3eaa2c03cc2643d3e9eed144a4ec9c203a0596325602c0c6505b4130","observation_id":"7887b898-9dbd-4a80-b42d-b00b546af26f","resolution":{"observed_at":"2026-08-01T02:55:48.085704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:55:48.184773Z","title":"arXiv preprint arXiv:2406.14909 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:48.184773Z"},"links":{"citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:0e004fac82d703ae30a16c8f375e4e4c06bf0d6c2b4ed96ce2dfc161d053f314","observation_id":"e198e754-b5c9-457f-a40e-ade83f9fbeed","resolution":{"observed_at":"2026-08-01T02:55:48.184773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-01T02:55:48.331046Z","title":"arXiv preprint arXiv:2305.13245 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:48.331046Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:83e81d70193811d79658ad46cab6d89231e248089f3581ee612b7c30bb80e05a","observation_id":"314b9551-7096-46a5-b542-c158c3b8d2d9","resolution":{"observed_at":"2026-08-01T02:55:48.331046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:55:48.470417Z","title":"and Ermon, Stefano and Rudra, Atri and R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:48.470417Z"},"links":{"citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:d7c224398b234b7bb774a349d1b0d5a519a47dc0d4b0a6d4bad14a32c4e70c46","observation_id":"e4fc1560-6eaa-4bb2-9fc6-c67a846795a2","resolution":{"observed_at":"2026-08-01T02:55:48.470417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:55:48.556427Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:48.556427Z"},"links":{"citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:e4f6b2bab426e25dd2e632cdd9079794f9de71c9fa92c50fdf7f8b8da98e0b7e","observation_id":"6df14abd-0b68-4617-84e4-20a62a65e62b","resolution":{"observed_at":"2026-08-01T02:55:48.556427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:55:48.670740Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:48.670740Z"},"links":{"citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:dfdb1f2942b3f7c8cfea71c02b61f7d51b70c5076d26078b4206453c9e9f27d8","observation_id":"a0945939-3453-46e1-b22d-bbcaf1bf4fe7","resolution":{"observed_at":"2026-08-01T02:55:48.670740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:55:48.807256Z","title":"arXiv preprint arXiv:2603.05451 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:48.807256Z"},"links":{"citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:57a01869a874246c052f8debe49690b6cb7add7246a6784e8c6dc1ca20bb76ac","observation_id":"0396ea82-1da0-4761-9476-e3525300648e","resolution":{"observed_at":"2026-08-01T02:55:48.807256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:55:48.932050Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:48.932050Z"},"links":{"citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:b6f9929217d2220ebd506ea5865fdd2dfb1c470a453c74cdcc03198c3dcb39b9","observation_id":"4eecc743-4bc8-41cf-b075-d1298e6c2905","resolution":{"observed_at":"2026-08-01T02:55:48.932050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11089","last_updated":"2025-02-27T09:01:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-16T11:53:44Z","title":"Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11089","snapshot_observed_at":"2026-08-01T02:55:49.035284Z","title":"arXiv preprint arXiv:2502.11089 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:49.035284Z"},"links":{"cited_paper":"/paper/2502.11089","citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:798c7b31c13e5d4d30cf7ded18d89d313672e93d1ff75819ff794b6951f4400d","observation_id":"d5c12d74-e239-4c32-97d9-25f5c1bc1304","resolution":{"observed_at":"2026-08-01T02:55:49.035284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07900","last_updated":"2025-09-04T16:23:02Z","snapshot_observed_at":"2026-07-06T21:39:08.559358Z","submitted_at":"2025-06-09T16:16:50Z","title":"MiniCPM4: Ultra-Efficient LLMs on End Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07900","snapshot_observed_at":"2026-08-01T02:55:49.147989Z","title":"arXiv preprint arXiv:2506.07900 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:49.147989Z"},"links":{"cited_paper":"/paper/2506.07900","citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:e03a75811f679d0d17d256464399ad465b56665fffcb5f2f3dd64ab396057feb","observation_id":"1ce58eaf-ac3a-466a-b5f7-694ebba9ac76","resolution":{"observed_at":"2026-08-01T02:55:49.147989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-01T02:55:49.270498Z","title":"arXiv preprint arXiv:2309.17453 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:49.270498Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:8504118ee084611e89d076237ced8d95f3eda4f0cde08760a3d1fedc89cd6d86","observation_id":"99ab8859-6de7-4715-a0e9-96170a4611a9","resolution":{"observed_at":"2026-08-01T02:55:49.270498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:55:49.370274Z","title":"arXiv preprint arXiv:2509.24745 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:49.370274Z"},"links":{"citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:104df771ba32275825192003e36aea60c32f9839ae8535ffda61b8a7e4127877","observation_id":"73d38bff-7fa9-4a55-90d3-ac941d49c72f","resolution":{"observed_at":"2026-08-01T02:55:49.370274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:55:49.490246Z","title":"arXiv preprint arXiv:2603.12201 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:49.490246Z"},"links":{"citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:646882b89fd6019a5588d9ddbd7a81258b7e569200cf0561aeee9c61051dd764","observation_id":"fd1baf07-ee63-47b5-b399-49b1fe8ac874","resolution":{"observed_at":"2026-08-01T02:55:49.490246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:55:49.590453Z","title":"arXiv preprint arXiv:2502.18137 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:49.590453Z"},"links":{"citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:ba47f455c3e944133162b401caf353b9536b5e09a2f8559ca5fe35a539ba15e8","observation_id":"e4a60a6e-cf4d-4eaf-80a6-222e9e87a9d3","resolution":{"observed_at":"2026-08-01T02:55:49.590453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:55:49.706856Z","title":"arXiv preprint arXiv:2602.13515 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:49.706856Z"},"links":{"citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:ffc69c0021feb904b43c320f6e9fa1232432ed43ea24ff8285c3f41013ce3d67","observation_id":"e9a3b653-9335-425d-957c-1d984892b036","resolution":{"observed_at":"2026-08-01T02:55:49.706856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:55:49.899847Z","title":"arXiv preprint arXiv:2603.06199 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:49.899847Z"},"links":{"citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:6fbd399dbe233e75eb94e06b1948cc06921d9b19e617da4d31876911b7c5c864","observation_id":"b61781ed-5b7c-4a77-b6e4-52b028151053","resolution":{"observed_at":"2026-08-01T02:55:49.899847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.08426","last_updated":"2026-05-25T11:18:29Z","snapshot_observed_at":"2026-08-03T03:22:52.672693Z","submitted_at":"2026-02-09T09:31:06Z","title":"Prism: Spectral-Aware Block-Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.08426","snapshot_observed_at":"2026-08-01T02:55:50.041954Z","title":"arXiv preprint arXiv:2602.08426 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:50.041954Z"},"links":{"cited_paper":"/paper/2602.08426","citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:e5363676af0ddc3d8fc838ccd895a1b468a09b08e887f1dc2d05dd57cf71567e","observation_id":"74a91bff-0875-489f-963a-b9c76365960f","resolution":{"observed_at":"2026-08-01T02:55:50.041954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.12087","last_updated":"2026-04-28T06:58:25Z","snapshot_observed_at":"2026-07-06T22:38:54.914862Z","submitted_at":"2025-12-12T23:30:43Z","title":"BLASST: Dynamic BLocked Attention Sparsity via Softmax Thresholding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.12087","snapshot_observed_at":"2026-08-01T02:55:50.187273Z","title":"arXiv preprint arXiv:2512.12087 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:50.187273Z"},"links":{"cited_paper":"/paper/2512.12087","citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:08522b94550f7028cef6469a0dc4cc7efa280e819a12f87a22a8a613a22c5840","observation_id":"78bbb400-e10c-45ef-8c68-c810580fa1f9","resolution":{"observed_at":"2026-08-01T02:55:50.187273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.26380","last_updated":"2026-04-25T07:03:31Z","snapshot_observed_at":"2026-08-02T13:16:02.235171Z","submitted_at":"2026-03-27T13:04:29Z","title":"Switch Attention: Towards Dynamic and Fine-grained Hybrid Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.26380","snapshot_observed_at":"2026-08-01T02:55:50.320256Z","title":"arXiv preprint arXiv:2603.26380 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:50.320256Z"},"links":{"cited_paper":"/paper/2603.26380","citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:620866ef00b1a1509efa646e5fd2df2330074c915fcb84352fc0cb3c88854587","observation_id":"265fb069-106d-4305-b54a-e46fcc019bc3","resolution":{"observed_at":"2026-08-01T02:55:50.320256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:55:50.398367Z","title":"arXiv preprint arXiv:2601.17367 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:50.398367Z"},"links":{"citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:1a0c147f167e2e3a4f7f1e25a296f2d630c40eafc2a9ef01f3de9ba9b5eb0849","observation_id":"d5b68bfa-d093-4172-9077-d18e87efc085","resolution":{"observed_at":"2026-08-01T02:55:50.398367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01005","last_updated":"2025-04-21T20:10:11Z","snapshot_observed_at":"2026-07-06T20:15:36.280948Z","submitted_at":"2025-01-02T02:02:20Z","title":"FlashInfer: Efficient and Customizable Attention Engine for LLM Inference Serving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01005","snapshot_observed_at":"2026-08-01T02:55:50.552427Z","title":"arXiv preprint arXiv:2501.01005 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:50.552427Z"},"links":{"cited_paper":"/paper/2501.01005","citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:9ef132ebd3f7491eea116fa97bdf1d0e411fdbffa9f653310835745f0810fd73","observation_id":"e75fa642-5e95-44f2-b899-179fb388485d","resolution":{"observed_at":"2026-08-01T02:55:50.552427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:55:50.676369Z","title":"Proceedings of the 29th symposium on operating systems principles , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:50.676369Z"},"links":{"citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:17c5f58d6ecae228a7e5a9d79b76daf6f3d9e64fa1b3c43b41fc82a495d52779","observation_id":"4acb7e70-5685-438c-9218-cc5653c26dfb","resolution":{"observed_at":"2026-08-01T02:55:50.676369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01889","last_updated":"2023-11-27T06:38:47Z","snapshot_observed_at":"2026-07-06T16:26:58.234941Z","submitted_at":"2023-10-03T08:44:50Z","title":"Ring Attention with Blockwise Transformers for Near-Infinite Context","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01889","snapshot_observed_at":"2026-08-01T02:55:50.847935Z","title":"CoRR abs/2310.01889 (2023) , author=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:50.847935Z"},"links":{"cited_paper":"/paper/2310.01889","citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:f50b22d18f1a18bd8fb837c4263d9a6bb094630ca91bd0e51b0550e18de5d32a","observation_id":"8fca7d37-b64f-4656-bd7d-92f312959700","resolution":{"observed_at":"2026-08-01T02:55:50.847935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:55:51.013937Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:51.013937Z"},"links":{"citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:8591a56661ee23463c1493a7353eaa3e91f7291ebe5f0d1584bf0fdd34b1d598","observation_id":"4468db8b-d732-4c53-86eb-a825be7d09c6","resolution":{"observed_at":"2026-08-01T02:55:51.013937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:55:51.235367Z","title":"arXiv preprint arXiv:2411.10958 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:51.235367Z"},"links":{"citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:e9d1bb056643ede23e96649c87b871249e41e74180c19d5ce0d22608598f7165","observation_id":"cdbe61bc-a5f0-4be6-8298-18332db0677a","resolution":{"observed_at":"2026-08-01T02:55:51.235367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21136","last_updated":"2025-06-06T07:47:22Z","snapshot_observed_at":"2026-08-03T20:53:26.614738Z","submitted_at":"2025-05-27T12:50:36Z","title":"SageAttention2++: A More Efficient Implementation of SageAttention2","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21136","snapshot_observed_at":"2026-08-01T02:55:51.477723Z","title":"arXiv preprint arXiv:2505.21136 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:51.477723Z"},"links":{"cited_paper":"/paper/2505.21136","citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:d230fb0a1a6291ab37b1bccabae4f39ce0104fcfef7b20c81a58c3a5da5ec2cd","observation_id":"be1ed503-9d27-423b-9bbb-e1333006e8f4","resolution":{"observed_at":"2026-08-01T02:55:51.477723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:55:51.646237Z","title":"2026 , publisher =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:51.646237Z"},"links":{"citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:594326e70a13f5a19d284b145bc1b2cf692a325428029c0f1c7e3e7b02bf9f72","observation_id":"ffb1585c-97b6-43c4-bfd6-39c2f8acccc9","resolution":{"observed_at":"2026-08-01T02:55:51.646237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:55:51.712438Z","title":"2023 , publisher =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:51.712438Z"},"links":{"citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:18ecbd71373b95679da21bea98e5648736456f91cf26537b5dbe2e4b48929f7f","observation_id":"b3442307-3ab0-4afc-bbf8-9d8b67c8700c","resolution":{"observed_at":"2026-08-01T02:55:51.712438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:55:51.870523Z","title":"GitHub repository , howpublished =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:51.870523Z"},"links":{"citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:b15b2d0c912b6f6405f7e5569b08d956023ff33b641f4c42cad07e6d0a896c54","observation_id":"6eb3b274-3a78-486a-9141-8b5d1618cbc3","resolution":{"observed_at":"2026-08-01T02:55:51.870523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.13392","last_updated":"2026-06-11T14:23:41Z","snapshot_observed_at":"2026-08-01T14:56:42.323551Z","submitted_at":"2026-06-11T14:23:41Z","title":"MiniMax Sparse Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.13392","snapshot_observed_at":"2026-08-01T02:55:52.016198Z","title":"arXiv preprint arXiv:2606.13392 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:52.016198Z"},"links":{"cited_paper":"/paper/2606.13392","citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:b410d27954644099d2878832530a665869edf59c050f9836c2f41601b5e4403b","observation_id":"2e7f9c91-1b42-4dc3-b863-4cb021ae7c50","resolution":{"observed_at":"2026-08-01T02:55:52.016198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:55:52.197288Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:52.197288Z"},"links":{"citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:a4f8097aca2ef29c97c275736c498763925d21fe9dd6d9d5cf5e07d0b19b3378","observation_id":"372fa9b9-9d05-4a28-becd-5a7d920c12cb","resolution":{"observed_at":"2026-08-01T02:55:52.197288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:55:52.348380Z","title":"arXiv preprint arXiv:2602.03560 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:52.348380Z"},"links":{"citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:7d7782e0743d5846a7396e589a6670215a76470171a539bacb86a8b580323b86","observation_id":"7f7801ea-a7bd-4187-89f4-04eb31c3ceff","resolution":{"observed_at":"2026-08-01T02:55:52.348380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02556","last_updated":"2025-12-02T09:25:14Z","snapshot_observed_at":"2026-07-31T23:49:25.878472Z","submitted_at":"2025-12-02T09:25:14Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.02556","snapshot_observed_at":"2026-08-01T02:55:52.539170Z","title":"2: Pushing the frontier of open large language models , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:52.539170Z"},"links":{"cited_paper":"/paper/2512.02556","citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:e764ffecee506f3bd72419f9be3f35849bfdeec5b75bfb7eb6c6f69326eee41c","observation_id":"5cd8f540-4b9a-4f76-84f8-93aaf5fdf7b4","resolution":{"observed_at":"2026-08-01T02:55:52.539170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00071","last_updated":"2026-02-06T19:40:50Z","snapshot_observed_at":"2026-08-01T02:15:47.181936Z","submitted_at":"2023-08-31T18:18:07Z","title":"YaRN: Efficient Context Window Extension of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00071","snapshot_observed_at":"2026-08-01T02:55:52.698377Z","title":"arXiv , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:52.698377Z"},"links":{"cited_paper":"/paper/2309.00071","citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:e1bfb029339508a11a92052e8989e64ab58019fa1ff54687e6f90ffc44c3a3bd","observation_id":"752c0eca-ddec-47e4-81c8-83ba42306556","resolution":{"observed_at":"2026-08-01T02:55:52.698377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-08-01T02:55:52.854697Z","title":"arXiv preprint arXiv:2507.20534 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:52.854697Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:431e575f834393a375380c3e50cfeab45ea85723bb89a5949c8ab88e81b38547","observation_id":"9fd9f65d-f319-43ae-8853-6b4db10cc38a","resolution":{"observed_at":"2026-08-01T02:55:52.854697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15763","last_updated":"2026-02-24T10:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T17:50:56Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15763","snapshot_observed_at":"2026-08-01T02:55:53.095194Z","title":"arXiv preprint arXiv:2602.15763 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:53.095194Z"},"links":{"cited_paper":"/paper/2602.15763","citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:e1e8be5521e2cea1028bdc041d99836a8512cc1bf04a5201fbe941beb9300fbc","observation_id":"cb465c79-47de-4847-bc1e-37be20d626e7","resolution":{"observed_at":"2026-08-01T02:55:53.095194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:55:53.255448Z","title":"Science , volume=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:53.255448Z"},"links":{"citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:8619ba8a4b803b1539fbf8a3b7fab8a36c41ef5643600ff65ad0fff24be8aa6b","observation_id":"15ba33b5-eede-4dac-af4a-0abb851a83f2","resolution":{"observed_at":"2026-08-01T02:55:53.255448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18016","last_updated":"2025-03-23T10:33:28Z","snapshot_observed_at":"2026-07-06T20:57:21.459904Z","submitted_at":"2025-03-23T10:33:28Z","title":"Retrieval Augmented Generation and Understanding in Vision: A Survey and New Outlook","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18016","snapshot_observed_at":"2026-08-01T02:55:53.414494Z","title":"arXiv preprint arXiv:2503.18016 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:53.414494Z"},"links":{"cited_paper":"/paper/2503.18016","citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:dc4f9f27cd8101ccf6e14809be057a6d95c0a4fb6ca9059bde8115c0656ab365","observation_id":"c20d5658-82a5-4014-91b5-248a7ddd67fb","resolution":{"observed_at":"2026-08-01T02:55:53.414494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:55:53.584885Z","title":"arXiv preprint arXiv:2602.03442 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:53.584885Z"},"links":{"citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:5ec7aae59e8cef1d66aff1f8d87d8c43e9e80602166d0e9a4b10264122672525","observation_id":"962716ca-ffaa-4b15-8dd7-7aff5763e726","resolution":{"observed_at":"2026-08-01T02:55:53.584885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10774","last_updated":"2024-08-26T21:01:02Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-16T01:33:02Z","title":"Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10774","snapshot_observed_at":"2026-08-01T02:55:53.816311Z","title":"arXiv preprint arXiv:2406.10774 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:53.816311Z"},"links":{"cited_paper":"/paper/2406.10774","citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:7e28e8389506e156429b8e7d0fb478f8ca685a6986955734cc93776ef4dd2c70","observation_id":"605440b1-68a9-4521-8455-8ac083d751f3","resolution":{"observed_at":"2026-08-01T02:55:53.816311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.02867","last_updated":"2018-07-28T06:51:27Z","snapshot_observed_at":"2026-07-06T06:37:55.065033Z","submitted_at":"2018-05-08T07:34:17Z","title":"Online normalizer calculation for softmax","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.02867","snapshot_observed_at":"2026-08-01T02:55:53.999965Z","title":"arXiv preprint arXiv:1805.02867 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:53.999965Z"},"links":{"cited_paper":"/paper/1805.02867","citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:dfb4a750f9c22019097ecabdc16ebd573952cc6f5c1b5c611128b7e2dbb764bb","observation_id":"5efec613-b623-495e-b49b-da72f5cfa1b5","resolution":{"observed_at":"2026-08-01T02:55:53.999965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:55:54.211435Z","title":"arXiv preprint arXiv:2510.07486 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:54.211435Z"},"links":{"citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:925c95f7a1e418e8c39092d6931e65aa97a77a03968bb89902b22898040dfbec","observation_id":"973f1528-763c-4d49-bc90-a226a834dc59","resolution":{"observed_at":"2026-08-01T02:55:54.211435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:55:54.325376Z","title":"Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:54.325376Z"},"links":{"citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:bcd7d09a439451d3fc838831bae97f302bd9deea1e10df54515118d4de221334","observation_id":"112c5b92-250a-49a9-9cd3-6567656a2aaa","resolution":{"observed_at":"2026-08-01T02:55:54.325376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:55:54.484860Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:54.484860Z"},"links":{"citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:4a85f14b331fd9c6d55e8fb71c5fe4d624766401bfea65f5e01cb20791807315","observation_id":"adac0b8f-8f53-426d-b728-56e26d944b93","resolution":{"observed_at":"2026-08-01T02:55:54.484860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:55:54.701513Z","title":"arXiv preprint arXiv:2603.06274 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:54.701513Z"},"links":{"citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:8cb950b7dc3db9681eddf01291dd77456f5026c1ae0f4afa31aea7e79df7f7a6","observation_id":"3173efb7-91b2-4634-8514-d4b53d543471","resolution":{"observed_at":"2026-08-01T02:55:54.701513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07518","last_updated":"2026-05-14T23:37:13Z","snapshot_observed_at":"2026-07-06T20:50:00.422560Z","submitted_at":"2025-03-10T16:41:14Z","title":"TokenButler: Token Importance is Predictable","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07518","snapshot_observed_at":"2026-08-01T02:55:54.858043Z","title":"arXiv preprint arXiv:2503.07518 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:54.858043Z"},"links":{"cited_paper":"/paper/2503.07518","citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:2d8f2ba17e8816e0cea2c8a9d2cb43dcaed74f32f59de793d9e220939bf10631","observation_id":"45f798d9-5313-4f2b-a997-698a771b918a","resolution":{"observed_at":"2026-08-01T02:55:54.858043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.16928","last_updated":"2026-06-08T02:38:05Z","snapshot_observed_at":"2026-08-02T02:41:46.596895Z","submitted_at":"2026-05-16T10:51:58Z","title":"Full Attention Strikes Back: Transferring Full Attention into Sparse within Hundred Training Steps","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.16928","snapshot_observed_at":"2026-08-01T02:55:55.008440Z","title":"arXiv preprint arXiv:2605.16928 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:55.008440Z"},"links":{"cited_paper":"/paper/2605.16928","citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:9cbcbb453f6af60ba45ea51d99fc6002c8d98bf6f5801d1ee07fc118dc42ab59","observation_id":"d6e48e26-ae9e-49f5-bd9a-1e29d1ebc24e","resolution":{"observed_at":"2026-08-01T02:55:55.008440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.20102","last_updated":"2026-06-04T11:55:53Z","snapshot_observed_at":"2026-08-05T00:11:47.524069Z","submitted_at":"2025-11-25T09:21:57Z","title":"SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.20102","snapshot_observed_at":"2026-08-01T02:55:55.168098Z","title":"arXiv preprint arXiv:2511.20102 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:55.168098Z"},"links":{"cited_paper":"/paper/2511.20102","citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:0849872fe2d4e8ddd64059404eff001b4237dc92c78c52f8a6d20b9489c6a66e","observation_id":"8ad8611a-7984-4426-b3e8-ef3e1b5ac2bc","resolution":{"observed_at":"2026-08-01T02:55:55.168098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:55:55.347696Z","title":"arXiv preprint arXiv:2512.14082 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:55.347696Z"},"links":{"citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:ad9d04c0e39a006ae446b20d5106b31126fa28a1e6b85e9549cada38ec38c3d9","observation_id":"52f282e2-3c08-4793-80a1-46324f01f57c","resolution":{"observed_at":"2026-08-01T02:55:55.347696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:55:55.511467Z","title":"arXiv preprint arXiv:2602.05853 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-01T02:55:55.511467Z"},"links":{"citing_paper":"/paper/2607.25291"},"observation_digest":"sha256:859358b0781190f23bd6cfb982b92654c2c0cacdeaba6b1abfdee4e86226b746","observation_id":"be8b4119-15ce-4dd8-8125-c52d175ddfb2","resolution":{"observed_at":"2026-08-01T02:55:55.511467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.25291","last_updated":"2026-07-28T04:57:19Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-02T09:47:49.803731Z","submitted_at":"2026-07-28T04:57:19Z","title":"CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":68,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 0 inbound Pith citation observations for arXiv:2607.25291."}