{"as_of":"2026-08-19T18:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:01a20812dd0174e732cec5f71c8e43e1cb318a80f547413e15fdf1e9ae917fe9","coverage":[{"denominator":78,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":78,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T10:50:12.926232Z","state":"measured"},{"denominator":79,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":79,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T05:40:56.557646Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.18753","snapshot_observed_at":"2026-07-12T05:40:56.557646Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-13T13:15:47.894654Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-12T05:40:56.557646Z"},"links":{"cited_paper":"/paper/2605.18753","citing_paper":"/paper/2607.02980"},"observation_digest":"sha256:1d4480cf9d3f82cb5271b898286fcada6b148745896977ef97bf9dd79bdbf36d","observation_id":"db6737fa-c185-44b1-a272-8815764a89af","resolution":{"observed_at":"2026-07-12T05:40:56.557646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.18753/citation-record","integrity":"/paper/2605.18753/integrity","json":"/paper/2605.18753/citation-record.json","paper":"/paper/2605.18753"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Is it really long context if all you need is retrieval? towards genuinely difficult long context NLP","venue":null,"work_id":"e8f0fbf7-a47e-49b6-8cb2-971a7098f396","year":2024},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:820a078195b7b9213acd8272c6e7c9bbc1a39a187b364146e0cb65537d32ec77","observation_id":"6d5ba521-272d-448a-8673-71cacd619d3a","resolution":{"observed_at":"2026-05-20T10:53:26.146562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2079b3df-d899-479e-bb21-4a9bc728779c","year":2026},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:2c222f22b6e6059c762f37bd18038c567cfc06cfe168dec24717a7868b7da6fe","observation_id":"929d89d6-30cd-40ee-8a68-1b6381af3f11","resolution":{"observed_at":"2026-05-20T10:53:26.135459Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T15:47:23.567466Z","title":"Attention is all you need.Advances in neural information processing systems, 30","venue":null,"work_id":"751efe07-5e91-415c-b3d1-f4734aa26960","year":2017},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:3ba01885cb52d849a87745d2ec37b08a67878c3068ba8fd12d3cbcb0a10c5860","observation_id":"60e5711f-49c1-4cba-a6b4-9e445e33c176","resolution":{"observed_at":"2026-05-20T10:53:26.133698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Softmax is not enough (for sharp size generalisation)","venue":null,"work_id":"768a1fbc-81d7-42d4-a7e1-9eaa6555a943","year":2025},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:9cd9d5326bb457fc892ff61311107308fc659088bb00d8241c65a28f02f4c0ab","observation_id":"7cde45ae-baeb-4fda-b8f7-8d05985f8c39","resolution":{"observed_at":"2026-05-20T10:53:26.144002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Native sparse attention: Hardware-aligned and natively trainable sparse attention","venue":null,"work_id":"cc70bdb5-742a-4dcb-a702-b6617a935cd3","year":2025},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:555e6556d2b2ae8c8a977e0402913a62243d05fcdda6c8047fb214e02aa97c3b","observation_id":"c3e2f403-7f6e-4f7d-8a65-294a897559f5","resolution":{"observed_at":"2026-05-20T10:53:26.129008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"InfLLM-v2: Dense-sparse switchable attention for seamless short-to-long adaptation","venue":null,"work_id":"423631e5-49d7-4fa3-b65f-1bdb928305fa","year":2026},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:638386fd9652558d630804e76e4f4738565eb5e3f46780b9c41a509a24dc5f3a","observation_id":"03f36460-b66b-4402-8a46-86c456e2fb4f","resolution":{"observed_at":"2026-05-20T10:53:26.137533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"79ddfac2-acf5-4e9b-9698-ea8cb9ff1f21","year":2019},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:3a8c020f4756ecccfdf6a6f30f67f1975dae13adf522b51abb044eacb53cf1fd","observation_id":"0068619b-f1ab-4ccf-b610-bbd56a088321","resolution":{"observed_at":"2026-05-20T10:53:26.141925Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Long-context generalization with sparse attention","venue":null,"work_id":"6f0961dd-3849-4184-bcd4-26aaa65731f9","year":2026},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:598f431ea7c87be68588c4800e7c5c161d24e025db5e851245b2d7a6856d9aea","observation_id":"13a84dfa-7a41-42fd-85bd-749ddcd466e9","resolution":{"observed_at":"2026-05-20T10:53:26.133509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MoBA: Mixture of block attention for long-context LLMs","venue":null,"work_id":"5e6598a8-24c9-40a7-a918-821e602346a0","year":2025},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:1bd856cdf271d64336fe89d918bfed41612b0136d06a79c43555f1a4029f2fa1","observation_id":"f54f691a-91c0-4bc2-8ee2-a6fdd31a56a4","resolution":{"observed_at":"2026-05-20T10:53:26.102675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T23:51:34.847508Z","title":"Flashattention: Fast and memory-efficient exact attention with IO-awareness","venue":null,"work_id":"b64095be-380d-4c5d-86ab-8c46fe414f29","year":2022},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:5ac15899eab8abb758324509b73063a7698e1fd00c04fa476847d2f968ad38bc","observation_id":"96437640-d12c-414b-a20d-477cfe944867","resolution":{"observed_at":"2026-05-20T10:53:26.094757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From softmax to sparsemax: A sparse model of attention and multi-label classification","venue":null,"work_id":"20827cec-dd7f-4f13-b808-47e757b99328","year":2016},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:0e50b25b8de41185bf70bc9cf2fdceb8bb6756bc115798a31955eca4eeb6e7c5","observation_id":"c1e71adb-e692-4559-91b5-c1e49de57ea7","resolution":{"observed_at":"2026-05-20T10:53:26.090382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adasplash: Adaptive sparse flash attention","venue":null,"work_id":"dceee591-246c-47aa-8167-a3c4ca984c22","year":2025},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:544503172fa05442f51fc36c309da202c40771ac28fccff19414d6d59ac8d43f","observation_id":"6d29233f-6a4b-4841-bc28-040776463dbf","resolution":{"observed_at":"2026-05-20T10:53:26.122761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adasplash-2: Faster differentiable sparse attention","venue":null,"work_id":"c9172127-99d7-4795-9e18-167213095247","year":2026},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:27492056cd1cf6b8996f94642e4cfdb80760f8fade7415bf1ba215182a433a34","observation_id":"28d35cc7-d532-45bc-bb60-7d3e98144cba","resolution":{"observed_at":"2026-05-20T10:53:26.092660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gqa: Training generalized multi-query transformer models from multi-head checkpoints","venue":null,"work_id":"e82a4005-aeb4-4ef2-8d4a-fe5afa7d1d7b","year":2023},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:7cb53b441c2b919ca8224ac3b9aa1094b8f3e53c1408dce40d2826ef3af8d04c","observation_id":"411b1c93-e3a7-4f79-8df0-f8e783e4eea6","resolution":{"observed_at":"2026-05-20T10:53:26.109441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning classifiers with fenchel-young losses: Generalized entropies, margins, and algorithms","venue":null,"work_id":"ddf96450-538e-48f4-a6ae-c5d05af7400e","year":2019},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:43d2e624e80f70713fb13c8cb9b1f57f4a46e8d635f7054eb5235a5a3adce793","observation_id":"6c096a2f-2461-42cd-a942-6d7e043880d6","resolution":{"observed_at":"2026-05-20T10:53:26.135662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":"5013fa4f-dc78-4a7e-b98d-d76916b1c9a4","year":2024},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:437f7d25f5c877662f866c811f2cadbe6d37ae28fc140468a2f7b1e75d6da23e","observation_id":"2127a77a-bee5-4144-8add-8b4dc98c9bba","resolution":{"observed_at":"2026-05-20T10:53:26.107670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6fdece8c-d97a-4cf6-8060-606b1b84d167","year":2019},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:e2061c5ad0e406efdaf28e836a87aa99b5b054c09e2deb266a324bd40ee368b7","observation_id":"745df542-c48f-46b2-90d7-bb65983a9acf","resolution":{"observed_at":"2026-05-20T10:53:26.107447Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Infllm-v2-data-5b dataset","venue":null,"work_id":"ac7299f7-e199-4efb-919b-5a48ebe3e0e2","year":2025},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:cfbc223ff2e36cd7f1ca8e185c4d15194bfc5b50fdc7f6344f945ae714a70565","observation_id":"382caca0-f26e-4ce1-a1d1-42e43378e158","resolution":{"observed_at":"2026-05-20T10:53:26.111009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07900","last_updated":"2025-09-04T16:23:02Z","snapshot_observed_at":"2026-08-09T02:25:55.181285Z","submitted_at":"2025-06-09T16:16:50Z","title":"MiniCPM4: Ultra-Efficient LLMs on End Devices","version":2},"cited_work":{"arxiv_id":"2506.07900","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07900","snapshot_observed_at":"2026-07-02T19:47:19.779661Z","title":"Minicpm4: Ultra-efficient llms on end devices","venue":null,"work_id":"344177ee-2d25-4b76-9c86-71e254c2d162","year":2025},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"cited_paper":"/paper/2506.07900","citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:b4ef28f7189a2cd23b7cce4c94663e5e44317c909e4c3ca197ab2483386e488c","observation_id":"a219ed25-0cbd-4564-a9bb-26d52baf25a1","resolution":{"observed_at":"2026-05-20T10:53:13.541414Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T01:40:35.521522Z","title":"RULER: What’s the real context size of your long-context language models? InFirst Conference on Language Modeling","venue":null,"work_id":"95c144f4-cb75-4090-a6ba-e076ca5009fb","year":2024},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:0f25d11cea34c8b9b8690cb5fadfcf2f27e5ccf64c188372291222d854a9358a","observation_id":"5c9972ef-8e6a-4392-8a57-6ab1c3edf280","resolution":{"observed_at":"2026-05-20T10:53:26.112768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"HELMET: How to evaluate long-context models effectively and thoroughly","venue":null,"work_id":"75cd26ed-2e93-410f-be68-fedb49710087","year":2025},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:99bf08420d3e21f0121dac18d9393fd120354ebb593a617d045e844db2072ba4","observation_id":"c454c62d-091b-4d39-a19f-f9b27fb03b8f","resolution":{"observed_at":"2026-05-20T10:53:26.109072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:57:25.345368Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark.Advances in Neural Information Processing Systems, 37:95266–95290","venue":null,"work_id":"8ce2e771-bc8c-4b3b-a834-6303b981b746","year":2024},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:e76635cd06444678b94b96154d76c21476002f22ee9f728b4291444d8042ff86","observation_id":"1e11a913-1c19-45e9-b9e3-b527eda3301f","resolution":{"observed_at":"2026-05-20T10:53:26.142415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":"2009.03300","doi":"10.48550/arxiv.2009.03300","metadata_source":"pith","pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Massive Multitask Language Understanding","venue":"cs.CY","work_id":"e87ec49a-544b-4ec8-8991-75298c64ff5e","year":2020},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:b04a4bdafe0cd0e2de89b9225dc67278f0593ff6b8400298d26abf0c528f39b9","observation_id":"066a030b-ac45-4354-b6a3-e1b65e8d6471","resolution":{"observed_at":"2026-05-20T10:53:13.574632Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Commonsenseqa: A question answering challenge targeting commonsense knowledge","venue":null,"work_id":"0441031b-fd11-4268-bcf3-894e4debf8b9","year":2019},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:8a7ca8b851e424a12eeef8553b7e12ecf4ab3138af9067998cf0a6411a663419","observation_id":"2ea2c98e-808c-43b1-8933-551ad4bf317a","resolution":{"observed_at":"2026-05-20T10:53:26.124815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.07911","doi":"10.48550/arxiv.2311.07911","metadata_source":"pith","pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Instruction-Following Evaluation for Large Language Models","venue":"cs.CL","work_id":"3aa06177-125a-4f5a-8f4a-8070c5986c26","year":2023},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:7a48234affe42a062835c9dedb75e9b3675f953b9afd90104c3d6190c85f17dd","observation_id":"4c26b643-b332-4ed3-92a0-779477d99aff","resolution":{"observed_at":"2026-05-20T10:53:13.559200Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T01:04:25.243929Z","title":"Hellaswag: Can a machine really finish your sentence? InProceedings of the 57th annual meeting of the association for computational linguistics, pages 4791–4800","venue":null,"work_id":"40e9d896-75dd-4672-b1eb-9a8bf6290ccb","year":2019},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:3bccf9a488e25c2f5b26a5790c99a4cb1d6fbfafaaf5df353c8ffa2e7b633d43","observation_id":"721e1ca2-1129-40ab-a4fa-c36d7c65a36c","resolution":{"observed_at":"2026-05-20T10:53:26.116548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:0d521ef57392277b0768b4d08be69cebdd5f03e9229666850b96343d6049d8aa","observation_id":"51b7de01-03e3-4df9-820f-149602f4de4c","resolution":{"observed_at":"2026-05-20T10:53:13.502184Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":"2103.03874","doi":"10.48550/arxiv.2103.03874","metadata_source":"pith","pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","venue":"cs.LG","work_id":"50652ac6-fb7c-4675-a2c2-159c241feb17","year":2021},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:fa7141c4aff063acc3d3646df026c6f63930e737676bb533103ce736af97081c","observation_id":"4fce58cb-1e38-4b55-9c22-2bccc3a88622","resolution":{"observed_at":"2026-05-20T10:53:13.577323Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Drop: A reading comprehension benchmark requiring discrete reasoning over paragraphs","venue":null,"work_id":"b979c120-87b7-4791-8dea-ea76a3b14034","year":2019},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:5b52149f45abbe7a3857a3474f7ddfe14d1df7e39125fa133a3050b13a2251dc","observation_id":"6af8292c-5eeb-4c28-a865-35a21d11dbfe","resolution":{"observed_at":"2026-05-20T10:53:26.126760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-15T17:40:38.050939Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":"2108.07732","doi":"10.1007/s11390-025-5518-5","metadata_source":"pith","pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Program Synthesis with Large Language Models","venue":"cs.PL","work_id":"fd241a05-03b9-4de2-9588-9d77ce176125","year":2021},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:43afbfd8093832e8fe7af81f61dd5354a95fd83c0716abc3dd9c855c2637b242","observation_id":"4431f30c-6e91-48fc-8b48-4d39681f5306","resolution":{"observed_at":"2026-05-20T10:53:13.556324Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:cd447d5d80665fe2f5d0d87ea53d41fe38e0037e052d1661ba6ffa4c6f68f60f","observation_id":"b9bd9f9c-2486-4072-8da8-92df5d05d670","resolution":{"observed_at":"2026-05-20T10:53:13.519507Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":"98acac9a-046b-4954-b8b8-7b8eb7fb4d18","year":2023},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:b587b09e6e2e342136ea603ab60462f7d624d5a3486e477ae0a926f94893d0e1","observation_id":"d210fddf-4bd7-43fc-9f7c-54e5f20d2873","resolution":{"observed_at":"2026-05-20T10:53:26.118486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sglang: Efficient execution of structured language model programs.Advances in neural information processing systems, 37:62557–62583","venue":null,"work_id":"889462de-9d24-4aac-8847-18d7f5ed8899","year":2024},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:b5073d34990953a993c795e9a98d07b4f02f6bb9472ff49bac801993b98d7246","observation_id":"308a8b91-229c-4f72-a63b-f3d9af120b49","resolution":{"observed_at":"2026-05-20T10:53:26.144440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flashattention-3: Fast and accurate attention with asynchrony and low-precision","venue":null,"work_id":"a762d2d7-e991-4b79-ba5a-1343be38e005","year":2024},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:f49bc366d93e3c426bb394da35a7a9c789c544fa2e08882693574a4f0b1ed3fc","observation_id":"61c50e82-deb7-4d3b-83e3-0f96536ea180","resolution":{"observed_at":"2026-05-20T10:53:26.119438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02069","last_updated":"2025-05-15T17:18:12Z","snapshot_observed_at":"2026-08-13T04:39:30.300015Z","submitted_at":"2024-06-04T07:51:30Z","title":"PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling","version":4},"cited_work":{"arxiv_id":"2406.02069","doi":"10.48550/arxiv.2406.02069","metadata_source":"pith","pith_arxiv_id":"2406.02069","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling","venue":"cs.CL","work_id":"6317700d-f903-4ce1-8f53-b43cb146d48b","year":2024},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"cited_paper":"/paper/2406.02069","citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:f3a90e9bd234c29730543a7bef3f1353c3933c94c3246316801660bb18c2f79b","observation_id":"5991786b-911d-483f-b8fe-2a03898e7ed1","resolution":{"observed_at":"2026-05-20T10:53:13.596117Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.042348+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.042348+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pyramidinfer: Pyramid kv cache compression for high-throughput llm inference","venue":null,"work_id":"0113eb32-1a6d-456f-a5cf-8d6328cd9ff4","year":2024},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:80fb202a3b6afd64b26e4f28b4b96706a66b169c0ed9f313666e5bc97fdcb70f","observation_id":"7fd93b9f-ad9a-46b0-a97e-c4efac714fa1","resolution":{"observed_at":"2026-05-20T10:53:26.115897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:53:40.665664Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":"f60900bc-0e03-4c8b-85d1-bdd7b0a25122","year":2024},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:ff7301259b1c0518d97562c33775226c850ce99a41e5a545cb2180a3fd79a2bc","observation_id":"89fc6086-267b-4d24-960d-16c253156d00","resolution":{"observed_at":"2026-05-20T10:53:26.075215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":"2004.05150","doi":"10.48550/arxiv.2004.05150","metadata_source":"pith","pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Longformer: The Long-Document Transformer","venue":"cs.CL","work_id":"abea7a44-6668-4de7-aab6-f53a6e5aa088","year":2020},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:3fb11d8a206a91dac3cdc10aec52ee238122ef9db287b6dd086548e17091c9e3","observation_id":"856ad4ff-07df-434d-8a66-40f646d9527c","resolution":{"observed_at":"2026-05-20T10:53:13.553401Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:59.161233+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:59.161233+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Big bird: Transformers for longer sequences","venue":null,"work_id":"02d73560-c734-4cd9-b2e2-e49d95731c58","year":2020},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:ccdf43ddf07f12c7968cc26b5c2e98ec6bb00533f65541693b265d9690496f7d","observation_id":"fcd1287e-80be-43f2-bb8a-2b4996452c3e","resolution":{"observed_at":"2026-05-20T10:53:26.073490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"H2o: Heavy-hitter oracle for efficient generative inference of large language models.Advances in Neural Information Processing Systems, 36:34661–34710","venue":null,"work_id":"6472bc60-6225-4380-9388-819dc40de88f","year":2023},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:8fad75249336a65e5850c3e4cf1ed13360966d854a95c6123c0f1a01eaa62a2d","observation_id":"4af70864-ffa5-4506-b5c9-9afcf20246bf","resolution":{"observed_at":"2026-05-20T10:53:26.114210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-08-16T23:28:24.568924Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":"2407.02490","doi":"10.48550/arxiv.2407.02490","metadata_source":"pith","pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Abdi, Dongsheng Li, Chin-Yew Lin, Yuqing Yang, and Lili Qiu","venue":"cs.CL","work_id":"ead3d842-61e6-4c52-8e2a-ea9a3986a1af","year":2024},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:708f149924183e9062aecaf95d0f6d5b907b8604edb4b7baccfa802097876e75","observation_id":"44cbbdd6-45e9-46b0-93d7-d27c7a5d104e","resolution":{"observed_at":"2026-05-20T10:53:13.547437Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:26:18.882600Z","title":"Reformer: The efficient transformer","venue":null,"work_id":"adf0b21e-4f59-4801-b411-e1e6d7fe266e","year":2020},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:d064f51ed053a245f16685c9dd9cbce34ecc6d87a855d4f7eb38dfd60be72a9a","observation_id":"f444d31c-07f9-4262-a33b-523a679281c1","resolution":{"observed_at":"2026-05-20T10:53:26.117767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.18137","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T20:48:56.478959Z","title":"Spargeattn: Accurate sparse attention accelerating any model inference","venue":null,"work_id":"6199672f-7a6e-41ee-9a53-dcc98d435cb6","year":2025},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:81cab377c7adb8e067017b784d3166fc86949391cfc51503d6c148c78d688d5d","observation_id":"61ed1033-3856-4c6c-932f-6bc89d8bd961","resolution":{"observed_at":"2026-05-20T10:53:13.565342Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10774","last_updated":"2024-08-26T21:01:02Z","snapshot_observed_at":"2026-08-14T18:53:06.624928Z","submitted_at":"2024-06-16T01:33:02Z","title":"Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference","version":2},"cited_work":{"arxiv_id":"2406.10774","doi":"10.48550/arxiv.2406.10774","metadata_source":"pith","pith_arxiv_id":"2406.10774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference","venue":"cs.CL","work_id":"2cad64c9-e2d5-42b6-8db9-03fafde4bcb0","year":2024},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"cited_paper":"/paper/2406.10774","citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:06f94a335e69d6f5b0e9b3ac824d76fbf2d97eeed976455631293bc28b564a36","observation_id":"2de1d86a-f818-4c0c-924d-118e52d8a62a","resolution":{"observed_at":"2026-05-20T10:53:13.550501Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01801","last_updated":"2024-10-29T18:26:09Z","snapshot_observed_at":"2026-08-14T11:45:47.400186Z","submitted_at":"2023-10-03T05:17:08Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","version":4},"cited_work":{"arxiv_id":"2310.01801","doi":"10.48550/arxiv.2310.01801","metadata_source":"pith","pith_arxiv_id":"2310.01801","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","venue":"cs.CL","work_id":"91379982-466d-4895-96f5-079b66259a73","year":2023},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"cited_paper":"/paper/2310.01801","citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:861b23c9b71eaffb2bc42bdcb04a061515cf7cc43a53c4ace125e9e2dcb9b3c4","observation_id":"f76f756c-f240-4be3-b87e-f23f48ce80e8","resolution":{"observed_at":"2026-05-20T10:53:13.571507Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10819","last_updated":"2024-10-14T17:59:58Z","snapshot_observed_at":"2026-08-16T03:51:26.346422Z","submitted_at":"2024-10-14T17:59:58Z","title":"DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads","version":1},"cited_work":{"arxiv_id":"2410.10819","doi":"10.48550/arxiv.2410.10819","metadata_source":"pith","pith_arxiv_id":"2410.10819","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads","venue":"cs.CL","work_id":"dcb5f5ed-ec94-4386-bfa7-02fcaeb844f1","year":2024},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"cited_paper":"/paper/2410.10819","citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:92f67836d283ed56066c27251220375eca645e4e994588d2079a31ea0e1a949d","observation_id":"a4ec7517-e142-4d4d-be6b-264149bff7ed","resolution":{"observed_at":"2026-05-20T10:53:13.580322Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.04541","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T08:44:28.034929Z","title":"Lycheedecode: Accelerating long-context llm inference via hybrid-head sparse decoding","venue":null,"work_id":"313785cb-9e7d-4bcb-a793-f1e42572b258","year":2026},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:598a8b5285c9897038d1d1df5862903cc78100176c5b7da6a3c79bf22477f2cf","observation_id":"5bea1bae-d609-4e79-8070-001742a9a948","resolution":{"observed_at":"2026-05-20T10:53:13.568362Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Snapkv: Llm knows what you are looking for before generation.Advances in Neural Information Processing Systems, 37:22947–22970","venue":null,"work_id":"870f393a-18e4-426e-bd67-701fef25cd88","year":2024},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:a3a79e410630e66faef4acf29cc46b6ea29c8943c69dabeaca2d729e77e6756b","observation_id":"0a4c63d7-30fd-4472-a06f-48ab893eb12c","resolution":{"observed_at":"2026-05-20T10:53:26.105830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.24133","doi":"10.48550/arxiv.2505.24133","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-KV: Redundancy-aware KV cache compression for reasoning models","venue":"PubMed","work_id":"08344675-41be-4f15-be42-98a70e11f174","year":2025},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:47c2cc464018b24b2eae593195f234c1c847667d45a3faad152d9d3a83fdddc8","observation_id":"242bae82-e641-4f8c-994f-c90ba31b61d1","resolution":{"observed_at":"2026-05-20T10:53:13.583802Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:24.844272+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:24.844272+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.12201","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T13:36:59.567865Z","title":"Indexcache: Accelerating sparse attention via cross-layer index reuse","venue":null,"work_id":"a3414223-70e8-45f8-95f6-3113f1b1facb","year":2026},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:e93e99a415498469d061898fb056a0629ccc8eca6d97842810d29bce6086c9f4","observation_id":"84c5d80e-72f7-430f-b5f6-4a638ee239d4","resolution":{"observed_at":"2026-05-20T10:53:13.529441Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T01:40:35.471103Z","title":"Infllm: Training-free long-context extrapolation for llms with an efficient context memory.Advances in neural information processing systems, 37:119638–119661","venue":null,"work_id":"d7c6dac3-b3c0-44ee-8227-9e1df685b704","year":2024},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:579cfe84e2b68773fd26fa6219b29d1215f77de329017e4c2c9f9b1924cd47c4","observation_id":"5aa1b51d-5b99-4871-8de2-8d4d7dc237ee","resolution":{"observed_at":"2026-05-20T10:53:26.121386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21465","last_updated":"2025-04-25T19:40:54Z","snapshot_observed_at":"2026-08-19T13:40:56.448822Z","submitted_at":"2024-10-28T19:08:12Z","title":"ShadowKV: KV Cache in Shadows for High-Throughput Long-Context LLM Inference","version":3},"cited_work":{"arxiv_id":"2410.21465","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.21465","snapshot_observed_at":"2026-07-10T01:36:44.234407Z","title":"Shadowkv: Kv cache in shadows for high-throughput long-context llm inference","venue":"cs.LG","work_id":"23d180f7-15ab-4477-b880-cd63ca2f6a95","year":2024},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"cited_paper":"/paper/2410.21465","citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:1d3d869175f418bec2e96b114011b68af91ce142e4ecfc4f66bcb6a6d5d6b6e3","observation_id":"2de173d6-f8da-40a1-b937-7a2692db3acb","resolution":{"observed_at":"2026-05-20T10:53:13.593270Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.13602","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T13:36:59.465220Z","title":"Nosa: Native and offloadable sparse attention","venue":null,"work_id":"727de993-3628-49af-8df1-d90b5799d122","year":2025},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:0db25619d4f7f4468c0e42a8bb14e5e4ca95bac0320988ad7dd77dca200e238d","observation_id":"0a017d96-554a-4abc-852f-ab2b4b2a37fe","resolution":{"observed_at":"2026-05-20T10:53:13.589945Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f018bc53-04cc-464a-954e-d5f16567fcdd","year":2024},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:2f78588aa846ba63563e4b5a9f60e8d4b4334c604a8ad80eec78920b12d56b2b","observation_id":"178987df-f6f3-4739-a48d-eabf26415659","resolution":{"observed_at":"2026-05-20T10:53:26.112291Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T22:30:10.801300Z","title":"Inference-time hyper-scaling with KV cache compression","venue":null,"work_id":"d281b14f-58c4-48af-a343-e51a274b0ddf","year":2026},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:be5d3abf3d2e5807bfa81586c8cc8b655dd1b6b4de8645f6e49cb8ce4bef57a8","observation_id":"d5245d6c-a565-4287-8f3e-f21f15e45ead","resolution":{"observed_at":"2026-05-20T10:53:26.148533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kvquant: Towards 10 million context length llm inference with kv cache quantization.Advances in Neural Information Processing Systems, 37:1270–1303","venue":null,"work_id":"5091dc6d-2942-4017-82f7-ae6ce722fbe6","year":2024},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:e60a5838f302f61f85897d165cea08936aa68964dbd78399c1bff446b74d6edc","observation_id":"6be08aa3-d628-42e7-8402-535a22e41e32","resolution":{"observed_at":"2026-05-20T10:53:26.140118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02750","last_updated":"2024-07-25T09:16:05Z","snapshot_observed_at":"2026-08-12T17:03:50.984887Z","submitted_at":"2024-02-05T06:06:47Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","version":2},"cited_work":{"arxiv_id":"2402.02750","doi":"10.48550/arxiv.2402.02750","metadata_source":"pith","pith_arxiv_id":"2402.02750","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","venue":"cs.CL","work_id":"735737c3-24e5-41c3-ab4f-04edcb36731c","year":2024},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"cited_paper":"/paper/2402.02750","citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:270ec7e466291c06c442f639dcabfc1d76a193d0565f35976d6cab8e6e1caa89","observation_id":"4b0f79cf-da3a-4097-840d-827433bdaddb","resolution":{"observed_at":"2026-05-20T10:53:13.598927Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pqcache: Product quantization-based kvcache for long context llm inference","venue":null,"work_id":"18c2b9f3-a94d-4264-8b52-bad47423bf7c","year":2025},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:b63319960dfaefb84fc43689bd0d790ba5e393f59e7c7d510def55aa885b1e9c","observation_id":"d54f0181-1c18-4a4f-b48f-72eeb58fc5ae","resolution":{"observed_at":"2026-05-20T10:53:26.114446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.18830","last_updated":"2026-05-19T17:27:20Z","snapshot_observed_at":"2026-07-06T22:33:43.999976Z","submitted_at":"2025-10-21T17:25:32Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","version":2},"cited_work":{"arxiv_id":"2510.18830","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.18830","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","venue":"cs.CL","work_id":"e937dbd7-aaa8-45fd-bda0-f1407adafb5c","year":2025},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"cited_paper":"/paper/2510.18830","citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:b554039be98fc2359754b086e72754345bc39b12069a620dedea9b4125151956","observation_id":"a8990c60-f268-4918-920b-394a6500e38c","resolution":{"observed_at":"2026-05-20T10:53:13.513638Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-18T03:43:14.193832Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"cited_work":{"arxiv_id":"2506.08889","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08889","snapshot_observed_at":"2026-07-02T13:36:59.523914Z","title":"Seerattention-r: Sparse attention adaptation for long reasoning","venue":null,"work_id":"5cd68498-f613-4fa1-a51f-eae46c0c6d2d","year":2025},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"cited_paper":"/paper/2506.08889","citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:3fcdce7f3fbc0ee72a14068300a5dcbcaa0cabe4384132b9ea80bb35dfdf4ea6","observation_id":"015213c6-84eb-4fbb-bb4f-1b04d4a97998","resolution":{"observed_at":"2026-05-20T10:53:13.586873Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13276","last_updated":"2025-02-17T02:24:47Z","snapshot_observed_at":"2026-08-16T14:39:45.917951Z","submitted_at":"2024-10-17T07:07:09Z","title":"SeerAttention: Learning Intrinsic Sparse Attention in Your LLMs","version":4},"cited_work":{"arxiv_id":"2410.13276","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.13276","snapshot_observed_at":"2026-07-10T01:36:44.065347Z","title":"Seerattention: Learning intrinsic sparse attention in your llms.arXiv preprint arXiv:2410.13276","venue":"cs.CL","work_id":"7e69f9a0-9472-4c02-8f79-806ba81f8531","year":2024},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"cited_paper":"/paper/2410.13276","citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:6d052d2c445a39ba1e68d5644c8a9558863d044768b95df1cfea6e7b93b1f11a","observation_id":"22512576-7a2a-4be3-8518-2108e49e5c76","resolution":{"observed_at":"2026-05-20T10:53:13.535272Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flash sparse attention: An alternative efficient implementation of native sparse attention kernel.arXiv e-prints, pages arXiv–2508","venue":null,"work_id":"4b5ce1c6-a312-4a14-9f1c-e71e2c5c2462","year":2025},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:543c0ee0d8f139685d791f7e2aebdedbd15fc00f17038688c460a60bf9f52dbe","observation_id":"8c463151-981c-4626-9282-0d893fa8f0bc","resolution":{"observed_at":"2026-05-20T10:53:26.099196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hsa: Head-wise sparse attention for efficient and accurate long-context inference","venue":null,"work_id":"a970416f-2e6f-42ca-b45f-df7138d744e4","year":null},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:b26cdfb1bfa85d485aadac1294453c68acce2c07e202a593763d298201cc67db","observation_id":"523dda38-9d8c-4fb4-bf91-921b201947fe","resolution":{"observed_at":"2026-05-20T10:53:26.065707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02556","last_updated":"2025-12-02T09:25:14Z","snapshot_observed_at":"2026-08-17T01:58:07.850738Z","submitted_at":"2025-12-02T09:25:14Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","version":1},"cited_work":{"arxiv_id":"2512.02556","doi":"10.18653/v1/d18-1512","metadata_source":"pith","pith_arxiv_id":"2512.02556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","venue":"cs.CL","work_id":"07c85cc5-4086-4abc-823b-6d0f4ff784d0","year":2025},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"cited_paper":"/paper/2512.02556","citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:ce4190715a63d079bed08c891981c93a58b4667913b607dcf7ccc3daada1eaad","observation_id":"8bc6fa7f-847b-4318-b89a-b5337e39fa49","resolution":{"observed_at":"2026-05-20T10:53:13.538082Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepseek-v4: Towards highly efficient million-token context in- telligence","venue":null,"work_id":"ab7d87ca-2ae1-4050-b514-669010f25956","year":2026},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:9ee1ad3f021c7fc894363cbdec8ff32d6e1ca83693d5cfed4355f7c98c5215fe","observation_id":"28691fa5-f1df-4e3a-a74a-f9d6191c0ed2","resolution":{"observed_at":"2026-05-20T10:53:26.063949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":"2405.04434","doi":"10.1145/3593013.3594097","metadata_source":"pith","pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","venue":"cs.CL","work_id":"1e1df141-cac8-47fd-b068-c4c96e51e331","year":2024},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:6b2485fc5b82d3c6961da4f953a353a5dfa4fdfe4ef479a294c0dffabc4c7ac4","observation_id":"a06cb1cf-cf5e-4d2e-ac87-937f1b96d7e7","resolution":{"observed_at":"2026-05-20T10:53:13.562151Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.13515","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T00:57:29.525384Z","title":"Spargeattention2: Trainable sparse attention via hybrid top-k+ top-p masking and distillation fine-tuning","venue":null,"work_id":"2d7078c0-e9ed-40ce-81f9-74a2b884cf9b","year":2026},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:c15a25288aea233e599faa5f6dbf12c58ed32f90047dc52d20d64f11e57a8b6e","observation_id":"6840e049-0ae7-4fbc-92b4-1063b144f783","resolution":{"observed_at":"2026-05-20T10:53:13.510469Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.05191","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Double-p: Hierarchical top-p sparse attention for long-context llms","venue":null,"work_id":"d94d673d-2385-44b0-9ab3-01a37a56a936","year":2026},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:2fd171320e3f2a2655a08afb61ab0c49ff78632df34c720bed6f74e2249c0136","observation_id":"b802fea6-bcc7-4764-a155-64c75f823508","resolution":{"observed_at":"2026-05-20T10:53:13.526500Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03624","last_updated":"2025-09-05T17:58:38Z","snapshot_observed_at":"2026-08-17T15:01:29.160915Z","submitted_at":"2025-04-04T17:41:58Z","title":"Nemotron-H: A Family of Accurate and Efficient Hybrid Mamba-Transformer Models","version":4},"cited_work":{"arxiv_id":"2504.03624","doi":"10.48550/arxiv.2504.03624","metadata_source":"pith","pith_arxiv_id":"2504.03624","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nemotron-H: A family of accurate and efficient hybrid Mamba-Transformer models","venue":"cs.CL","work_id":"134d0eac-bc97-4065-9c60-e8fde9d20b48","year":2025},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"cited_paper":"/paper/2504.03624","citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:af041251ecf6818192cdc4d03de21cae2f38fe1f4e5f20f7cacdeb7dc5314ff0","observation_id":"b387206a-3673-41b1-9161-664b978492c4","resolution":{"observed_at":"2026-05-20T10:53:13.523245Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Possible generalization of boltzmann-gibbs statistics.Journal of statistical physics, 52(1):479–487","venue":null,"work_id":"d4fa6c84-e63e-4257-b3bd-3cd8baf35361","year":1988},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:fb3eff964da003a5342289d19addadc60dbdc2bb308d86b35390e90c1e41afc2","observation_id":"5e5eac3a-8f1c-4e36-af15-f69d8cda4fb0","resolution":{"observed_at":"2026-05-20T10:53:26.102971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MiniCPM: Unveiling the potential of small language models with scalable training strategies","venue":null,"work_id":"5407c967-dea2-4255-a1e0-31450c35914c","year":2024},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:08dd28c75886bbc49289835b574cfedfbaf1e713be32333f0e81b390aa272962","observation_id":"52831df3-351c-45eb-bef1-1cf126c01724","resolution":{"observed_at":"2026-05-20T10:53:26.077431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":"1909.08053","doi":"10.48550/arxiv.1909.08053","metadata_source":"pith","pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","venue":"cs.CL","work_id":"c888e6d1-0b1d-43d6-9ef5-f0912a0efa1b","year":2019},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:e1925646e98b358788e74070e2b6dc6792083818c7ea233873748265e41db63d","observation_id":"8909391e-6eb6-4e71-bdd6-9f125bc24e1b","resolution":{"observed_at":"2026-05-20T10:53:13.516609Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Olmes: A standard for language model evaluations","venue":null,"work_id":"a71304d4-16c4-49e1-935d-f9b2918b132e","year":2025},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:17b248f246bb1683e41792f439a11103304c9348e52ed5e75608ff1dba0bc2c8","observation_id":"15a95ccd-30b8-4cc5-a967-a66f05443e93","resolution":{"observed_at":"2026-05-20T10:53:26.110754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T21:44:12.851583Z","title":"The language model evaluation harness, 07 2024","venue":null,"work_id":"9148854a-4b09-4c5d-b1a4-5ee9cccc772c","year":2024},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:89298a9b05e392ac852503970f864a1673da5ad2336f005c145b310d92545249","observation_id":"0ae6d7d9-f2eb-44a5-81e2-f604dafe161f","resolution":{"observed_at":"2026-05-20T10:53:26.101138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.16795","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T04:17:37.486688Z","title":"Hardware-aligned hierarchical sparse attention for efficient long-term memory access","venue":null,"work_id":"744418af-c2c6-4810-bb7c-83889639d977","year":2025},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:b150444c41a2c4de5ac2f209478b5042a532c71dff4f9e1039558a2543c06b9c","observation_id":"1a315cbe-b00b-4ae8-90bf-c80d01e79514","resolution":{"observed_at":"2026-05-20T10:53:13.544336Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.23319","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Every to- ken counts: Generalizing 16m ultra-long context in large language models","venue":null,"work_id":"9f7e7432-b090-4d69-ac00-2e01de2c0265","year":2025},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:7f0861591389643559646cccf868621a954193096050a6de1d9c5d615c6e38f2","observation_id":"63a076b0-92e8-4a4b-ae1c-c3535cfb464d","resolution":{"observed_at":"2026-05-20T10:53:13.532290Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"lim n→∞ H aggrsoftmax z(1),z (2),· · ·,z (H);θ logn = 1","venue":null,"work_id":"103f2214-25ab-4648-b459-cf244d6b672e","year":null},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:f56d3e98b086352214006d22365648c73031b22bad025804f015042cf5228169","observation_id":"a1a735b0-6b28-4105-9879-e05470164930","resolution":{"observed_at":"2026-05-20T10:53:26.060183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proof.We first prove that softmax head aggregation is dispersive","venue":null,"work_id":"e9febb38-fd3e-4efe-91b4-a2212087d9dc","year":null},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:fef0d00940721fc6c950afe07af4e3e6416606f1dd40b303e6208ce93d549476","observation_id":"92d0096f-f18d-4542-a5a9-224759a06778","resolution":{"observed_at":"2026-05-20T10:53:26.066170Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-17T02:28:01.764345Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention"},"reference_resolution":{"displayed":78,"state_counts":{"malformed_identifier":2,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":4,"verified_exact":28,"verified_fuzzy":42},"total_outbound_references":78},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 78 of 78 outbound references and 1 inbound Pith citation observation for arXiv:2605.18753."}