{"as_of":"2026-08-08T05:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cf2a711e096cf4214d735cc2221a853ff43c58b1594b0459210e3126834a91ce","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T06:03:19.387482Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T05:13:27.644720Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T05:13:28.150379Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"cited_work":{"arxiv_id":"2506.11104","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.11104","snapshot_observed_at":"2026-08-06T05:13:28.150379Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","venue":"cs.CL","work_id":"edb9e462-8aee-44a9-8a94-23a88c065cab","year":2025},"citing_paper":{"arxiv_id":"2508.02122","last_updated":"2025-08-04T07:03:35Z","snapshot_observed_at":"2026-08-06T05:12:35.180174Z","submitted_at":"2025-08-04T07:03:35Z","title":"An Overview of Algorithms for Contactless Cardiac Feature Extraction from Radar Signals: Advances and Challenges","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T05:13:27.644720Z"},"links":{"cited_paper":"/paper/2506.11104","citing_paper":"/paper/2508.02122"},"observation_digest":"sha256:3681e0db290824fe4513db6fff4b4e08c4b6e195512fd3ff1a05a9a2ceafb600","observation_id":"3d0b4a51-b3ee-462f-9e79-f2da65fab369","resolution":{"observed_at":"2026-08-06T05:13:28.210636Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.11104/citation-record","integrity":"/paper/2506.11104/integrity","json":"/paper/2506.11104/citation-record.json","paper":"/paper/2506.11104"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:19.872798Z","title":null,"venue":null,"work_id":"34418bf2-3f18-4a8e-b871-430d691c928c","year":2024},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.265408Z"},"links":{"citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:d9b31b3d3bb0e82fbfce9acbd1df3f139eda440e31111bdb35af9851795db8d3","observation_id":"39b75541-84d0-436c-a687-1d832d3d8a51","resolution":{"observed_at":"2026-08-07T06:03:19.875957Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:19.863672Z","title":null,"venue":null,"work_id":"33a55e1d-c270-458a-aac5-94dc87ef258b","year":2024},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.269172Z"},"links":{"citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:0bd0b3bcc153f2b2f20adc2bfaef560381e5eb6b4f46d6e4453746fe2fb9c6b2","observation_id":"fd441fa5-0ea3-4132-a475-96c32bb8aacd","resolution":{"observed_at":"2026-08-07T06:03:19.866737Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:19.855052Z","title":null,"venue":null,"work_id":"b564e8df-eb75-4e40-9e36-61b30c77e8f1","year":2004},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.272325Z"},"links":{"citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:6239a138bb93257020be52bd972dc58c78f675f63d5a517750c396c5fec7d6f6","observation_id":"3260fa7d-8bec-493d-a95d-2eb25927ded6","resolution":{"observed_at":"2026-08-07T06:03:19.857783Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-07T06:03:19.278649Z","title":"Peters, and Arman Cohan","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.278649Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:5df291450f9f3d07ea0dfc2097d3f3bed0c3851dec05507af92738cf26c3a027","observation_id":"0aa85b62-32dd-445b-8034-ac4fda8bcde0","resolution":{"observed_at":"2026-08-07T06:03:19.278649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:19.281563Z","title":null,"venue":null,"work_id":null,"year":1964},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.281563Z"},"links":{"citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:146f349fbc7714bb7f848a2e35549e3d0f6429fc19de254a14ab1c4011554899","observation_id":"2a75ea7a-6630-4698-aa96-2d9059574388","resolution":{"observed_at":"2026-08-07T06:03:19.281563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03675","last_updated":"2024-08-08T01:20:13Z","snapshot_observed_at":"2026-07-06T18:57:48.065595Z","submitted_at":"2024-08-07T10:31:07Z","title":"NACL: A General and Effective KV Cache Eviction Framework for LLMs at Inference Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03675","snapshot_observed_at":"2026-08-07T06:03:19.284561Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.284561Z"},"links":{"cited_paper":"/paper/2408.03675","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:23188989e5a6a6b6cd4dd43f4c4ab31d63def19d03742576b9027575ec08c5ca","observation_id":"109f8c1b-18d4-40e9-9e3d-309081fc6931","resolution":{"observed_at":"2026-08-07T06:03:19.284561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-06T08:05:35.311510Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-07T06:03:19.287621Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.287621Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:919842c04942c0fe9b759654886914b05755fe069d1a5cb51bb3d8766d2c0833","observation_id":"b5e93402-0bcf-4b35-aa7d-d1b0f66e2241","resolution":{"observed_at":"2026-08-07T06:03:19.287621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03555","last_updated":"2020-10-01T00:41:49Z","snapshot_observed_at":"2026-07-06T09:26:25.974216Z","submitted_at":"2020-06-05T17:09:16Z","title":"Masked Language Modeling for Proteins via Linearly Scalable Long-Context Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03555","snapshot_observed_at":"2026-08-07T06:03:19.290731Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.290731Z"},"links":{"cited_paper":"/paper/2006.03555","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:566f5a7bb03b1bdb7f5bac0c1c807aee5be5fe2a9a538f476b54eadd45d95d0b","observation_id":"ace05112-41fc-445a-8fff-53ea8b05380c","resolution":{"observed_at":"2026-08-07T06:03:19.290731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.00015","last_updated":"2019-09-06T16:55:20Z","snapshot_observed_at":"2026-08-04T18:25:35.193476Z","submitted_at":"2019-08-30T18:06:14Z","title":"Adaptively Sparse Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.00015","snapshot_observed_at":"2026-08-07T06:03:19.293695Z","title":"Correia, Vlad Niculae, and André F","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.293695Z"},"links":{"cited_paper":"/paper/1909.00015","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:e6739f9ea233df17eac7292b1f929744b5f190d619bf6384adb2158487a33539","observation_id":"2ed08cd9-9e48-4ab4-a16c-a33e2b3f3383","resolution":{"observed_at":"2026-08-07T06:03:19.293695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-07T06:03:19.296945Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.296945Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:e2b54d45bbdc2726a49155c727c1dea5326e65c6fdf5b3b7435edd166e738418","observation_id":"72b51fed-4cae-4cf4-a006-764cc2c0b555","resolution":{"observed_at":"2026-08-07T06:03:19.296945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.01749","last_updated":"2019-06-19T20:26:03Z","snapshot_observed_at":"2026-07-06T07:58:00.005620Z","submitted_at":"2019-06-04T23:00:43Z","title":"Multi-News: a Large-Scale Multi-Document Summarization Dataset and Abstractive Hierarchical Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.01749","snapshot_observed_at":"2026-08-07T06:03:19.299889Z","title":"Fabbri, Irene Li, Tianwei She, Suyi Li, and Dragomir R","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.299889Z"},"links":{"cited_paper":"/paper/1906.01749","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:e089c99b4c617fab77b81579a4167db759157cbf3f2a9eb7b680b29f68f8de9d","observation_id":"f462fe05-3d87-4621-b1b1-f213bc3d6e00","resolution":{"observed_at":"2026-08-07T06:03:19.299889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:19.302732Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.302732Z"},"links":{"citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:d211da54056a966172172dbed538e4b7c258c457fc9419ddbb0ffaa94e9ab1d6","observation_id":"a38fa083-ed9b-4ed8-9083-7a3cbef28524","resolution":{"observed_at":"2026-08-07T06:03:19.302732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:19.846215Z","title":"Semsa: Semantic sparse attention is hidden in large language models","venue":null,"work_id":"67ffd689-f2a3-4c8a-9ecb-f7ed2553c75a","year":null},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.305392Z"},"links":{"citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:99bd7679edc6d54ed4da3444455987fd120a33e655dc5de07f085abf22246c3f","observation_id":"b593f040-8eea-4bca-9588-07bbd603a0e1","resolution":{"observed_at":"2026-08-07T06:03:19.849396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:19.837239Z","title":null,"venue":null,"work_id":"3b2e67a1-8ad8-4c94-9046-c5c1cbc497a1","year":2024},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.308260Z"},"links":{"citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:0b731bb20d53d920e68fe08de235eaadf30d10bae7e13edd89ef7bee060b7c59","observation_id":"38126815-345c-449c-97d8-caf3610bff33","resolution":{"observed_at":"2026-08-07T06:03:19.840241Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01801","last_updated":"2024-10-29T18:26:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T05:17:08Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01801","snapshot_observed_at":"2026-08-07T06:03:19.311000Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.311000Z"},"links":{"cited_paper":"/paper/2310.01801","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:a95988b1b368762cd02ec1b61456091998f7539e43f649d06a2af8e61195d5ff","observation_id":"11123903-98f1-4399-8696-71a83d51e448","resolution":{"observed_at":"2026-08-07T06:03:19.311000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.01377","last_updated":"2021-08-03T09:16:55Z","snapshot_observed_at":"2026-07-06T11:35:04.274714Z","submitted_at":"2021-08-03T09:16:55Z","title":"A Dynamic Head Importance Computation Mechanism for Neural Machine Translation","version":1},"cited_work":{"arxiv_id":"2108.01377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2108.01377","snapshot_observed_at":"2026-08-07T06:03:19.613071Z","title":"A Dynamic Head Importance Computation Mechanism for Neural Machine Translation","venue":"cs.CL","work_id":"4901fbaa-700d-4aab-bf6a-6ba70d8f078f","year":2021},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.313839Z"},"links":{"cited_paper":"/paper/2108.01377","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:14d3c9f84100f759b3c8df28c188a5152b33bb563e922dcb45f60d835d52dff3","observation_id":"7dfb9399-0a44-4a50-9657-3da18bb4e273","resolution":{"observed_at":"2026-08-07T06:03:19.616366Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.12180","last_updated":"2019-12-20T13:27:27Z","snapshot_observed_at":"2026-08-06T23:06:09.224235Z","submitted_at":"2019-12-20T13:27:27Z","title":"Axial Attention in Multidimensional Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.12180","snapshot_observed_at":"2026-08-07T06:03:19.316871Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.316871Z"},"links":{"cited_paper":"/paper/1912.12180","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:0eef89e92d65f7a5b18eba9d468fb383b8ea1d8d2b62de0fede1e8def9ac2020","observation_id":"a9404664-de59-48ed-99fe-06cc174f009e","resolution":{"observed_at":"2026-08-07T06:03:19.316871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17565","last_updated":"2024-12-21T13:55:49Z","snapshot_observed_at":"2026-07-06T18:36:42.830927Z","submitted_at":"2024-06-25T14:02:08Z","title":"MemServe: Context Caching for Disaggregated LLM Serving with Elastic Memory Pool","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17565","snapshot_observed_at":"2026-08-07T06:03:19.319925Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.319925Z"},"links":{"cited_paper":"/paper/2406.17565","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:0750246203eefe5a9205b939da423cf9ec365aa19553109f994bed4bc2cbdf11","observation_id":"964a02ee-e3b0-467c-b77d-b3cd16ae2297","resolution":{"observed_at":"2026-08-07T06:03:19.319925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.04451","last_updated":"2020-02-18T16:01:18Z","snapshot_observed_at":"2026-07-06T08:50:12.690900Z","submitted_at":"2020-01-13T18:38:28Z","title":"Reformer: The Efficient Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.04451","snapshot_observed_at":"2026-08-07T06:03:19.322704Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.322704Z"},"links":{"cited_paper":"/paper/2001.04451","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:07381c199bb6bbe6111bbe39004bffc34553fa1a3614e43ee5b780abaf01a13b","observation_id":"60a43518-9018-4fbb-a493-0f4020fed5a6","resolution":{"observed_at":"2026-08-07T06:03:19.322704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13298","last_updated":"2023-01-30T21:31:48Z","snapshot_observed_at":"2026-07-06T14:46:19.313091Z","submitted_at":"2023-01-30T21:31:48Z","title":"LongEval: Guidelines for Human Evaluation of Faithfulness in Long-form Summarization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13298","snapshot_observed_at":"2026-08-07T06:03:19.325755Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.325755Z"},"links":{"cited_paper":"/paper/2301.13298","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:c883d2df579a97450e5561a1c21eecb04d55d6c000a3795b89ea9ca1797df257","observation_id":"77f0c218-0e94-4bb1-80cc-3958813350b3","resolution":{"observed_at":"2026-08-07T06:03:19.325755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14469","last_updated":"2024-06-17T03:01:58Z","snapshot_observed_at":"2026-08-07T22:57:56.263839Z","submitted_at":"2024-04-22T17:42:58Z","title":"SnapKV: LLM Knows What You are Looking for Before Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14469","snapshot_observed_at":"2026-08-07T06:03:19.328603Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.328603Z"},"links":{"cited_paper":"/paper/2404.14469","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:3a3f20c287f8414b35df7e223e042d761e65ad6d688d5672e4cf15a4e7f9e91e","observation_id":"dff2d4cb-47cf-4d2b-82dc-4e4ec51871a2","resolution":{"observed_at":"2026-08-07T06:03:19.328603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05561","last_updated":"2021-12-10T14:12:32Z","snapshot_observed_at":"2026-07-06T12:17:25.041202Z","submitted_at":"2021-12-10T14:12:32Z","title":"Global Attention Mechanism: Retain Information to Enhance Channel-Spatial Interactions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.05561","snapshot_observed_at":"2026-08-07T06:03:19.331633Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.331633Z"},"links":{"cited_paper":"/paper/2112.05561","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:7012e1f3654ba3bde98d12e4b7ece6e86eb952be1a823e72573f55fa11069730","observation_id":"c5eacb4a-1b9d-4430-91be-00d18496f4a5","resolution":{"observed_at":"2026-08-07T06:03:19.331633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:19.828602Z","title":null,"venue":null,"work_id":"7f0ee529-5407-4433-9a24-487331481b35","year":2024},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.334602Z"},"links":{"citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:8dfa05b6b2920eecfd258c3991f68653b05e81ff22616ee7aea0ef591bb65064","observation_id":"e8386c03-f072-4bf1-82c1-b59efe1bbb23","resolution":{"observed_at":"2026-08-07T06:03:19.831550Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:19.819696Z","title":null,"venue":null,"work_id":"3aaaecda-b714-4645-a08f-4b3d75bd8aa5","year":2025},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.337352Z"},"links":{"citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:aa16f5d42b1019bbbb456c1f051433b651caa54b6b067142edc5a602fe0763a4","observation_id":"47463b5e-831e-45b2-a3ba-4524dcb270d4","resolution":{"observed_at":"2026-08-07T06:03:19.822960Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:19.340101Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.340101Z"},"links":{"citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:ddbc00a15838b856c1192fbe5a4036570b95d34baaa64f2dc5e03243c25c1a70","observation_id":"b849773a-ef26-49c0-b491-92f618feca64","resolution":{"observed_at":"2026-08-07T06:03:19.340101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.04393","last_updated":"2019-06-11T04:56:17Z","snapshot_observed_at":"2026-07-06T07:59:26.617246Z","submitted_at":"2019-06-11T04:56:17Z","title":"Lightweight and Efficient Neural Natural Language Processing with Quaternion Networks","version":1},"cited_work":{"arxiv_id":"1906.04393","doi":null,"metadata_source":"pith","pith_arxiv_id":"1906.04393","snapshot_observed_at":"2026-08-07T06:03:19.554211Z","title":"Lightweight and Efficient Neural Natural Language Processing with Quaternion Networks","venue":"cs.CL","work_id":"178f0358-71f6-4159-915f-78f59d7390bc","year":2019},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.342944Z"},"links":{"cited_paper":"/paper/1906.04393","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:2c5e62ecd53ee0477a5b4e810f75a3f34a125e9ffd1a27ca7d3feb3b7aa80248","observation_id":"723e7c91-852a-4b51-baeb-20f365ac3591","resolution":{"observed_at":"2026-08-07T06:03:19.557693Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:19.345983Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.345983Z"},"links":{"citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:0ffcbc6c0508ee965abac1fba5f0164eec0d314524bc670dffe1a11ba5911086","observation_id":"aee541e8-2104-418f-88f2-f80226d18deb","resolution":{"observed_at":"2026-08-07T06:03:19.345983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12366","last_updated":"2020-12-22T21:34:02Z","snapshot_observed_at":"2026-07-06T10:27:07.314342Z","submitted_at":"2020-12-22T21:34:02Z","title":"Multi-Head Self-Attention with Role-Guided Masks","version":1},"cited_work":{"arxiv_id":"2012.12366","doi":null,"metadata_source":"pith","pith_arxiv_id":"2012.12366","snapshot_observed_at":"2026-08-07T06:03:19.539671Z","title":"Multi-Head Self-Attention with Role-Guided Masks","venue":"cs.CL","work_id":"752ee9cc-805f-4247-8cdf-ec77ed084d17","year":2020},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.348741Z"},"links":{"cited_paper":"/paper/2012.12366","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:384d81f299625fb70e5c598450beb01cc202b9b2d6e03557ca271a30b200b92c","observation_id":"53206f46-2ae0-49ae-9df8-68285976e6a3","resolution":{"observed_at":"2026-08-07T06:03:19.545146Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08553","last_updated":"2024-06-04T14:49:36Z","snapshot_observed_at":"2026-07-06T18:14:08.102261Z","submitted_at":"2024-05-14T12:41:11Z","title":"Improving Transformers with Dynamically Composable Multi-Head Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08553","snapshot_observed_at":"2026-08-07T06:03:19.353231Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.353231Z"},"links":{"cited_paper":"/paper/2405.08553","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:e62f8e0ceb92f82a310c3582afdaaf05cdcd24d9f160eb3ffd1790a32c18f62c","observation_id":"78a2e262-6928-4375-ae3e-d37f98c80da9","resolution":{"observed_at":"2026-08-07T06:03:19.353231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-07T06:03:19.357102Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.357102Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:f257432b02b98b65b77bf8becde1b8a9495003009c6bb01afecef1e4e66aa345","observation_id":"4ad6a6f0-2888-4cc0-bc53-f5b9ee758c26","resolution":{"observed_at":"2026-08-07T06:03:19.357102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00428","last_updated":"2024-10-09T11:40:31Z","snapshot_observed_at":"2026-07-06T19:25:06.162911Z","submitted_at":"2024-10-01T06:23:17Z","title":"LayerKV: Optimizing Large Language Model Serving with Layer-wise KV Cache Management","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00428","snapshot_observed_at":"2026-08-07T06:03:19.359687Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.359687Z"},"links":{"cited_paper":"/paper/2410.00428","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:6df4a224d6d748314fd9c5143039d7653e84e918f27840f2daba4d3cbc72c7c7","observation_id":"f770c5da-57e3-4456-a076-a60800a339bf","resolution":{"observed_at":"2026-08-07T06:03:19.359687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15220","last_updated":"2024-08-01T07:51:25Z","snapshot_observed_at":"2026-08-04T06:24:10.295170Z","submitted_at":"2024-02-23T09:29:19Z","title":"ChunkAttention: Efficient Self-Attention with Prefix-Aware KV Cache and Two-Phase Partition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15220","snapshot_observed_at":"2026-08-07T06:03:19.362463Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.362463Z"},"links":{"cited_paper":"/paper/2402.15220","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:d973358f6d332c2c7999a65114b6cf7718de69da234a1d7c9739c97b211428f5","observation_id":"d96aaaba-19ec-46e6-b609-794c52746810","resolution":{"observed_at":"2026-08-07T06:03:19.362463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:19.365339Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.365339Z"},"links":{"citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:87007d52320bc1d3c6a81d2d961de79365c87676db069d5af2b82a87ffc36e75","observation_id":"582542cf-e636-4fcf-a262-cdc2a48eb119","resolution":{"observed_at":"2026-08-07T06:03:19.365339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:19.800359Z","title":null,"venue":null,"work_id":"543e01f9-3624-4f8d-b204-5a6aa72239f6","year":2020},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.368297Z"},"links":{"citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:17562994fb3ded2f053b018248c6a091d7c9535ea9d157ea68495f1fcbac5255","observation_id":"92cf65c7-5490-460f-8c4f-d8e12ac71434","resolution":{"observed_at":"2026-08-07T06:03:19.803606Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:19.370887Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.370887Z"},"links":{"citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:c3a4d20d374f157e16199f93553b36d286c7e026e6dc8745c1205362346e80ff","observation_id":"6af78f03-c580-41bb-a8e2-244859840541","resolution":{"observed_at":"2026-08-07T06:03:19.370887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03131","last_updated":"2025-08-30T09:35:22Z","snapshot_observed_at":"2026-08-06T18:56:07.858056Z","submitted_at":"2024-12-04T08:51:23Z","title":"DiffKV: Differentiated Memory Management for Large Language Models with Parallel KV Compaction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03131","snapshot_observed_at":"2026-08-07T06:03:19.373594Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.373594Z"},"links":{"cited_paper":"/paper/2412.03131","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:533dda1f7a4e2b34e9da8e8da57cfafc88fa24ef92158252f30f01e19b785c59","observation_id":"5814662f-8955-4c90-9230-7afdb02297a1","resolution":{"observed_at":"2026-08-07T06:03:19.373594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:19.376481Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.376481Z"},"links":{"citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:8c8d4bf637bbb2f47169209a7b440e8f036fecef13a7724d5fb2a33d310c543b","observation_id":"e15d8fcf-d490-405b-bfa2-f6f4f5218f1c","resolution":{"observed_at":"2026-08-07T06:03:19.376481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:03:19.781176Z","title":null,"venue":null,"work_id":"c20b2be8-b1ac-4853-babc-bea2e9d4a6ee","year":2024},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.379033Z"},"links":{"citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:cf0aff7b92d38924cbe72ec7e11068df98afe23bf90035621e58545a87ae426e","observation_id":"ac3977f9-50d3-4bac-a657-5d6f08e176a4","resolution":{"observed_at":"2026-08-07T06:03:19.784410Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23079","last_updated":"2024-10-30T14:53:37Z","snapshot_observed_at":"2026-08-03T21:08:34.653026Z","submitted_at":"2024-10-30T14:53:37Z","title":"BUZZ: Beehive-structured Sparse KV Cache with Segmented Heavy Hitters for Efficient LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23079","snapshot_observed_at":"2026-08-07T06:03:19.381771Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.381771Z"},"links":{"cited_paper":"/paper/2410.23079","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:bf57928f658563e99845a12f6021253c53605445804054fb2998b70c595a5204","observation_id":"0fa2375a-4a90-4325-82ad-523cb12c7c76","resolution":{"observed_at":"2026-08-07T06:03:19.381771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-07T06:03:19.384593Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.384593Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:6956b915ec992f6c0ee56773bc76677922bcfeeec4705e385d3e7b099a171759","observation_id":"8ad58d27-eea1-4510-8dc9-59d415f56a26","resolution":{"observed_at":"2026-08-07T06:03:19.384593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03594","last_updated":"2026-04-22T15:33:51Z","snapshot_observed_at":"2026-07-06T20:01:45.826971Z","submitted_at":"2024-11-29T05:57:37Z","title":"BatchLLM: Optimizing Large Batched LLM Inference with Global Prefix Sharing and Throughput-oriented Token Batching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03594","snapshot_observed_at":"2026-08-07T06:03:19.387482Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T06:03:19.387482Z"},"links":{"cited_paper":"/paper/2412.03594","citing_paper":"/paper/2506.11104"},"observation_digest":"sha256:ab5a105c1753d23fb762c630f4bc658289a0461c144cfe02ba491be3f4a9cb73","observation_id":"a6411a1e-082c-4e41-a447-5238a7d44b9c","resolution":{"observed_at":"2026-08-07T06:03:19.387482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.11104","last_updated":"2025-06-06T20:24:36Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T20:41:32.031099Z","submitted_at":"2025-06-06T20:24:36Z","title":"DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":3,"verified_fuzzy":1},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 1 inbound Pith citation observation for arXiv:2506.11104."}