{"as_of":"2026-08-05T21:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7016ecc04bed58d709ae53d093a10e94940dd58f7f8696ddf32c599886737eb2","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":31,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:50:03.978556Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":3,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-07-06T18:40:27.299063Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":"2407.02490","doi":"10.48550/arxiv.2407.02490","metadata_source":"pith","pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Abdi, Dongsheng Li, Chin-Yew Lin, Yuqing Yang, and Lili Qiu","venue":"cs.CL","work_id":"ead3d842-61e6-4c52-8e2a-ea9a3986a1af","year":2024},"citing_paper":{"arxiv_id":"2406.02069","last_updated":"2025-05-15T17:18:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T07:51:30Z","title":"PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T09:58:29.057357Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2406.02069"},"observation_digest":"sha256:f23c4f944090679b07ed27e10034c56924c6b52cd08d8d2985cfd0c27712e9a3","observation_id":"9b2ac96e-76a3-4183-bfa8-0a575b874f14","resolution":{"observed_at":"2026-05-12T09:58:29.171156Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-07-06T18:40:27.299063Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":"2407.02490","doi":"10.48550/arxiv.2407.02490","metadata_source":"pith","pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Abdi, Dongsheng Li, Chin-Yew Lin, Yuqing Yang, and Lili Qiu","venue":"cs.CL","work_id":"ead3d842-61e6-4c52-8e2a-ea9a3986a1af","year":2024},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:60f0a3ab24bb21f8b8920a3aa58eedbf5241424fceb3c926d881d308b5a71d1c","observation_id":"8e637f98-6e48-42a6-8a2c-3a55a8834366","resolution":{"observed_at":"2026-05-18T08:12:01.955613Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-07-06T18:40:27.299063Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":"2407.02490","doi":"10.48550/arxiv.2407.02490","metadata_source":"pith","pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Abdi, Dongsheng Li, Chin-Yew Lin, Yuqing Yang, and Lili Qiu","venue":"cs.CL","work_id":"ead3d842-61e6-4c52-8e2a-ea9a3986a1af","year":2024},"citing_paper":{"arxiv_id":"2410.10819","last_updated":"2024-10-14T17:59:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-14T17:59:58Z","title":"DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-18T11:49:16.654836Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2410.10819"},"observation_digest":"sha256:c08f9a36198ae9c255336b69ed1bf843af9599616859e8011afc060770db5f6e","observation_id":"a6c4347b-3505-4498-8c4a-ecc4928d63e9","resolution":{"observed_at":"2026-05-18T11:49:16.795888Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-07-06T18:40:27.299063Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":"2407.02490","doi":"10.48550/arxiv.2407.02490","metadata_source":"pith","pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Abdi, Dongsheng Li, Chin-Yew Lin, Yuqing Yang, and Lili Qiu","venue":"cs.CL","work_id":"ead3d842-61e6-4c52-8e2a-ea9a3986a1af","year":2024},"citing_paper":{"arxiv_id":"2502.01068","last_updated":"2026-04-20T06:24:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-03T05:25:09Z","title":"FastKV: Decoupling of Context Reduction and KV Cache Compression for Prefill-Decoding Acceleration","version":7},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-23T03:59:58.634512Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2502.01068"},"observation_digest":"sha256:9e191d69fc3e0d245c456c32c6127549663ff7558f1a827e4d0ec7ef5a053186","observation_id":"c4f212c6-33a8-4b7f-830c-206048453844","resolution":{"observed_at":"2026-05-23T04:02:30.356815Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-07-06T18:40:27.299063Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":"2407.02490","doi":"10.48550/arxiv.2407.02490","metadata_source":"pith","pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Abdi, Dongsheng Li, Chin-Yew Lin, Yuqing Yang, and Lili Qiu","venue":"cs.CL","work_id":"ead3d842-61e6-4c52-8e2a-ea9a3986a1af","year":2024},"citing_paper":{"arxiv_id":"2502.11089","last_updated":"2025-02-27T09:01:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-16T11:53:44Z","title":"Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-16T23:46:29.975858Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2502.11089"},"observation_digest":"sha256:ec284e84f5736bfa2be27a29c7615d1105ce2631b1f735705089207fb3b72632","observation_id":"681f0673-0b72-43a4-abd7-1ab0cb30250d","resolution":{"observed_at":"2026-05-16T23:46:30.161102Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-07-06T18:40:27.299063Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":"2407.02490","doi":"10.48550/arxiv.2407.02490","metadata_source":"pith","pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Abdi, Dongsheng Li, Chin-Yew Lin, Yuqing Yang, and Lili Qiu","venue":"cs.CL","work_id":"ead3d842-61e6-4c52-8e2a-ea9a3986a1af","year":2024},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:4518dfaacf241da96c0af3a2669b3ad58daced721ccefadc5bbd92be3af9aa0f","observation_id":"7277d24d-9352-4285-820c-0cb3f6496af7","resolution":{"observed_at":"2026-05-16T06:15:46.253626Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-07-06T18:40:27.299063Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":"2407.02490","doi":"10.48550/arxiv.2407.02490","metadata_source":"pith","pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Abdi, Dongsheng Li, Chin-Yew Lin, Yuqing Yang, and Lili Qiu","venue":"cs.CL","work_id":"ead3d842-61e6-4c52-8e2a-ea9a3986a1af","year":2024},"citing_paper":{"arxiv_id":"2508.16703","last_updated":"2026-04-08T06:56:34Z","snapshot_observed_at":"2026-07-06T22:16:52.874707Z","submitted_at":"2025-08-22T07:41:35Z","title":"ShadowNPU: System and Algorithm Co-design for NPU-Centric On-Device LLM Inference","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T22:03:10.316005Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2508.16703"},"observation_digest":"sha256:7a19083f45e2633c36b2a735ea78aa2f70dd5ddc8b2dc4d452c0283bf62b82fc","observation_id":"65217528-7120-4a7a-b774-60cfb657162c","resolution":{"observed_at":"2026-05-18T22:06:52.082431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-07-06T18:40:27.299063Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-08-05T11:54:14.367710Z","title":"MInference 1.0: Acceler- ating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02163","last_updated":"2025-09-02T10:14:28Z","snapshot_observed_at":"2026-08-05T11:54:11.653972Z","submitted_at":"2025-09-02T10:14:28Z","title":"Enhancing Reliability in LLM-Integrated Robotic Systems: A Unified Approach to Security and Safety","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T11:54:14.367710Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2509.02163"},"observation_digest":"sha256:b610cfc55c163a7eec3cc899d955fb749e82d7be2b3d2aee8d0be602c9ab12c1","observation_id":"ca52ff46-90bc-4a78-ae48-08d8c6da7500","resolution":{"observed_at":"2026-08-05T11:54:14.367710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-07-06T18:40:27.299063Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":"2407.02490","doi":"10.48550/arxiv.2407.02490","metadata_source":"pith","pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Abdi, Dongsheng Li, Chin-Yew Lin, Yuqing Yang, and Lili Qiu","venue":"cs.CL","work_id":"ead3d842-61e6-4c52-8e2a-ea9a3986a1af","year":2024},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-01T16:00:12.897969Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:61e4829a040fd877617f488eb5bd9046c2879110d2eacfab44d32507952095a5","observation_id":"87954259-ef6d-4d24-a4b2-7bf3539ab4e2","resolution":{"observed_at":"2026-05-18T05:30:55.155139Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-07-06T18:40:27.299063Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-08-03T03:22:53.923474Z","title":"Abdi, Dongsheng Li, Chin-Yew Lin, Yuqing Yang, and Lili Qiu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.08426","last_updated":"2026-05-25T11:18:29Z","snapshot_observed_at":"2026-08-03T03:22:52.672693Z","submitted_at":"2026-02-09T09:31:06Z","title":"Prism: Spectral-Aware Block-Sparse Attention","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T03:22:53.923474Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2602.08426"},"observation_digest":"sha256:0774be0190c3abf3c5726101a3694926f7c74116e3eb4540f58a36709b236e3b","observation_id":"691b9a4c-d2e9-45d6-876a-a9f44abdf1c1","resolution":{"observed_at":"2026-08-03T03:22:53.923474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-07-06T18:40:27.299063Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":"2407.02490","doi":"10.48550/arxiv.2407.02490","metadata_source":"pith","pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Abdi, Dongsheng Li, Chin-Yew Lin, Yuqing Yang, and Lili Qiu","venue":"cs.CL","work_id":"ead3d842-61e6-4c52-8e2a-ea9a3986a1af","year":2024},"citing_paper":{"arxiv_id":"2603.10726","last_updated":"2026-05-20T10:27:28Z","snapshot_observed_at":"2026-07-06T22:48:39.649787Z","submitted_at":"2026-03-11T12:59:12Z","title":"PrefixWall: Mitigating Prefix Caching Side Channels in Shared LLM Systems","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-21T12:14:09.509302Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2603.10726"},"observation_digest":"sha256:387bd3aa9e7cc44453d70ee53c0687fbf5e78975a1a97a1b758f392017c0278a","observation_id":"83f6ced1-9abc-41e9-a942-c1eb01f4f7dd","resolution":{"observed_at":"2026-05-21T12:15:06.744912Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-07-06T18:40:27.299063Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-07-13T16:19:49.419805Z","title":"Greg Kamradt","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.28457","last_updated":"2026-06-24T09:39:21Z","snapshot_observed_at":"2026-08-02T09:49:06.093893Z","submitted_at":"2026-03-30T13:59:38Z","title":"Three non-Hermitian random matrix universality classes of complex edge statistics: Spacing ratios and distributions","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T16:19:49.419805Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2603.28457"},"observation_digest":"sha256:cfcbfc434289bd07efc8df5343cced7d8d29a7bd6ef8ad06c5d7d7d7154df47f","observation_id":"e8fe1080-28b1-4054-957e-2b2ed372cf7f","resolution":{"observed_at":"2026-07-13T16:19:49.419805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-07-06T18:40:27.299063Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":"2407.02490","doi":"10.48550/arxiv.2407.02490","metadata_source":"pith","pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Abdi, Dongsheng Li, Chin-Yew Lin, Yuqing Yang, and Lili Qiu","venue":"cs.CL","work_id":"ead3d842-61e6-4c52-8e2a-ea9a3986a1af","year":2024},"citing_paper":{"arxiv_id":"2603.28458","last_updated":"2026-04-06T09:47:34Z","snapshot_observed_at":"2026-08-02T11:27:36.874895Z","submitted_at":"2026-03-30T13:59:51Z","title":"HISA: Efficient Hierarchical Indexing for Fine-Grained Sparse Attention","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-14T21:40:28.854082Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2603.28458"},"observation_digest":"sha256:8ca283e79ff07b9568fedaab87f156d94a1e0b389d00c17495d9d4b74a0e5238","observation_id":"5b77b6de-5270-476c-8eec-3f8775bcb0e7","resolution":{"observed_at":"2026-05-14T21:43:00.751161Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-07-06T18:40:27.299063Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":"2407.02490","doi":"10.48550/arxiv.2407.02490","metadata_source":"pith","pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Abdi, Dongsheng Li, Chin-Yew Lin, Yuqing Yang, and Lili Qiu","venue":"cs.CL","work_id":"ead3d842-61e6-4c52-8e2a-ea9a3986a1af","year":2024},"citing_paper":{"arxiv_id":"2605.02568","last_updated":"2026-05-04T13:19:29Z","snapshot_observed_at":"2026-07-31T19:18:10.074012Z","submitted_at":"2026-05-04T13:19:29Z","title":"StreamIndex: Memory-Bounded Compressed Sparse Attention via Streaming Top-k","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-08T18:44:42.456111Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2605.02568"},"observation_digest":"sha256:8799d12d996383b07a61bf4f5daa9b67c1909c2f3beee9a86cb4f89d7a14b2ec","observation_id":"371997cc-fc2a-45a3-a6fc-09deef0a4244","resolution":{"observed_at":"2026-05-09T06:15:37.731448Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-07-06T18:40:27.299063Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":"2407.02490","doi":"10.48550/arxiv.2407.02490","metadata_source":"pith","pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Abdi, Dongsheng Li, Chin-Yew Lin, Yuqing Yang, and Lili Qiu","venue":"cs.CL","work_id":"ead3d842-61e6-4c52-8e2a-ea9a3986a1af","year":2024},"citing_paper":{"arxiv_id":"2605.06554","last_updated":"2026-05-07T16:49:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-07T16:49:28Z","title":"Long Context Pre-Training with Lighthouse Attention","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-08T10:10:38.610613Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2605.06554"},"observation_digest":"sha256:7a54a0b9309a8149e727989021ba598a6a9385572cb0b4bc95b08bcd0424781e","observation_id":"3bcb5b8b-a10f-4efd-8c81-1b156e449bba","resolution":{"observed_at":"2026-05-11T20:11:09.397118Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-07-06T18:40:27.299063Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":"2407.02490","doi":"10.48550/arxiv.2407.02490","metadata_source":"pith","pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Abdi, Dongsheng Li, Chin-Yew Lin, Yuqing Yang, and Lili Qiu","venue":"cs.CL","work_id":"ead3d842-61e6-4c52-8e2a-ea9a3986a1af","year":2024},"citing_paper":{"arxiv_id":"2605.06763","last_updated":"2026-05-11T02:30:41Z","snapshot_observed_at":"2026-07-06T23:19:10.574595Z","submitted_at":"2026-05-07T17:37:56Z","title":"Sparse Attention as a Range Searching Problem: Towards an Inference-Efficient Index for KV Cache","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-11T01:15:35.871863Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2605.06763"},"observation_digest":"sha256:6781c27c11fb7fe610d1580e587ced6b8d2ab964650a91e0022fb1a44eae01ac","observation_id":"6e946a6a-3acd-40b1-887a-3f10d559de34","resolution":{"observed_at":"2026-05-11T01:15:50.429219Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-07-06T18:40:27.299063Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":"2407.02490","doi":"10.48550/arxiv.2407.02490","metadata_source":"pith","pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Abdi, Dongsheng Li, Chin-Yew Lin, Yuqing Yang, and Lili Qiu","venue":"cs.CL","work_id":"ead3d842-61e6-4c52-8e2a-ea9a3986a1af","year":2024},"citing_paper":{"arxiv_id":"2605.18753","last_updated":"2026-05-18T17:59:52Z","snapshot_observed_at":"2026-08-02T11:52:59.734226Z","submitted_at":"2026-05-18T17:59:52Z","title":"DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-20T10:50:12.926232Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2605.18753"},"observation_digest":"sha256:aef78a4575545d7983d6512204ea1fc52f43377e5911b23f259a4c1e83f15d3f","observation_id":"44cbbdd6-45e9-46b0-93d7-d27c7a5d104e","resolution":{"observed_at":"2026-05-20T10:53:13.547437Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-07-06T18:40:27.299063Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":"2407.02490","doi":"10.48550/arxiv.2407.02490","metadata_source":"pith","pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Abdi, Dongsheng Li, Chin-Yew Lin, Yuqing Yang, and Lili Qiu","venue":"cs.CL","work_id":"ead3d842-61e6-4c52-8e2a-ea9a3986a1af","year":2024},"citing_paper":{"arxiv_id":"2605.25475","last_updated":"2026-05-25T06:29:43Z","snapshot_observed_at":"2026-08-02T08:45:15.831498Z","submitted_at":"2026-05-25T06:29:43Z","title":"IndexMem: Learned KV-Cache Eviction with Latent Memory for Long-Context LLM Inference","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T22:03:07.685253Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2605.25475"},"observation_digest":"sha256:c78edd0ea7bde2e3ec97bd3019a048ee44470f5d654c8e8c5ca60876a18cd34b","observation_id":"82c0a072-b8d5-43c0-a43e-a8a86834bd94","resolution":{"observed_at":"2026-06-29T22:03:59.863178Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-07-06T18:40:27.299063Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":"2407.02490","doi":"10.48550/arxiv.2407.02490","metadata_source":"pith","pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Abdi, Dongsheng Li, Chin-Yew Lin, Yuqing Yang, and Lili Qiu","venue":"cs.CL","work_id":"ead3d842-61e6-4c52-8e2a-ea9a3986a1af","year":2024},"citing_paper":{"arxiv_id":"2606.07604","last_updated":"2026-05-29T09:40:38Z","snapshot_observed_at":"2026-08-03T04:00:50.272221Z","submitted_at":"2026-05-29T09:40:38Z","title":"Contribution Weights: A Geometrical Analysis of Self-Attention Transformers","version":1},"reference_index":134,"source":"arxiv_source","source_observed_at":"2026-06-28T23:29:02.457697Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2606.07604"},"observation_digest":"sha256:354358a198a6d7564d0b678dc60642ad875511b295b1109195a27ef7318700f1","observation_id":"f543456c-1afd-4396-ba3f-1c23272a88e3","resolution":{"observed_at":"2026-06-28T23:32:46.749346Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-07-06T18:40:27.299063Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":"2407.02490","doi":"10.48550/arxiv.2407.02490","metadata_source":"pith","pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Abdi, Dongsheng Li, Chin-Yew Lin, Yuqing Yang, and Lili Qiu","venue":"cs.CL","work_id":"ead3d842-61e6-4c52-8e2a-ea9a3986a1af","year":2024},"citing_paper":{"arxiv_id":"2606.07703","last_updated":"2026-06-05T09:13:52Z","snapshot_observed_at":"2026-07-06T23:47:19.773490Z","submitted_at":"2026-06-05T09:13:52Z","title":"How Much Dense Attention is Necessary? Oracle-Guided Sparse Prefill for Full/GQA Layers in Hybrid Long-Context Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T22:52:13.337419Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2606.07703"},"observation_digest":"sha256:b9599942786b87898ae8bb43a43d6afb125896275256e6804d5689e5bee0798f","observation_id":"40b9c12d-7e6f-48da-b1f5-6d1606fbe75d","resolution":{"observed_at":"2026-07-02T16:17:09.159889Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-07-06T18:40:27.299063Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":"2407.02490","doi":"10.48550/arxiv.2407.02490","metadata_source":"pith","pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Abdi, Dongsheng Li, Chin-Yew Lin, Yuqing Yang, and Lili Qiu","venue":"cs.CL","work_id":"ead3d842-61e6-4c52-8e2a-ea9a3986a1af","year":2024},"citing_paper":{"arxiv_id":"2606.09441","last_updated":"2026-06-08T12:50:13Z","snapshot_observed_at":"2026-08-03T04:43:09.780812Z","submitted_at":"2026-06-08T12:50:13Z","title":"SIFT: Selective-Index For Fast Compute of RAG Prefill by Exploiting Attention Invariance","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T16:24:31.109508Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2606.09441"},"observation_digest":"sha256:68140a4dd438f247eacefa218b72fc43d68bd2d3c81c79d3f64534bee0cc8111","observation_id":"220dc4c9-14fb-475a-915e-5bbb705f6507","resolution":{"observed_at":"2026-07-03T01:37:31.268022Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-07-06T18:40:27.299063Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":"2407.02490","doi":"10.48550/arxiv.2407.02490","metadata_source":"pith","pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Abdi, Dongsheng Li, Chin-Yew Lin, Yuqing Yang, and Lili Qiu","venue":"cs.CL","work_id":"ead3d842-61e6-4c52-8e2a-ea9a3986a1af","year":2024},"citing_paper":{"arxiv_id":"2606.09508","last_updated":"2026-06-08T14:02:18Z","snapshot_observed_at":"2026-08-03T05:12:39.957667Z","submitted_at":"2026-06-08T14:02:18Z","title":"From Rigid to Dynamic: Entropy-Guided Adaptive Inference for Long-Context LLMs","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-27T16:57:02.709967Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2606.09508"},"observation_digest":"sha256:203629831649cec08d22733b502806ba83a71533be25ff669e750c653c0cd852","observation_id":"e4a10a0d-e597-4083-a80a-1d11a8bd2bbf","resolution":{"observed_at":"2026-06-27T17:01:07.726301Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-07-06T18:40:27.299063Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":"2407.02490","doi":"10.48550/arxiv.2407.02490","metadata_source":"pith","pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Abdi, Dongsheng Li, Chin-Yew Lin, Yuqing Yang, and Lili Qiu","venue":"cs.CL","work_id":"ead3d842-61e6-4c52-8e2a-ea9a3986a1af","year":2024},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":1},"reference_index":132,"source":"pdf_text","source_observed_at":"2026-06-26T16:15:22.543601Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:2f4d9aaf37a6b6a2b0b60d53d93b6a09883382c61808e7c54df385ec854da34f","observation_id":"d46ba56a-1e4d-4629-a0b0-f65436b9c3a7","resolution":{"observed_at":"2026-07-04T05:09:36.976767Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-07-06T18:40:27.299063Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-08-02T10:49:13.460701Z","title":"MInference 1.0: Accelerating Pre-filling for Long- Context LLMs via Dynamic Sparse Attention, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-02T10:48:55.986116Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":132,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:13.460701Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:512c1eb0d0078b322f569e57d5cc016f34b460a6439d5bff717d53076dd80593","observation_id":"91bc4a43-88c4-4dc1-a536-759e80b6eaf9","resolution":{"observed_at":"2026-08-02T10:49:13.460701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-07-06T18:40:27.299063Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":"2407.02490","doi":"10.48550/arxiv.2407.02490","metadata_source":"pith","pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Abdi, Dongsheng Li, Chin-Yew Lin, Yuqing Yang, and Lili Qiu","venue":"cs.CL","work_id":"ead3d842-61e6-4c52-8e2a-ea9a3986a1af","year":2024},"citing_paper":{"arxiv_id":"2606.27791","last_updated":"2026-06-26T07:20:23Z","snapshot_observed_at":"2026-08-03T05:34:54.121098Z","submitted_at":"2026-06-26T07:20:23Z","title":"NLL-Guided Full-Attention Layer Selection for Training-Free Sliding-Window Adaptation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T05:00:15.336703Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2606.27791"},"observation_digest":"sha256:2d64683b42526cd4b911c416338dc90c0f1f124e4782b38ac3868a65dfd34e31","observation_id":"46920f48-52ae-436b-9d5a-203aa039cf3a","resolution":{"observed_at":"2026-06-29T19:03:51.719634Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-07-06T18:40:27.299063Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":"2407.02490","doi":"10.48550/arxiv.2407.02490","metadata_source":"pith","pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Abdi, Dongsheng Li, Chin-Yew Lin, Yuqing Yang, and Lili Qiu","venue":"cs.CL","work_id":"ead3d842-61e6-4c52-8e2a-ea9a3986a1af","year":2024},"citing_paper":{"arxiv_id":"2606.29563","last_updated":"2026-06-28T19:04:47Z","snapshot_observed_at":"2026-08-02T13:11:07.991129Z","submitted_at":"2026-06-28T19:04:47Z","title":"Coverage-Driven KV Cache Eviction for Efficient and Improved Inference of LLM","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-30T07:19:48.530272Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2606.29563"},"observation_digest":"sha256:7048b9dfb0c753283e74897cdfc896bb76d55941ec07124c4325e02af3458709","observation_id":"517cc6a6-ee9e-4000-bfeb-1fec7201f700","resolution":{"observed_at":"2026-06-30T07:24:21.385249Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-07-06T18:40:27.299063Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":"2407.02490","doi":"10.48550/arxiv.2407.02490","metadata_source":"pith","pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Abdi, Dongsheng Li, Chin-Yew Lin, Yuqing Yang, and Lili Qiu","venue":"cs.CL","work_id":"ead3d842-61e6-4c52-8e2a-ea9a3986a1af","year":2024},"citing_paper":{"arxiv_id":"2606.30709","last_updated":"2026-06-29T16:20:35Z","snapshot_observed_at":"2026-08-02T18:09:44.238450Z","submitted_at":"2026-06-29T16:20:35Z","title":"Hierarchical Global Attention (HGA)","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-01T06:54:58.841989Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2606.30709"},"observation_digest":"sha256:dfc10f49cb68912442030ee6e1534ae8abacf2c0293e86b0cd25ad2f33585aa6","observation_id":"8ea4c474-9722-4fe5-a252-a84a522b42ae","resolution":{"observed_at":"2026-07-01T06:55:28.774424Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-07-06T18:40:27.299063Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-07-11T22:15:14.580916Z","title":"Jiang, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.07724","last_updated":"2026-07-04T20:41:42Z","snapshot_observed_at":"2026-08-02T15:40:18.200445Z","submitted_at":"2026-07-04T20:41:42Z","title":"Uncertainty-gated selection for block-sparse attention","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-11T22:15:14.580916Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2607.07724"},"observation_digest":"sha256:f509800a62f0e9828592073f1c9aff3c1eac60cef8094f48c6acbee1d4dc3244","observation_id":"0fcff984-9533-4404-b38f-594b5faea618","resolution":{"observed_at":"2026-07-11T22:15:14.580916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-07-06T18:40:27.299063Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":"2407.02490","doi":"10.48550/arxiv.2407.02490","metadata_source":"pith","pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Abdi, Dongsheng Li, Chin-Yew Lin, Yuqing Yang, and Lili Qiu","venue":"cs.CL","work_id":"ead3d842-61e6-4c52-8e2a-ea9a3986a1af","year":2024},"citing_paper":{"arxiv_id":"2607.08032","last_updated":"2026-07-09T01:15:03Z","snapshot_observed_at":"2026-08-02T16:38:21.894642Z","submitted_at":"2026-07-09T01:15:03Z","title":"What to Keep, What to Forget: A Rate--Distortion View of Memory Compaction in LLMs and Agents","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-10T01:26:59.421158Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2607.08032"},"observation_digest":"sha256:37a5fbe3e0386da2db0d47125a104abbc1e1f0a7b239552bc38b7ec41cf3f440","observation_id":"45063632-881f-418d-8182-17cf68216e57","resolution":{"observed_at":"2026-07-10T01:36:44.231104Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-07-06T18:40:27.299063Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-07-31T19:52:40.866676Z","title":"Huiqiang Jiang, Yucheng Li, Chengruidong Zhang, Qianhui Wu, Xufang Luo, Surin Ahn, Zhenhua Han, Amir H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24260","last_updated":"2026-07-27T10:51:38Z","snapshot_observed_at":"2026-08-03T17:09:54.706842Z","submitted_at":"2026-07-27T10:51:38Z","title":"KAP: Bridging the Knowledge Selection-Runtime Consumption Gap in LLM Systems","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T19:52:40.866676Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2607.24260"},"observation_digest":"sha256:b0fc1099cb7cfe5a35f1f4bce5d56b5d83a4fcea8d65d95f5380f47572a55965","observation_id":"8f387e1f-e50b-47f9-88e7-abfa0bf8fff3","resolution":{"observed_at":"2026-07-31T19:52:40.866676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-07-06T18:40:27.299063Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-08-05T20:50:03.978556Z","title":"Abdi, Dongsheng Li, Chin-Yew Lin, Yuqing Yang, and Lili Qiu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03335","last_updated":"2026-08-04T08:47:57Z","snapshot_observed_at":"2026-08-05T21:07:52.028679Z","submitted_at":"2026-08-04T08:47:57Z","title":"SPADE: An Input-Adaptive Sparse Attention Engine for Fast Video Diffusion Models Inference","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T20:50:03.978556Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2608.03335"},"observation_digest":"sha256:3ea97e43b6a77b413b6e4cd05e137ac8f9f565a62bda75b04f9da74a51960347","observation_id":"6a485c77-41fc-46fd-a732-9357902f67c8","resolution":{"observed_at":"2026-08-05T20:50:03.978556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2407.02490/citation-record","integrity":"/paper/2407.02490/integrity","json":"/paper/2407.02490/citation-record.json","paper":"/paper/2407.02490"},"outbound":[],"paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T18:40:27.299063Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 31 inbound Pith citation observations for arXiv:2407.02490."}