{"as_of":"2026-08-06T01:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a3b7bb52e8663e8ca2ef99e68006a1b4b4032c1c9f06f47ab450178c991da2e1","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T03:05:34.843274Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T06:11:23.742632Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-06-30T06:14:19.020219Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.21526","last_updated":"2026-04-21T03:10:04Z","snapshot_observed_at":"2026-07-06T22:04:20.800847Z","submitted_at":"2025-07-29T06:28:23Z","title":"Accelerating Prefilling via Decoding-time Contribution Sparsity","version":4},"cited_work":{"arxiv_id":"2507.21526","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21526","snapshot_observed_at":"2026-06-30T06:14:19.020219Z","title":"Accelerating Prefilling via Decoding-time Contribution Sparsity","venue":"cs.CL","work_id":"e2d52e1f-056c-415e-af4a-8b3dfe4d0817","year":2025},"citing_paper":{"arxiv_id":"2602.22575","last_updated":"2026-05-05T13:29:50Z","snapshot_observed_at":"2026-07-06T22:47:06.893212Z","submitted_at":"2026-02-26T03:30:28Z","title":"S2O: Early Stopping for Sparse Attention via Online Permutation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T19:32:52.948154Z"},"links":{"cited_paper":"/paper/2507.21526","citing_paper":"/paper/2602.22575"},"observation_digest":"sha256:dce9d6e6b0c026d20549c07dbfdf08854fa36730fe8352dbbe4d7203ef7111b1","observation_id":"71687192-9038-4f65-a634-37452d4c4141","resolution":{"observed_at":"2026-05-15T19:36:32.848517Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21526","last_updated":"2026-04-21T03:10:04Z","snapshot_observed_at":"2026-07-06T22:04:20.800847Z","submitted_at":"2025-07-29T06:28:23Z","title":"Accelerating Prefilling via Decoding-time Contribution Sparsity","version":4},"cited_work":{"arxiv_id":"2507.21526","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21526","snapshot_observed_at":"2026-06-30T06:14:19.020219Z","title":"Accelerating Prefilling via Decoding-time Contribution Sparsity","venue":"cs.CL","work_id":"e2d52e1f-056c-415e-af4a-8b3dfe4d0817","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"cited_paper":"/paper/2507.21526","citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:3df9ee21e8095403fb0892c82835504d159507929bfaca1a2c2ba57b8e493178","observation_id":"5a3aa25d-3f69-4882-8886-3b6d2f0c7957","resolution":{"observed_at":"2026-05-11T09:05:58.042049Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21526","last_updated":"2026-04-21T03:10:04Z","snapshot_observed_at":"2026-07-06T22:04:20.800847Z","submitted_at":"2025-07-29T06:28:23Z","title":"Accelerating Prefilling via Decoding-time Contribution Sparsity","version":4},"cited_work":{"arxiv_id":"2507.21526","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21526","snapshot_observed_at":"2026-06-30T06:14:19.020219Z","title":"Accelerating Prefilling via Decoding-time Contribution Sparsity","venue":"cs.CL","work_id":"e2d52e1f-056c-415e-af4a-8b3dfe4d0817","year":2025},"citing_paper":{"arxiv_id":"2606.29844","last_updated":"2026-06-29T06:33:37Z","snapshot_observed_at":"2026-08-03T00:15:01.794218Z","submitted_at":"2026-06-29T06:33:37Z","title":"MATCH: Modulating Attention via In-Context Retrieval for Long-Context Transformers","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-06-30T06:11:23.742632Z"},"links":{"cited_paper":"/paper/2507.21526","citing_paper":"/paper/2606.29844"},"observation_digest":"sha256:8738b8bab080495502f8b25adc6b547c45bd1a15c8e1abb5114c51e4d2c66fb0","observation_id":"f3f8182f-2bde-423a-92d5-304f40faf09e","resolution":{"observed_at":"2026-06-30T06:14:19.022993Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.21526/citation-record","integrity":"/paper/2507.21526/integrity","json":"/paper/2507.21526/citation-record.json","paper":"/paper/2507.21526"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2507.21526","last_updated":"2026-04-21T03:10:04Z","snapshot_observed_at":"2026-07-06T22:04:20.800847Z","submitted_at":"2025-07-29T06:28:23Z","title":"Accelerating Prefilling via Decoding-time Contribution Sparsity","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-19T03:05:34.843274Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.21526"},"observation_digest":"sha256:0b6563d6b8090622a4b8eb3025154091b469bfc8e3202b5e6e7f8e07b06ddec0","observation_id":"6752a959-e23b-4e7f-9a6c-9c3867d5517a","resolution":{"observed_at":"2026-05-19T03:06:59.982748Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":"2305.13245","doi":"10.48550/arxiv.2305.13245","metadata_source":"pith","pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","venue":"cs.CL","work_id":"b73ad5b2-e553-4c71-b0c9-67e67ba7b158","year":2023},"citing_paper":{"arxiv_id":"2507.21526","last_updated":"2026-04-21T03:10:04Z","snapshot_observed_at":"2026-07-06T22:04:20.800847Z","submitted_at":"2025-07-29T06:28:23Z","title":"Accelerating Prefilling via Decoding-time Contribution Sparsity","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-19T03:05:34.843274Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2507.21526"},"observation_digest":"sha256:2dd3ac35054545eaf83acde9f4362612e27c967e310bad86f195f615aa744a75","observation_id":"8edc1096-af4f-4018-805d-dd8a33972296","resolution":{"observed_at":"2026-05-19T03:06:59.938352Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14508","last_updated":"2024-06-19T04:00:32Z","snapshot_observed_at":"2026-08-02T11:20:36.216220Z","submitted_at":"2023-08-28T11:53:40Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","version":2},"cited_work":{"arxiv_id":"2308.14508","doi":"10.48550/arxiv.2308.14508","metadata_source":"pith","pith_arxiv_id":"2308.14508","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","venue":"cs.CL","work_id":"ba7831c4-9427-4e0e-a5c1-4e98511f4b53","year":2023},"citing_paper":{"arxiv_id":"2507.21526","last_updated":"2026-04-21T03:10:04Z","snapshot_observed_at":"2026-07-06T22:04:20.800847Z","submitted_at":"2025-07-29T06:28:23Z","title":"Accelerating Prefilling via Decoding-time Contribution Sparsity","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-19T03:05:34.843274Z"},"links":{"cited_paper":"/paper/2308.14508","citing_paper":"/paper/2507.21526"},"observation_digest":"sha256:5b03ccf1d30e089444d3b8937c2bfaff68fcf7b0678aeb27ee25c1af1fd9be8c","observation_id":"2ba95874-c273-4c76-8393-dbff51ef72a6","resolution":{"observed_at":"2026-05-19T03:06:59.943448Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":"2004.05150","doi":"10.48550/arxiv.2004.05150","metadata_source":"pith","pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Longformer: The Long-Document Transformer","venue":"cs.CL","work_id":"abea7a44-6668-4de7-aab6-f53a6e5aa088","year":2020},"citing_paper":{"arxiv_id":"2507.21526","last_updated":"2026-04-21T03:10:04Z","snapshot_observed_at":"2026-07-06T22:04:20.800847Z","submitted_at":"2025-07-29T06:28:23Z","title":"Accelerating Prefilling via Decoding-time Contribution Sparsity","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-19T03:05:34.843274Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2507.21526"},"observation_digest":"sha256:aeb74912a4ec0a95c14fdc1da4ef2c8ad366eac9412c99ecb018f0a5f9fda26a","observation_id":"b6b17967-ac78-4f27-bdf2-2605be464210","resolution":{"observed_at":"2026-05-19T03:06:59.953216Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:59.161233+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:59.161233+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":"1904.10509","doi":"10.48550/arxiv.1904.10509","metadata_source":"pith","pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generating Long Sequences with Sparse Transformers","venue":"cs.LG","work_id":"c5b81688-45ee-4a9a-b095-e6290f45cb6c","year":2019},"citing_paper":{"arxiv_id":"2507.21526","last_updated":"2026-04-21T03:10:04Z","snapshot_observed_at":"2026-07-06T22:04:20.800847Z","submitted_at":"2025-07-29T06:28:23Z","title":"Accelerating Prefilling via Decoding-time Contribution Sparsity","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-19T03:05:34.843274Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2507.21526"},"observation_digest":"sha256:01fa192be3ad58154c8c43fdc5998a0e8684fff9102a0b4fa6fefa6f2b6d0e81","observation_id":"5f4fce76-b8a9-472e-86e9-0ff971984bce","resolution":{"observed_at":"2026-05-19T03:06:59.957968Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:59.71041+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:59.71041+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":"2307.02486","doi":"10.48550/arxiv.2307.02486","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2307.02486 (2023)","venue":"arXiv (Cornell University)","work_id":"d2bcbcf1-3536-4da3-a03e-007066557381","year":2023},"citing_paper":{"arxiv_id":"2507.21526","last_updated":"2026-04-21T03:10:04Z","snapshot_observed_at":"2026-07-06T22:04:20.800847Z","submitted_at":"2025-07-29T06:28:23Z","title":"Accelerating Prefilling via Decoding-time Contribution Sparsity","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-19T03:05:34.843274Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2507.21526"},"observation_digest":"sha256:f1ed87a76dd0bc28f04b5a98d50c49757e0ce61ae68e588028924b21c61e1866","observation_id":"bc1e33a6-66c6-4201-be3f-bbe78c148eb5","resolution":{"observed_at":"2026-05-19T03:06:59.963072Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2507.21526","last_updated":"2026-04-21T03:10:04Z","snapshot_observed_at":"2026-07-06T22:04:20.800847Z","submitted_at":"2025-07-29T06:28:23Z","title":"Accelerating Prefilling via Decoding-time Contribution Sparsity","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-19T03:05:34.843274Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.21526"},"observation_digest":"sha256:3ff74e4df0c27e8f45497274f32879c25e94bfa654823b45ad738f314e28bf5b","observation_id":"b2944ae0-d9ca-4c94-bc02-ec369b85ea0b","resolution":{"observed_at":"2026-05-19T03:06:59.899550Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2507.21526","last_updated":"2026-04-21T03:10:04Z","snapshot_observed_at":"2026-07-06T22:04:20.800847Z","submitted_at":"2025-07-29T06:28:23Z","title":"Accelerating Prefilling via Decoding-time Contribution Sparsity","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-19T03:05:34.843274Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2507.21526"},"observation_digest":"sha256:45273610a4cf2975ec4468522f581c8d9d2b82fe33f03d2d1818d9e6c486b492","observation_id":"013ae64f-7454-4a2a-b689-fba98dda6e35","resolution":{"observed_at":"2026-05-19T03:06:59.967683Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":"2310.06825","doi":"10.48550/arxiv.2310.06825","metadata_source":"pith","pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mistral 7B","venue":"cs.CL","work_id":"eb5e1305-ad11-4875-ad8d-ad8b8f697599","year":2023},"citing_paper":{"arxiv_id":"2507.21526","last_updated":"2026-04-21T03:10:04Z","snapshot_observed_at":"2026-07-06T22:04:20.800847Z","submitted_at":"2025-07-29T06:28:23Z","title":"Accelerating Prefilling via Decoding-time Contribution Sparsity","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-19T03:05:34.843274Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2507.21526"},"observation_digest":"sha256:bfe29d0120723f785c45277451fbf1481d46f9a83500ac75181e6fb407d81429","observation_id":"06440acb-70e4-45ec-9322-ffe2279fb5aa","resolution":{"observed_at":"2026-05-19T03:06:59.977245Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:12.282824+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:12.282824+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20766","last_updated":"2025-02-28T06:34:53Z","snapshot_observed_at":"2026-07-06T20:44:13.353359Z","submitted_at":"2025-02-28T06:34:53Z","title":"FlexPrefill: A Context-Aware Sparse Attention Mechanism for Efficient Long-Sequence Inference","version":1},"cited_work":{"arxiv_id":"2502.20766","doi":"10.48550/arxiv.2502.20766","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.20766","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flex- prefill: A context-aware sparse attention mechanism for efficient long-sequence inference.arXiv preprint arXiv:2502.20766","venue":"ArXiv.org","work_id":"0cb1c44c-efb7-45c0-aee5-f6032ae66a8b","year":2025},"citing_paper":{"arxiv_id":"2507.21526","last_updated":"2026-04-21T03:10:04Z","snapshot_observed_at":"2026-07-06T22:04:20.800847Z","submitted_at":"2025-07-29T06:28:23Z","title":"Accelerating Prefilling via Decoding-time Contribution Sparsity","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-19T03:05:34.843274Z"},"links":{"cited_paper":"/paper/2502.20766","citing_paper":"/paper/2507.21526"},"observation_digest":"sha256:a87904beb4dfe57d8063166285c75e6c6479f800b7a5779139cff09eada859e1","observation_id":"fe522093-4b58-4108-9d8d-c7eacb0b20b3","resolution":{"observed_at":"2026-05-19T03:06:59.904965Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00071","last_updated":"2026-02-06T19:40:50Z","snapshot_observed_at":"2026-08-01T02:15:47.181936Z","submitted_at":"2023-08-31T18:18:07Z","title":"YaRN: Efficient Context Window Extension of Large Language Models","version":3},"cited_work":{"arxiv_id":"2309.00071","doi":"10.48550/arxiv.2309.00071","metadata_source":"pith","pith_arxiv_id":"2309.00071","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"YaRN: Efficient Context Window Extension of Large Language Models","venue":"cs.CL","work_id":"31f454a9-7de2-4696-86f2-9bfa1410f80d","year":2023},"citing_paper":{"arxiv_id":"2507.21526","last_updated":"2026-04-21T03:10:04Z","snapshot_observed_at":"2026-07-06T22:04:20.800847Z","submitted_at":"2025-07-29T06:28:23Z","title":"Accelerating Prefilling via Decoding-time Contribution Sparsity","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-19T03:05:34.843274Z"},"links":{"cited_paper":"/paper/2309.00071","citing_paper":"/paper/2507.21526"},"observation_digest":"sha256:3a7938dde55dbc82f069f42d540e4ef2b0bd9ac437b6dbb6647427d6c1cb26f8","observation_id":"fbdc757e-8c42-4657-be80-d28b6511d4f0","resolution":{"observed_at":"2026-05-19T03:06:59.932202Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10774","last_updated":"2024-08-26T21:01:02Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-16T01:33:02Z","title":"Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference","version":2},"cited_work":{"arxiv_id":"2406.10774","doi":"10.48550/arxiv.2406.10774","metadata_source":"pith","pith_arxiv_id":"2406.10774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference","venue":"cs.CL","work_id":"2cad64c9-e2d5-42b6-8db9-03fafde4bcb0","year":2024},"citing_paper":{"arxiv_id":"2507.21526","last_updated":"2026-04-21T03:10:04Z","snapshot_observed_at":"2026-07-06T22:04:20.800847Z","submitted_at":"2025-07-29T06:28:23Z","title":"Accelerating Prefilling via Decoding-time Contribution Sparsity","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-19T03:05:34.843274Z"},"links":{"cited_paper":"/paper/2406.10774","citing_paper":"/paper/2507.21526"},"observation_digest":"sha256:4aa79e412022a25ac1fad8144f9bd3c4b149e90f87e8def84c52a0350cddb038","observation_id":"3d544be1-1534-4c55-8221-f7f6228959eb","resolution":{"observed_at":"2026-05-19T03:06:59.927072Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10819","last_updated":"2024-10-14T17:59:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-14T17:59:58Z","title":"DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads","version":1},"cited_work":{"arxiv_id":"2410.10819","doi":"10.48550/arxiv.2410.10819","metadata_source":"pith","pith_arxiv_id":"2410.10819","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads","venue":"cs.CL","work_id":"dcb5f5ed-ec94-4386-bfa7-02fcaeb844f1","year":2024},"citing_paper":{"arxiv_id":"2507.21526","last_updated":"2026-04-21T03:10:04Z","snapshot_observed_at":"2026-07-06T22:04:20.800847Z","submitted_at":"2025-07-29T06:28:23Z","title":"Accelerating Prefilling via Decoding-time Contribution Sparsity","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-19T03:05:34.843274Z"},"links":{"cited_paper":"/paper/2410.10819","citing_paper":"/paper/2507.21526"},"observation_digest":"sha256:d6eb7e3112fec6e5cccc48f6496f32a7bb480b82ceb7663a47195e04b0746764","observation_id":"fc6f7531-f91e-4297-82df-bdd8a9632fa4","resolution":{"observed_at":"2026-05-19T03:06:59.910968Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":"2309.17453","doi":"10.48550/arxiv.2309.17453","metadata_source":"pith","pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Streaming Language Models with Attention Sinks","venue":"cs.CL","work_id":"a8d25452-c237-48c9-88a4-682717c3979a","year":2023},"citing_paper":{"arxiv_id":"2507.21526","last_updated":"2026-04-21T03:10:04Z","snapshot_observed_at":"2026-07-06T22:04:20.800847Z","submitted_at":"2025-07-29T06:28:23Z","title":"Accelerating Prefilling via Decoding-time Contribution Sparsity","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-19T03:05:34.843274Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2507.21526"},"observation_digest":"sha256:d2921c9f0204e57d686e3659932798869d482f6e40fd89a961e27a7631c68b85","observation_id":"52568b56-e0b0-45a4-8a27-c9a2417962d7","resolution":{"observed_at":"2026-05-19T03:06:59.916469Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16428","last_updated":"2025-03-20T17:59:58Z","snapshot_observed_at":"2026-07-06T20:56:14.017923Z","submitted_at":"2025-03-20T17:59:58Z","title":"XAttention: Block Sparse Attention with Antidiagonal Scoring","version":1},"cited_work":{"arxiv_id":"2503.16428","doi":"10.48550/arxiv.2503.16428","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.16428","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Xattention: Block sparse attention with antidiagonal scoring.arXiv preprint arXiv:2503.16428","venue":"ArXiv.org","work_id":"660ed69e-6b5b-4d82-8a52-f5b1514a694b","year":2018},"citing_paper":{"arxiv_id":"2507.21526","last_updated":"2026-04-21T03:10:04Z","snapshot_observed_at":"2026-07-06T22:04:20.800847Z","submitted_at":"2025-07-29T06:28:23Z","title":"Accelerating Prefilling via Decoding-time Contribution Sparsity","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-19T03:05:34.843274Z"},"links":{"cited_paper":"/paper/2503.16428","citing_paper":"/paper/2507.21526"},"observation_digest":"sha256:be0300d3d60a148087e03e5dc7e7ffda8f810c55a1dce5477b21518e28664656","observation_id":"74f1b448-573d-466e-8df6-ad20893a2a52","resolution":{"observed_at":"2026-05-19T03:06:59.948278Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2507.21526","last_updated":"2026-04-21T03:10:04Z","snapshot_observed_at":"2026-07-06T22:04:20.800847Z","submitted_at":"2025-07-29T06:28:23Z","title":"Accelerating Prefilling via Decoding-time Contribution Sparsity","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-19T03:05:34.843274Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2507.21526"},"observation_digest":"sha256:f748ef9d57dea37f29fa6ec396b6eda9c7da300646941b4a24f42997a850377a","observation_id":"917f7ec0-2177-4215-ba76-cffb91f8fd40","resolution":{"observed_at":"2026-05-19T03:06:59.922217Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14924","last_updated":"2024-09-23T11:20:20Z","snapshot_observed_at":"2026-07-06T19:20:23.589464Z","submitted_at":"2024-09-23T11:20:20Z","title":"Retrieval Augmented Generation (RAG) and Beyond: A Comprehensive Survey on How to Make your LLMs use External Data More Wisely","version":1},"cited_work":{"arxiv_id":"2409.14924","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.14924","snapshot_observed_at":"2026-06-29T07:33:13.582327Z","title":"arXiv preprint arXiv:2409.14924","venue":null,"work_id":"af0c891e-fdf9-4948-a505-02d93676427c","year":2024},"citing_paper":{"arxiv_id":"2507.21526","last_updated":"2026-04-21T03:10:04Z","snapshot_observed_at":"2026-07-06T22:04:20.800847Z","submitted_at":"2025-07-29T06:28:23Z","title":"Accelerating Prefilling via Decoding-time Contribution Sparsity","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-19T03:05:34.843274Z"},"links":{"cited_paper":"/paper/2409.14924","citing_paper":"/paper/2507.21526"},"observation_digest":"sha256:e3c7f3187d0418e89e1b2973af494270a6ac557ff9eee8e7f49a01746f7ed6a1","observation_id":"1672b298-ddfa-48c1-8d1e-88ae6677fa66","resolution":{"observed_at":"2026-05-19T03:06:59.972943Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.21526","last_updated":"2026-04-21T03:10:04Z","latest_version":4,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T22:04:20.800847Z","submitted_at":"2025-07-29T06:28:23Z","title":"Accelerating Prefilling via Decoding-time Contribution Sparsity"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":0,"metadata_mismatch":11,"parse_uncertain":0,"unresolved":0,"verified_exact":6,"verified_fuzzy":0},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 3 inbound Pith citation observations for arXiv:2507.21526."}