{"as_of":"2026-08-08T04:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6ecb03172a5d42d18b70bca4cd118c7ff06d14b472014a0d9643fe54da303024","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:24:27.928826Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.05300/citation-record","integrity":"/paper/2506.05300/integrity","json":"/paper/2506.05300/citation-record.json","paper":"/paper/2506.05300"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:28.439567Z","title":"https://openai","venue":null,"work_id":"f5de7330-53be-4efe-bc9b-bd375f185ff3","year":2021},"citing_paper":{"arxiv_id":"2506.05300","last_updated":"2025-06-05T17:50:32Z","snapshot_observed_at":"2026-08-07T10:19:13.309866Z","submitted_at":"2025-06-05T17:50:32Z","title":"Power Law Guided Dynamic Sifting for Efficient Attention","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:27.782005Z"},"links":{"citing_paper":"/paper/2506.05300"},"observation_digest":"sha256:30210a1971577cdbf52b5b5002c138429fb293b247bebeee059743f975fce331","observation_id":"74077666-a4ef-468f-b19a-4b9880d6df09","resolution":{"observed_at":"2026-08-07T10:24:28.444823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:28.421720Z","title":"Neural machine translation by jointly learning to align and translate","venue":null,"work_id":"76a8bc93-da8d-474c-858e-05d97b1b30f2","year":2015},"citing_paper":{"arxiv_id":"2506.05300","last_updated":"2025-06-05T17:50:32Z","snapshot_observed_at":"2026-08-07T10:19:13.309866Z","submitted_at":"2025-06-05T17:50:32Z","title":"Power Law Guided Dynamic Sifting for Efficient Attention","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:27.787646Z"},"links":{"citing_paper":"/paper/2506.05300"},"observation_digest":"sha256:cebfc4ffc0fac59b73daea9f8c6b5075dc15fcce3028754273d259d995a49523","observation_id":"7fc8f2da-397c-4670-a0ae-7d8a392156f8","resolution":{"observed_at":"2026-08-07T10:24:28.427432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08363","last_updated":"2026-06-16T14:51:28Z","snapshot_observed_at":"2026-08-08T01:16:10.442965Z","submitted_at":"2025-02-12T12:50:15Z","title":"Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding","version":3},"cited_work":{"arxiv_id":"2502.08363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.08363","snapshot_observed_at":"2026-08-07T10:24:28.112713Z","title":"Top-Theta Attention: Sparsifying Transformers by Compensated Thresholding","venue":"cs.CL","work_id":"96d2d400-2c68-4a65-835a-2eacffbe2ba5","year":2025},"citing_paper":{"arxiv_id":"2506.05300","last_updated":"2025-06-05T17:50:32Z","snapshot_observed_at":"2026-08-07T10:19:13.309866Z","submitted_at":"2025-06-05T17:50:32Z","title":"Power Law Guided Dynamic Sifting for Efficient Attention","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:27.792499Z"},"links":{"cited_paper":"/paper/2502.08363","citing_paper":"/paper/2506.05300"},"observation_digest":"sha256:6734335fc7716fc87c9e66bd852671242e7525f451e3a97b2262709dd0cdb284","observation_id":"ebca9c3e-09b4-4cd2-b792-5828cdc7c8a8","resolution":{"observed_at":"2026-08-07T10:24:28.119897Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09988","last_updated":"2024-12-13T22:03:43Z","snapshot_observed_at":"2026-07-06T19:32:42.378146Z","submitted_at":"2024-10-13T20:09:41Z","title":"HARDMath: A Benchmark Dataset for Challenging Problems in Applied Mathematics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09988","snapshot_observed_at":"2026-08-07T10:24:27.797796Z","title":"Hardmath: A benchmark dataset for challenging problems in applied mathematics","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05300","last_updated":"2025-06-05T17:50:32Z","snapshot_observed_at":"2026-08-07T10:19:13.309866Z","submitted_at":"2025-06-05T17:50:32Z","title":"Power Law Guided Dynamic Sifting for Efficient Attention","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:27.797796Z"},"links":{"cited_paper":"/paper/2410.09988","citing_paper":"/paper/2506.05300"},"observation_digest":"sha256:26746bee1dce007041773a9180b7978db23e23ef7cc613a8801925377a9d2065","observation_id":"e55a2a4e-0c0b-4f49-9ada-b0ed3ac7d8e7","resolution":{"observed_at":"2026-08-07T10:24:27.797796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:27.802839Z","title":"Open llm leaderboard v2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05300","last_updated":"2025-06-05T17:50:32Z","snapshot_observed_at":"2026-08-07T10:19:13.309866Z","submitted_at":"2025-06-05T17:50:32Z","title":"Power Law Guided Dynamic Sifting for Efficient Attention","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:27.802839Z"},"links":{"citing_paper":"/paper/2506.05300"},"observation_digest":"sha256:9fb90af028d55e8f7aaa0bfadb1c5d6fcbc91b85d95bf63bd1b684d6ca45101f","observation_id":"a3f05dba-9183-455d-b0de-eb6771809a6b","resolution":{"observed_at":"2026-08-07T10:24:27.802839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:27.807637Z","title":"The llama 3 herd of models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05300","last_updated":"2025-06-05T17:50:32Z","snapshot_observed_at":"2026-08-07T10:19:13.309866Z","submitted_at":"2025-06-05T17:50:32Z","title":"Power Law Guided Dynamic Sifting for Efficient Attention","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:27.807637Z"},"links":{"citing_paper":"/paper/2506.05300"},"observation_digest":"sha256:eddb456ac0507562317c11104bb9300ebdfbfdfa98822888402d7e1c486f46e2","observation_id":"76ec73af-94a5-4ab7-970b-fcbfbd2d9ee0","resolution":{"observed_at":"2026-08-07T10:24:27.807637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06899","last_updated":"2021-06-13T02:30:23Z","snapshot_observed_at":"2026-08-08T01:15:11.346221Z","submitted_at":"2021-06-13T02:30:23Z","title":"Memory-efficient Transformers via Top-$k$ Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06899","snapshot_observed_at":"2026-08-07T10:24:27.813137Z","title":"Memory-efficient transformers via top-k attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05300","last_updated":"2025-06-05T17:50:32Z","snapshot_observed_at":"2026-08-07T10:19:13.309866Z","submitted_at":"2025-06-05T17:50:32Z","title":"Power Law Guided Dynamic Sifting for Efficient Attention","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:27.813137Z"},"links":{"cited_paper":"/paper/2106.06899","citing_paper":"/paper/2506.05300"},"observation_digest":"sha256:c7dd902aa0429b594d65cef333b1044f9c3e0ae258113970a69476000de5ce43","observation_id":"7e97d933-5039-405c-a9c7-73d870709794","resolution":{"observed_at":"2026-08-07T10:24:27.813137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:28.360234Z","title":"Data movement is all you need: A case study on optimizing transformers","venue":null,"work_id":"eac451de-55b5-42af-a274-a1f0d06316b1","year":2021},"citing_paper":{"arxiv_id":"2506.05300","last_updated":"2025-06-05T17:50:32Z","snapshot_observed_at":"2026-08-07T10:19:13.309866Z","submitted_at":"2025-06-05T17:50:32Z","title":"Power Law Guided Dynamic Sifting for Efficient Attention","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:27.818820Z"},"links":{"citing_paper":"/paper/2506.05300"},"observation_digest":"sha256:3404118522858ebbac85e31803580d354a6341d322fffb1687b49758d204eaf5","observation_id":"6a95fec0-428f-4311-9d45-6ac1f1f6a947","resolution":{"observed_at":"2026-08-07T10:24:28.365638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T10:24:27.823651Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05300","last_updated":"2025-06-05T17:50:32Z","snapshot_observed_at":"2026-08-07T10:19:13.309866Z","submitted_at":"2025-06-05T17:50:32Z","title":"Power Law Guided Dynamic Sifting for Efficient Attention","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:27.823651Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2506.05300"},"observation_digest":"sha256:eb9986c3eec7b86728b0ee5212042fc790367435fb9667f7ebcdc29920cc27e5","observation_id":"6a86935d-29e9-408a-aedf-73d6f7c058f4","resolution":{"observed_at":"2026-08-07T10:24:27.823651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:28.344499Z","title":"InfiniGen: Efficient generative inference of large language models with dynamic KV cache management","venue":null,"work_id":"deee5df1-c381-4cd0-bc8b-668d1dece008","year":2024},"citing_paper":{"arxiv_id":"2506.05300","last_updated":"2025-06-05T17:50:32Z","snapshot_observed_at":"2026-08-07T10:19:13.309866Z","submitted_at":"2025-06-05T17:50:32Z","title":"Power Law Guided Dynamic Sifting for Efficient Attention","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:27.828534Z"},"links":{"citing_paper":"/paper/2506.05300"},"observation_digest":"sha256:217f8418b4fcd38a5652d32345506ccddc715df89a4a417da3e8842f9a5e0dc8","observation_id":"05c23738-ec40-4958-93ae-0c7b3f561df2","resolution":{"observed_at":"2026-08-07T10:24:28.349370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:28.328545Z","title":"Accelerating attention through gradient-based learned runtime pruning","venue":null,"work_id":"b15161b3-6bc5-4da6-9b89-0b25e6066dc7","year":2022},"citing_paper":{"arxiv_id":"2506.05300","last_updated":"2025-06-05T17:50:32Z","snapshot_observed_at":"2026-08-07T10:19:13.309866Z","submitted_at":"2025-06-05T17:50:32Z","title":"Power Law Guided Dynamic Sifting for Efficient Attention","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:27.833109Z"},"links":{"citing_paper":"/paper/2506.05300"},"observation_digest":"sha256:583993b9deaba362b8f467f1d46c1875b38056a84a1eca4aeab421442ee425a4","observation_id":"f7c2ba93-f23e-45da-b333-bb374b356ffd","resolution":{"observed_at":"2026-08-07T10:24:28.333646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17118","last_updated":"2023-08-28T22:48:46Z","snapshot_observed_at":"2026-08-01T09:57:16.282788Z","submitted_at":"2023-05-26T17:39:58Z","title":"Scissorhands: Exploiting the Persistence of Importance Hypothesis for LLM KV Cache Compression at Test Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17118","snapshot_observed_at":"2026-08-07T10:24:27.837909Z","title":"Scissorhands: Exploiting the persistence of importance hypothesis for llm kv cache compression at test time","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05300","last_updated":"2025-06-05T17:50:32Z","snapshot_observed_at":"2026-08-07T10:19:13.309866Z","submitted_at":"2025-06-05T17:50:32Z","title":"Power Law Guided Dynamic Sifting for Efficient Attention","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:27.837909Z"},"links":{"cited_paper":"/paper/2305.17118","citing_paper":"/paper/2506.05300"},"observation_digest":"sha256:5535ea1d7c785652c2c9038dab62c2c093af54449f6cab000274dcbc0e588925","observation_id":"401a3eb3-448a-437d-a999-339ba30fe238","resolution":{"observed_at":"2026-08-07T10:24:27.837909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-07-06T05:12:10.387914Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-07T10:24:27.842761Z","title":"Pointer sentinel mixture models","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.05300","last_updated":"2025-06-05T17:50:32Z","snapshot_observed_at":"2026-08-07T10:19:13.309866Z","submitted_at":"2025-06-05T17:50:32Z","title":"Power Law Guided Dynamic Sifting for Efficient Attention","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:27.842761Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2506.05300"},"observation_digest":"sha256:3f4aff7b92df61da2d9e80d839297de456c201205bf9ae37c2bc32ad9572d677","observation_id":"6a659b0b-9fca-492e-82cc-6881f8088efc","resolution":{"observed_at":"2026-08-07T10:24:27.842761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13541","last_updated":"2024-02-26T08:40:50Z","snapshot_observed_at":"2026-07-06T16:51:15.252642Z","submitted_at":"2023-11-22T17:30:41Z","title":"Linear Log-Normal Attention with Unbiased Concentration","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13541","snapshot_observed_at":"2026-08-07T10:24:27.847626Z","title":"Linear log-normal attention with unbiased concentration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05300","last_updated":"2025-06-05T17:50:32Z","snapshot_observed_at":"2026-08-07T10:19:13.309866Z","submitted_at":"2025-06-05T17:50:32Z","title":"Power Law Guided Dynamic Sifting for Efficient Attention","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:27.847626Z"},"links":{"cited_paper":"/paper/2311.13541","citing_paper":"/paper/2506.05300"},"observation_digest":"sha256:bb74689424d61b5a7273c857df451b347b261971dad940ec22bf74f88c5de1a5","observation_id":"3146998c-b91e-4c49-93f2-4eeb1ed3dab9","resolution":{"observed_at":"2026-08-07T10:24:27.847626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:27.852244Z","title":"Nvidia nsight compute","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05300","last_updated":"2025-06-05T17:50:32Z","snapshot_observed_at":"2026-08-07T10:19:13.309866Z","submitted_at":"2025-06-05T17:50:32Z","title":"Power Law Guided Dynamic Sifting for Efficient Attention","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:27.852244Z"},"links":{"citing_paper":"/paper/2506.05300"},"observation_digest":"sha256:663600af9488ef3e11365b378bcb6e09dd6a287b1b06769a491112e3f5711d0a","observation_id":"7e32a359-1215-4bd3-a58b-95c2fb69a47f","resolution":{"observed_at":"2026-08-07T10:24:27.852244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:27.857623Z","title":"Automatic differentiation in pytorch","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.05300","last_updated":"2025-06-05T17:50:32Z","snapshot_observed_at":"2026-08-07T10:19:13.309866Z","submitted_at":"2025-06-05T17:50:32Z","title":"Power Law Guided Dynamic Sifting for Efficient Attention","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:27.857623Z"},"links":{"citing_paper":"/paper/2506.05300"},"observation_digest":"sha256:5fb108dd2ca9d636a4ab1b51a02f1ab16163684494b0c685ab604ecc9682db7f","observation_id":"caca6fe1-5524-45c8-9d76-4bad809bc8ea","resolution":{"observed_at":"2026-08-07T10:24:27.857623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:27.862367Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05300","last_updated":"2025-06-05T17:50:32Z","snapshot_observed_at":"2026-08-07T10:19:13.309866Z","submitted_at":"2025-06-05T17:50:32Z","title":"Power Law Guided Dynamic Sifting for Efficient Attention","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:27.862367Z"},"links":{"citing_paper":"/paper/2506.05300"},"observation_digest":"sha256:4b3335b92502b9ae2a0db4edb394130a9210892828a5d7d18905782ab472a905","observation_id":"81cc7fd9-f485-41b4-b6db-05053430d3f9","resolution":{"observed_at":"2026-08-07T10:24:27.862367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:28.279916Z","title":"Sparq attention: Bandwidth-efficient llm inference, 2023","venue":null,"work_id":"7d2e56c9-4ceb-4e18-9f7c-ef06034e6ebe","year":2023},"citing_paper":{"arxiv_id":"2506.05300","last_updated":"2025-06-05T17:50:32Z","snapshot_observed_at":"2026-08-07T10:19:13.309866Z","submitted_at":"2025-06-05T17:50:32Z","title":"Power Law Guided Dynamic Sifting for Efficient Attention","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:27.866858Z"},"links":{"citing_paper":"/paper/2506.05300"},"observation_digest":"sha256:4aea8f52116e867902b9495fbc4397461cae95827bab811775f8940580173b99","observation_id":"5f4326c2-3618-4f90-b65b-926656dd0bfc","resolution":{"observed_at":"2026-08-07T10:24:28.285761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:28.263109Z","title":"AxoNN: An asynchronous, message-driven parallel framework for extreme-scale deep learning","venue":null,"work_id":"f0830094-e3c6-494c-9d45-c400d263b382","year":2022},"citing_paper":{"arxiv_id":"2506.05300","last_updated":"2025-06-05T17:50:32Z","snapshot_observed_at":"2026-08-07T10:19:13.309866Z","submitted_at":"2025-06-05T17:50:32Z","title":"Power Law Guided Dynamic Sifting for Efficient Attention","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:27.871654Z"},"links":{"citing_paper":"/paper/2506.05300"},"observation_digest":"sha256:eac1cdb90abd82a696344a53718f781e1f0c93b22551b6c70b0dac4546c878e8","observation_id":"ffa05f8c-47a3-470e-a07b-759ad51e116b","resolution":{"observed_at":"2026-08-07T10:24:28.268279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:28.247365Z","title":"Democratizing AI: Open-source scalable LLM training on GPU-based supercomputers","venue":null,"work_id":"1c4602d4-9969-4793-a940-f7144eef94d1","year":2024},"citing_paper":{"arxiv_id":"2506.05300","last_updated":"2025-06-05T17:50:32Z","snapshot_observed_at":"2026-08-07T10:19:13.309866Z","submitted_at":"2025-06-05T17:50:32Z","title":"Power Law Guided Dynamic Sifting for Efficient Attention","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:27.876504Z"},"links":{"citing_paper":"/paper/2506.05300"},"observation_digest":"sha256:2300ec04ec104a2841da835842691d97f69c1bf7065baf2d19f98ba6d3e9dea2","observation_id":"60301ef0-6756-403f-a45b-1d754180aec1","resolution":{"observed_at":"2026-08-07T10:24:28.252311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:28.231622Z","title":"Ranjan, Zack Sating, and Abhinav Bhatele","venue":null,"work_id":"ba3880cc-bb03-4fe8-8299-ee9b9909a33e","year":2024},"citing_paper":{"arxiv_id":"2506.05300","last_updated":"2025-06-05T17:50:32Z","snapshot_observed_at":"2026-08-07T10:19:13.309866Z","submitted_at":"2025-06-05T17:50:32Z","title":"Power Law Guided Dynamic Sifting for Efficient Attention","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:27.882048Z"},"links":{"citing_paper":"/paper/2506.05300"},"observation_digest":"sha256:d5cf16fb66f8b30d7454cbc2e85eb09eb8c5dcf35518a2e6016b3e9d142d4996","observation_id":"8442784a-d719-49af-bc3b-6e5889bba6b1","resolution":{"observed_at":"2026-08-07T10:24:28.236411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:28.216691Z","title":"Loki: Low-rank keys for efficient sparse attention","venue":null,"work_id":"d5a36e46-debd-4583-8955-696c2f2fae99","year":2024},"citing_paper":{"arxiv_id":"2506.05300","last_updated":"2025-06-05T17:50:32Z","snapshot_observed_at":"2026-08-07T10:19:13.309866Z","submitted_at":"2025-06-05T17:50:32Z","title":"Power Law Guided Dynamic Sifting for Efficient Attention","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:27.886619Z"},"links":{"citing_paper":"/paper/2506.05300"},"observation_digest":"sha256:46f888afa8e26fc55347afd2e067756825a608fc3f689d8d292b3ed46f5db447","observation_id":"92454305-aaad-4ad5-8de7-73867d7fdd78","resolution":{"observed_at":"2026-08-07T10:24:28.221449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:28.200815Z","title":"Pytorch 2.0: Our next generation release that is faster, more pythonic and dynamic as ever","venue":null,"work_id":"712bd2f4-b207-46d5-bc16-d9a9136fa6ee","year":2023},"citing_paper":{"arxiv_id":"2506.05300","last_updated":"2025-06-05T17:50:32Z","snapshot_observed_at":"2026-08-07T10:19:13.309866Z","submitted_at":"2025-06-05T17:50:32Z","title":"Power Law Guided Dynamic Sifting for Efficient Attention","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:27.891209Z"},"links":{"citing_paper":"/paper/2506.05300"},"observation_digest":"sha256:bba6aa2aa08bd108307fbe9d6b1c95a45a72dbc43faab0cd3ad99ec2b349713e","observation_id":"ff6532a2-db3f-41a2-8bd5-da387a31c1e5","resolution":{"observed_at":"2026-08-07T10:24:28.205696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:27.895730Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.05300","last_updated":"2025-06-05T17:50:32Z","snapshot_observed_at":"2026-08-07T10:19:13.309866Z","submitted_at":"2025-06-05T17:50:32Z","title":"Power Law Guided Dynamic Sifting for Efficient Attention","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:27.895730Z"},"links":{"citing_paper":"/paper/2506.05300"},"observation_digest":"sha256:e6a489c7ba9baf5a1d801b6b89df3a8650b3b3b4e6ae1556ea5e1e40c73f5955","observation_id":"889d5025-cb8d-472a-80cf-a9f9a8fef3fb","resolution":{"observed_at":"2026-08-07T10:24:27.895730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02076","last_updated":"2025-01-23T00:52:08Z","snapshot_observed_at":"2026-08-07T03:51:37.675554Z","submitted_at":"2024-09-03T17:25:54Z","title":"LongGenBench: Benchmarking Long-Form Generation in Long Context LLMs","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02076","snapshot_observed_at":"2026-08-07T10:24:27.900314Z","title":"Longgenbench: Benchmarking long-form generation in long context llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05300","last_updated":"2025-06-05T17:50:32Z","snapshot_observed_at":"2026-08-07T10:19:13.309866Z","submitted_at":"2025-06-05T17:50:32Z","title":"Power Law Guided Dynamic Sifting for Efficient Attention","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:27.900314Z"},"links":{"cited_paper":"/paper/2409.02076","citing_paper":"/paper/2506.05300"},"observation_digest":"sha256:4571df9222fdf42105660de41d78e2c91eef0cc2d58d6e6702d6979a56152734","observation_id":"155a4e28-7b78-4608-b62e-b81353cfc3c6","resolution":{"observed_at":"2026-08-07T10:24:27.900314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T10:24:27.905032Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05300","last_updated":"2025-06-05T17:50:32Z","snapshot_observed_at":"2026-08-07T10:19:13.309866Z","submitted_at":"2025-06-05T17:50:32Z","title":"Power Law Guided Dynamic Sifting for Efficient Attention","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:27.905032Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.05300"},"observation_digest":"sha256:0ac2e823afd42a442b61956f915eb9adb541993a8223bd440fef6727f8fef97e","observation_id":"4ad8a3fe-516e-41ed-91c0-7e4d7613fa5f","resolution":{"observed_at":"2026-08-07T10:24:27.905032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:28.174677Z","title":"Zeroquant-v2: Exploring post-training quantization in llms from comprehensive study to low rank compensation","venue":null,"work_id":"58291f75-cf8d-4992-b9ec-d769e5b24ead","year":2023},"citing_paper":{"arxiv_id":"2506.05300","last_updated":"2025-06-05T17:50:32Z","snapshot_observed_at":"2026-08-07T10:19:13.309866Z","submitted_at":"2025-06-05T17:50:32Z","title":"Power Law Guided Dynamic Sifting for Efficient Attention","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:27.909679Z"},"links":{"citing_paper":"/paper/2506.05300"},"observation_digest":"sha256:d6709bce93c61b36c68e3d3bf9dff7281317c1a0d99393d5ea9a4d8330728c96","observation_id":"cb59260a-de63-45e3-b34c-c2cd94e96690","resolution":{"observed_at":"2026-08-07T10:24:28.179953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:28.159395Z","title":"Parallel top-k algorithms on gpu: A comprehensive study and new methods","venue":null,"work_id":"b54b22dc-06a6-40c4-af7b-887052fa87ea","year":null},"citing_paper":{"arxiv_id":"2506.05300","last_updated":"2025-06-05T17:50:32Z","snapshot_observed_at":"2026-08-07T10:19:13.309866Z","submitted_at":"2025-06-05T17:50:32Z","title":"Power Law Guided Dynamic Sifting for Efficient Attention","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:27.914131Z"},"links":{"citing_paper":"/paper/2506.05300"},"observation_digest":"sha256:969b2b617a2903a231e2f03023d61021049b3c382c1de8f800d3d18aade9525c","observation_id":"3cb83ece-a43a-4a25-a213-b702cbdae523","resolution":{"observed_at":"2026-08-07T10:24:28.164444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-08-06T19:19:02.165567Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-07T10:24:27.923861Z","title":"H _2 o: Heavy-hitter oracle for efficient generative inference of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05300","last_updated":"2025-06-05T17:50:32Z","snapshot_observed_at":"2026-08-07T10:19:13.309866Z","submitted_at":"2025-06-05T17:50:32Z","title":"Power Law Guided Dynamic Sifting for Efficient Attention","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:27.923861Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2506.05300"},"observation_digest":"sha256:8a3f5283f51f619f31d5c4b6f20c4381d4646438d1e562d82935380916a2fdff","observation_id":"aa89239b-eded-432e-93fc-ab7fe461df0f","resolution":{"observed_at":"2026-08-07T10:24:27.923861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:28.133345Z","title":"Instruction-following evaluation for large language models, 2023","venue":null,"work_id":"69f207eb-23b3-4ea2-9d34-cb39c5ca1e5f","year":2023},"citing_paper":{"arxiv_id":"2506.05300","last_updated":"2025-06-05T17:50:32Z","snapshot_observed_at":"2026-08-07T10:19:13.309866Z","submitted_at":"2025-06-05T17:50:32Z","title":"Power Law Guided Dynamic Sifting for Efficient Attention","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:27.928826Z"},"links":{"citing_paper":"/paper/2506.05300"},"observation_digest":"sha256:681d14ff5651d220cb1ff8b18e350a1d71b605e1b8ddb3ecc2fdbab768b0720c","observation_id":"aea9aeaa-8f9e-49a2-8dae-b6030fbb0e87","resolution":{"observed_at":"2026-08-07T10:24:28.138496Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:27.919133Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05300","last_updated":"2025-06-05T17:50:32Z","snapshot_observed_at":"2026-08-07T10:19:13.309866Z","submitted_at":"2025-06-05T17:50:32Z","title":"Power Law Guided Dynamic Sifting for Efficient Attention","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:27.919133Z"},"links":{"citing_paper":"/paper/2506.05300"},"observation_digest":"sha256:ff40f8d4beaebf816a5752400781f5231ba70031c5698e9dcfe8c6849be0f11e","observation_id":"30257cfd-aa48-4b9d-a665-fda66e1870e4","resolution":{"observed_at":"2026-08-07T10:24:27.919133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.05300","last_updated":"2025-06-05T17:50:32Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T10:19:13.309866Z","submitted_at":"2025-06-05T17:50:32Z","title":"Power Law Guided Dynamic Sifting for Efficient Attention"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":1,"verified_fuzzy":13},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2506.05300."}