{"as_of":"2026-08-08T01:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b23e0b233f2848484b3f8b6ef61e4c24c412712d785d60def9dcf614c07e7329","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:26:02.274620Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:45:48.458849Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T00:45:48.747511Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-07T11:19:01.412236Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"cited_work":{"arxiv_id":"2506.02572","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.02572","snapshot_observed_at":"2026-08-07T00:45:48.747511Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","venue":"cs.LG","work_id":"b281805c-434b-4b6f-8e01-cbc075af3219","year":2025},"citing_paper":{"arxiv_id":"2608.04405","last_updated":"2026-08-05T03:19:21Z","snapshot_observed_at":"2026-08-08T01:11:21.551739Z","submitted_at":"2026-08-05T03:19:21Z","title":"Training-Free Hashing-Based Attention via Binary Principal Components","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T00:45:48.458849Z"},"links":{"cited_paper":"/paper/2506.02572","citing_paper":"/paper/2608.04405"},"observation_digest":"sha256:8b965fcb432a6501246f6aa0e9b4e6d9a60bd1ec5b599530182b5b99570bd82f","observation_id":"8a1c847a-d352-4183-97c4-ee08663a825b","resolution":{"observed_at":"2026-08-07T00:45:48.754100Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.02572/citation-record","integrity":"/paper/2506.02572/integrity","json":"/paper/2506.02572/citation-record.json","paper":"/paper/2506.02572"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:25:57.349731Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-07T11:19:01.412236Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T11:25:57.349731Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:c1ede7e3cb68683c1b76e7c2f89dba1f724f25c03156fe972e786c5553660548","observation_id":"d00d6d16-d450-434f-9c50-f55eeaeb2bb2","resolution":{"observed_at":"2026-08-07T11:25:57.349731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:25:57.459565Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-07T11:19:01.412236Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T11:25:57.459565Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:e0ce111f39fae248f96ce48ea3de950766294bdf026531e3de5502973930991d","observation_id":"d0264211-adc8-4dcf-9e69-f46c3df0a536","resolution":{"observed_at":"2026-08-07T11:25:57.459565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:25:57.675401Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-07T11:19:01.412236Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T11:25:57.675401Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:322650888384b374e327dbdc9fd376af3f771f1655cc1808895eab3c30d4245b","observation_id":"28ab32b5-96e1-4cf7-8a59-a4db1e863739","resolution":{"observed_at":"2026-08-07T11:25:57.675401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:25:57.843590Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-07T11:19:01.412236Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T11:25:57.843590Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:d268821620224dbe6d43e36915362769d132f41127fef39e1c44477f3ab2cc92","observation_id":"4ef753db-df26-4f3a-ad33-345fced6e436","resolution":{"observed_at":"2026-08-07T11:25:57.843590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14508","last_updated":"2024-06-19T04:00:32Z","snapshot_observed_at":"2026-08-02T11:20:36.216220Z","submitted_at":"2023-08-28T11:53:40Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14508","snapshot_observed_at":"2026-08-07T11:25:57.958618Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-07T11:19:01.412236Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T11:25:57.958618Z"},"links":{"cited_paper":"/paper/2308.14508","citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:53222fb90d2b2c5f1c7e5cc05e9ce0084941213e106e58b99732af7c5274885b","observation_id":"5258d014-ba2d-4a4b-b4e7-f30b0cc1acb1","resolution":{"observed_at":"2026-08-07T11:25:57.958618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15204","last_updated":"2025-01-03T11:44:51Z","snapshot_observed_at":"2026-08-04T21:07:04.238345Z","submitted_at":"2024-12-19T18:59:17Z","title":"LongBench v2: Towards Deeper Understanding and Reasoning on Realistic Long-context Multitasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15204","snapshot_observed_at":"2026-08-07T11:25:58.070396Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-07T11:19:01.412236Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T11:25:58.070396Z"},"links":{"cited_paper":"/paper/2412.15204","citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:a1c399a1853746dea9e55abedf823ea6ee7b1eaef21422b4e478c56717f42c36","observation_id":"9867a5ec-f2d4-463f-bc37-ca11d9540298","resolution":{"observed_at":"2026-08-07T11:25:58.070396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16179","last_updated":"2024-12-18T17:36:36Z","snapshot_observed_at":"2026-07-06T19:37:11.636987Z","submitted_at":"2024-10-21T16:44:51Z","title":"MagicPIG: LSH Sampling for Efficient LLM Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16179","snapshot_observed_at":"2026-08-07T11:25:58.308531Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-07T11:19:01.412236Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T11:25:58.308531Z"},"links":{"cited_paper":"/paper/2410.16179","citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:e0292d5c57d7c28ffdd1d4fcab22582d603f14273997bc3c439f3d74e63e83e5","observation_id":"a455538b-71a8-48d8-88b4-fa44995695e9","resolution":{"observed_at":"2026-08-07T11:25:58.308531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-07T11:25:58.446766Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-07T11:19:01.412236Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T11:25:58.446766Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:80eb43dfd9e03768625c93b409692e23304737b0f9d79e786fec233bdf7ad263","observation_id":"e84205aa-0633-4f08-9907-660047ea07d1","resolution":{"observed_at":"2026-08-07T11:25:58.446766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:25:58.692270Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-07T11:19:01.412236Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T11:25:58.692270Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:7870fda4e640c5c248023484ed01a3ccd5627c8c99e1ff237668ab5e046d0d84","observation_id":"0b527f51-05cf-4587-8bc5-3bf20c84f762","resolution":{"observed_at":"2026-08-07T11:25:58.692270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14468","last_updated":"2025-06-03T21:55:57Z","snapshot_observed_at":"2026-07-06T20:09:42.677491Z","submitted_at":"2024-12-19T02:34:15Z","title":"HashAttention: Semantic Sparsity for Faster Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14468","snapshot_observed_at":"2026-08-07T11:25:58.886175Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-07T11:19:01.412236Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T11:25:58.886175Z"},"links":{"cited_paper":"/paper/2412.14468","citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:d775a4376fea736ad8cc896fe172aea5d5edcd3115a07e8728f322fd0bd200c0","observation_id":"ab5eca77-3f83-46e3-8a11-8324063aa0d8","resolution":{"observed_at":"2026-08-07T11:25:58.886175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:05.916272Z","title":null,"venue":null,"work_id":"8070b6d3-45a5-41e3-90ef-4b4ab06f5a5e","year":1999},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-07T11:19:01.412236Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T11:25:59.049157Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:d044cd27958faa466413405c13466ee9e6bf79bb0fb59c123972b8380384dc5e","observation_id":"af753a9a-dbfa-4988-8115-d17d67229f61","resolution":{"observed_at":"2026-08-07T11:26:06.014550Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06899","last_updated":"2021-06-13T02:30:23Z","snapshot_observed_at":"2026-08-08T01:15:11.346221Z","submitted_at":"2021-06-13T02:30:23Z","title":"Memory-efficient Transformers via Top-$k$ Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06899","snapshot_observed_at":"2026-08-07T11:25:59.218497Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-07T11:19:01.412236Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T11:25:59.218497Z"},"links":{"cited_paper":"/paper/2106.06899","citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:ad49f264f5a9887117659cf30041a203cca65c6aa50f3cab9583f6292995b767","observation_id":"8629c365-fbe6-4024-9823-fe469e099adb","resolution":{"observed_at":"2026-08-07T11:25:59.218497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-05T09:48:25.127042Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-07T11:25:59.316579Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-07T11:19:01.412236Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T11:25:59.316579Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:e5f75b6fb1d8cb7ef6994fda3dcae127c4a8f5cd03ae04d4d7f5cbcfe94cc1d0","observation_id":"19c23bce-5875-44f6-92fb-259f5d75ee64","resolution":{"observed_at":"2026-08-07T11:25:59.316579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-07T11:25:59.386831Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-07T11:19:01.412236Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T11:25:59.386831Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:8dda2c487be041179c40683eb9079cb3979fd51fa4db75a9145f29062fe31362","observation_id":"98153a66-8728-42ce-93cd-e39469ce9dac","resolution":{"observed_at":"2026-08-07T11:25:59.386831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:05.659394Z","title":null,"venue":null,"work_id":"6ad2a32a-60f4-462a-b7b6-5b0b99aa6075","year":2025},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-07T11:19:01.412236Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T11:25:59.455430Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:2b2254c69ce52acbb6bc6acdd442a5ee4f0b72d38ff299b6cbe51c4f62467b27","observation_id":"8f6999e4-445f-4533-874c-ec85146d0447","resolution":{"observed_at":"2026-08-07T11:26:05.794332Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:05.465776Z","title":null,"venue":null,"work_id":"6f788081-8823-49f0-9b66-583f380cd2b8","year":2023},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-07T11:19:01.412236Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T11:25:59.604558Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:c60295741d8f38288072bb29964ec9532e1084215a9e099178a327ef93042020","observation_id":"1edc92a5-580a-4b71-85b4-741ef6a3ddd3","resolution":{"observed_at":"2026-08-07T11:26:05.546700Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:25:59.706591Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-07T11:19:01.412236Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T11:25:59.706591Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:24d2e516c19753489eff62b344817877669adea50cdc79ef8011751e5e165134","observation_id":"02e562ac-2889-411f-b68f-268dde24cd2e","resolution":{"observed_at":"2026-08-07T11:25:59.706591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:05.247807Z","title":null,"venue":null,"work_id":"0534929b-145a-4d07-abfb-db6f5dfb824f","year":2024},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-07T11:19:01.412236Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T11:25:59.830867Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:faf0e2809a50a9c62c64c58f608499b711fbfd3844e729c39af8f6136e2e31a7","observation_id":"012433c7-92dc-48a1-aabe-e548db1efe5e","resolution":{"observed_at":"2026-08-07T11:26:05.347082Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:25:59.949662Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-07T11:19:01.412236Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T11:25:59.949662Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:284502fb66757a0e631aa821c12a828e9f5a60f3ee7ae6a86cc28fc84ad3e890","observation_id":"37306390-c055-4a70-999b-5d757f92dd6c","resolution":{"observed_at":"2026-08-07T11:25:59.949662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T11:26:00.038860Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-07T11:19:01.412236Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:00.038860Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:8a06e5dbb95d000948cdb061912683b1bd5604f1290b5a6e5fbf9cbdf81ca18d","observation_id":"098a8c1b-004e-4148-b148-d46686046608","resolution":{"observed_at":"2026-08-07T11:26:00.038860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02750","last_updated":"2024-07-25T09:16:05Z","snapshot_observed_at":"2026-07-06T17:25:18.238343Z","submitted_at":"2024-02-05T06:06:47Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02750","snapshot_observed_at":"2026-08-07T11:26:00.133693Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-07T11:19:01.412236Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:00.133693Z"},"links":{"cited_paper":"/paper/2402.02750","citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:73940a45adbcfc12856e402233c20f9c6e4d0e91532f5e9d20fb029ebe257ab0","observation_id":"2b7360b8-110d-47b9-a140-000b9b0cab85","resolution":{"observed_at":"2026-08-07T11:26:00.133693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:05.029299Z","title":null,"venue":null,"work_id":"6ecaa95e-47b4-4324-bf79-862b310d2ac4","year":2024},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-07T11:19:01.412236Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:00.262542Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:abb4ee843d2ce66e5bd46e498c25d1be8b469d8b3d605bb8dbe3465783155500","observation_id":"9117e012-3f1c-47d6-9b79-58783242eea5","resolution":{"observed_at":"2026-08-07T11:26:05.128766Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:04.841103Z","title":null,"venue":null,"work_id":"05bf4512-2acb-4609-9a8f-7f5c8cfd2c69","year":2024},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-07T11:19:01.412236Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:00.355214Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:79521b4079ff468cbde6b64eefd5e9879018e185ad279d3c4875d376fee6a26d","observation_id":"4d96180c-7e34-4588-b55a-2bb8ac645924","resolution":{"observed_at":"2026-08-07T11:26:04.945624Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:04.600217Z","title":null,"venue":null,"work_id":"f0b47ab1-4f60-4dfd-89b8-82e5992ef3dd","year":2025},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-07T11:19:01.412236Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:00.450652Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:106abf79c3f1f9af1426d0e2f94b309cd35eab1f05e6518a6b8c70e95430ace6","observation_id":"39d47bc8-9f11-4b4f-a4d5-29fc19b45eb6","resolution":{"observed_at":"2026-08-07T11:26:04.729592Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04985","last_updated":"2024-09-04T10:04:52Z","snapshot_observed_at":"2026-07-06T16:58:47.790985Z","submitted_at":"2023-12-08T11:47:35Z","title":"SparQ Attention: Bandwidth-Efficient LLM Inference","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04985","snapshot_observed_at":"2026-08-07T11:26:00.637951Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-07T11:19:01.412236Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:00.637951Z"},"links":{"cited_paper":"/paper/2312.04985","citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:703727017efbe5a645c7322151b032c9547ae63aeb3e40baea12c0596d68c8c8","observation_id":"c9d52bb4-15be-4955-bc9d-3d23740d9950","resolution":{"observed_at":"2026-08-07T11:26:00.637951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:00.727994Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-07T11:19:01.412236Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:00.727994Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:93fafcf5b660c344cd7c20e2c4e63419bb95b7308bee48cbc659cb4736e895c8","observation_id":"0e03dd71-908c-4e4f-a12d-e05dcd4523fe","resolution":{"observed_at":"2026-08-07T11:26:00.727994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02542","last_updated":"2024-11-07T18:58:50Z","snapshot_observed_at":"2026-08-06T19:11:01.600257Z","submitted_at":"2024-06-04T17:58:03Z","title":"Loki: Low-rank Keys for Efficient Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02542","snapshot_observed_at":"2026-08-07T11:26:00.797982Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-07T11:19:01.412236Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:00.797982Z"},"links":{"cited_paper":"/paper/2406.02542","citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:ecc6c037a478a1395ea33574a6c0190a72959050aa08f5c2a6d62c7a8da011dc","observation_id":"db9cac96-1645-4357-b4db-31300544deb0","resolution":{"observed_at":"2026-08-07T11:26:00.797982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21465","last_updated":"2025-04-25T19:40:54Z","snapshot_observed_at":"2026-08-01T20:33:25.557711Z","submitted_at":"2024-10-28T19:08:12Z","title":"ShadowKV: KV Cache in Shadows for High-Throughput Long-Context LLM Inference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21465","snapshot_observed_at":"2026-08-07T11:26:00.895653Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-07T11:19:01.412236Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:00.895653Z"},"links":{"cited_paper":"/paper/2410.21465","citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:15ca253b6c7f63f8452d8cc4248618589e8bd3a0295fd1a4caef8ae9ce1b219c","observation_id":"2178ee9d-6c7e-4b91-bb98-be1e9a5b5e6b","resolution":{"observed_at":"2026-08-07T11:26:00.895653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:04.370963Z","title":null,"venue":null,"work_id":"4dbeaf77-70d2-4dc8-b178-643fcb9edf7f","year":2021},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-07T11:19:01.412236Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:01.047307Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:9ab74343a8abf95bf83bbb2eb553ccd2a73232214c7df08b474d75bf7666a56e","observation_id":"1537f08e-129f-4807-ac9a-fcca9ebf512d","resolution":{"observed_at":"2026-08-07T11:26:04.503621Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10774","last_updated":"2024-08-26T21:01:02Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-16T01:33:02Z","title":"Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10774","snapshot_observed_at":"2026-08-07T11:26:01.145607Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-07T11:19:01.412236Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:01.145607Z"},"links":{"cited_paper":"/paper/2406.10774","citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:28ab32a89fc300cea3c392875880cbb3fd305b1aed53459ac672d54dfaadb2b5","observation_id":"f8c98f77-f5ad-4674-bfef-2c7c10eb8831","resolution":{"observed_at":"2026-08-07T11:26:01.145607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:01.299814Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-07T11:19:01.412236Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:01.299814Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:f91b0d142bd2fee4f2035ab2b469b4e25803ee391d67a1756750f8da86b58e98","observation_id":"42e625ea-5c24-45e6-899b-70ef97c44005","resolution":{"observed_at":"2026-08-07T11:26:01.299814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:04.202098Z","title":null,"venue":null,"work_id":"2d8c0e2e-7003-449f-a85f-e52585684f6b","year":2023},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-07T11:19:01.412236Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:01.430394Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:809988f3e18f0da9d4be964a716820bc6624ad8994928fb34c69b34e93185248","observation_id":"d50ea01c-306d-4f00-ad0e-a8fda0e12902","resolution":{"observed_at":"2026-08-07T11:26:04.278953Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:03.955841Z","title":null,"venue":null,"work_id":"1435b5f9-0ffc-4394-8ddd-a36cf5587b5b","year":2012},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-07T11:19:01.412236Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:01.499338Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:5f837e92bc03b3ac7f342abbe63290e8b80c3e81cd743f26b81fa6358d7d7b33","observation_id":"266518e8-ac32-4b3a-aa97-26293bc11f2a","resolution":{"observed_at":"2026-08-07T11:26:04.091956Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:03.734909Z","title":null,"venue":null,"work_id":"f8fba1cf-a9c4-4eb2-937b-1539d53fe53c","year":2008},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-07T11:19:01.412236Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:01.598450Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:fe54913adfdbca9b4848d63580ef23415abf3d5d6fe6da3608fdf689cca7e81c","observation_id":"e3fd5a6e-c4bc-4898-9132-2d7c822408d2","resolution":{"observed_at":"2026-08-07T11:26:03.842301Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:03.470084Z","title":null,"venue":null,"work_id":"196c971b-924a-4f08-9e52-d63cb1cf6d03","year":2024},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-07T11:19:01.412236Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:01.694965Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:d81fcdb77f1def489c6e5c241bfb676fc24ee973289c4f57ddf6991dc202cb8f","observation_id":"536b9b5a-dd44-432e-93ed-2e855ea981e6","resolution":{"observed_at":"2026-08-07T11:26:03.625450Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-07T11:26:01.762361Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-07T11:19:01.412236Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:01.762361Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:dc30a3bddf1947902692e07828199c49fa990de45d4964025e840835843db895","observation_id":"aa457d13-4aa4-42e0-b74b-cda988a847f4","resolution":{"observed_at":"2026-08-07T11:26:01.762361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01005","last_updated":"2025-04-21T20:10:11Z","snapshot_observed_at":"2026-07-06T20:15:36.280948Z","submitted_at":"2025-01-02T02:02:20Z","title":"FlashInfer: Efficient and Customizable Attention Engine for LLM Inference Serving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01005","snapshot_observed_at":"2026-08-07T11:26:01.860825Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-07T11:19:01.412236Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:01.860825Z"},"links":{"cited_paper":"/paper/2501.01005","citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:c0e9ea808c421748966c13f9eb55b7fd4d780c67051d8089ba6b0c2011403c75","observation_id":"8438d211-1c14-4880-88be-6b85ebcf3437","resolution":{"observed_at":"2026-08-07T11:26:01.860825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:03.176519Z","title":null,"venue":null,"work_id":"b52fa05d-efee-4930-a4c5-0b65c28a89ad","year":2024},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-07T11:19:01.412236Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:01.933392Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:bbf385f2683fd36c4343d46b762413891ea0b63ffcf22f7b977f0fbdb5740fb7","observation_id":"823f57db-0166-4562-9bd7-c85d58cb7e38","resolution":{"observed_at":"2026-08-07T11:26:03.351191Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:02.944933Z","title":null,"venue":null,"work_id":"6856e6cc-d2bd-4354-83e9-7ea41eb98ab5","year":2024},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-07T11:19:01.412236Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:02.028935Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:abe9691deca618392b30ef3e3d6ccaf1395ee1220830faf446061d322a682f21","observation_id":"99128bbc-79ff-452d-8e15-744b868cf3bf","resolution":{"observed_at":"2026-08-07T11:26:03.056187Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:02.643857Z","title":null,"venue":null,"work_id":"1862dfdb-bd01-46f8-957d-4244fe4df7d2","year":2024},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-07T11:19:01.412236Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:02.149538Z"},"links":{"citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:f2bac83ab54961ca7674eb35e601a58d02a375acb036b47cf5fcdb07ae718281","observation_id":"06830067-bf8d-4a76-ac42-edd18430f3f6","resolution":{"observed_at":"2026-08-07T11:26:02.786954Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-07T11:26:02.274620Z","title":"Gonzalez, Clark Barrett, and Ying Sheng","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","snapshot_observed_at":"2026-08-07T11:19:01.412236Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:02.274620Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2506.02572"},"observation_digest":"sha256:d54663f7a064b42bacde25adcb35412ef2c721d33e6fa4c7eb37568e08b8db8f","observation_id":"baecab88-b21b-4b40-ab88-44eae0a1654e","resolution":{"observed_at":"2026-08-07T11:26:02.274620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.02572","last_updated":"2025-06-03T07:53:32Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T11:19:01.412236Z","submitted_at":"2025-06-03T07:53:32Z","title":"HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 1 inbound Pith citation observation for arXiv:2506.02572."}