{"as_of":"2026-08-13T10:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ce428d5bc412b5b829dac1393639927a646f5dd524edac3512097a60734fb199","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T05:58:03.113220Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T16:17:09.834609Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-11T21:26:16.418821Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"cited_work":{"arxiv_id":"2602.10718","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.10718","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","venue":"cs.LG","work_id":"b3887252-bc82-4fbe-8753-6edb44a54df1","year":2026},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"cited_paper":"/paper/2602.10718","citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:9355cccfc71669ba548e12410deb93b27377a1c9e64a47707e17ef780f00533b","observation_id":"1f507c2f-d205-4357-bc1c-f7dd9b5705f1","resolution":{"observed_at":"2026-05-11T09:05:58.161185Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"cited_work":{"arxiv_id":"2602.10718","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.10718","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","venue":"cs.LG","work_id":"b3887252-bc82-4fbe-8753-6edb44a54df1","year":2026},"citing_paper":{"arxiv_id":"2605.05696","last_updated":"2026-05-07T05:36:03Z","snapshot_observed_at":"2026-08-11T12:01:41.274255Z","submitted_at":"2026-05-07T05:36:03Z","title":"Irminsul: MLA-Native Position-Independent Caching for Agentic LLM Serving","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-08T05:37:02.419657Z"},"links":{"cited_paper":"/paper/2602.10718","citing_paper":"/paper/2605.05696"},"observation_digest":"sha256:e451948ff715dc2c2443d3c8d05a79ff90492e792512663ba58e82a6b2f3df24","observation_id":"c274f7cc-b4a6-4258-a008-fa485603c4dd","resolution":{"observed_at":"2026-05-11T21:26:16.431880Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2602.10718/citation-record","integrity":"/paper/2602.10718/integrity","json":"/paper/2602.10718/citation-record.json","paper":"/paper/2602.10718"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2512.02556","last_updated":"2025-12-02T09:25:14Z","snapshot_observed_at":"2026-08-12T08:24:59.243273Z","submitted_at":"2025-12-02T09:25:14Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","version":1},"cited_work":{"arxiv_id":"2512.02556","doi":"10.18653/v1/d18-1512","metadata_source":"pith","pith_arxiv_id":"2512.02556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","venue":"cs.CL","work_id":"07c85cc5-4086-4abc-823b-6d0f4ff784d0","year":2025},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"cited_paper":"/paper/2512.02556","citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:ad8491d2b78f31a0d4742f893f73633ba377a328df93d17227e7cd674e5515aa","observation_id":"ff04e2b7-85ac-4e7e-834c-bf1ce329ac26","resolution":{"observed_at":"2026-05-16T06:00:40.740867Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-11T01:48:59.557045Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.19437","doi":"10.1016/j.neucom.2023.127063.url:https://www.sciencedirect","metadata_source":"pith","pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V3 Technical Report","venue":"cs.CL","work_id":"57d2791d-2219-4c31-a077-afc04b12a75c","year":2024},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:aa92e91f60a1471514c901e1dd1fbe1bb7131742ade1807eabd3fa35b30a939a","observation_id":"d24bc5db-c3dd-4b34-b259-5aaf256ee9a0","resolution":{"observed_at":"2026-05-16T06:00:40.737232Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T19:52:52.621263Z","title":"Large language models: a survey of their development, capabilities, and applications.Knowledge and Information Systems, 67(3):2967–3022","venue":null,"work_id":"ca9eec63-e521-4fdd-8854-56bf371a5a9d","year":2025},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:ef4ad927c20e0be5af79cfbaafff139655b7844e0ee77367e99ab6bf26ba449a","observation_id":"9de1798a-32a1-499c-b0bb-e358b6d830b7","resolution":{"observed_at":"2026-05-16T06:00:41.412001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Quarot: Outlier-free 4-bit inference in rotated llms.Advances in Neural Information Processing Systems, 37:100213– 100240","venue":null,"work_id":"c7ead886-6b98-4085-a839-493bb5e67d46","year":2024},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:2e523fb7c56b3aa23df76e7a654fcfd934400b4889298c760ab710a755d4b8a6","observation_id":"2e41304e-2d6e-4cb2-9134-275e1cd61209","resolution":{"observed_at":"2026-05-16T06:00:41.409792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyondaime: Advancing math reasoning evaluation beyond high school olympiads","venue":null,"work_id":"b7dc8989-1432-45ad-a0c7-37f3f8c20933","year":2025},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:733bf7e57808f288d6b23e786481a3a55622a61418c9f81b4c4f1852db3d6c8a","observation_id":"e339cbd7-a8b8-4fcd-b620-23eb6c459b6d","resolution":{"observed_at":"2026-05-16T06:00:41.405607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kvquant: Towards 10 million context length llm inference with kv cache quantization","venue":null,"work_id":"d5d6b6f6-c7b9-4031-84b3-cb4a03861013","year":2024},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:197541c5b2fb0f0fdc699f259321b0c8e9d7bb424a2f0d808f90bbde769f7dd5","observation_id":"da9fac27-60df-462d-9c09-4df9712bedd9","resolution":{"observed_at":"2026-05-16T06:00:41.407669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.18883","doi":"10.48550/arxiv.2509.18883","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Introducing LongCat-flash-thinking: A technical report","venue":"arXiv (Cornell University)","work_id":"d83b56e1-68ce-4e32-b9c0-fc080b79c8fd","year":2025},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:eb101fdb83fbd7ff75fafc46a6572450affc11d51a38f95baac5274fb00e1210","observation_id":"b2c2e177-53a5-465e-ba1f-1eb02c3c8643","resolution":{"observed_at":"2026-05-16T06:00:40.708301Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.01322","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T09:37:49.308056Z","title":"Longcat-flash technical report","venue":null,"work_id":"112bbed5-cf36-4773-82b3-0229bfea4626","year":2025},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:1a7ea0eb548966341927bd156dd25c879aa80c59882f39688a4552dc27f89404","observation_id":"d3cd48a7-b0a4-4fed-8418-f758da0887c4","resolution":{"observed_at":"2026-05-16T06:00:40.705131Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-11T21:19:33.078277Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":"2210.17323","doi":"10.48550/arxiv.2210.17323","metadata_source":"pith","pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","venue":"cs.LG","work_id":"19ed8c44-202a-48f6-8169-637d5a5f2408","year":2022},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:eb93bb53b68016d253db44803ff53bf02bc83c72fca3ffd5ebadfa082ca4bf12","observation_id":"eb96c667-edaf-44f5-8f66-4620ccfbe884","resolution":{"observed_at":"2026-05-16T06:00:40.807482Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-07-17T20:22:03.028003+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-17T20:22:03.028003+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04127","last_updated":"2025-01-10T14:31:21Z","snapshot_observed_at":"2026-08-12T23:48:42.921391Z","submitted_at":"2024-06-06T14:49:06Z","title":"Are We Done with MMLU?","version":3},"cited_work":{"arxiv_id":"2406.04127","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04127","snapshot_observed_at":"2026-07-04T19:20:05.653512Z","title":"Are we done with mmlu? CoRR, abs/2406.04127","venue":null,"work_id":"ed71a0fb-b1cc-4fbc-a1d5-01a096a4e957","year":2024},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"cited_paper":"/paper/2406.04127","citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:faeb81c16d3e69dfc6986311dfc4460df838c6179b257a50032feeeead381647","observation_id":"f4d28fa1-cf1e-4b17-a6f4-5dbde74f30ac","resolution":{"observed_at":"2026-05-16T06:00:40.711571Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T09:12:54.999095Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:c4455fe3716e75161a2b4c0c55852c692eafcac7787f0b6fe5ed3fbabf654260","observation_id":"1396979d-481e-4421-9d02-8e322cfc130d","resolution":{"observed_at":"2026-05-16T06:00:40.733974Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-10T12:35:09.020030Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":"2009.03300","doi":"10.48550/arxiv.2009.03300","metadata_source":"pith","pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Massive Multitask Language Understanding","venue":"cs.CY","work_id":"e87ec49a-544b-4ec8-8991-75298c64ff5e","year":2020},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:ffbd16955ab85df0b80183a7b011d5d0d6a1383820de8110c75f9628c3da7294","observation_id":"0c31b9a6-c1d5-433a-bc64-53ff67c91f19","resolution":{"observed_at":"2026-05-16T06:00:40.724731Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hmmt 2025","venue":null,"work_id":"1ec63a3f-46e5-4f54-b620-bcbf49aa0fcf","year":2025},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:338c595b13fe85da92bfa3170f94bf78785f893455621d6324e38541621d9e98","observation_id":"028ebe34-3e9b-4e94-8cd5-cc8794a6c64a","resolution":{"observed_at":"2026-05-16T06:00:41.442481Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flashattention-3: Fast and accurate attention with asyn- chrony and low-precision","venue":null,"work_id":"6f610fa2-7334-44b0-b958-dacb63f495d0","year":2024},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:a50c8a656fc208d5565692f73141ea5555859b1540f1d223580ac14627988f5a","observation_id":"a6e294eb-2d6f-4672-8ed3-0e82722d1d48","resolution":{"observed_at":"2026-05-16T06:00:41.440548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code","venue":null,"work_id":"efaa1922-d6c8-45e6-8baf-430529e31b5d","year":2025},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:29e1b429fd30b6051394c525ab4d879bd99b549e9e9da61fbb7097ff74d34f74","observation_id":"b8e00ad6-46fa-4c02-8815-fdad04cf581f","resolution":{"observed_at":"2026-05-16T06:00:41.438225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flashmla: Efficient multi-head latent attention kernels","venue":null,"work_id":"3571952c-77f6-4d18-82df-d3c4302c9288","year":2025},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:4e9be659a0e0a06896658dbf84414a9bda4715eb76c58e2ebc1654cdbbba90f5","observation_id":"a8bdbf34-4915-4981-bc9b-9fbf9317e9ef","resolution":{"observed_at":"2026-05-16T06:00:41.435586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fp8 quantization: The power of the exponent.Advances in Neural Information Processing Systems, 35:14651–14662","venue":null,"work_id":"c38e8f91-93ff-4ca6-aedd-7e41e1845c9d","year":2022},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:d84c504047f67625bc67fd50416acf600f6047cebdf9c72131cf9a2dfc61cdd0","observation_id":"bd162b2c-62f9-4ba4-b5a4-eefdb6b46a4d","resolution":{"observed_at":"2026-05-16T06:00:41.432977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19442","last_updated":"2025-07-30T05:24:46Z","snapshot_observed_at":"2026-08-11T00:33:34.388194Z","submitted_at":"2024-12-27T04:17:57Z","title":"A Survey on Large Language Model Acceleration based on KV Cache Management","version":3},"cited_work":{"arxiv_id":"2412.19442","doi":"10.48550/arxiv.2412.19442","metadata_source":"pith","pith_arxiv_id":"2412.19442","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A survey on large lan- guage model acceleration based on kv cache management","venue":"cs.AI","work_id":"5ad86189-256c-4911-bb00-fbfc90ae9a4e","year":2024},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"cited_paper":"/paper/2412.19442","citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:e9c1b0b9bc883bc859887672cb578f6f0489fbb40e8c436e8de54ceef77ac2c2","observation_id":"a10f8116-8746-4f62-9278-ea6d0cbfeaec","resolution":{"observed_at":"2026-05-16T06:00:40.800812Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:20:05.433835+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:20:05.433835+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.15987","last_updated":"2023-08-30T12:18:18Z","snapshot_observed_at":"2026-08-11T20:55:22.157859Z","submitted_at":"2023-08-30T12:18:18Z","title":"FPTQ: Fine-grained Post-Training Quantization for Large Language Models","version":1},"cited_work":{"arxiv_id":"2308.15987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.15987","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fptq: Fine-grained post-training quantization for large language models","venue":null,"work_id":"67c0dd3e-f7bf-494d-a81d-cab84bb27965","year":2023},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"cited_paper":"/paper/2308.15987","citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:4f96e962da3502430ed7aea4037605f264ef958bd8294f6ac04e616d5eef2312","observation_id":"ea2e2da1-6c11-417a-ab5c-00f035b25fcf","resolution":{"observed_at":"2026-05-16T06:00:40.790664Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From live data to high-quality benchmarks: The arena-hard pipeline, April 2024","venue":null,"work_id":"6a195ef1-d635-41d9-b3ff-a952dd5e40d0","year":2024},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:b2b3e569a2234f639f3f3583333e932777dae6ccd05248ce888ae5f2f97b5d90","observation_id":"ffb43ce5-0f4b-4e5c-bb04-6d0b42bb1dfa","resolution":{"observed_at":"2026-05-16T06:00:41.430158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:32:39.114869Z","title":"Let’s verify step by step","venue":null,"work_id":"7c9f7d5c-e081-4728-8d71-07bae6642366","year":2023},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:83b90a973f0c24727274fcd3d93bd9233607304b45fce799082a8c9f6de2fd82","observation_id":"146f8d88-3c75-485b-a414-89bae5b4080d","resolution":{"observed_at":"2026-05-16T06:00:41.427723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zebralogic: On the scaling limits of LLMs for logical reasoning","venue":null,"work_id":"ae2fa901-ec85-4738-88c9-3fc407c12c15","year":2025},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:79e95b39a48a5c9567d8935478257133b985d9bb7c890ff147f2874305a452e7","observation_id":"afd98214-88a5-4ff9-bb3d-3162a0aff120","resolution":{"observed_at":"2026-05-16T06:00:41.425299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T17:05:09.008702Z","title":"Awq: Activation-aware weight quantization for on-device llm compression and acceleration.Proceedings of machine learning and systems, 6:87–100","venue":null,"work_id":"2446ee30-3b81-412e-826d-a75cd7821fdc","year":2024},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:1500863527cd822a9a2ad2c53976f32d6eff4f99f1da3dc0018fd0ca0e9178e5","observation_id":"85a44771-7cbb-4e45-8c06-ce93a4e8cbe8","resolution":{"observed_at":"2026-05-16T06:00:41.422560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":"2405.04434","doi":"10.1145/3593013.3594097","metadata_source":"pith","pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","venue":"cs.CL","work_id":"1e1df141-cac8-47fd-b068-c4c96e51e331","year":2024},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:cee6c1d9a3ec7982796197b19d0c046580253ad20b142276edb8dce65ad855ea","observation_id":"b96e52ad-ce14-4acb-ae21-6e69344598f3","resolution":{"observed_at":"2026-05-16T06:00:40.787332Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.21204","doi":"10.48550/arxiv.2601.21204","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"& Cai, X","venue":"Open MIND","work_id":"3d8bee12-25ae-433a-bb2b-4c2e474a81de","year":2026},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:9aa2f52de65ad238a2508ec261528594332d57d6cb8e72db297f9bd5133abea9","observation_id":"c9283ccc-49a4-4505-9a65-f03811395bf1","resolution":{"observed_at":"2026-05-16T06:00:40.727875Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02750","last_updated":"2024-07-25T09:16:05Z","snapshot_observed_at":"2026-08-12T17:03:50.984887Z","submitted_at":"2024-02-05T06:06:47Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","version":2},"cited_work":{"arxiv_id":"2402.02750","doi":"10.48550/arxiv.2402.02750","metadata_source":"pith","pith_arxiv_id":"2402.02750","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","venue":"cs.CL","work_id":"735737c3-24e5-41c3-ab4f-04edcb36731c","year":2024},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"cited_paper":"/paper/2402.02750","citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:e1cae6a80d83e59e443244609b853026a2a7e801981bfc103e320356d5e69cb3","observation_id":"401b5094-ff2a-45d5-863a-4030a33e5ac6","resolution":{"observed_at":"2026-05-16T06:00:40.714918Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Aime 2024","venue":null,"work_id":"f1135419-6424-4803-9908-ab920a9cb114","year":2024},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:c079dee25446532c4205bd0308cda6499a25bd7e3ac44d38538b84b5e03fcff7","observation_id":"c87961f7-0b14-4ef1-a1e1-fabfdb25302b","resolution":{"observed_at":"2026-05-16T06:00:41.420002Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Aime 2025","venue":null,"work_id":"da1b7421-835d-4501-845e-7e941316f7c0","year":2025},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:054c3cf4d81240a03333d5ca24b1190da2182af6f3325d059ce36431b586f6a4","observation_id":"6406654b-3f19-44e9-a286-6746a9842724","resolution":{"observed_at":"2026-05-16T06:00:41.418155Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nvidia h100 tensor core gpu","venue":null,"work_id":"01d71e04-a6d6-47e8-8718-47f37d96080e","year":2026},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:45798bc8dd9a00138805542bf04dc0b51c54249fa20e084ff021776d729c889a","observation_id":"a8535f93-a846-44a7-8091-26e1744cc9b0","resolution":{"observed_at":"2026-05-16T06:00:41.444489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.05433","last_updated":"2022-09-29T20:47:07Z","snapshot_observed_at":"2026-08-10T16:19:00.326414Z","submitted_at":"2022-09-12T17:39:55Z","title":"FP8 Formats for Deep Learning","version":2},"cited_work":{"arxiv_id":"2209.05433","doi":"10.48550/arxiv.2209.05433","metadata_source":"pith","pith_arxiv_id":"2209.05433","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FP8 Formats for Deep Learning","venue":"cs.LG","work_id":"c7217bc9-e53d-40c5-a437-25a74abc36cd","year":2022},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"cited_paper":"/paper/2209.05433","citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:a4a12dd3ff6db3ef0e32f1787be8558a12475e9ce2bd830d5b9093a8df49d3c7","observation_id":"28da0d75-5e81-4a14-899e-9f53e5f184c9","resolution":{"observed_at":"2026-05-16T06:00:40.780835Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:35.618396+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:35.618396+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T10:43:39.491142Z","title":null,"venue":null,"work_id":"20816d24-89c4-490b-99ef-c4c53d0419e5","year":2024},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:6ad7bd715b437740319e3e124e836c1d016844052ee3ec88c14384fcd731d00a","observation_id":"872555fd-866a-4059-a8c7-45b562dca162","resolution":{"observed_at":"2026-05-16T06:00:41.416066Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18003","last_updated":"2024-11-20T02:04:10Z","snapshot_observed_at":"2026-08-12T23:14:54.561199Z","submitted_at":"2024-07-25T12:56:22Z","title":"Keep the Cost Down: A Review on Methods to Optimize LLM' s KV-Cache Consumption","version":4},"cited_work":{"arxiv_id":"2407.18003","doi":"10.48550/arxiv.2407.18003","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.18003","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Keep the cost down: A review on methods to optimize llm’s kv-cache consumption","venue":"arXiv (Cornell University)","work_id":"45195b7c-36a4-4e3e-8f9e-db76070aec96","year":2024},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"cited_paper":"/paper/2407.18003","citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:9c90e04d406b56b7924c4c602ddc201006fb6dc3003c8475956d08ba7e20cf3c","observation_id":"b21af5fd-a71a-4e57-a297-453a0d1f8cd8","resolution":{"observed_at":"2026-05-16T06:00:40.765255Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.23279","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:00:09.050200Z","title":"Unveiling super experts in mixture-of-experts large language models","venue":null,"work_id":"d563d0e0-da96-4b3f-bed9-67c8e41f048a","year":2025},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:7fc7cbe437630ef2e135b84c87461434f453bfac801679ba27e6bbbe5b674c5c","observation_id":"738d38ad-17eb-4351-93ff-6eef95345c56","resolution":{"observed_at":"2026-05-16T06:00:40.769142Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15021","last_updated":"2025-01-25T02:01:56Z","snapshot_observed_at":"2026-08-11T06:31:30.411216Z","submitted_at":"2025-01-25T02:01:56Z","title":"AKVQ-VL: Attention-Aware KV Cache Adaptive 2-Bit Quantization for Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2501.15021","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.15021","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Akvq-vl: Attention-aware kv cache adaptive 2-bit quantization for vision-language models","venue":null,"work_id":"88c5cc73-d4c3-44d9-ab0e-365b4d2ac76d","year":2025},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"cited_paper":"/paper/2501.15021","citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:3b588c87493e644e201be8f7ce8916fee67e060f6e74be304a4dec28e4d0b05e","observation_id":"75706047-98c0-465f-8482-4571787ff875","resolution":{"observed_at":"2026-05-16T06:00:40.761408Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04257","last_updated":"2025-08-06T09:40:09Z","snapshot_observed_at":"2026-08-12T12:22:45.193172Z","submitted_at":"2025-08-06T09:40:09Z","title":"KVSink: Understanding and Enhancing the Preservation of Attention Sinks in KV Cache Quantization for LLMs","version":1},"cited_work":{"arxiv_id":"2508.04257","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.04257","snapshot_observed_at":"2026-06-30T11:14:37.612699Z","title":"Kvsink: Understanding and enhancing the preservation of attention sinks in kv cache quantization for llms","venue":null,"work_id":"74eea277-92cf-4c33-974f-fce6f0e92678","year":2025},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"cited_paper":"/paper/2508.04257","citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:9e2d529cf668f3b07c8fb12a7e1ef74646b2aad54b6912e6e14194e58722352c","observation_id":"941a7b1b-0002-4dab-a2d8-811c82e3db2e","resolution":{"observed_at":"2026-05-16T06:00:40.756876Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:130054338bef68162fd4b2ce0a5e6911d37646c895f9af9381a5f20635bed01c","observation_id":"ffc5e7d6-2ead-4d3b-9349-b6a1fc54ba35","resolution":{"observed_at":"2026-05-16T07:02:54.298502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.16725","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:50:10.434955Z","title":"Longcat-flash-thinking-2601 technical report","venue":null,"work_id":"1375347d-bbc3-47bf-a423-d4e39ac50144","year":2026},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:d4c9cd2cf2fc7063098ba67794d44432ce6d4e1cf4c33abacd983e0c952dc745","observation_id":"19de3124-d426-40e6-bb7f-00ec675e5497","resolution":{"observed_at":"2026-05-16T06:00:40.772983Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.00279","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T11:59:50.609970Z","title":"Longcat-flash-omni technical report","venue":null,"work_id":"1dbab870-b4d6-467a-8178-d537289d5aa4","year":2025},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:8c0614b6902a82b5782b80d8a18ce3c1c78352ba314cb3d09ed7830814092c4f","observation_id":"8115f59e-59db-4dfd-a92f-2a0e67652181","resolution":{"observed_at":"2026-05-16T06:00:40.784126Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17951","last_updated":"2023-06-15T08:14:02Z","snapshot_observed_at":"2026-08-13T02:03:58.798597Z","submitted_at":"2023-03-31T10:29:17Z","title":"FP8 versus INT8 for efficient deep learning inference","version":2},"cited_work":{"arxiv_id":"2303.17951","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.17951","snapshot_observed_at":"2026-07-02T02:06:26.126499Z","title":"van Baalen, A","venue":null,"work_id":"c1042045-61e3-424f-89ce-fae064220f68","year":2023},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"cited_paper":"/paper/2303.17951","citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:c4f2be949cb78b366be5d0b17f87d752a3b50baf77489fa3573abfd7a56c6c62","observation_id":"2181953e-4a3c-40af-bae4-5cebd2f7a20d","resolution":{"observed_at":"2026-05-16T06:00:40.804585Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-06T00:29:17.674418Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":"2406.01574","doi":"10.1145/3711896.3737413","metadata_source":"pith","pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","venue":"cs.CL","work_id":"3c028052-035a-4c22-b80e-3046edb44adc","year":2024},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:e072d4b303687c97c663af4e905ba353e3401c05815725edeee2aa77d4291098","observation_id":"ab9cbd9a-41aa-410b-9fb2-8beda59b1d44","resolution":{"observed_at":"2026-05-16T06:00:40.744485Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.03332","doi":"10.48550/arxiv.2508.03332","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Exploring layer-wise information effectiveness for post-training quantization in small language models","venue":"arXiv (Cornell University)","work_id":"1674648d-bdff-4075-ab26-e3f9db8393ec","year":2025},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:3d32716859d392bb2c903286df933e0a24439a848e9354bbe2d3b2d73c9f0156","observation_id":"4b5203a8-14c2-436b-bcdc-0a352b55ec5c","resolution":{"observed_at":"2026-05-16T06:00:40.794189Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.09146","doi":"10.48550/arxiv.2511.09146","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dope: Denoising rotary position embedding","venue":"ArXiv.org","work_id":"f2c450f3-6d65-4abd-85f6-2288d55b379a","year":2025},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:37bf0151548dd36227f9194d7ddadc35e22ab52e06abcf609df1504ef837f023","observation_id":"8aa1dece-69ae-4dec-b02c-f03492ae9dd6","resolution":{"observed_at":"2026-05-16T06:00:40.752336Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14317","last_updated":"2025-06-09T09:48:43Z","snapshot_observed_at":"2026-08-12T00:42:03.431383Z","submitted_at":"2025-02-20T07:10:43Z","title":"ParallelComp: Parallel Long-Context Compressor for Length Extrapolation","version":2},"cited_work":{"arxiv_id":"2502.14317","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.14317","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Parallelcomp: Parallel long-context compressor for length extrapolation","venue":null,"work_id":"f2fdb41b-87f3-4809-a9da-4170207fffa5","year":2025},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"cited_paper":"/paper/2502.14317","citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:630ca4ca8695c361effad947c6b2e5c584d3f6964a12b8bd41a785deda4b1e83","observation_id":"818aac3d-4993-424f-b1dc-d899ec3280d3","resolution":{"observed_at":"2026-05-16T06:00:40.721817Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fit and prune: Fast and training-free visual token pruning for multi-modal large language models","venue":null,"work_id":"cd35b2be-681d-45f7-96df-0334034ef78f","year":2025},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:0dd20095834e873d2b01aa8c2fa235dd15edb0a8433bfb144a4a2f234ddd644b","observation_id":"e33aaf71-3a38-47ba-93a8-a839b1471656","resolution":{"observed_at":"2026-05-16T06:00:41.414152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16383","last_updated":"2025-02-02T03:04:54Z","snapshot_observed_at":"2026-08-12T06:09:48.327480Z","submitted_at":"2025-01-25T01:45:29Z","title":"RotateKV: Accurate and Robust 2-Bit KV Cache Quantization for LLMs via Outlier-Aware Adaptive Rotations","version":2},"cited_work":{"arxiv_id":"2501.16383","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.16383","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RotateKV: Accurate and robust 2-bit KV cache quantization for LLMs via outlier-aware adaptive rotations","venue":null,"work_id":"22cf4f09-6722-4326-9f8f-94715e45d56c","year":2025},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"cited_paper":"/paper/2501.16383","citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:68a9cac1b57bec642a77c8c3a5a387eff7055f97ce8ed7a1132c244cbead5906","observation_id":"e8c23886-9869-4f6f-8177-b2cb59ef9e6e","resolution":{"observed_at":"2026-05-16T06:00:40.748727Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.23966","doi":"10.48550/arxiv.2512.23966","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient context scaling with longcat zigzag attention","venue":"arXiv (Cornell University)","work_id":"c7e7f535-e790-490f-bc24-4d64a100a49e","year":2025},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:548da1403e484bf2cf596d6481f79af5568384286093329262ee8c1c6a228ca7","observation_id":"cfd79c3e-131e-4582-9060-99f4ad02e374","resolution":{"observed_at":"2026-05-16T06:00:40.797923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-08-11T17:12:54.016914Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"cited_work":{"arxiv_id":"2601.14004","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.14004","snapshot_observed_at":"2026-07-03T05:27:39.623381Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","venue":"cs.CL","work_id":"4dc137c8-5a45-4f05-af90-21a590fb3d7b","year":2026},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"cited_paper":"/paper/2601.14004","citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:5f8c5cac1d23ae2e006e310caa87c4da1ae73fcb82ad4af77e35e00145b5d33d","observation_id":"db7c344a-33ed-4e21-bf4a-efeaf9d8d115","resolution":{"observed_at":"2026-05-16T06:00:40.730979Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.07911","doi":"10.48550/arxiv.2311.07911","metadata_source":"pith","pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Instruction-Following Evaluation for Large Language Models","venue":"cs.CL","work_id":"3aa06177-125a-4f5a-8f4a-8070c5986c26","year":2023},"citing_paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-16T05:58:03.113220Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2602.10718"},"observation_digest":"sha256:2b7530290490e176a8520e95ffec806ee084c6fda0a8935236d20a156bed3b44","observation_id":"c10a3a8d-699b-4888-b2ff-d0a95b7cebf2","resolution":{"observed_at":"2026-05-16T06:00:40.718108Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2602.10718","last_updated":"2026-04-28T04:57:29Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T05:11:10.404748Z","submitted_at":"2026-02-11T10:24:42Z","title":"SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":3,"unresolved":1,"verified_exact":28,"verified_fuzzy":14},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 2 inbound Pith citation observations for arXiv:2602.10718."}