{"as_of":"2026-08-08T11:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:84839b4dab7a802dcc56a4546f98cedefe0d972ffce6e268ffbcc5165716f2a4","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:42:23.114204Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.18231/citation-record","integrity":"/paper/2505.18231/integrity","json":"/paper/2505.18231/citation-record.json","paper":"/paper/2505.18231"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T14:42:19.441861Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:19.441861Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:805ec22f70a341a187070e5e630fa8d3422c79169b59bf1303bb794d3a9f8a8a","observation_id":"04021691-f782-4ee0-911a-c5d942775906","resolution":{"observed_at":"2026-08-07T14:42:19.441861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:26.822105Z","title":"Quarot: Outlier-free 4-bit inference in rotated llms.Advances in Neural Information Processing Systems, 37:100213– 100240, 2025","venue":null,"work_id":"c3fb6428-e5b2-46a0-bfd5-2f37ba9aa439","year":2025},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:19.520380Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:4f8f4bb35fbb7ad77963003fe55d62ea76bd0e458079df2a14970cfd2436fad9","observation_id":"c064fde5-75fc-4a2e-b708-2129e03f7fad","resolution":{"observed_at":"2026-08-07T14:42:26.876599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:26.657201Z","title":"LongBench: A bilingual, multitask benchmark for long context understanding","venue":null,"work_id":"40882291-808d-4320-b80a-951ed439ce52","year":2024},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:19.618799Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:9a0da6722bd3f4d4f4ab721e4e12131ea97772604debbd1a92681feabed88e72","observation_id":"d1864e14-059f-4226-8a0c-6a126f8d17bb","resolution":{"observed_at":"2026-08-07T14:42:26.751190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02069","last_updated":"2025-05-15T17:18:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T07:51:30Z","title":"PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02069","snapshot_observed_at":"2026-08-07T14:42:19.668535Z","title":"Pyramidkv: Dynamic kv cache compression based on pyramidal information funneling.arXiv preprint arXiv:2406.02069, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:19.668535Z"},"links":{"cited_paper":"/paper/2406.02069","citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:0b431fc3590e0487fc584e04f874eb25722a10aaec72be6a62ef18be49515715","observation_id":"88c24244-3562-4128-9757-43225bc40b2e","resolution":{"observed_at":"2026-08-07T14:42:19.668535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:26.493155Z","title":"Palu: Kv- cache compression with low-rank projection","venue":null,"work_id":"10ff89f1-7673-432c-bc29-752d02e04d5d","year":null},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:19.709613Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:e23b1e375cd9a855f71bd5deea4829e4ba141dbc581540bb8818664bd5ce8ce9","observation_id":"ba5f5ffe-9949-4414-a9f7-cecf98a97fd4","resolution":{"observed_at":"2026-08-07T14:42:26.582959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:19.764346Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:19.764346Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:2b2d097e0dc9623b55bbfd09b55cad3703b6b23bc4fcd77de441f644d874d090","observation_id":"91388cae-ec1a-4f50-b9c5-1d2c76dc15a4","resolution":{"observed_at":"2026-08-07T14:42:19.764346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05265","last_updated":"2025-01-27T13:39:25Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:59:35Z","title":"PrefixQuant: Eliminating Outliers by Prefixed Tokens for Large Language Models Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05265","snapshot_observed_at":"2026-08-07T14:42:19.813220Z","title":"Prefixquant: Static quantization beats dynamic through prefixed outliers in llms.arXiv preprint arXiv:2410.05265, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:19.813220Z"},"links":{"cited_paper":"/paper/2410.05265","citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:df61b5b0cd964278b4c926e4e25fd77a2f71bf3e79225427fd9883162c86bdd8","observation_id":"be3bddb7-379b-45c4-ad85-3dab61ece3b6","resolution":{"observed_at":"2026-08-07T14:42:19.813220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T14:42:19.966304Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:19.966304Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:700415a2a99856feed7afa7889e805c42e83168e38653529680ed18803648ad8","observation_id":"589311a8-858a-4cf4-86fd-0d9430dc88b7","resolution":{"observed_at":"2026-08-07T14:42:19.966304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02065","last_updated":"2021-10-03T07:43:16Z","snapshot_observed_at":"2026-07-06T11:54:34.626457Z","submitted_at":"2021-10-03T07:43:16Z","title":"SDR: Efficient Neural Re-ranking using Succinct Document Representation","version":1},"cited_work":{"arxiv_id":"2110.02065","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.02065","snapshot_observed_at":"2026-08-07T14:42:23.728088Z","title":"SDR: Efficient Neural Re-ranking using Succinct Document Representation","venue":"cs.IR","work_id":"5e77f4cb-7f39-4132-b79f-6d9de69cea97","year":2021},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:20.113131Z"},"links":{"cited_paper":"/paper/2110.02065","citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:66a7d774b1999d2123cf78703cc078ccf6eefed3aa548135445d8d5cdf557f94","observation_id":"523759e0-e41f-47d2-b35d-306f8731b9da","resolution":{"observed_at":"2026-08-07T14:42:23.794083Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14314","last_updated":"2023-05-23T17:50:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-23T17:50:33Z","title":"QLoRA: Efficient Finetuning of Quantized LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14314","snapshot_observed_at":"2026-08-07T14:42:20.170685Z","title":"Qlora: Efficient finetuning of quantized llms, 2023.URL https://arxiv","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:20.170685Z"},"links":{"cited_paper":"/paper/2305.14314","citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:ec0ec6161c634ab008af533fafa27b78594037bbfc413136abeb82521e7c0e44","observation_id":"e6527f5f-df86-49c4-b3d3-88fdb0cc812f","resolution":{"observed_at":"2026-08-07T14:42:20.170685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06118","last_updated":"2024-09-11T07:48:26Z","snapshot_observed_at":"2026-08-06T11:31:16.355778Z","submitted_at":"2024-01-11T18:54:44Z","title":"Extreme Compression of Large Language Models via Additive Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06118","snapshot_observed_at":"2026-08-07T14:42:20.242101Z","title":"Extreme compression of large language models via additive quantization.arXiv preprint arXiv:2401.06118, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:20.242101Z"},"links":{"cited_paper":"/paper/2401.06118","citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:b32e1bc70861d353fee446c660f2f8a58ab2ac7ca3ed6a05058adc923cafc51e","observation_id":"daa42476-cae2-4cc7-a772-afad805be48b","resolution":{"observed_at":"2026-08-07T14:42:20.242101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-07T08:38:54.025062Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-07T14:42:20.321754Z","title":"Gptq: Accurate post-training quantization for generative pre-trained transformers.arXiv preprint arXiv:2210.17323, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:20.321754Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:5ebcd954373b714d091f6143c43b9fa06104fc2d64f6c0888120f10f18530b78","observation_id":"20dde1d7-2727-4da2-8f76-345abae103fd","resolution":{"observed_at":"2026-08-07T14:42:20.321754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:26.317678Z","title":"A framework for few-shot language model evaluation, 07 2024","venue":null,"work_id":"3fc6cdfc-2828-4610-b554-7598d752cb2a","year":2024},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:20.403085Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:619d3e43bdc12da471c50da9e4216dc94f5e063726ec992cfbce5c43311cb8c2","observation_id":"7b40e5c0-9aa5-4cf1-b909-8b9a77f3007a","resolution":{"observed_at":"2026-08-07T14:42:26.414042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T14:42:20.499175Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:20.499175Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:fc0944710e69ba796a803775f9ddad0e56660df26e571bd3541d42a6904d86ab","observation_id":"3b8af31b-88bf-48d7-8a27-2733d47331b5","resolution":{"observed_at":"2026-08-07T14:42:20.499175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T14:42:20.623145Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:20.623145Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:685b1710a4664b51f04dec45b78412545a18f04db6e8f0c3ae9d952624be8c64","observation_id":"0e792160-6fcd-460f-ab99-611bae593cf0","resolution":{"observed_at":"2026-08-07T14:42:20.623145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:20.725384Z","title":"Finding structure with randomness: Probabilistic algorithms for constructing approximate matrix decompositions.SIAM review, 53(2):217–288, 2011","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:20.725384Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:f9dbba9ec573fcc8d0a64a4398f6b8edd2460c3e99f8ea9d9d134980424f0738","observation_id":"96eb77fc-124f-4476-92df-21cf9a40f843","resolution":{"observed_at":"2026-08-07T14:42:20.725384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14256","last_updated":"2024-05-23T07:37:16Z","snapshot_observed_at":"2026-07-06T18:18:21.334080Z","submitted_at":"2024-05-23T07:37:16Z","title":"ZipCache: Accurate and Efficient KV Cache Quantization with Salient Token Identification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14256","snapshot_observed_at":"2026-08-07T14:42:20.783045Z","title":"Zipcache: Accurate and efficient kv cache quantization with salient token identification.arXiv preprint arXiv:2405.14256, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:20.783045Z"},"links":{"cited_paper":"/paper/2405.14256","citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:2417fe163f7632089b6fd6b9c4985daa42dcfbfc2360bb19497839ec71622876","observation_id":"735a74b6-9c5a-4958-af5b-36956bc96a53","resolution":{"observed_at":"2026-08-07T14:42:20.783045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T14:42:20.854098Z","title":"Measuring massive multitask language understanding.arXiv preprint arXiv:2009.03300, 2020","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:20.854098Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:85ccc94c6212f89888f524ad3f49db6b7513b5f4c91ea575b5e93b3d89f711d2","observation_id":"4a3d52a4-87ed-4ce3-9d03-863457c7e3e0","resolution":{"observed_at":"2026-08-07T14:42:20.854098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:20.904104Z","title":"Kvquant: Towards 10 million context length llm inference with kv cache quantization.Advances in Neural Information Processing Systems, 37:1270–1303, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:20.904104Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:fa0be169d5172188ddece628f11e5f20ec7031453c1d2e206f45150ddec47317","observation_id":"5ca32f2e-10e1-42c3-a799-bdc70c0a2837","resolution":{"observed_at":"2026-08-07T14:42:20.904104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13987","last_updated":"2025-01-23T08:24:25Z","snapshot_observed_at":"2026-08-04T02:17:06.214016Z","submitted_at":"2025-01-23T08:24:25Z","title":"OstQuant: Refining Large Language Model Quantization with Orthogonal and Scaling Transformations for Better Distribution Fitting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13987","snapshot_observed_at":"2026-08-07T14:42:20.965959Z","title":"Ostquant: Refining large language model quantization with orthogonal and scaling transformations for better distribution fitting.arXiv preprint arXiv:2501.13987, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:20.965959Z"},"links":{"cited_paper":"/paper/2501.13987","citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:6ff72bfe6e9950f0b73ad34a68c462c98d4823c19f2f03d30a76acc4b1248a71","observation_id":"67e9cea5-60b0-4f83-a1c7-19a6a6315861","resolution":{"observed_at":"2026-08-07T14:42:20.965959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:21.019251Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:21.019251Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:fbad6a65ca42d402bbfcbca042659dc07f9d7036da61043a96695d5ca38d7038","observation_id":"0ffa03f2-aeb4-406d-82c3-eb69fd9ac9d4","resolution":{"observed_at":"2026-08-07T14:42:21.019251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-08-07T14:42:21.069575Z","title":"Squeezellm: Dense-and-sparse quantization.arXiv preprint arXiv:2306.07629, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:21.069575Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:5fbcf80f0fc372ece7204a886c27f3313dd9e74b4c10ac6d5ad970b04962aeff","observation_id":"c33b91b4-7076-4fed-839a-2d4ea3d92494","resolution":{"observed_at":"2026-08-07T14:42:21.069575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:21.150721Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:21.150721Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:b30c358b8032a90e6426e0aa742378430af5eee00b89f939d0493c62a1aef73c","observation_id":"510a1e5d-fb85-4824-9e6c-b785a122dce8","resolution":{"observed_at":"2026-08-07T14:42:21.150721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:21.194134Z","title":"Retrieval-augmented generation for knowledge-intensive nlp tasks.Advances in neural information processing systems, 33:9459–9474, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:21.194134Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:ccf45a8d076ae188b88cf3a83cc80363c6294485c6a9ed0c9d1f1c43930ce1c0","observation_id":"93600400-dce6-4a09-8da9-685a63ff55d3","resolution":{"observed_at":"2026-08-07T14:42:21.194134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:21.275247Z","title":"Snapkv: Llm knows what you are looking for before generation.Advances in Neural Information Processing Systems, 37:22947–22970, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:21.275247Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:efcbac85268ada087849eb0aabed1700927bbee6aa0e0d0593a143984a00d13b","observation_id":"1d7e3402-796f-45cc-8aba-8a6650c27255","resolution":{"observed_at":"2026-08-07T14:42:21.275247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14731","last_updated":"2025-05-16T09:40:01Z","snapshot_observed_at":"2026-07-06T19:36:10.759412Z","submitted_at":"2024-10-16T08:34:51Z","title":"MatryoshkaKV: Adaptive KV Compression via Trainable Orthogonal Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14731","snapshot_observed_at":"2026-08-07T14:42:21.377519Z","title":"Matryoshkakv: Adaptive kv compression via trainable orthogonal projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:21.377519Z"},"links":{"cited_paper":"/paper/2410.14731","citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:1d7050675efeb8ef644ffc45ed678eb6bbda0f90f5ac55eb39b1286e05479abc","observation_id":"e30a4de3-986a-4d57-bf11-6c0d9001326c","resolution":{"observed_at":"2026-08-07T14:42:21.377519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:26.097670Z","title":"Awq: Activation-aware weight quantization for on-device llm compression and acceleration.Proceedings of Machine Learning and Systems, 6:87–100, 2024","venue":null,"work_id":"da04d2bc-fa58-4d9b-90c4-f52ea24cb5ea","year":2024},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:21.476258Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:dd6b78565fe0bf102c29c5ca9e74e829e4fef84c0529ae8955ab43d8cd92e4f2","observation_id":"7ff29666-6aef-41c8-840f-82f242a95a2f","resolution":{"observed_at":"2026-08-07T14:42:26.198825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17066","last_updated":"2024-10-22T11:47:04Z","snapshot_observed_at":"2026-08-06T23:02:55.718749Z","submitted_at":"2024-09-25T16:25:45Z","title":"VPTQ: Extreme Low-bit Vector Post-Training Quantization for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17066","snapshot_observed_at":"2026-08-07T14:42:21.528632Z","title":"Vptq: Extreme low-bit vector post-training quantization for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:21.528632Z"},"links":{"cited_paper":"/paper/2409.17066","citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:7bcd405de94f62105e7232eb7fb6546a54513e320e327aa4a4a62fb9b75d425d","observation_id":"0c0a7fbb-d6e8-41a6-9cc4-bf018e610764","resolution":{"observed_at":"2026-08-07T14:42:21.528632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16406","last_updated":"2025-02-20T06:07:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-26T02:15:49Z","title":"SpinQuant: LLM quantization with learned rotations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16406","snapshot_observed_at":"2026-08-07T14:42:21.563050Z","title":"Spinquant: Llm quantization with learned rotations.arXiv preprint arXiv:2405.16406, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:21.563050Z"},"links":{"cited_paper":"/paper/2405.16406","citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:ee311e0b0ead8fbf00db0e1300dfa8120ff8abf5045c6148d17ce56247251b92","observation_id":"0d3692ca-f0bf-41ec-ae6a-a95c3ae19497","resolution":{"observed_at":"2026-08-07T14:42:21.563050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02750","last_updated":"2024-07-25T09:16:05Z","snapshot_observed_at":"2026-07-06T17:25:18.238343Z","submitted_at":"2024-02-05T06:06:47Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02750","snapshot_observed_at":"2026-08-07T14:42:21.631333Z","title":"Kivi: A tuning-free asymmetric 2bit quantization for kv cache.arXiv preprint arXiv:2402.02750, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:21.631333Z"},"links":{"cited_paper":"/paper/2402.02750","citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:366a0f59c49d30aa67e64b56f265119f7b0283137e38aff78570f27ffaad8af8","observation_id":"86282d67-e22d-4b85-a153-824487fbbdd5","resolution":{"observed_at":"2026-08-07T14:42:21.631333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:25.879925Z","title":null,"venue":null,"work_id":"588b2deb-362d-411b-97cc-e029f6d8fee1","year":2024},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:21.706702Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:2b8f5c479c8f0fdfa707de787489747626745975bbb1eea46b42ea91952c59d1","observation_id":"ef42813c-e02f-4efe-a7e1-e6948ece603f","resolution":{"observed_at":"2026-08-07T14:42:25.985348Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:21.756963Z","title":"Cake: Cascading and adaptive kv cache eviction with layer preferences.arXiv preprint arXiv:2503.12491, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:21.756963Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:0e972f02d000b4db814211f5895dd35271b56eced77a5310876dba37734fc4ad","observation_id":"8a2d3072-513e-4c5a-8db2-9ed89116cbc4","resolution":{"observed_at":"2026-08-07T14:42:21.756963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:21.846993Z","title":"Coqa: A conversational question answering challenge.Transactions of the Association for Computational Linguistics, 7:249–266, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:21.846993Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:116f11139582e410fc62ae9d73fc7a1db4f571b0ac52289435e61329d795dd69","observation_id":"4c80056c-736e-482b-884d-e635ae7bda2a","resolution":{"observed_at":"2026-08-07T14:42:21.846993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:25.678879Z","title":"Hanson-wright inequality and sub-gaussian concentra- tion","venue":null,"work_id":"3df52cf0-ea5a-4a6a-9a42-35695d411ea0","year":2013},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:21.943014Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:14fa2d877be7d33c23ffcfa8b980267e331f7f2d1acb54e38ba0ce128af078b0","observation_id":"93d8bf7c-4959-4bc8-8d67-58a6147bd157","resolution":{"observed_at":"2026-08-07T14:42:25.738176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:25.516271Z","title":null,"venue":null,"work_id":"45a489d3-64eb-4a45-83ea-3551de21f9d0","year":2023},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:22.054272Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:81e50f88804d0f87f3d4f0f653aaa2a3534195ed40e8432f9412c2bf28163d1b","observation_id":"8a99de4a-d23d-4050-850c-d43e52fedb8c","resolution":{"observed_at":"2026-08-07T14:42:25.616849Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T14:42:22.125724Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:22.125724Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:5fe457d962b14f664c6d7f9cef35449ea9616c050a4daea16d95ae872721d0d4","observation_id":"9e15ebc8-9549-4bb6-a683-c712d4cb7235","resolution":{"observed_at":"2026-08-07T14:42:22.125724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:25.343227Z","title":"QuIP#: Even better LLM quantization with hadamard incoherence and lattice codebooks","venue":null,"work_id":"1833ce6d-3cba-4d83-984d-ddd57644eccd","year":2024},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:22.217465Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:b18e59af0a3860ef690867cff20183b9ee359b403fa11a23a2dc5f2982f59a36","observation_id":"b0a527a4-b230-468f-bd55-1992104ff61b","resolution":{"observed_at":"2026-08-07T14:42:25.408508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:22.302830Z","title":"Attention is all you need.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:22.302830Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:ea3a4d0c09e7069ba4ea4a7bdd2fc950bf433d52a20dd6888d4f1a754a5fbef0","observation_id":"07b96d21-7971-43bc-ac17-0773479f1a63","resolution":{"observed_at":"2026-08-07T14:42:22.302830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18415","last_updated":"2025-06-13T05:55:26Z","snapshot_observed_at":"2026-08-07T15:59:11.064826Z","submitted_at":"2025-04-25T15:17:52Z","title":"BitNet v2: Native 4-bit Activations with Hadamard Transformation for 1-bit LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.18415","snapshot_observed_at":"2026-08-07T14:42:22.378319Z","title":"Bitnet v2: Native 4-bit activations with hadamard transformation for 1-bit llms.arXiv preprint arXiv:2504.18415, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:22.378319Z"},"links":{"cited_paper":"/paper/2504.18415","citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:d2dc41599f2b7b663dc97790c86097962e46a121a5e8c4601b8f2e91df7233f3","observation_id":"50e1376b-fe23-4b48-b5f8-6a7a9f9b03e5","resolution":{"observed_at":"2026-08-07T14:42:22.378319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:22.452938Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:22.452938Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:62a54fb2abfe05c2e5f0e2e1e09d4ad331554c3894bdeec1147f545d92e535fe","observation_id":"487e206a-3751-47e3-9ec8-a14135340265","resolution":{"observed_at":"2026-08-07T14:42:22.452938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18096","last_updated":"2024-02-28T06:34:54Z","snapshot_observed_at":"2026-07-06T17:36:40.933805Z","submitted_at":"2024-02-28T06:34:54Z","title":"No Token Left Behind: Reliable KV Cache Compression via Importance-Aware Mixed Precision Quantization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18096","snapshot_observed_at":"2026-08-07T14:42:22.512307Z","title":"No token left behind: Reliable kv cache compression via importance-aware mixed precision quantization.arXiv preprint arXiv:2402.18096, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:22.512307Z"},"links":{"cited_paper":"/paper/2402.18096","citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:293b23c29512dda2bcf79d6e7e4a7b774c82c0a3d0f40fe13b090d2ce22214b3","observation_id":"d96754ce-5019-4912-aa00-8454d5ad2387","resolution":{"observed_at":"2026-08-07T14:42:22.512307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13003","last_updated":"2023-03-23T02:55:50Z","snapshot_observed_at":"2026-07-06T15:06:56.845060Z","submitted_at":"2023-03-23T02:55:50Z","title":"Benchmarking the Reliability of Post-training Quantization: a Particular Focus on Worst-case Performance","version":1},"cited_work":{"arxiv_id":"2303.13003","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.13003","snapshot_observed_at":"2026-08-07T14:42:23.396409Z","title":"Benchmarking the Reliability of Post-training Quantization: a Particular Focus on Worst-case Performance","venue":"cs.LG","work_id":"3a318a4d-91b9-44b3-b9af-feb2a4545947","year":2023},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:22.560543Z"},"links":{"cited_paper":"/paper/2303.13003","citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:d1377cee0aac4222a771e7cb63864c73f5e1af6a28a0b90923435b2da5ea0117","observation_id":"87d1acc8-019d-4a99-bedb-7d94516415f0","resolution":{"observed_at":"2026-08-07T14:42:23.446611Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:25.160925Z","title":"Kv cache is 1 bit per channel: Efficient large language model inference with coupled quantization.Advances in Neural Information Processing Systems, 37:3304–3331, 2024","venue":null,"work_id":"45f0b839-fc47-450d-889f-e9cd3bdf6a27","year":2024},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:22.657980Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:a1f28c6999a3a44b37fc1744e931fa5ad37450fb1967ded693e277946931308b","observation_id":"96f64d5c-4832-4640-93ca-2772e53b30f5","resolution":{"observed_at":"2026-08-07T14:42:25.245202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:24.934751Z","title":"H2o: Heavy-hitter oracle for efficient generative inference of large language models.Advances in Neural Information Processing Systems, 36:34661–34710, 2023","venue":null,"work_id":"c6cd3b05-313f-4ef7-88ac-bb581d3f2e46","year":2023},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:22.696914Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:ad49fb76cba3f5493a80095c0d221d6ce2bf48830460e09d1f3624b0dd60afd1","observation_id":"b3f8a2f2-0842-4cc6-93e4-361c804c15e6","resolution":{"observed_at":"2026-08-07T14:42:25.047251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:24.747742Z","title":"Decompose Σ = Cov(X) =D+A , D= diag(Σ),A ii = 0,∥A∥ F ≤Γ","venue":null,"work_id":"b3ec0068-d2f4-4e28-9861-79ad1722ec80","year":null},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:22.744073Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:30fb5ec7a9243b760106540b1cd918ab3105391089308745db1e66304223d2f1","observation_id":"4c769c61-a318-4598-9404-46aaa563c585","resolution":{"observed_at":"2026-08-07T14:42:24.860495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:24.570632Z","title":null,"venue":null,"work_id":"ec07038b-edc3-460d-be10-79394883fbaf","year":null},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:22.835376Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:764010dfae7a416673761431d7aef9098a3a00744aa033e3f573e8dec23e3c1d","observation_id":"005a9e7c-b858-409e-88b6-4d08833ba59f","resolution":{"observed_at":"2026-08-07T14:42:24.627060Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:24.407432Z","title":"Then hTDh= 1−¯ε, f(h) :=h TAh= 1 d sTAs, and Var(Yi) = (1−¯ε) +f(h)","venue":null,"work_id":"7be47945-53ad-4a98-afd6-f0f96a4dafb9","year":null},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:22.891916Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:cd31714527d67b1ba03c65cbc4f9e4c82885ce38403a06d0227c097014746ff5","observation_id":"9ae2d4ba-a8d4-4bcd-a9df-c8af1065cd99","resolution":{"observed_at":"2026-08-07T14:42:24.481106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:24.203450Z","title":"Applying the Hanson-Wright inequality [34], for anyu >0 Pr |sTAs|> u ≤2 exp −c u2/Γ2 wherecis a universal constant","venue":null,"work_id":"2d57c1c5-83fe-438e-8ae6-0ae314c4595a","year":null},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:22.978513Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:6c162175bd8eb2dcf2037ecaa392f823121a94146e99a106bb0fcb08edb6e878","observation_id":"3ff43d2c-dac1-43d0-9560-f3cb61434e5a","resolution":{"observed_at":"2026-08-07T14:42:24.295084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:23.904206Z","title":"Exponent becomes −ln(2/α) ; hence Pr(|f(h)|> t)≤α","venue":null,"work_id":"e2df00fc-3809-4b8a-967e-e590a42329b2","year":null},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:23.036088Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:165d54291200daa07d83f175d8d01b07fdea8174fdf1f3be968b46b053d84443","observation_id":"94c89684-f3fd-4a5a-9186-136648659cb3","resolution":{"observed_at":"2026-08-07T14:42:24.086439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2856.8562","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:23.291219Z","title":null,"venue":null,"work_id":"8955fcf0-b4e1-43c4-b382-d75e21b01a73","year":1957},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:23.114204Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:e9cc114bac96ab6c8980eefe45ad2dfafcf9c0d2d1fe1702a5343121abe9418a","observation_id":"9145d042-9aea-4cae-9d61-0018c71de493","resolution":{"observed_at":"2026-08-07T14:42:23.342602Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T14:37:48.217884Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":2,"verified_fuzzy":13},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2505.18231."}