{"as_of":"2026-08-05T02:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:288f71536179fcf1619d3b8c8f9777224289931660cabde424d06fc10fe59238","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":34,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T04:39:06.778635Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T14:39:57.850108Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.06118","last_updated":"2024-09-11T07:48:26Z","snapshot_observed_at":"2026-07-06T17:14:28.456108Z","submitted_at":"2024-01-11T18:54:44Z","title":"Extreme Compression of Large Language Models via Additive Quantization","version":4},"cited_work":{"arxiv_id":"2401.06118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06118","snapshot_observed_at":"2026-07-04T14:39:57.850108Z","title":"Elias Frantar and Dan Alistarh","venue":null,"work_id":"38bf2888-df57-4a97-a9ca-5d4d524ea463","year":2024},"citing_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-11T12:40:02.129674Z"},"links":{"cited_paper":"/paper/2401.06118","citing_paper":"/paper/2403.13372"},"observation_digest":"sha256:65061799a3ae79e9b2bdc2a7c1cf0ca30e5daa1baf7742cf45b5e1b2fb2601ff","observation_id":"3dd06b7b-8bce-49cb-a565-a81aefc033e8","resolution":{"observed_at":"2026-05-11T12:40:02.208737Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06118","last_updated":"2024-09-11T07:48:26Z","snapshot_observed_at":"2026-07-06T17:14:28.456108Z","submitted_at":"2024-01-11T18:54:44Z","title":"Extreme Compression of Large Language Models via Additive Quantization","version":4},"cited_work":{"arxiv_id":"2401.06118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06118","snapshot_observed_at":"2026-07-04T14:39:57.850108Z","title":"Elias Frantar and Dan Alistarh","venue":null,"work_id":"38bf2888-df57-4a97-a9ca-5d4d524ea463","year":2024},"citing_paper":{"arxiv_id":"2405.16406","last_updated":"2025-02-20T06:07:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-26T02:15:49Z","title":"SpinQuant: LLM quantization with learned rotations","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T15:52:34.606853Z"},"links":{"cited_paper":"/paper/2401.06118","citing_paper":"/paper/2405.16406"},"observation_digest":"sha256:2884523808fc22c9ce7862ec08307961b8d657b3cff29de056943eed8f4254b1","observation_id":"d88f3d30-7423-4d92-b7f0-ba9d9a364a0d","resolution":{"observed_at":"2026-05-15T15:52:34.665680Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06118","last_updated":"2024-09-11T07:48:26Z","snapshot_observed_at":"2026-07-06T17:14:28.456108Z","submitted_at":"2024-01-11T18:54:44Z","title":"Extreme Compression of Large Language Models via Additive Quantization","version":4},"cited_work":{"arxiv_id":"2401.06118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06118","snapshot_observed_at":"2026-07-04T14:39:57.850108Z","title":"Elias Frantar and Dan Alistarh","venue":null,"work_id":"38bf2888-df57-4a97-a9ca-5d4d524ea463","year":2024},"citing_paper":{"arxiv_id":"2508.04853","last_updated":"2026-04-09T18:24:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-06T20:00:40Z","title":"Provable Post-Training Quantization: Theoretical Analysis of OPTQ and Qronos","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T23:52:06.036879Z"},"links":{"cited_paper":"/paper/2401.06118","citing_paper":"/paper/2508.04853"},"observation_digest":"sha256:89000ccd91aa24080a85953a981a20459184b4e3a9e2af8b96b7c0dc60d4f0cc","observation_id":"3a7063dd-279e-4af3-b72b-569d925c50c6","resolution":{"observed_at":"2026-05-18T23:52:53.045199Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06118","last_updated":"2024-09-11T07:48:26Z","snapshot_observed_at":"2026-07-06T17:14:28.456108Z","submitted_at":"2024-01-11T18:54:44Z","title":"Extreme Compression of Large Language Models via Additive Quantization","version":4},"cited_work":{"arxiv_id":"2401.06118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06118","snapshot_observed_at":"2026-07-04T14:39:57.850108Z","title":"Elias Frantar and Dan Alistarh","venue":null,"work_id":"38bf2888-df57-4a97-a9ca-5d4d524ea463","year":2024},"citing_paper":{"arxiv_id":"2509.22166","last_updated":"2026-04-24T11:44:43Z","snapshot_observed_at":"2026-07-06T22:30:50.642382Z","submitted_at":"2025-09-26T10:27:55Z","title":"Motivating Next-Gen Accelerators with Flexible (N:M) Activation Sparsity via Benchmarking Lightweight Post-Training Sparsification Approaches","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T13:36:55.938673Z"},"links":{"cited_paper":"/paper/2401.06118","citing_paper":"/paper/2509.22166"},"observation_digest":"sha256:0a115cee8dc231070350fc6e5b058c4d685caae4a140d7d01ec1cdbb1bb096a8","observation_id":"333bcaa5-066f-428e-9eee-ded1225fba65","resolution":{"observed_at":"2026-05-18T13:41:25.968867Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06118","last_updated":"2024-09-11T07:48:26Z","snapshot_observed_at":"2026-07-06T17:14:28.456108Z","submitted_at":"2024-01-11T18:54:44Z","title":"Extreme Compression of Large Language Models via Additive Quantization","version":4},"cited_work":{"arxiv_id":"2401.06118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06118","snapshot_observed_at":"2026-07-04T14:39:57.850108Z","title":"Elias Frantar and Dan Alistarh","venue":null,"work_id":"38bf2888-df57-4a97-a9ca-5d4d524ea463","year":2024},"citing_paper":{"arxiv_id":"2512.04746","last_updated":"2026-05-18T07:28:29Z","snapshot_observed_at":"2026-08-02T23:38:31.117499Z","submitted_at":"2025-12-04T12:35:10Z","title":"SignRoundV2: Toward Closing the Performance Gap in Extremely Low-Bit Post-Training Quantization for LLMs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T17:08:05.945757Z"},"links":{"cited_paper":"/paper/2401.06118","citing_paper":"/paper/2512.04746"},"observation_digest":"sha256:89e215ad119dd330a741a812626430003db46e2b5353dd58892e8e3323d70c10","observation_id":"cf5c1dce-4a29-48eb-9245-3601303fbc57","resolution":{"observed_at":"2026-05-21T17:10:24.846706Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06118","last_updated":"2024-09-11T07:48:26Z","snapshot_observed_at":"2026-07-06T17:14:28.456108Z","submitted_at":"2024-01-11T18:54:44Z","title":"Extreme Compression of Large Language Models via Additive Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06118","snapshot_observed_at":"2026-08-03T18:28:17.210379Z","title":"Extreme com- pression of large language models via additive quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.05277","last_updated":"2026-06-02T23:07:19Z","snapshot_observed_at":"2026-08-04T06:30:15.213627Z","submitted_at":"2025-12-04T21:57:10Z","title":"From Segments to Scenes: Temporal Understanding for Agentic Autonomous Driving via Vision-Language Models","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T18:28:17.210379Z"},"links":{"cited_paper":"/paper/2401.06118","citing_paper":"/paper/2512.05277"},"observation_digest":"sha256:1496ceb061c898fa15c2eb799913359be135a7c05a567872560e3258e583f5a5","observation_id":"cd9276b6-6e56-42e4-b282-ef7f11db4a9d","resolution":{"observed_at":"2026-08-03T18:28:17.210379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06118","last_updated":"2024-09-11T07:48:26Z","snapshot_observed_at":"2026-07-06T17:14:28.456108Z","submitted_at":"2024-01-11T18:54:44Z","title":"Extreme Compression of Large Language Models via Additive Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06118","snapshot_observed_at":"2026-08-03T06:01:14.100670Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.00942","last_updated":"2026-05-28T22:25:40Z","snapshot_observed_at":"2026-08-03T06:01:11.327887Z","submitted_at":"2026-02-01T00:00:11Z","title":"SALAAD: Sparse And Low-Rank Adaptation via ADMM for Large Language Model Inference","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T06:01:14.100670Z"},"links":{"cited_paper":"/paper/2401.06118","citing_paper":"/paper/2602.00942"},"observation_digest":"sha256:80ae0c74c2369a0a735fddcc9ff0f35f3b044a255f4659cffe33d80c3cd4aa53","observation_id":"489a29cb-7857-4be1-bf98-15d8e6810e65","resolution":{"observed_at":"2026-08-03T06:01:14.100670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06118","last_updated":"2024-09-11T07:48:26Z","snapshot_observed_at":"2026-07-06T17:14:28.456108Z","submitted_at":"2024-01-11T18:54:44Z","title":"Extreme Compression of Large Language Models via Additive Quantization","version":4},"cited_work":{"arxiv_id":"2401.06118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06118","snapshot_observed_at":"2026-07-04T14:39:57.850108Z","title":"Elias Frantar and Dan Alistarh","venue":null,"work_id":"38bf2888-df57-4a97-a9ca-5d4d524ea463","year":2024},"citing_paper":{"arxiv_id":"2602.04163","last_updated":"2026-05-15T03:25:05Z","snapshot_observed_at":"2026-08-02T22:48:54.849826Z","submitted_at":"2026-02-04T02:54:37Z","title":"BPDQ: Bit-Plane Decomposition Quantization on a Variable Grid for Large Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-21T14:10:32.706531Z"},"links":{"cited_paper":"/paper/2401.06118","citing_paper":"/paper/2602.04163"},"observation_digest":"sha256:d11cc2e6f972f928dae297a92d04b07eedd4287ab4a864746482e07d5d1cf311","observation_id":"45b46223-496e-4c88-ba72-22c31e4d0991","resolution":{"observed_at":"2026-05-21T14:14:12.382706Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06118","last_updated":"2024-09-11T07:48:26Z","snapshot_observed_at":"2026-07-06T17:14:28.456108Z","submitted_at":"2024-01-11T18:54:44Z","title":"Extreme Compression of Large Language Models via Additive Quantization","version":4},"cited_work":{"arxiv_id":"2401.06118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06118","snapshot_observed_at":"2026-07-04T14:39:57.850108Z","title":"Elias Frantar and Dan Alistarh","venue":null,"work_id":"38bf2888-df57-4a97-a9ca-5d4d524ea463","year":2024},"citing_paper":{"arxiv_id":"2602.05902","last_updated":"2026-05-08T19:18:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-05T17:18:02Z","title":"CoreQ: Learning-Free Mismatch Correction and Successive Rounding for Quantization","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T06:51:18.629467Z"},"links":{"cited_paper":"/paper/2401.06118","citing_paper":"/paper/2602.05902"},"observation_digest":"sha256:c49b963efafaaad6c98aa4d769b7304acf2aedc74c13263bc954064ea3278314","observation_id":"e5ef73dd-2ab6-4029-9439-b0f719b04bf2","resolution":{"observed_at":"2026-05-16T06:52:28.430581Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06118","last_updated":"2024-09-11T07:48:26Z","snapshot_observed_at":"2026-07-06T17:14:28.456108Z","submitted_at":"2024-01-11T18:54:44Z","title":"Extreme Compression of Large Language Models via Additive Quantization","version":4},"cited_work":{"arxiv_id":"2401.06118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06118","snapshot_observed_at":"2026-07-04T14:39:57.850108Z","title":"Elias Frantar and Dan Alistarh","venue":null,"work_id":"38bf2888-df57-4a97-a9ca-5d4d524ea463","year":2024},"citing_paper":{"arxiv_id":"2602.22575","last_updated":"2026-05-05T13:29:50Z","snapshot_observed_at":"2026-07-06T22:47:06.893212Z","submitted_at":"2026-02-26T03:30:28Z","title":"S2O: Early Stopping for Sparse Attention via Online Permutation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T19:32:52.948154Z"},"links":{"cited_paper":"/paper/2401.06118","citing_paper":"/paper/2602.22575"},"observation_digest":"sha256:e42d4083ebbd3d4890b4c1bec015abc75161c9baf8b4d7c1dc2d2fca007a1a4a","observation_id":"f334d98c-2e02-47ea-ab38-a8fb93907250","resolution":{"observed_at":"2026-05-15T19:36:32.866811Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06118","last_updated":"2024-09-11T07:48:26Z","snapshot_observed_at":"2026-07-06T17:14:28.456108Z","submitted_at":"2024-01-11T18:54:44Z","title":"Extreme Compression of Large Language Models via Additive Quantization","version":4},"cited_work":{"arxiv_id":"2401.06118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06118","snapshot_observed_at":"2026-07-04T14:39:57.850108Z","title":"Elias Frantar and Dan Alistarh","venue":null,"work_id":"38bf2888-df57-4a97-a9ca-5d4d524ea463","year":2024},"citing_paper":{"arxiv_id":"2604.02501","last_updated":"2026-04-02T20:09:05Z","snapshot_observed_at":"2026-07-30T03:07:00.572975Z","submitted_at":"2026-04-02T20:09:05Z","title":"ECG Foundation Models and Medical LLMs for Agentic Cardiovascular Intelligence at the Edge: A Review and Outlook","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-13T20:23:15.138933Z"},"links":{"cited_paper":"/paper/2401.06118","citing_paper":"/paper/2604.02501"},"observation_digest":"sha256:c72c26a935ef8cba6b0cc6db2129742bcf82c15d08bba93e625189fd6315cd20","observation_id":"6ba3859a-434d-4e99-95de-461bee102348","resolution":{"observed_at":"2026-05-13T20:28:14.274229Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06118","last_updated":"2024-09-11T07:48:26Z","snapshot_observed_at":"2026-07-06T17:14:28.456108Z","submitted_at":"2024-01-11T18:54:44Z","title":"Extreme Compression of Large Language Models via Additive Quantization","version":4},"cited_work":{"arxiv_id":"2401.06118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06118","snapshot_observed_at":"2026-07-04T14:39:57.850108Z","title":"Elias Frantar and Dan Alistarh","venue":null,"work_id":"38bf2888-df57-4a97-a9ca-5d4d524ea463","year":2024},"citing_paper":{"arxiv_id":"2604.06916","last_updated":"2026-04-08T10:14:47Z","snapshot_observed_at":"2026-07-06T22:55:15.791334Z","submitted_at":"2026-04-08T10:14:47Z","title":"FP4 Explore, BF16 Train: Diffusion Reinforcement Learning via Efficient Rollout Scaling","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T18:10:06.994557Z"},"links":{"cited_paper":"/paper/2401.06118","citing_paper":"/paper/2604.06916"},"observation_digest":"sha256:85351867a1ee3d13bd9c4fb97572e7883a6ad404e725b17e5806004688f0b616","observation_id":"32fc55e5-b72b-42a9-a150-90d68dcd6960","resolution":{"observed_at":"2026-05-11T05:25:56.614042Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06118","last_updated":"2024-09-11T07:48:26Z","snapshot_observed_at":"2026-07-06T17:14:28.456108Z","submitted_at":"2024-01-11T18:54:44Z","title":"Extreme Compression of Large Language Models via Additive Quantization","version":4},"cited_work":{"arxiv_id":"2401.06118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06118","snapshot_observed_at":"2026-07-04T14:39:57.850108Z","title":"Elias Frantar and Dan Alistarh","venue":null,"work_id":"38bf2888-df57-4a97-a9ca-5d4d524ea463","year":2024},"citing_paper":{"arxiv_id":"2604.18556","last_updated":"2026-05-15T09:34:30Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:45:47Z","title":"GSQ: Highly-Accurate Low-Precision Scalar Quantization for LLMs via Gumbel-Softmax Sampling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T05:29:51.182114Z"},"links":{"cited_paper":"/paper/2401.06118","citing_paper":"/paper/2604.18556"},"observation_digest":"sha256:101540cbe3fd98d3f2a80607d7cb0e8f78e73b110e00fbd2671484ecc40b0adb","observation_id":"4b9d5074-6984-40e8-a8c0-1370479d3c14","resolution":{"observed_at":"2026-05-10T05:36:02.303475Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06118","last_updated":"2024-09-11T07:48:26Z","snapshot_observed_at":"2026-07-06T17:14:28.456108Z","submitted_at":"2024-01-11T18:54:44Z","title":"Extreme Compression of Large Language Models via Additive Quantization","version":4},"cited_work":{"arxiv_id":"2401.06118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06118","snapshot_observed_at":"2026-07-04T14:39:57.850108Z","title":"Elias Frantar and Dan Alistarh","venue":null,"work_id":"38bf2888-df57-4a97-a9ca-5d4d524ea463","year":2024},"citing_paper":{"arxiv_id":"2604.18556","last_updated":"2026-05-15T09:34:30Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:45:47Z","title":"GSQ: Highly-Accurate Low-Precision Scalar Quantization for LLMs via Gumbel-Softmax Sampling","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-19T18:01:08.514022Z"},"links":{"cited_paper":"/paper/2401.06118","citing_paper":"/paper/2604.18556"},"observation_digest":"sha256:ec09a06930d97af4c8bdcc83cd996d4e28342c55601c8599f9d823f777fe185f","observation_id":"3a17d4df-ac86-439a-9dfd-bebaa3d296e9","resolution":{"observed_at":"2026-05-19T18:02:42.259097Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06118","last_updated":"2024-09-11T07:48:26Z","snapshot_observed_at":"2026-07-06T17:14:28.456108Z","submitted_at":"2024-01-11T18:54:44Z","title":"Extreme Compression of Large Language Models via Additive Quantization","version":4},"cited_work":{"arxiv_id":"2401.06118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06118","snapshot_observed_at":"2026-07-04T14:39:57.850108Z","title":"Elias Frantar and Dan Alistarh","venue":null,"work_id":"38bf2888-df57-4a97-a9ca-5d4d524ea463","year":2024},"citing_paper":{"arxiv_id":"2604.19157","last_updated":"2026-04-21T07:12:23Z","snapshot_observed_at":"2026-08-04T15:44:44.654982Z","submitted_at":"2026-04-21T07:12:23Z","title":"SAW-INT4: System-Aware 4-Bit KV-Cache Quantization for Real-World LLM Serving","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T03:09:51.453839Z"},"links":{"cited_paper":"/paper/2401.06118","citing_paper":"/paper/2604.19157"},"observation_digest":"sha256:b342aa1d8b7b6d6bf858cc28a265b26fd5280581cf7bf6ad056f37b3c0a8cbe4","observation_id":"0dbeb0ac-ca5b-4fbc-8c29-b34318db1bef","resolution":{"observed_at":"2026-05-10T03:14:08.292383Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06118","last_updated":"2024-09-11T07:48:26Z","snapshot_observed_at":"2026-07-06T17:14:28.456108Z","submitted_at":"2024-01-11T18:54:44Z","title":"Extreme Compression of Large Language Models via Additive Quantization","version":4},"cited_work":{"arxiv_id":"2401.06118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06118","snapshot_observed_at":"2026-07-04T14:39:57.850108Z","title":"Elias Frantar and Dan Alistarh","venue":null,"work_id":"38bf2888-df57-4a97-a9ca-5d4d524ea463","year":2024},"citing_paper":{"arxiv_id":"2604.19167","last_updated":"2026-04-21T07:25:02Z","snapshot_observed_at":"2026-07-06T23:05:53.378585Z","submitted_at":"2026-04-21T07:25:02Z","title":"LBLLM: Lightweight Binarization of Large Language Models via Three-Stage Distillation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-10T03:04:14.900791Z"},"links":{"cited_paper":"/paper/2401.06118","citing_paper":"/paper/2604.19167"},"observation_digest":"sha256:5cab863221dd9acdd3219042e1380c2a6773cb48cc9ab15322777c5de112725a","observation_id":"6a650f0d-7fa8-4f00-b4a7-398ca6af3654","resolution":{"observed_at":"2026-05-11T12:46:04.531356Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06118","last_updated":"2024-09-11T07:48:26Z","snapshot_observed_at":"2026-07-06T17:14:28.456108Z","submitted_at":"2024-01-11T18:54:44Z","title":"Extreme Compression of Large Language Models via Additive Quantization","version":4},"cited_work":{"arxiv_id":"2401.06118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06118","snapshot_observed_at":"2026-07-04T14:39:57.850108Z","title":"Elias Frantar and Dan Alistarh","venue":null,"work_id":"38bf2888-df57-4a97-a9ca-5d4d524ea463","year":2024},"citing_paper":{"arxiv_id":"2605.18475","last_updated":"2026-05-18T14:30:58Z","snapshot_observed_at":"2026-08-04T01:21:32.686727Z","submitted_at":"2026-05-18T14:30:58Z","title":"GAMMA: Global Bit Allocation for Mixed-Precision Models under Arbitrary Budgets","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-20T12:25:39.417436Z"},"links":{"cited_paper":"/paper/2401.06118","citing_paper":"/paper/2605.18475"},"observation_digest":"sha256:6863362e893a9c28cf03b47c453eeeee2b8803c84278afa59b7fad3fd6223136","observation_id":"48269ae2-16fa-4a43-ab45-baf1c23ae9cf","resolution":{"observed_at":"2026-05-20T12:28:16.821701Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06118","last_updated":"2024-09-11T07:48:26Z","snapshot_observed_at":"2026-07-06T17:14:28.456108Z","submitted_at":"2024-01-11T18:54:44Z","title":"Extreme Compression of Large Language Models via Additive Quantization","version":4},"cited_work":{"arxiv_id":"2401.06118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06118","snapshot_observed_at":"2026-07-04T14:39:57.850108Z","title":"Elias Frantar and Dan Alistarh","venue":null,"work_id":"38bf2888-df57-4a97-a9ca-5d4d524ea463","year":2024},"citing_paper":{"arxiv_id":"2605.24011","last_updated":"2026-08-03T19:37:08Z","snapshot_observed_at":"2026-08-05T01:32:36.475427Z","submitted_at":"2026-05-19T19:57:26Z","title":"ActQuant: Sub-4-bit Action-Guided Quantization for Vision-Language-Action Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T17:54:56.386488Z"},"links":{"cited_paper":"/paper/2401.06118","citing_paper":"/paper/2605.24011"},"observation_digest":"sha256:ede137105fe550cf2a9301c451f64892cdf2372da0081eac4e415227c0f5f43e","observation_id":"2a2a897d-b308-4140-bfad-424919528f20","resolution":{"observed_at":"2026-07-01T15:05:47.976295Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06118","last_updated":"2024-09-11T07:48:26Z","snapshot_observed_at":"2026-07-06T17:14:28.456108Z","submitted_at":"2024-01-11T18:54:44Z","title":"Extreme Compression of Large Language Models via Additive Quantization","version":4},"cited_work":{"arxiv_id":"2401.06118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06118","snapshot_observed_at":"2026-07-04T14:39:57.850108Z","title":"Elias Frantar and Dan Alistarh","venue":null,"work_id":"38bf2888-df57-4a97-a9ca-5d4d524ea463","year":2024},"citing_paper":{"arxiv_id":"2605.25203","last_updated":"2026-05-24T18:05:37Z","snapshot_observed_at":"2026-08-04T10:11:25.132076Z","submitted_at":"2026-05-24T18:05:37Z","title":"Influence-Inspired Spectral Rotations for Extreme Low-Bit LLM Quantization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T12:13:18.805668Z"},"links":{"cited_paper":"/paper/2401.06118","citing_paper":"/paper/2605.25203"},"observation_digest":"sha256:75f659681d73b3cb40e71e47bf2c3b8927c320033506c19ca6c17edef6467211","observation_id":"3cda3c24-9941-44c3-89d3-d58c3e24e172","resolution":{"observed_at":"2026-06-30T12:14:39.062248Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06118","last_updated":"2024-09-11T07:48:26Z","snapshot_observed_at":"2026-07-06T17:14:28.456108Z","submitted_at":"2024-01-11T18:54:44Z","title":"Extreme Compression of Large Language Models via Additive Quantization","version":4},"cited_work":{"arxiv_id":"2401.06118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06118","snapshot_observed_at":"2026-07-04T14:39:57.850108Z","title":"Elias Frantar and Dan Alistarh","venue":null,"work_id":"38bf2888-df57-4a97-a9ca-5d4d524ea463","year":2024},"citing_paper":{"arxiv_id":"2605.26660","last_updated":"2026-05-31T09:30:47Z","snapshot_observed_at":"2026-08-04T01:50:38.200953Z","submitted_at":"2026-05-26T07:46:13Z","title":"WINDQuant: Weight-Informed Neural Decision-Making for Global Mixed-Precision LLM Quantization","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T19:30:42.994906Z"},"links":{"cited_paper":"/paper/2401.06118","citing_paper":"/paper/2605.26660"},"observation_digest":"sha256:8beea97f0bb53d19fd1658f2d7350cb3812a2a119bc6214c57f9fa36745b17ba","observation_id":"d72d6847-4844-4887-8057-75c4c71efd3f","resolution":{"observed_at":"2026-06-29T19:33:53.959601Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06118","last_updated":"2024-09-11T07:48:26Z","snapshot_observed_at":"2026-07-06T17:14:28.456108Z","submitted_at":"2024-01-11T18:54:44Z","title":"Extreme Compression of Large Language Models via Additive Quantization","version":4},"cited_work":{"arxiv_id":"2401.06118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06118","snapshot_observed_at":"2026-07-04T14:39:57.850108Z","title":"Elias Frantar and Dan Alistarh","venue":null,"work_id":"38bf2888-df57-4a97-a9ca-5d4d524ea463","year":2024},"citing_paper":{"arxiv_id":"2605.29843","last_updated":"2026-05-28T12:24:15Z","snapshot_observed_at":"2026-07-06T23:39:15.620929Z","submitted_at":"2026-05-28T12:24:15Z","title":"HARP: Hadamard-Preconditioned Adaptive Rotation Processor for Extreme LLM Quantization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T09:16:37.939055Z"},"links":{"cited_paper":"/paper/2401.06118","citing_paper":"/paper/2605.29843"},"observation_digest":"sha256:c6389e90c9d2fac207e726bdbffe7723ece5624eea7416c5d41a8983e15ba0dc","observation_id":"bc8f316e-7897-4f4a-ada1-14ead50af142","resolution":{"observed_at":"2026-06-29T13:53:29.657669Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06118","last_updated":"2024-09-11T07:48:26Z","snapshot_observed_at":"2026-07-06T17:14:28.456108Z","submitted_at":"2024-01-11T18:54:44Z","title":"Extreme Compression of Large Language Models via Additive Quantization","version":4},"cited_work":{"arxiv_id":"2401.06118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06118","snapshot_observed_at":"2026-07-04T14:39:57.850108Z","title":"Elias Frantar and Dan Alistarh","venue":null,"work_id":"38bf2888-df57-4a97-a9ca-5d4d524ea463","year":2024},"citing_paper":{"arxiv_id":"2606.02823","last_updated":"2026-06-01T19:40:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:40:32Z","title":"Qift: Shift-Friendly No-Zero W2 Post-Training Quantization for Rotated W2A4/KV4 LLM Inference","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T15:49:41.836888Z"},"links":{"cited_paper":"/paper/2401.06118","citing_paper":"/paper/2606.02823"},"observation_digest":"sha256:e518000009d4c482abe06cd59a40a07d5add65fefcb7e323d76061b7f3c1cb91","observation_id":"3a953875-6e80-4582-ac2d-67aab035d42e","resolution":{"observed_at":"2026-07-01T22:06:15.957269Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06118","last_updated":"2024-09-11T07:48:26Z","snapshot_observed_at":"2026-07-06T17:14:28.456108Z","submitted_at":"2024-01-11T18:54:44Z","title":"Extreme Compression of Large Language Models via Additive Quantization","version":4},"cited_work":{"arxiv_id":"2401.06118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06118","snapshot_observed_at":"2026-07-04T14:39:57.850108Z","title":"Elias Frantar and Dan Alistarh","venue":null,"work_id":"38bf2888-df57-4a97-a9ca-5d4d524ea463","year":2024},"citing_paper":{"arxiv_id":"2606.03465","last_updated":"2026-06-02T10:45:21Z","snapshot_observed_at":"2026-07-06T23:43:40.769504Z","submitted_at":"2026-06-02T10:45:21Z","title":"Rethinking the Role of Tensor Decompositions in Post-Training LLM Compression","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T11:31:25.851340Z"},"links":{"cited_paper":"/paper/2401.06118","citing_paper":"/paper/2606.03465"},"observation_digest":"sha256:aea7e5ac86e49996d794793dc8b62a8a7e6414732191b054da152d8b78da2781","observation_id":"13e220e0-5905-4fd6-96e1-1c607db14c73","resolution":{"observed_at":"2026-07-02T01:46:26.898431Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06118","last_updated":"2024-09-11T07:48:26Z","snapshot_observed_at":"2026-07-06T17:14:28.456108Z","submitted_at":"2024-01-11T18:54:44Z","title":"Extreme Compression of Large Language Models via Additive Quantization","version":4},"cited_work":{"arxiv_id":"2401.06118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06118","snapshot_observed_at":"2026-07-04T14:39:57.850108Z","title":"Elias Frantar and Dan Alistarh","venue":null,"work_id":"38bf2888-df57-4a97-a9ca-5d4d524ea463","year":2024},"citing_paper":{"arxiv_id":"2606.04050","last_updated":"2026-06-29T14:48:51Z","snapshot_observed_at":"2026-08-02T11:21:40.769275Z","submitted_at":"2026-06-02T08:52:04Z","title":"LiftQuant: Continuous Bit-Width LLM via Dimensional Lifting and Projection","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-28T11:14:03.535306Z"},"links":{"cited_paper":"/paper/2401.06118","citing_paper":"/paper/2606.04050"},"observation_digest":"sha256:a5e34f9946caceea0c0a5a98aa50b3fc690dd51ae81017537a46c1189836eee9","observation_id":"f4e9c52e-ef22-423e-affa-381ea50aecf8","resolution":{"observed_at":"2026-07-02T02:06:27.011046Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06118","last_updated":"2024-09-11T07:48:26Z","snapshot_observed_at":"2026-07-06T17:14:28.456108Z","submitted_at":"2024-01-11T18:54:44Z","title":"Extreme Compression of Large Language Models via Additive Quantization","version":4},"cited_work":{"arxiv_id":"2401.06118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06118","snapshot_observed_at":"2026-07-04T14:39:57.850108Z","title":"Elias Frantar and Dan Alistarh","venue":null,"work_id":"38bf2888-df57-4a97-a9ca-5d4d524ea463","year":2024},"citing_paper":{"arxiv_id":"2606.04050","last_updated":"2026-06-29T14:48:51Z","snapshot_observed_at":"2026-08-02T11:21:40.769275Z","submitted_at":"2026-06-02T08:52:04Z","title":"LiftQuant: Continuous Bit-Width LLM via Dimensional Lifting and Projection","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-30T11:17:53.736872Z"},"links":{"cited_paper":"/paper/2401.06118","citing_paper":"/paper/2606.04050"},"observation_digest":"sha256:f30b9169bc320d15a6ad15e1e1ae021c776aaa46be5fa9f35f266f2ad481562f","observation_id":"1ea1b4fe-faf0-407b-b888-28787d78b9f9","resolution":{"observed_at":"2026-06-30T11:24:38.301078Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06118","last_updated":"2024-09-11T07:48:26Z","snapshot_observed_at":"2026-07-06T17:14:28.456108Z","submitted_at":"2024-01-11T18:54:44Z","title":"Extreme Compression of Large Language Models via Additive Quantization","version":4},"cited_work":{"arxiv_id":"2401.06118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06118","snapshot_observed_at":"2026-07-04T14:39:57.850108Z","title":"Elias Frantar and Dan Alistarh","venue":null,"work_id":"38bf2888-df57-4a97-a9ca-5d4d524ea463","year":2024},"citing_paper":{"arxiv_id":"2606.12876","last_updated":"2026-06-11T04:06:02Z","snapshot_observed_at":"2026-08-02T07:08:48.372955Z","submitted_at":"2026-06-11T04:06:02Z","title":"Multi-Bitwidth Quantization for LLMs Using Additive Codebooks","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-06-27T07:29:14.923431Z"},"links":{"cited_paper":"/paper/2401.06118","citing_paper":"/paper/2606.12876"},"observation_digest":"sha256:16a9b6a98c2769cf968ca40da288459c9fb398003a2480e2acc18bffca4dcd71","observation_id":"83aedfc9-6608-44c9-bd81-e3f1d9ee33ca","resolution":{"observed_at":"2026-07-03T13:48:21.354907Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06118","last_updated":"2024-09-11T07:48:26Z","snapshot_observed_at":"2026-07-06T17:14:28.456108Z","submitted_at":"2024-01-11T18:54:44Z","title":"Extreme Compression of Large Language Models via Additive Quantization","version":4},"cited_work":{"arxiv_id":"2401.06118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06118","snapshot_observed_at":"2026-07-04T14:39:57.850108Z","title":"Elias Frantar and Dan Alistarh","venue":null,"work_id":"38bf2888-df57-4a97-a9ca-5d4d524ea463","year":2024},"citing_paper":{"arxiv_id":"2606.24937","last_updated":"2026-07-27T15:17:17Z","snapshot_observed_at":"2026-08-02T23:19:25.465662Z","submitted_at":"2026-06-22T17:48:54Z","title":"The Hitchhiker's Guide to Agentic AI: From Foundations to Systems","version":1},"reference_index":150,"source":"pdf_text","source_observed_at":"2026-06-26T08:09:57.542558Z"},"links":{"cited_paper":"/paper/2401.06118","citing_paper":"/paper/2606.24937"},"observation_digest":"sha256:b56bfe0e8429b6df5edb2bf85c9e2ef3f3b9ac3f004b297bbf1be90ddac7297f","observation_id":"c38210ad-15bc-46e6-a32b-2e8b5f66b6ea","resolution":{"observed_at":"2026-07-04T11:09:46.230247Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06118","last_updated":"2024-09-11T07:48:26Z","snapshot_observed_at":"2026-07-06T17:14:28.456108Z","submitted_at":"2024-01-11T18:54:44Z","title":"Extreme Compression of Large Language Models via Additive Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06118","snapshot_observed_at":"2026-08-02T10:27:18.293481Z","title":"Extreme Compression of Large Language Models via Additive Quantization.arXiv Preprint arXiv:2401.06118, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.24937","last_updated":"2026-07-27T15:17:17Z","snapshot_observed_at":"2026-08-02T23:19:25.465662Z","submitted_at":"2026-06-22T17:48:54Z","title":"The Hitchhiker's Guide to Agentic AI: From Foundations to Systems","version":2},"reference_index":150,"source":"pdf_text","source_observed_at":"2026-08-02T10:27:18.293481Z"},"links":{"cited_paper":"/paper/2401.06118","citing_paper":"/paper/2606.24937"},"observation_digest":"sha256:426fedd1b8b7c84a6e0ea65778782fd0b390d2185e878b9c5107a12b89ea97fc","observation_id":"c86b2b5d-32b6-49d8-833c-44c9cf9ff354","resolution":{"observed_at":"2026-08-02T10:27:18.293481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06118","last_updated":"2024-09-11T07:48:26Z","snapshot_observed_at":"2026-07-06T17:14:28.456108Z","submitted_at":"2024-01-11T18:54:44Z","title":"Extreme Compression of Large Language Models via Additive Quantization","version":4},"cited_work":{"arxiv_id":"2401.06118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06118","snapshot_observed_at":"2026-07-04T14:39:57.850108Z","title":"Elias Frantar and Dan Alistarh","venue":null,"work_id":"38bf2888-df57-4a97-a9ca-5d4d524ea463","year":2024},"citing_paper":{"arxiv_id":"2606.27205","last_updated":"2026-07-03T12:47:47Z","snapshot_observed_at":"2026-08-03T09:35:27.462057Z","submitted_at":"2026-06-25T16:02:05Z","title":"Smaller Models, Unexpected Costs: Trade-offs in LLM Quantization for Automated Program Repair","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T03:10:37.068739Z"},"links":{"cited_paper":"/paper/2401.06118","citing_paper":"/paper/2606.27205"},"observation_digest":"sha256:7b4a7a55f69de938cf43545295d4bb3b27433eef686efe4414ebf286063370d1","observation_id":"07535700-f01f-4327-8453-3e5bdb230fd3","resolution":{"observed_at":"2026-07-04T14:39:57.851690Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06118","last_updated":"2024-09-11T07:48:26Z","snapshot_observed_at":"2026-07-06T17:14:28.456108Z","submitted_at":"2024-01-11T18:54:44Z","title":"Extreme Compression of Large Language Models via Additive Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06118","snapshot_observed_at":"2026-07-12T11:49:34.865484Z","title":"Egiazarian et al.Extreme Compression of Large Language Models via Additive Quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.27205","last_updated":"2026-07-03T12:47:47Z","snapshot_observed_at":"2026-08-03T09:35:27.462057Z","submitted_at":"2026-06-25T16:02:05Z","title":"Smaller Models, Unexpected Costs: Trade-offs in LLM Quantization for Automated Program Repair","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T11:49:34.865484Z"},"links":{"cited_paper":"/paper/2401.06118","citing_paper":"/paper/2606.27205"},"observation_digest":"sha256:d9e9e08a1c9858cc9f07dab3e8b0cd59361b63af9b27aa09c839b272e624309c","observation_id":"382d3d53-2e97-4f26-8029-f94b47b65942","resolution":{"observed_at":"2026-07-12T11:49:34.865484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06118","last_updated":"2024-09-11T07:48:26Z","snapshot_observed_at":"2026-07-06T17:14:28.456108Z","submitted_at":"2024-01-11T18:54:44Z","title":"Extreme Compression of Large Language Models via Additive Quantization","version":4},"cited_work":{"arxiv_id":"2401.06118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06118","snapshot_observed_at":"2026-07-04T14:39:57.850108Z","title":"Elias Frantar and Dan Alistarh","venue":null,"work_id":"38bf2888-df57-4a97-a9ca-5d4d524ea463","year":2024},"citing_paper":{"arxiv_id":"2606.29239","last_updated":"2026-08-03T15:22:02Z","snapshot_observed_at":"2026-08-05T01:27:42.365132Z","submitted_at":"2026-06-28T07:06:46Z","title":"Breaking the Rounding Trap: Securing LLMs against Quantization-Conditioned Backdoors","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T07:47:18.350953Z"},"links":{"cited_paper":"/paper/2401.06118","citing_paper":"/paper/2606.29239"},"observation_digest":"sha256:460553c5700755148325352af25d11bbce74de6a1c39141a42779ce72839c0a5","observation_id":"b72dd6dc-1cf9-4c3c-b5ed-fd9b823302c7","resolution":{"observed_at":"2026-06-30T08:04:28.755411Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06118","last_updated":"2024-09-11T07:48:26Z","snapshot_observed_at":"2026-07-06T17:14:28.456108Z","submitted_at":"2024-01-11T18:54:44Z","title":"Extreme Compression of Large Language Models via Additive Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06118","snapshot_observed_at":"2026-08-04T04:39:06.778635Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29239","last_updated":"2026-08-03T15:22:02Z","snapshot_observed_at":"2026-08-05T01:27:42.365132Z","submitted_at":"2026-06-28T07:06:46Z","title":"Breaking the Rounding Trap: Securing LLMs against Quantization-Conditioned Backdoors","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T04:39:06.778635Z"},"links":{"cited_paper":"/paper/2401.06118","citing_paper":"/paper/2606.29239"},"observation_digest":"sha256:d6540fc1e2fee080b966cacc25663a89c1978e660d41e3cff03753a37a312af3","observation_id":"a37e7a8f-29ce-45ad-818b-9a0fffe88d7f","resolution":{"observed_at":"2026-08-04T04:39:06.778635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06118","last_updated":"2024-09-11T07:48:26Z","snapshot_observed_at":"2026-07-06T17:14:28.456108Z","submitted_at":"2024-01-11T18:54:44Z","title":"Extreme Compression of Large Language Models via Additive Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06118","snapshot_observed_at":"2026-07-14T08:45:52.855783Z","title":"arXiv preprint arXiv:2401.06118 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10855","last_updated":"2026-07-12T17:39:09Z","snapshot_observed_at":"2026-08-03T20:11:14.002088Z","submitted_at":"2026-07-12T17:39:09Z","title":"Reliability Scaling Laws for Quantized Large Language Models","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-07-14T08:45:52.855783Z"},"links":{"cited_paper":"/paper/2401.06118","citing_paper":"/paper/2607.10855"},"observation_digest":"sha256:8d09c00072e3cf9ccc1e3d3dd073312ab6f8ae05dea2b81b71ac1cfc25324d51","observation_id":"7b6e680d-99cb-4fc7-8bfa-e3b9323788d2","resolution":{"observed_at":"2026-07-14T08:45:52.855783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06118","last_updated":"2024-09-11T07:48:26Z","snapshot_observed_at":"2026-07-06T17:14:28.456108Z","submitted_at":"2024-01-11T18:54:44Z","title":"Extreme Compression of Large Language Models via Additive Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06118","snapshot_observed_at":"2026-07-31T22:36:29.223928Z","title":"Extreme compression of large language models via additive quantization.arXiv preprint arXiv:2401.06118, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24148","last_updated":"2026-07-27T08:29:05Z","snapshot_observed_at":"2026-07-31T22:36:27.209638Z","submitted_at":"2026-07-27T08:29:05Z","title":"A Motion-Aware Vector Quantization Framework with Centroid Reuse for Efficient VLA Inference","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T22:36:29.223928Z"},"links":{"cited_paper":"/paper/2401.06118","citing_paper":"/paper/2607.24148"},"observation_digest":"sha256:3057ab683f42b4384bac77c63f44cd22c3bbfd7332d55a5345b6e28838578987","observation_id":"2fec4cf6-8036-4a8f-8ff8-cdab958a7770","resolution":{"observed_at":"2026-07-31T22:36:29.223928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2401.06118/citation-record","integrity":"/paper/2401.06118/integrity","json":"/paper/2401.06118/citation-record.json","paper":"/paper/2401.06118"},"outbound":[],"paper":{"arxiv_id":"2401.06118","last_updated":"2024-09-11T07:48:26Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T17:14:28.456108Z","submitted_at":"2024-01-11T18:54:44Z","title":"Extreme Compression of Large Language Models via Additive Quantization"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 34 inbound Pith citation observations for arXiv:2401.06118."}