{"as_of":"2026-08-04T21:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:163d841bfd2d94836b0e261f51332920a267edc897038a9c3e3a7d87c9a173b7","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":42,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T11:24:19.403461Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-10T06:15:00.866473Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":"2306.03078","doi":"10.48550/arxiv.2306.03078","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Spqr: A sparse-quantized representation for near-lossless llm weight compression.arXiv preprint arXiv:2306.03078","venue":null,"work_id":"9f122cd0-f5dd-4105-8cf5-cc97759850e8","year":2024},"citing_paper":{"arxiv_id":"2404.14294","last_updated":"2024-07-19T04:47:36Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T15:53:08Z","title":"A Survey on Efficient Inference for Large Language Models","version":3},"reference_index":196,"source":"pdf_text","source_observed_at":"2026-05-15T02:39:33.007894Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2404.14294"},"observation_digest":"sha256:1c86f932fd9d8b0b5f567ff59249ee567215284ea45bb8c2532fa1aa27d3b7bf","observation_id":"bb0773e2-c299-4c5c-b311-4e488060f525","resolution":{"observed_at":"2026-05-15T02:39:33.210769Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":"2306.03078","doi":"10.48550/arxiv.2306.03078","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Spqr: A sparse-quantized representation for near-lossless llm weight compression.arXiv preprint arXiv:2306.03078","venue":null,"work_id":"9f122cd0-f5dd-4105-8cf5-cc97759850e8","year":2024},"citing_paper":{"arxiv_id":"2505.02380","last_updated":"2026-01-26T11:44:39Z","snapshot_observed_at":"2026-07-06T21:18:55.327700Z","submitted_at":"2025-05-05T05:42:14Z","title":"EntroLLM: Entropy Encoded Weight Compression for Efficient Large Language Model Inference on Edge Devices","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-22T16:34:37.083239Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2505.02380"},"observation_digest":"sha256:87898a83c6aaf8475d86dba93c546409029351cbb81097489ae0ef03419ee0b6","observation_id":"abbca5a6-faa9-4c66-9b1e-0a241ffeff3a","resolution":{"observed_at":"2026-05-22T16:34:59.286285Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":"2306.03078","doi":"10.48550/arxiv.2306.03078","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Spqr: A sparse-quantized representation for near-lossless llm weight compression.arXiv preprint arXiv:2306.03078","venue":null,"work_id":"9f122cd0-f5dd-4105-8cf5-cc97759850e8","year":2024},"citing_paper":{"arxiv_id":"2507.03052","last_updated":"2026-04-18T08:43:38Z","snapshot_observed_at":"2026-07-06T21:52:04.633603Z","submitted_at":"2025-07-03T12:17:45Z","title":"From 2:4 to 8:16 sparsity patterns in LLMs for Outliers and Weights with Variance Correction","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-19T05:45:46.354637Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2507.03052"},"observation_digest":"sha256:3f4ba21aeddc9b60764156044bf995e4743f7a8b889b34071ac2724f78b8b1a2","observation_id":"c47f2b99-b8d2-47f0-a23a-a326b70c7a08","resolution":{"observed_at":"2026-05-19T05:47:07.687089Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-08-04T11:24:19.403461Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.05544","last_updated":"2026-06-03T18:20:52Z","snapshot_observed_at":"2026-08-04T16:54:48.294180Z","submitted_at":"2025-10-07T03:07:47Z","title":"Activation-Informed Pareto-Guided Low-Rank Compression for Efficient LLM/VLM","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T11:24:19.403461Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2510.05544"},"observation_digest":"sha256:3b4cc8fbb7939da4f009b419cef75f41c1e44d1018f3453fe66fcf4aa55ebe51","observation_id":"dc117cc0-8f7c-4e3e-94a1-dbcfbac4d388","resolution":{"observed_at":"2026-08-04T11:24:19.403461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-08-03T14:04:34.644179Z","title":"Spqr: A sparse- quantized representation for near-lossless llm weight compression,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.21835","last_updated":"2026-06-23T08:23:09Z","snapshot_observed_at":"2026-08-04T00:22:46.583209Z","submitted_at":"2025-12-26T02:41:18Z","title":"Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T14:04:34.644179Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2512.21835"},"observation_digest":"sha256:c791529d444ec7ff7ac6d5e36194d8d1e58dc27510f110281542a1c725ebba65","observation_id":"8c40f42f-b3c2-42b6-ac17-82841a3ccebe","resolution":{"observed_at":"2026-08-03T14:04:34.644179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-08-03T04:37:26.060146Z","title":"Spqr: A sparse- quantized representation for near-lossless llm weight compression,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.04595","last_updated":"2026-07-22T11:57:18Z","snapshot_observed_at":"2026-08-03T12:20:03.340934Z","submitted_at":"2026-02-04T14:22:08Z","title":"Harmonia: Algorithm-Hardware Co-Design for Memory- and Compute-Efficient BFP-based LLM Inference","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:26.060146Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2602.04595"},"observation_digest":"sha256:acf9c0132ddcfdc19566efb68a167445b78b4e91a198d9868a340a0f6f40fc81","observation_id":"5199e9da-5a26-450e-8ec1-9e215102956d","resolution":{"observed_at":"2026-08-03T04:37:26.060146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-08-02T19:38:56.284753Z","title":"[Online]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.01915","last_updated":"2026-06-02T17:19:21Z","snapshot_observed_at":"2026-08-02T19:38:35.065209Z","submitted_at":"2026-03-02T14:28:48Z","title":"Fast Entropy Decoding for Sparse MVM on GPUs","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T19:38:56.284753Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2603.01915"},"observation_digest":"sha256:4e6138bad07ede90ed74eecbb70ae8784e7bd4ae10a17c4115c8db3198813b0a","observation_id":"56105472-385e-4698-963b-1c5ff359324d","resolution":{"observed_at":"2026-08-02T19:38:56.284753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-07-13T23:28:12.790404Z","title":"Spqr: A sparse-quantized representation for near- lossless llm weight compression","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.16867","last_updated":"2026-06-03T09:37:20Z","snapshot_observed_at":"2026-08-04T17:34:53.201310Z","submitted_at":"2026-03-17T17:59:51Z","title":"Efficient Reasoning on the Edge","version":2},"reference_index":124,"source":"pdf_text","source_observed_at":"2026-07-13T23:28:12.790404Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2603.16867"},"observation_digest":"sha256:a713a37b07394503e49b973099800e1084c9982a04240d717a222950d9fb5008","observation_id":"912358a8-8cba-4513-9622-c2cc17e05a8c","resolution":{"observed_at":"2026-07-13T23:28:12.790404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":"2306.03078","doi":"10.48550/arxiv.2306.03078","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Spqr: A sparse-quantized representation for near-lossless llm weight compression.arXiv preprint arXiv:2306.03078","venue":null,"work_id":"9f122cd0-f5dd-4105-8cf5-cc97759850e8","year":2024},"citing_paper":{"arxiv_id":"2604.06916","last_updated":"2026-04-08T10:14:47Z","snapshot_observed_at":"2026-07-06T22:55:15.791334Z","submitted_at":"2026-04-08T10:14:47Z","title":"FP4 Explore, BF16 Train: Diffusion Reinforcement Learning via Efficient Rollout Scaling","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T18:10:06.994557Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2604.06916"},"observation_digest":"sha256:d6d9becdfa1495abaa0df4bb85a4bb40936a5d044ba16dd35cc65a5441e119d2","observation_id":"d2d37f02-7cb0-4f3a-aed4-d8319b61500f","resolution":{"observed_at":"2026-05-11T05:25:56.668692Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":"2306.03078","doi":"10.48550/arxiv.2306.03078","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Spqr: A sparse-quantized representation for near-lossless llm weight compression.arXiv preprint arXiv:2306.03078","venue":null,"work_id":"9f122cd0-f5dd-4105-8cf5-cc97759850e8","year":2024},"citing_paper":{"arxiv_id":"2604.17104","last_updated":"2026-05-12T19:14:25Z","snapshot_observed_at":"2026-07-06T23:04:14.688737Z","submitted_at":"2026-04-18T18:40:29Z","title":"TStore: Rethinking AI Model Hub with Tensor-Centric Compression","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T06:16:58.389670Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2604.17104"},"observation_digest":"sha256:345b431010f4a6a946d6bbc07aa7f7e966f7692bf2d43c8a6ac0b9bc4087ffaa","observation_id":"23fd9b77-2b6d-4bb9-8ccc-76ff4ee2878d","resolution":{"observed_at":"2026-05-10T06:21:27.081572Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":"2306.03078","doi":"10.48550/arxiv.2306.03078","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Spqr: A sparse-quantized representation for near-lossless llm weight compression.arXiv preprint arXiv:2306.03078","venue":null,"work_id":"9f122cd0-f5dd-4105-8cf5-cc97759850e8","year":2024},"citing_paper":{"arxiv_id":"2604.17104","last_updated":"2026-05-12T19:14:25Z","snapshot_observed_at":"2026-07-06T23:04:14.688737Z","submitted_at":"2026-04-18T18:40:29Z","title":"TStore: Rethinking AI Model Hub with Tensor-Centric Compression","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-14T22:04:16.100009Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2604.17104"},"observation_digest":"sha256:e0bcd3d5af7aa611c3a544f04ddfb3ba6df78185d29bdcfd905c9f523040854a","observation_id":"c9f6c509-6706-40b0-bc7c-e2b5e87c82f6","resolution":{"observed_at":"2026-05-14T22:08:04.731475Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":"2306.03078","doi":"10.48550/arxiv.2306.03078","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Spqr: A sparse-quantized representation for near-lossless llm weight compression.arXiv preprint arXiv:2306.03078","venue":null,"work_id":"9f122cd0-f5dd-4105-8cf5-cc97759850e8","year":2024},"citing_paper":{"arxiv_id":"2604.18556","last_updated":"2026-05-15T09:34:30Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:45:47Z","title":"GSQ: Highly-Accurate Low-Precision Scalar Quantization for LLMs via Gumbel-Softmax Sampling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T05:29:51.182114Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2604.18556"},"observation_digest":"sha256:6e2c3ccbb595ff0c84450a569e69593d6f9e38c6d35f99510063b14334a8946b","observation_id":"c7d73a95-d2fe-4d80-b28c-16bb1f9a002a","resolution":{"observed_at":"2026-05-10T05:36:02.324016Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":"2306.03078","doi":"10.48550/arxiv.2306.03078","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Spqr: A sparse-quantized representation for near-lossless llm weight compression.arXiv preprint arXiv:2306.03078","venue":null,"work_id":"9f122cd0-f5dd-4105-8cf5-cc97759850e8","year":2024},"citing_paper":{"arxiv_id":"2604.18556","last_updated":"2026-05-15T09:34:30Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:45:47Z","title":"GSQ: Highly-Accurate Low-Precision Scalar Quantization for LLMs via Gumbel-Softmax Sampling","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-19T18:01:08.514022Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2604.18556"},"observation_digest":"sha256:04e9081a3a169bc4795bf151cc75c72d7d73a394f3a2a8bf37a0181f39431ec5","observation_id":"137de9a0-079b-43b2-b6ed-fab5d6b3da09","resolution":{"observed_at":"2026-05-19T18:02:42.165210Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":"2306.03078","doi":"10.48550/arxiv.2306.03078","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Spqr: A sparse-quantized representation for near-lossless llm weight compression.arXiv preprint arXiv:2306.03078","venue":null,"work_id":"9f122cd0-f5dd-4105-8cf5-cc97759850e8","year":2024},"citing_paper":{"arxiv_id":"2604.19167","last_updated":"2026-04-21T07:25:02Z","snapshot_observed_at":"2026-07-06T23:05:53.378585Z","submitted_at":"2026-04-21T07:25:02Z","title":"LBLLM: Lightweight Binarization of Large Language Models via Three-Stage Distillation","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-10T03:04:14.900791Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2604.19167"},"observation_digest":"sha256:81be96f352fa9acc8d8cfb592b469686f5443627adc0d9876a350d951bb4bd4a","observation_id":"6e088adb-7b8d-44b9-b8f5-fa52471cfced","resolution":{"observed_at":"2026-05-11T12:46:04.928422Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":"2306.03078","doi":"10.48550/arxiv.2306.03078","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Spqr: A sparse-quantized representation for near-lossless llm weight compression.arXiv preprint arXiv:2306.03078","venue":null,"work_id":"9f122cd0-f5dd-4105-8cf5-cc97759850e8","year":2024},"citing_paper":{"arxiv_id":"2604.19884","last_updated":"2026-04-21T18:03:38Z","snapshot_observed_at":"2026-08-02T02:23:56.450641Z","submitted_at":"2026-04-21T18:03:38Z","title":"From Signal Degradation to Computation Collapse: Uncovering the Two Failure Modes of LLM Quantization","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-10T02:32:50.182859Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2604.19884"},"observation_digest":"sha256:127ddf39315f82c3cf8f13e8af0964137288e9ec6fc16e5fa8c45cda137911c8","observation_id":"dd2d1e82-23ad-468d-8bf9-35cbc370a7c9","resolution":{"observed_at":"2026-05-10T02:38:17.222652Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":"2306.03078","doi":"10.48550/arxiv.2306.03078","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Spqr: A sparse-quantized representation for near-lossless llm weight compression.arXiv preprint arXiv:2306.03078","venue":null,"work_id":"9f122cd0-f5dd-4105-8cf5-cc97759850e8","year":2024},"citing_paper":{"arxiv_id":"2604.20682","last_updated":"2026-04-22T15:31:46Z","snapshot_observed_at":"2026-07-06T23:07:14.243878Z","submitted_at":"2026-04-22T15:31:46Z","title":"Variance Is Not Importance: Structural Analysis of Transformer Compressibility Across Model Scales","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T01:44:42.989053Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2604.20682"},"observation_digest":"sha256:c23612a5ac44809f6700a55143d9eea4b1195a2731a8626ba277c11184325054","observation_id":"402acaad-10c2-44e7-aeb3-3b5d57c70dba","resolution":{"observed_at":"2026-05-11T13:26:04.489349Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":"2306.03078","doi":"10.48550/arxiv.2306.03078","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Spqr: A sparse-quantized representation for near-lossless llm weight compression.arXiv preprint arXiv:2306.03078","venue":null,"work_id":"9f122cd0-f5dd-4105-8cf5-cc97759850e8","year":2024},"citing_paper":{"arxiv_id":"2604.22906","last_updated":"2026-04-24T16:56:53Z","snapshot_observed_at":"2026-07-06T23:09:14.698490Z","submitted_at":"2026-04-24T16:56:53Z","title":"Network Edge Inference for Large Language Models: Principles, Techniques, and Opportunities","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-08T09:45:57.201837Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2604.22906"},"observation_digest":"sha256:38ce06025b5860fa60c06f5bf4c2022f7a50e7a5ce94b1440a40e26915f29b9f","observation_id":"6c94e8d7-3868-43ef-a1ff-2d9524769418","resolution":{"observed_at":"2026-05-11T20:16:10.423526Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":"2306.03078","doi":"10.48550/arxiv.2306.03078","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Spqr: A sparse-quantized representation for near-lossless llm weight compression.arXiv preprint arXiv:2306.03078","venue":null,"work_id":"9f122cd0-f5dd-4105-8cf5-cc97759850e8","year":2024},"citing_paper":{"arxiv_id":"2604.24008","last_updated":"2026-04-27T03:43:29Z","snapshot_observed_at":"2026-07-06T23:10:07.178566Z","submitted_at":"2026-04-27T03:43:29Z","title":"Coverage-Based Calibration for Post-Training Quantization via Weighted Set Cover over Outlier Channels","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T04:35:02.120009Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2604.24008"},"observation_digest":"sha256:711515be0a9d1b947f1bca4c09908a04011dac89267642902e7a00e68e47aaea","observation_id":"04fc6925-320a-4bf0-9578-6fb8c4805269","resolution":{"observed_at":"2026-05-11T21:41:16.276376Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":"2306.03078","doi":"10.48550/arxiv.2306.03078","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Spqr: A sparse-quantized representation for near-lossless llm weight compression.arXiv preprint arXiv:2306.03078","venue":null,"work_id":"9f122cd0-f5dd-4105-8cf5-cc97759850e8","year":2024},"citing_paper":{"arxiv_id":"2604.24273","last_updated":"2026-04-27T10:03:37Z","snapshot_observed_at":"2026-07-06T23:10:20.676482Z","submitted_at":"2026-04-27T10:03:37Z","title":"BitRL: Reinforcement Learning with 1-bit Quantized Language Models for Resource-Constrained Edge Deployment","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T04:23:26.079298Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2604.24273"},"observation_digest":"sha256:f315ebce457972f04d479948cedd8e299c3c4e5ec2c93b4e3d4bf92c5bb5bf56","observation_id":"508720db-69cb-483d-9c1a-ca2eb750e94e","resolution":{"observed_at":"2026-05-11T21:46:42.449581Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":"2306.03078","doi":"10.48550/arxiv.2306.03078","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Spqr: A sparse-quantized representation for near-lossless llm weight compression.arXiv preprint arXiv:2306.03078","venue":null,"work_id":"9f122cd0-f5dd-4105-8cf5-cc97759850e8","year":2024},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:8cccad8f92b9f742c7afb6230b71785bf93779ca509d058d72bc642bdbd8fb77","observation_id":"a31d2bd8-75ae-4446-84fa-f321c3bdd100","resolution":{"observed_at":"2026-05-11T16:36:08.092490Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":"2306.03078","doi":"10.48550/arxiv.2306.03078","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Spqr: A sparse-quantized representation for near-lossless llm weight compression.arXiv preprint arXiv:2306.03078","venue":null,"work_id":"9f122cd0-f5dd-4105-8cf5-cc97759850e8","year":2024},"citing_paper":{"arxiv_id":"2605.06014","last_updated":"2026-05-07T11:11:54Z","snapshot_observed_at":"2026-07-06T23:18:31.432422Z","submitted_at":"2026-05-07T11:11:54Z","title":"Quantizing With Randomized Hadamard Transforms: Efficient Heuristic Now Proven","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-08T14:07:51.451501Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2605.06014"},"observation_digest":"sha256:7057b24e593bc1c01355892c59666814b8f04831693909daa9c8f6a6f69d5e08","observation_id":"7c4972d2-18c2-42e6-84af-5789017e334a","resolution":{"observed_at":"2026-05-11T18:46:08.487611Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":"2306.03078","doi":"10.48550/arxiv.2306.03078","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Spqr: A sparse-quantized representation for near-lossless llm weight compression.arXiv preprint arXiv:2306.03078","venue":null,"work_id":"9f122cd0-f5dd-4105-8cf5-cc97759850e8","year":2024},"citing_paper":{"arxiv_id":"2605.06052","last_updated":"2026-05-07T11:37:52Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T11:37:52Z","title":"XtraMAC: An Efficient MAC Architecture for Mixed-Precision LLM Inference on FPGA","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T04:13:29.486007Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2605.06052"},"observation_digest":"sha256:fd722e2ed8c243148a228b4fed4c32d1b90daf6577aab398b6a7e799613cdea4","observation_id":"1bb94b70-b3d9-4bcb-9d5b-38cb1b382a7c","resolution":{"observed_at":"2026-05-11T21:51:11.301572Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":"2306.03078","doi":"10.48550/arxiv.2306.03078","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Spqr: A sparse-quantized representation for near-lossless llm weight compression.arXiv preprint arXiv:2306.03078","venue":null,"work_id":"9f122cd0-f5dd-4105-8cf5-cc97759850e8","year":2024},"citing_paper":{"arxiv_id":"2605.11222","last_updated":"2026-05-11T20:33:41Z","snapshot_observed_at":"2026-07-06T23:23:06.755816Z","submitted_at":"2026-05-11T20:33:41Z","title":"ADMM-Q: An Improved Hessian-based Weight Quantizer for Post-Training Quantization of Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T02:35:25.946090Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2605.11222"},"observation_digest":"sha256:62ef84e0780eeaf59de1e53556da7790328e63de12ffeea323bda281ff2f9f1e","observation_id":"69fc575c-709f-4493-856f-b0fbb3ae6b16","resolution":{"observed_at":"2026-05-13T02:37:07.849512Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":"2306.03078","doi":"10.48550/arxiv.2306.03078","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Spqr: A sparse-quantized representation for near-lossless llm weight compression.arXiv preprint arXiv:2306.03078","venue":null,"work_id":"9f122cd0-f5dd-4105-8cf5-cc97759850e8","year":2024},"citing_paper":{"arxiv_id":"2605.14844","last_updated":"2026-05-14T13:52:31Z","snapshot_observed_at":"2026-07-06T23:26:13.644646Z","submitted_at":"2026-05-14T13:52:31Z","title":"XFP: Quality-Targeted Adaptive Codebook Quantization with Sparse Outlier Separation for LLM Inference","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-30T21:28:36.358474Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2605.14844"},"observation_digest":"sha256:ac97e18fd19e229814d63f25787d3b0b5605857b8a8735458e045afc28897e88","observation_id":"25a9cd37-c230-48c1-898e-23fd8e314672","resolution":{"observed_at":"2026-06-30T21:35:04.693173Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":"2306.03078","doi":"10.48550/arxiv.2306.03078","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Spqr: A sparse-quantized representation for near-lossless llm weight compression.arXiv preprint arXiv:2306.03078","venue":null,"work_id":"9f122cd0-f5dd-4105-8cf5-cc97759850e8","year":2024},"citing_paper":{"arxiv_id":"2605.17745","last_updated":"2026-05-18T01:56:12Z","snapshot_observed_at":"2026-08-02T20:09:39.867939Z","submitted_at":"2026-05-18T01:56:12Z","title":"StatQAT: Statistical Quantizer Optimization for Deep Networks","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-20T01:20:06.033991Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2605.17745"},"observation_digest":"sha256:2aef3ac389f58e96fd68a80ec17d9aa954b9be2a6b03eeb6fca009d1cbad4a35","observation_id":"525299f0-dde1-4505-bead-c2e73308cb40","resolution":{"observed_at":"2026-05-20T01:22:55.766489Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":"2306.03078","doi":"10.48550/arxiv.2306.03078","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Spqr: A sparse-quantized representation for near-lossless llm weight compression.arXiv preprint arXiv:2306.03078","venue":null,"work_id":"9f122cd0-f5dd-4105-8cf5-cc97759850e8","year":2024},"citing_paper":{"arxiv_id":"2605.19929","last_updated":"2026-05-19T14:49:57Z","snapshot_observed_at":"2026-08-02T05:44:37.705586Z","submitted_at":"2026-05-19T14:49:57Z","title":"Breaking Modality Heterogeneity in Low-Bit Quantization for Large Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T05:20:45.264341Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2605.19929"},"observation_digest":"sha256:714b31e70839015398572964489afafed054e2876df27794d23126301a3f1ba1","observation_id":"7f9f3ad1-5da1-465e-8b40-aa5a0d1a5d26","resolution":{"observed_at":"2026-05-20T05:23:03.685044Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":"2306.03078","doi":"10.48550/arxiv.2306.03078","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Spqr: A sparse-quantized representation for near-lossless llm weight compression.arXiv preprint arXiv:2306.03078","venue":null,"work_id":"9f122cd0-f5dd-4105-8cf5-cc97759850e8","year":2024},"citing_paper":{"arxiv_id":"2605.20193","last_updated":"2026-04-04T04:50:03Z","snapshot_observed_at":"2026-08-02T04:22:19.625757Z","submitted_at":"2026-04-04T04:50:03Z","title":"Improving Quantized Model Performance in Qualitative Analysis with Multi-Pass Prompt Verification","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T09:35:10.701255Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2605.20193"},"observation_digest":"sha256:b7eb4350016d104d65efc364799abfbd870e8fd6e095c95529a5f281faa714c6","observation_id":"d74e7e15-7d25-4983-b79c-95b16e64e007","resolution":{"observed_at":"2026-05-21T09:39:57.649753Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":"2306.03078","doi":"10.48550/arxiv.2306.03078","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Spqr: A sparse-quantized representation for near-lossless llm weight compression.arXiv preprint arXiv:2306.03078","venue":null,"work_id":"9f122cd0-f5dd-4105-8cf5-cc97759850e8","year":2024},"citing_paper":{"arxiv_id":"2605.23078","last_updated":"2026-05-21T22:23:38Z","snapshot_observed_at":"2026-08-02T10:30:48.658412Z","submitted_at":"2026-05-21T22:23:38Z","title":"GEMQ: Global Expert-Level Mixed-Precision Quantization for MoE LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-25T05:33:06.719954Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2605.23078"},"observation_digest":"sha256:412c40049c43b26b8d941e582cfde215150ca31dd93693ed596a0ce3716712ae","observation_id":"6785d84f-8a65-4c56-840b-839f7360b804","resolution":{"observed_at":"2026-05-25T05:36:39.947415Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":"2306.03078","doi":"10.48550/arxiv.2306.03078","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Spqr: A sparse-quantized representation for near-lossless llm weight compression.arXiv preprint arXiv:2306.03078","venue":null,"work_id":"9f122cd0-f5dd-4105-8cf5-cc97759850e8","year":2024},"citing_paper":{"arxiv_id":"2605.24011","last_updated":"2026-06-04T20:07:22Z","snapshot_observed_at":"2026-08-01T12:29:34.981172Z","submitted_at":"2026-05-19T19:57:26Z","title":"ActQuant: Sub-4-bit Action-Guided Quantization for Vision-Language-Action Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T17:54:56.386488Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2605.24011"},"observation_digest":"sha256:6c867a413ecbb8238c2f4c3c5fe8e415098cf08860f004bdd4d399d22b3cebc6","observation_id":"1024fff2-658c-4bfd-af25-aaae7e16e62a","resolution":{"observed_at":"2026-07-01T15:05:47.964211Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":"2306.03078","doi":"10.48550/arxiv.2306.03078","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Spqr: A sparse-quantized representation for near-lossless llm weight compression.arXiv preprint arXiv:2306.03078","venue":null,"work_id":"9f122cd0-f5dd-4105-8cf5-cc97759850e8","year":2024},"citing_paper":{"arxiv_id":"2606.01412","last_updated":"2026-05-31T19:17:39Z","snapshot_observed_at":"2026-08-03T03:34:13.453285Z","submitted_at":"2026-05-31T19:17:39Z","title":"GPTQ-intrinsic LoRA: A Near-optimal Algorithm for Low-precision Quantization with Low-rank Adaptation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T17:28:14.160341Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2606.01412"},"observation_digest":"sha256:ae8073079b6b70b2f918e1a49980c12fd43cac46942775d0cce05f6d515ffc8c","observation_id":"502cb8de-5919-4714-b595-88ad5a0b764c","resolution":{"observed_at":"2026-07-01T21:06:14.443665Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":"2306.03078","doi":"10.48550/arxiv.2306.03078","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Spqr: A sparse-quantized representation for near-lossless llm weight compression.arXiv preprint arXiv:2306.03078","venue":null,"work_id":"9f122cd0-f5dd-4105-8cf5-cc97759850e8","year":2024},"citing_paper":{"arxiv_id":"2606.03328","last_updated":"2026-07-30T06:41:18Z","snapshot_observed_at":"2026-08-02T23:18:01.472395Z","submitted_at":"2026-06-02T08:38:14Z","title":"Averaged Evaluation Masks Capability Trade-Offs: Multi-Source Calibration for High-Sparsity LLM Pruning","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-28T11:27:02.902720Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2606.03328"},"observation_digest":"sha256:4b91904633b841561b06883fbc59e360c74a8e9e979e4d9b14b6901a9871b572","observation_id":"717bb3ab-73a8-48f7-8b9e-9643b389c5e3","resolution":{"observed_at":"2026-07-02T01:56:27.563117Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":"2306.03078","doi":"10.48550/arxiv.2306.03078","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Spqr: A sparse-quantized representation for near-lossless llm weight compression.arXiv preprint arXiv:2306.03078","venue":null,"work_id":"9f122cd0-f5dd-4105-8cf5-cc97759850e8","year":2024},"citing_paper":{"arxiv_id":"2606.04032","last_updated":"2026-06-04T17:08:43Z","snapshot_observed_at":"2026-07-06T23:44:14.261541Z","submitted_at":"2026-06-01T20:59:05Z","title":"Do Transformers Need Three Projections? Systematic Study of QKV Variants","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-06-28T15:14:49.475561Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2606.04032"},"observation_digest":"sha256:8a6468edef8c1aa996c2e9e4aca76da763ffed060d66da64a52b81eae7101cf9","observation_id":"3ee4bc38-d30c-49f2-ad35-d4906aae8c83","resolution":{"observed_at":"2026-07-01T22:36:17.239860Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":"2306.03078","doi":"10.48550/arxiv.2306.03078","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Spqr: A sparse-quantized representation for near-lossless llm weight compression.arXiv preprint arXiv:2306.03078","venue":null,"work_id":"9f122cd0-f5dd-4105-8cf5-cc97759850e8","year":2024},"citing_paper":{"arxiv_id":"2606.04349","last_updated":"2026-06-05T07:15:28Z","snapshot_observed_at":"2026-08-03T07:13:29.397921Z","submitted_at":"2026-06-03T02:05:10Z","title":"MorphoQuant: Modality-Aware Quantization for Omni-modal Large Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T07:16:45.665440Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2606.04349"},"observation_digest":"sha256:3f5841954878699428bf64581d9e7bf1e719248c8ab03faaf9463a5c39a1e97a","observation_id":"1e05ef26-205f-4fbf-bf74-2ac4256e16f8","resolution":{"observed_at":"2026-07-02T06:56:44.617007Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":"2306.03078","doi":"10.48550/arxiv.2306.03078","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Spqr: A sparse-quantized representation for near-lossless llm weight compression.arXiv preprint arXiv:2306.03078","venue":null,"work_id":"9f122cd0-f5dd-4105-8cf5-cc97759850e8","year":2024},"citing_paper":{"arxiv_id":"2606.06060","last_updated":"2026-06-04T11:59:56Z","snapshot_observed_at":"2026-08-01T13:46:09.792396Z","submitted_at":"2026-06-04T11:59:56Z","title":"ReCache: Learning Budget-Aware Caching Schedules for Diffusion Models via REINFORCE","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T02:09:44.280357Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2606.06060"},"observation_digest":"sha256:cb4fa9e2e55a72074c67d7610ba7dd05fc11d157e2deddee6d61fb96bc0f1644","observation_id":"f96606f8-32f2-469f-be75-f20943798333","resolution":{"observed_at":"2026-07-02T12:26:56.437227Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":"2306.03078","doi":"10.48550/arxiv.2306.03078","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Spqr: A sparse-quantized representation for near-lossless llm weight compression.arXiv preprint arXiv:2306.03078","venue":null,"work_id":"9f122cd0-f5dd-4105-8cf5-cc97759850e8","year":2024},"citing_paper":{"arxiv_id":"2606.09864","last_updated":"2026-06-01T02:02:20Z","snapshot_observed_at":"2026-08-03T01:43:21.917246Z","submitted_at":"2026-06-01T02:02:20Z","title":"Alignment Collapse Under KV Cache Quantization: Diagnosis and Mitigation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-28T15:37:34.129339Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2606.09864"},"observation_digest":"sha256:89abe22e64aba1e8d131b56844e137e308ba919e66f93d1233b178c9d77dbaca","observation_id":"4c7493ab-d888-45ef-b06e-f4f834f5e3da","resolution":{"observed_at":"2026-07-01T22:16:15.998711Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":"2306.03078","doi":"10.48550/arxiv.2306.03078","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Spqr: A sparse-quantized representation for near-lossless llm weight compression.arXiv preprint arXiv:2306.03078","venue":null,"work_id":"9f122cd0-f5dd-4105-8cf5-cc97759850e8","year":2024},"citing_paper":{"arxiv_id":"2606.13054","last_updated":"2026-06-11T08:37:20Z","snapshot_observed_at":"2026-07-06T23:51:55.044440Z","submitted_at":"2026-06-11T08:37:20Z","title":"TWLA: Achieving Ternary Weights and Low-Bit Activations for LLMs via Post-Training Quantization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T07:37:59.122704Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2606.13054"},"observation_digest":"sha256:25cc654db998705c388e2863ceb0d3d54b5fc8daa7f0aa402c1d0d61d0eee300","observation_id":"fc55f228-6f35-4346-95aa-4801b5f1abe8","resolution":{"observed_at":"2026-07-03T13:48:20.625511Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":"2306.03078","doi":"10.48550/arxiv.2306.03078","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Spqr: A sparse-quantized representation for near-lossless llm weight compression.arXiv preprint arXiv:2306.03078","venue":null,"work_id":"9f122cd0-f5dd-4105-8cf5-cc97759850e8","year":2024},"citing_paper":{"arxiv_id":"2606.23406","last_updated":"2026-06-22T14:30:47Z","snapshot_observed_at":"2026-07-06T23:58:07.236199Z","submitted_at":"2026-06-22T14:30:47Z","title":"HyperQuant: A Rate-Distortion-Optimal Quantization Pipeline for Large Language and Diffusion Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T08:46:01.500880Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2606.23406"},"observation_digest":"sha256:d02f6acc4329abacbb7691bdc83b5b1f83bfaadf807a4c23840a14a9b11e9485","observation_id":"e9202480-a0cc-4eb9-b907-2e86d001c1fb","resolution":{"observed_at":"2026-07-04T10:29:45.520230Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":"2306.03078","doi":"10.48550/arxiv.2306.03078","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Spqr: A sparse-quantized representation for near-lossless llm weight compression.arXiv preprint arXiv:2306.03078","venue":null,"work_id":"9f122cd0-f5dd-4105-8cf5-cc97759850e8","year":2024},"citing_paper":{"arxiv_id":"2607.02461","last_updated":"2026-07-02T17:27:34Z","snapshot_observed_at":"2026-08-02T16:58:40.309745Z","submitted_at":"2026-07-02T17:27:34Z","title":"OrbitQuant: Data-Agnostic Quantization for Image and Video Diffusion Transformers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-03T14:56:10.553212Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2607.02461"},"observation_digest":"sha256:04c94cf325a502ca84c48f51eeddb1a31c9b01602a3c23a85546e76190863e81","observation_id":"0be784fa-4d15-4337-ba3b-dc65e0879361","resolution":{"observed_at":"2026-07-03T14:58:32.414192Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-07-12T09:50:23.266920Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02574","last_updated":"2026-06-30T16:12:40Z","snapshot_observed_at":"2026-07-12T09:50:22.497230Z","submitted_at":"2026-06-30T16:12:40Z","title":"From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-12T09:50:23.266920Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2607.02574"},"observation_digest":"sha256:ce95d6f0ebe34cf454f4e28af4f7b83e56be5e8200af10df84b4a4c92567a5f9","observation_id":"1608e6ca-b4d6-4e66-970f-76d12497b53a","resolution":{"observed_at":"2026-07-12T09:50:23.266920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-07-14T08:45:52.855783Z","title":"arXiv preprint arXiv:2306.03078 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10855","last_updated":"2026-07-12T17:39:09Z","snapshot_observed_at":"2026-08-03T20:11:14.002088Z","submitted_at":"2026-07-12T17:39:09Z","title":"Reliability Scaling Laws for Quantized Large Language Models","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-07-14T08:45:52.855783Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2607.10855"},"observation_digest":"sha256:d0c86dbab24808bb2444024d7c703e6617811deb7720e775f5d8bcd116d6d06d","observation_id":"985908c5-d4d4-4e43-a1c3-239b203a1eea","resolution":{"observed_at":"2026-07-14T08:45:52.855783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-08-02T03:55:40.314783Z","title":"Spqr: A sparse-quantized representation for near-lossless llm weight compression.arXiv preprint arXiv:2306.03078,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13735","last_updated":"2026-07-17T08:40:24Z","snapshot_observed_at":"2026-08-02T03:55:39.332940Z","submitted_at":"2026-07-15T11:47:24Z","title":"Constraint-Driven Model Optimization: An Industry Framework for Selecting Compression and Acceleration Techniques in Modern Machine Learning Systems","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T03:55:40.314783Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2607.13735"},"observation_digest":"sha256:23b11a0e5db68df6124fd49b3b67daf0a719462ad29cfe9bd496baa2465759e3","observation_id":"c93a4183-b56e-4ef5-ab2f-0cba141bdf49","resolution":{"observed_at":"2026-08-02T03:55:40.314783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-08-01T21:09:06.957974Z","title":"SpQR: A sparse-quantized representation for near-lossless LLM weight compression, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16184","last_updated":"2026-07-17T17:58:29Z","snapshot_observed_at":"2026-08-04T04:46:38.301479Z","submitted_at":"2026-07-17T17:58:29Z","title":"PagedWeight: Efficient MoE LLM Serving with Dynamic Quality-Aware Weight Quantization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T21:09:06.957974Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2607.16184"},"observation_digest":"sha256:5b16c1e76c3e89e917ea0d065df37153e692961b49579408a0a6a8f70708aa1e","observation_id":"2c55b6ea-52d1-422e-b93f-4f07719a5c3a","resolution":{"observed_at":"2026-08-01T21:09:06.957974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2306.03078/citation-record","integrity":"/paper/2306.03078/integrity","json":"/paper/2306.03078/citation-record.json","paper":"/paper/2306.03078"},"outbound":[],"paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 42 inbound Pith citation observations for arXiv:2306.03078."}