{"as_of":"2026-08-14T06:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:05872712cadbb43a5ae58b43bbb971705bbc777a7af36b1f24f93acf49419ad0","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T12:22:39.003914Z","state":"measured"},{"denominator":77,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":77,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T00:38:48.606027Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T12:59:52.356456Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14363","snapshot_observed_at":"2026-08-11T00:38:48.606027Z","title":"Resq: Mixed- precision quantization of large language models with low-rank residuals,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19442","last_updated":"2025-07-30T05:24:46Z","snapshot_observed_at":"2026-08-11T00:33:34.388194Z","submitted_at":"2024-12-27T04:17:57Z","title":"A Survey on Large Language Model Acceleration based on KV Cache Management","version":3},"reference_index":182,"source":"pdf_text","source_observed_at":"2026-08-11T00:38:48.606027Z"},"links":{"cited_paper":"/paper/2412.14363","citing_paper":"/paper/2412.19442"},"observation_digest":"sha256:f8cf315dbe95a5e24739f6e99fb36a002dad95eaa24cca842b1ab1e3ad1157ba","observation_id":"0989df39-3651-4f1f-b73d-8a0fd835d447","resolution":{"observed_at":"2026-08-11T00:38:48.606027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14363","snapshot_observed_at":"2026-08-10T14:54:22.698198Z","title":"Resq: Mixed-precision quantization of large language models with low-rank residuals","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16383","last_updated":"2025-02-02T03:04:54Z","snapshot_observed_at":"2026-08-12T06:09:48.327480Z","submitted_at":"2025-01-25T01:45:29Z","title":"RotateKV: Accurate and Robust 2-Bit KV Cache Quantization for LLMs via Outlier-Aware Adaptive Rotations","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-10T14:54:22.698198Z"},"links":{"cited_paper":"/paper/2412.14363","citing_paper":"/paper/2501.16383"},"observation_digest":"sha256:14c45b0b9db2a3f07017a00dea21c0bb95994c1ab36d2801859ab86ace78f2f8","observation_id":"9354d518-b538-432f-b321-777feba70eff","resolution":{"observed_at":"2026-08-10T14:54:22.698198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14363","snapshot_observed_at":"2026-08-03T11:10:52.707779Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.07475","last_updated":"2026-07-04T06:36:53Z","snapshot_observed_at":"2026-08-09T09:37:24.448153Z","submitted_at":"2026-01-12T12:27:22Z","title":"ARCQuant: Boosting NVFP4 Quantization with Augmented Residual Channels for LLMs","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-03T11:10:52.707779Z"},"links":{"cited_paper":"/paper/2412.14363","citing_paper":"/paper/2601.07475"},"observation_digest":"sha256:bc069e7d5cd50a282df533a29587cdf999ed1abcaa140c10ddcf71225597dfe3","observation_id":"db04ed1b-9a1f-47cd-889a-6f9c31fb8190","resolution":{"observed_at":"2026-08-03T11:10:52.707779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"cited_work":{"arxiv_id":"2412.14363","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.14363","snapshot_observed_at":"2026-07-04T12:59:52.356456Z","title":"Mixed-Precision Quantization of Large Language Models","venue":null,"work_id":"9970dc39-d908-43e1-846b-0b18a85ac0ab","year":2025},"citing_paper":{"arxiv_id":"2604.20682","last_updated":"2026-04-22T15:31:46Z","snapshot_observed_at":"2026-08-11T14:45:44.788372Z","submitted_at":"2026-04-22T15:31:46Z","title":"Variance Is Not Importance: Structural Analysis of Transformer Compressibility Across Model Scales","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T01:44:42.989053Z"},"links":{"cited_paper":"/paper/2412.14363","citing_paper":"/paper/2604.20682"},"observation_digest":"sha256:4355b8548c570308c7efb13ac1a18b08ac5241c16b643ca9c9a232daad162262","observation_id":"203c50dc-9625-4f66-a193-588f56647cd9","resolution":{"observed_at":"2026-05-11T13:26:04.544270Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"cited_work":{"arxiv_id":"2412.14363","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.14363","snapshot_observed_at":"2026-07-04T12:59:52.356456Z","title":"Mixed-Precision Quantization of Large Language Models","venue":null,"work_id":"9970dc39-d908-43e1-846b-0b18a85ac0ab","year":2025},"citing_paper":{"arxiv_id":"2606.04115","last_updated":"2026-07-14T14:04:32Z","snapshot_observed_at":"2026-08-02T05:34:23.902031Z","submitted_at":"2026-06-02T18:23:20Z","title":"dMX: Differentiable Mixed-Precision Assignment for Low-Precision Floating-Point Formats","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T11:20:06.292977Z"},"links":{"cited_paper":"/paper/2412.14363","citing_paper":"/paper/2606.04115"},"observation_digest":"sha256:5cae53f47439ebd56a8a369efb8d386512b9e3d80f3d4bd8293403670d987b39","observation_id":"2fa022f9-b499-44ef-8a7c-376882dc0c21","resolution":{"observed_at":"2026-07-02T02:06:26.105639Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14363","snapshot_observed_at":"2026-07-15T10:56:54.155632Z","title":"ResQ: Mixed-precision quan- tization of large language models with low-rank residuals.arXiv preprint arXiv:2412.14363, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.04115","last_updated":"2026-07-14T14:04:32Z","snapshot_observed_at":"2026-08-02T05:34:23.902031Z","submitted_at":"2026-06-02T18:23:20Z","title":"dMX: Differentiable Mixed-Precision Assignment for Low-Precision Floating-Point Formats","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-15T10:56:54.155632Z"},"links":{"cited_paper":"/paper/2412.14363","citing_paper":"/paper/2606.04115"},"observation_digest":"sha256:ea078d6d435009f8c2900a52017474b472aff0ba21a68612179e4e53d23740fc","observation_id":"74e42f0f-80a9-4853-899d-dc176c6a364d","resolution":{"observed_at":"2026-07-15T10:56:54.155632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"cited_work":{"arxiv_id":"2412.14363","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.14363","snapshot_observed_at":"2026-07-04T12:59:52.356456Z","title":"Mixed-Precision Quantization of Large Language Models","venue":null,"work_id":"9970dc39-d908-43e1-846b-0b18a85ac0ab","year":2025},"citing_paper":{"arxiv_id":"2606.12876","last_updated":"2026-06-11T04:06:02Z","snapshot_observed_at":"2026-08-02T07:08:48.372955Z","submitted_at":"2026-06-11T04:06:02Z","title":"Multi-Bitwidth Quantization for LLMs Using Additive Codebooks","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-06-27T07:29:14.923431Z"},"links":{"cited_paper":"/paper/2412.14363","citing_paper":"/paper/2606.12876"},"observation_digest":"sha256:280e4cc3d176952817d58aaee3c61bb7be110d49de13d49cdbc403ad6fd513b6","observation_id":"76203019-c512-4b06-928c-48c9af433a7d","resolution":{"observed_at":"2026-07-03T13:48:21.307051Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"cited_work":{"arxiv_id":"2412.14363","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.14363","snapshot_observed_at":"2026-07-04T12:59:52.356456Z","title":"Mixed-Precision Quantization of Large Language Models","venue":null,"work_id":"9970dc39-d908-43e1-846b-0b18a85ac0ab","year":2025},"citing_paper":{"arxiv_id":"2606.26587","last_updated":"2026-06-25T04:19:04Z","snapshot_observed_at":"2026-08-02T10:04:20.542320Z","submitted_at":"2026-06-25T04:19:04Z","title":"SharQ: Bridging Activation Sparsity and FP4 Quantization for LLM Inference","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-26T05:41:39.052865Z"},"links":{"cited_paper":"/paper/2412.14363","citing_paper":"/paper/2606.26587"},"observation_digest":"sha256:17170066b8d88655474478fce889047e489a2730152a9467e6668e87aad36c75","observation_id":"0c189f19-d0d7-4bf7-96ca-0de477a6d0e3","resolution":{"observed_at":"2026-07-04T12:59:52.357889Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14363","snapshot_observed_at":"2026-08-01T03:16:46.892829Z","title":"Resq: Mixed-precision quantization of large language models with low-rank residuals,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27694","last_updated":"2026-07-30T05:26:20Z","snapshot_observed_at":"2026-08-08T17:55:34.075087Z","submitted_at":"2026-07-30T05:26:20Z","title":"GyRot: Leveraging Hidden Synergy between Rotation and Fine-grained Group Quantization for Low-bit LLM Inference","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T03:16:46.892829Z"},"links":{"cited_paper":"/paper/2412.14363","citing_paper":"/paper/2607.27694"},"observation_digest":"sha256:197fefa85b181c10236f113f7ccb1de699b31c10ebf39315b3498ab95c4df68b","observation_id":"040d99fe-e452-4a6e-8205-a5dc4e315599","resolution":{"observed_at":"2026-08-01T03:16:46.892829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.14363/citation-record","integrity":"/paper/2412.14363/integrity","json":"/paper/2412.14363/citation-record.json","paper":"/paper/2412.14363"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.15024","last_updated":"2024-02-09T17:59:40Z","snapshot_observed_at":"2026-08-13T04:33:54.170151Z","submitted_at":"2024-01-26T17:35:45Z","title":"SliceGPT: Compress Large Language Models by Deleting Rows and Columns","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15024","snapshot_observed_at":"2026-08-11T12:22:38.755084Z","title":"L., Nascimento, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.755084Z"},"links":{"cited_paper":"/paper/2401.15024","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:b8192a20a6930d33467af7237ba945830690e2720aac8760726dc2dd449232c2","observation_id":"fda058dc-91e5-4449-8546-40e713c32df8","resolution":{"observed_at":"2026-08-11T12:22:38.755084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:38.760201Z","title":"QUIK : Towards end-to-end 4-bit inference on generative large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.760201Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:30f65eea85fb70100fad432c2fd375c82b5c14672b0d9ee3f7a184ec04c5e4c6","observation_id":"98d6d846-a6bf-4649-8968-14bffd0b998c","resolution":{"observed_at":"2026-08-11T12:22:38.760201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00456","last_updated":"2024-10-29T11:09:12Z","snapshot_observed_at":"2026-08-13T00:40:50.161960Z","submitted_at":"2024-03-30T19:20:06Z","title":"QuaRot: Outlier-Free 4-Bit Inference in Rotated LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00456","snapshot_observed_at":"2026-08-11T12:22:38.763953Z","title":"L., Li, B., Cameron, P., Jaggi, M., Alistarh, D., Hoefler, T., and Hensman, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.763953Z"},"links":{"cited_paper":"/paper/2404.00456","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:0a0e6c873461391b76b9454839a80f474943ec2501743ebfb9e87dee336ae007","observation_id":"29ebbb2a-601c-4599-8f5c-79cef0d22026","resolution":{"observed_at":"2026-08-11T12:22:38.763953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:38.768700Z","title":"L ong B ench: A bilingual, multitask benchmark for long context understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.768700Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:a3b04dcf0522ab727ec575808d80f15fe23da8f8af3328dddb5d493b5cc6d1c1","observation_id":"0cf70a50-b769-449d-a644-eacf1bbe934c","resolution":{"observed_at":"2026-08-11T12:22:38.768700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:39.906342Z","title":"PIQA : Reasoning about physical commonsense in natural language","venue":null,"work_id":"530325d7-eb12-4b5b-8096-308a895706b4","year":2020},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.772381Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:bc07d774a157cb573ce95f992c03416f76a23676415b51b669197520732841d1","observation_id":"4906daad-b726-4035-baa8-4ed936460af0","resolution":{"observed_at":"2026-08-11T12:22:39.910642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-08-12T23:11:46.275639Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-08-11T12:22:38.776013Z","title":"S., and Wu, K.-C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.776013Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:69d39acb5fe85fe1c7255d41290e3e60add86027a2b5070ef4bcdcfe42aa4908","observation_id":"323c0ab9-4f1b-4b74-ad4e-9bb33b0d543a","resolution":{"observed_at":"2026-08-11T12:22:38.776013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:39.895197Z","title":null,"venue":null,"work_id":"e3bec6ed-3741-4626-a4bd-e5815d262af3","year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.780084Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:70d7cbcdf48a470f040d24716609eb7983cebda8716bb2579375f59b07a94e55","observation_id":"73f4de28-cf69-4dbd-9b85-e5de4284169e","resolution":{"observed_at":"2026-08-11T12:22:39.899036Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.06085","last_updated":"2018-07-17T07:33:19Z","snapshot_observed_at":"2026-07-06T06:39:21.688392Z","submitted_at":"2018-05-16T01:19:43Z","title":"PACT: Parameterized Clipping Activation for Quantized Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.06085","snapshot_observed_at":"2026-08-11T12:22:38.783535Z","title":"I.-J., Srinivasan, V., and Gopalakrishnan, K","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.783535Z"},"links":{"cited_paper":"/paper/1805.06085","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:b1e00912cd6b2f42890d9c2dc4f22d5076ccf6f032146f40e0efa2d899dd9858","observation_id":"ea7bf735-f1ff-4498-b177-db544f4e548b","resolution":{"observed_at":"2026-08-11T12:22:38.783535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-07-06T07:55:12.121264Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-08-11T12:22:38.787784Z","title":"Boolq: Exploring the surprising difficulty of natural yes/no questions","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.787784Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:ee3f55e4c4a8493f07a553721ef8c38e015dc8ebbed49ea4255444c12ac03ebb","observation_id":"b5a31317-a4a4-42c1-a1c2-c64253763a13","resolution":{"observed_at":"2026-08-11T12:22:38.787784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-11T12:22:38.792466Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.792466Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:31e356a846840f2cf079a1f9944a8440315413c92832a9df216f9d650267263e","observation_id":"888b947e-c520-44d0-b28f-42183e4f8769","resolution":{"observed_at":"2026-08-11T12:22:38.792466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-11T12:22:38.796468Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.796468Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:0e9ca952b05247ab60a6dbd1ecdda78800e11e0f2cb6378722107ede8bc2d838","observation_id":"ca9a8a28-4d9b-4d4c-9079-ec3c659ea1e0","resolution":{"observed_at":"2026-08-11T12:22:38.796468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:38.800077Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.800077Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:e49c33da289ea6a07bcc656d15db14d865dc323fbcaf85f256133d7fa1bdcd0b","observation_id":"9735236a-e432-4f9c-a318-640e13cfae42","resolution":{"observed_at":"2026-08-11T12:22:38.800077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-08-13T11:24:04.469181Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-08-11T12:22:38.803446Z","title":"SpQR : A sparse-quantized representation for near-lossless llm weight compression","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.803446Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:62237a11c5399e735e8d083c8f7f355653708b57353c39f86d6d6eed2d039202","observation_id":"fa5ce59d-3650-4b85-9f2b-1675639fee9f","resolution":{"observed_at":"2026-08-11T12:22:38.803446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04643","last_updated":"2024-04-12T13:00:25Z","snapshot_observed_at":"2026-08-13T07:57:53.919816Z","submitted_at":"2024-03-07T16:42:37Z","title":"QAQ: Quality Adaptive Quantization for LLM KV Cache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04643","snapshot_observed_at":"2026-08-11T12:22:38.806973Z","title":"QAQ : Quality adaptive quantization for llm kv cache","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.806973Z"},"links":{"cited_paper":"/paper/2403.04643","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:4799db9db27358ebb2cebb2d6bb4a91498eff29d6dc15da02dc410cf855ee73c","observation_id":"bd55bf82-363b-46c6-ba82-1cd0ece397af","resolution":{"observed_at":"2026-08-11T12:22:38.806973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06118","last_updated":"2024-09-11T07:48:26Z","snapshot_observed_at":"2026-08-13T04:44:21.410224Z","submitted_at":"2024-01-11T18:54:44Z","title":"Extreme Compression of Large Language Models via Additive Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06118","snapshot_observed_at":"2026-08-11T12:22:38.810656Z","title":"Extreme compression of large language models via additive quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.810656Z"},"links":{"cited_paper":"/paper/2401.06118","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:7e43357ee272b84fd20bb334c9b77444cf0ac96e999a66d9055ee8e0789f4c70","observation_id":"012ecf26-b6d9-431e-96fb-17a1f35b1b75","resolution":{"observed_at":"2026-08-11T12:22:38.810656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-11T21:19:33.078277Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-11T12:22:38.814251Z","title":"GPTQ : Accurate post-training quantization for generative pre-trained transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.814251Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:cb75e43aa187d65fb520973b576d6805ef2576c85eb51a24853021edd73716c8","observation_id":"0300c697-a7cb-4e93-808d-7971eda845a7","resolution":{"observed_at":"2026-08-11T12:22:38.814251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:38.817747Z","title":"A framework for few-shot language model evaluation, 07 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.817747Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:47cc3888c99254129ef80d71ce153d40709cba33729e4a846d87e6ee1240441a","observation_id":"9320ed35-7913-479d-8256-8bc779be1619","resolution":{"observed_at":"2026-08-11T12:22:38.817747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:38.821257Z","title":"W., and Keutzer, K","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.821257Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:e1b911d16e51f1ae4deb2b8a76d24c9cbc1300a03cdb1b29b339a9d26bb44487","observation_id":"98a1aaa1-5cee-4e4c-b7d6-b28d76ef90f9","resolution":{"observed_at":"2026-08-11T12:22:38.821257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.12237","last_updated":"2019-11-29T09:55:22Z","snapshot_observed_at":"2026-08-13T20:30:00.884929Z","submitted_at":"2019-11-27T15:54:55Z","title":"SAMSum Corpus: A Human-annotated Dialogue Dataset for Abstractive Summarization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.12237","snapshot_observed_at":"2026-08-11T12:22:38.824457Z","title":"SAMSum corpus: A human-annotated dialogue dataset for abstractive summarization","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.824457Z"},"links":{"cited_paper":"/paper/1911.12237","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:da53928bedbd3817b2ab2b34c7705596aef0b9c9d8421e4541d1cbe0d19d65d5","observation_id":"a187354c-1988-4510-bcea-69d363d219c8","resolution":{"observed_at":"2026-08-11T12:22:38.824457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:39.870995Z","title":"APTQ : Attention-aware post-training mixed-precision quantization for large language models","venue":null,"work_id":"6a23c262-b502-4ba4-94a3-f4355b46b921","year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.828156Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:6524ca8c3068d3b0e95eade906ce7d9e8f82c91175b4482c4d176a249e2d6130","observation_id":"b491a92e-362b-4c19-8fb1-d7eee7902bd1","resolution":{"observed_at":"2026-08-11T12:22:39.874845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14256","last_updated":"2024-05-23T07:37:16Z","snapshot_observed_at":"2026-08-13T09:14:24.407578Z","submitted_at":"2024-05-23T07:37:16Z","title":"ZipCache: Accurate and Efficient KV Cache Quantization with Salient Token Identification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14256","snapshot_observed_at":"2026-08-11T12:22:38.831351Z","title":"ZipCache : Accurate and efficient kv cache quantization with salient token identification","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.831351Z"},"links":{"cited_paper":"/paper/2405.14256","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:2ab4f7cac75f0372d38f8ef1651d731a0d637d47dee74a991b6a47ea0b4fa495","observation_id":"eb1cb692-bfda-4467-89e1-2f8988c49a39","resolution":{"observed_at":"2026-08-11T12:22:38.831351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:38.835297Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.835297Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:f9fc9029727f6575ed7dd07f6c53aceb1f8623f6989d2df40568fc095cfd2bc7","observation_id":"85af2621-dfc3-414b-8eb8-47ee1a297c0f","resolution":{"observed_at":"2026-08-11T12:22:38.835297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-13T04:29:50.330115Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-11T12:22:38.838579Z","title":"W., Shao, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.838579Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:f5ac05deb52ff427cb37e9a5dd5556cdd34ba3ae28e7f1cdbde7917defc456ba","observation_id":"6aab0856-dddc-441b-bce0-76553e2988e1","resolution":{"observed_at":"2026-08-11T12:22:38.838579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14917","last_updated":"2025-05-25T08:58:37Z","snapshot_observed_at":"2026-08-12T23:59:39.093057Z","submitted_at":"2024-05-23T16:21:48Z","title":"SliM-LLM: Salience-Driven Mixed-Precision Quantization for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14917","snapshot_observed_at":"2026-08-11T12:22:38.842294Z","title":"SliM-LLM : Salience-driven mixed-precision quantization for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.842294Z"},"links":{"cited_paper":"/paper/2405.14917","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:7ff454393f7485a79bf75b8e1a121becbfa72beec8a3f179a23d13ad2e88fd67","observation_id":"94e41327-fd94-452c-9613-0033d004c734","resolution":{"observed_at":"2026-08-11T12:22:38.842294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:39.852688Z","title":"Accurate post training quantization with small calibration sets","venue":null,"work_id":"2972e806-d749-47dd-9e24-cdfb1fe2eba7","year":2021},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.845886Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:ff01a3036025bdbe8e9b76134fa3fea6bb40034c964888df50e008c263637abd","observation_id":"180cdfcd-5a4f-449d-9476-ff9ccfa7946b","resolution":{"observed_at":"2026-08-11T12:22:39.856640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-13T07:43:17.158479Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-08-11T12:22:38.849655Z","title":"Gear: An efficient kv cache compression recipefor near-lossless generative inference of llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.849655Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:79c92f7dbfbccaaf1aa70922a64a01a28336e6214d02190deae8aaec88dc8ae1","observation_id":"8a50b5f7-d468-4e8b-bfbc-e2ed5fb7edd7","resolution":{"observed_at":"2026-08-11T12:22:38.849655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-13T11:18:21.844753Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-08-11T12:22:38.853192Z","title":"W., and Keutzer, K","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.853192Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:76069ae9979526b31f7ea761830af3ea4682286c687f0e1422956359e4643e75","observation_id":"5194d093-8a59-44b6-8c34-a4f59fa04511","resolution":{"observed_at":"2026-08-11T12:22:38.853192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:39.841327Z","title":"OWQ : Outlier-aware weight quantization for efficient fine-tuning and inference of large language models","venue":null,"work_id":"fa120812-ec81-42db-a576-181062982ad1","year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.856813Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:ac25fce1684024c5d4754572bc6adacee7c073c75f065ed155f4cf3a1a6db0b6","observation_id":"01e71233-e6d8-40b0-8ba8-b8bf66f08fbf","resolution":{"observed_at":"2026-08-11T12:22:39.845115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:38.860219Z","title":"SVDQuant : Absorbing outliers by low-rank components for 4-bit diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.860219Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:eecda3633fa8e2893b2a8f2f8a20c908626ff15beeba59044e0c07e1769587f7","observation_id":"3670b04e-1dd8-4b6e-adfc-e19f7341568e","resolution":{"observed_at":"2026-08-11T12:22:38.860219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14731","last_updated":"2025-05-16T09:40:01Z","snapshot_observed_at":"2026-08-12T22:22:02.658142Z","submitted_at":"2024-10-16T08:34:51Z","title":"MatryoshkaKV: Adaptive KV Compression via Trainable Orthogonal Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14731","snapshot_observed_at":"2026-08-11T12:22:38.863760Z","title":"MatryoshkaKV : Adaptive kv compression via trainable orthogonal projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.863760Z"},"links":{"cited_paper":"/paper/2410.14731","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:358bb9f127d6fa76bad901fb4266121479017c0be862f7da2cdb5563a3856b7a","observation_id":"b295b582-d3bf-47e4-b5c9-8ef67398a795","resolution":{"observed_at":"2026-08-11T12:22:38.863760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:39.830606Z","title":"Duquant: Distributing outliers via dual transformation makes stronger quantized llms","venue":null,"work_id":"36ce9ac1-1c2a-4feb-9107-0407771e0b56","year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.867491Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:b69ec84a74593ad180e17078728986c3fccf977158b37926d226cf414d483974","observation_id":"8518c039-3763-4a23-8a5d-9a0328f83243","resolution":{"observed_at":"2026-08-11T12:22:39.834633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:39.820086Z","title":"AWQ : Activation-aware weight quantization for on-device llm compression and acceleration","venue":null,"work_id":"51c30594-288d-492c-90ba-01af4f0ad1bb","year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.870930Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:3ba6a04214764e342d453e737f66c7d71a516a19f3ca1bf1eef4df59f7b27e00","observation_id":"f5882700-fdd5-418b-bdd4-ddb5ba719e1e","resolution":{"observed_at":"2026-08-11T12:22:39.823746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04532","last_updated":"2025-05-01T02:14:05Z","snapshot_observed_at":"2026-08-13T00:12:52.272658Z","submitted_at":"2024-05-07T17:59:30Z","title":"QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04532","snapshot_observed_at":"2026-08-11T12:22:38.874322Z","title":"QServe : W4a8kv4 quantization and system co-design for efficient llm serving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.874322Z"},"links":{"cited_paper":"/paper/2405.04532","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:c28668cf776418409951987c841876550c7d7fd5016ec0cf6048933817cd0c5d","observation_id":"672889be-de83-492a-8334-d73da03b3c3f","resolution":{"observed_at":"2026-08-11T12:22:38.874322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08041","last_updated":"2024-04-06T10:22:57Z","snapshot_observed_at":"2026-08-13T05:50:58.243860Z","submitted_at":"2023-10-12T05:25:49Z","title":"QLLM: Accurate and Efficient Low-Bitwidth Quantization for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08041","snapshot_observed_at":"2026-08-11T12:22:38.878253Z","title":"QLLM : Accurate and efficient low-bitwidth quantization for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.878253Z"},"links":{"cited_paper":"/paper/2310.08041","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:0c4ea3171262ad9999f029a2c6cabfe70d05a5b400b45779bfffa87405466b53","observation_id":"02159c26-b30b-4751-8b7a-edb233335d2d","resolution":{"observed_at":"2026-08-11T12:22:38.878253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03091","last_updated":"2023-10-04T01:13:49Z","snapshot_observed_at":"2026-08-13T16:44:59.404632Z","submitted_at":"2023-06-05T17:59:41Z","title":"RepoBench: Benchmarking Repository-Level Code Auto-Completion Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03091","snapshot_observed_at":"2026-08-11T12:22:38.882488Z","title":"RepoBench : Benchmarking repository-level code auto-completion systems","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.882488Z"},"links":{"cited_paper":"/paper/2306.03091","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:3b69f5669b0eb1c4f74e580a58957d8742ade96d0a65e611f015bfa48444c85e","observation_id":"a409a826-96ac-4f73-a143-d94ac889b68e","resolution":{"observed_at":"2026-08-11T12:22:38.882488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02750","last_updated":"2024-07-25T09:16:05Z","snapshot_observed_at":"2026-08-12T17:03:50.984887Z","submitted_at":"2024-02-05T06:06:47Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02750","snapshot_observed_at":"2026-08-11T12:22:38.885979Z","title":"KIVI : A tuning-free asymmetric 2bit quantization for kv cache","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.885979Z"},"links":{"cited_paper":"/paper/2402.02750","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:462a328b70995fee0f9a578ec7a8ca9cf403539bbe302357830069c9416eb015","observation_id":"a384ac31-e490-4143-920b-a8521ea8b37b","resolution":{"observed_at":"2026-08-11T12:22:38.885979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16406","last_updated":"2025-02-20T06:07:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-26T02:15:49Z","title":"SpinQuant: LLM quantization with learned rotations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16406","snapshot_observed_at":"2026-08-11T12:22:38.889642Z","title":"SpinQuant : Llm quantization with learned rotations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.889642Z"},"links":{"cited_paper":"/paper/2405.16406","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:5e21c84ec703a8d2e99fda5df35689423e4a05a946a8e71cf5ec82b166492ab5","observation_id":"ada04707-734b-4730-a56a-be7f57fb5790","resolution":{"observed_at":"2026-08-11T12:22:38.889642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-07-06T05:12:10.387914Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-11T12:22:38.893145Z","title":"Pointer sentinel mixture models","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.893145Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:a4edc6e4fbc914ee749a58dc38f218529c763856ba99d73802b8c7fce8e4fed6","observation_id":"657afab0-bffc-4382-9b2d-d373b37bc0e7","resolution":{"observed_at":"2026-08-11T12:22:38.893145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:39.809216Z","title":"Llama 3.2: Revolutionizing edge AI and vision with open, customizable models , 2024 a","venue":null,"work_id":"6689d0ca-c1fc-41f1-a505-7e15d305f975","year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.896642Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:4596c0c6909c1bf778922b0ca970af59819f42384f059d134e2d48c48104742e","observation_id":"7e525663-48d4-4e72-bfa3-8bf9528542f0","resolution":{"observed_at":"2026-08-11T12:22:39.813238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:39.797663Z","title":"Introducing Meta Llama 3: The most capable openly available LLM to date","venue":null,"work_id":"e5687d44-14b4-44aa-b594-56468f84c719","year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.900006Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:48934a94fcc1595ad0acd32d912c39d2ead77a29db92e33758311b2c8595cc7a","observation_id":"71408979-c82a-4e96-84d7-4e1d34ae3197","resolution":{"observed_at":"2026-08-11T12:22:39.801562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:38.903241Z","title":"Can a suit of armor conduct electricity? a new dataset for open book question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.903241Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:ecdf968ac6de3b816175d9ed52e89719eceb59a57f16ee0742e68e5612f29542","observation_id":"bbfbb140-674e-4a7a-bc1f-b9094136d1c0","resolution":{"observed_at":"2026-08-11T12:22:38.903241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.09557","last_updated":"2024-04-01T06:09:41Z","snapshot_observed_at":"2026-08-14T06:12:29.966982Z","submitted_at":"2022-06-20T03:48:17Z","title":"LUT-GEMM: Quantized Matrix Multiplication based on LUTs for Efficient Inference in Large-Scale Generative Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.09557","snapshot_observed_at":"2026-08-11T12:22:38.906855Z","title":"J., Kim, B., Lee, Y., and Lee, D","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.906855Z"},"links":{"cited_paper":"/paper/2206.09557","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:6be2cdde66828aa4d39154f47bb373ad79872ef5cd47ca7c278c606eb7e204d9","observation_id":"2abd8d63-e3fd-4201-bb72-1a8e6559d684","resolution":{"observed_at":"2026-08-11T12:22:38.906855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:38.910471Z","title":"Pytorch: An imperative style, high-performance deep learning library","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.910471Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:8306f9d3788168a7e4ef4513b3a922b9abfb16989f62e9bb89a144d3d95c49c4","observation_id":"96cef960-686f-4279-9847-37ee47d223ca","resolution":{"observed_at":"2026-08-11T12:22:38.910471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:39.773143Z","title":"L., Bhagavatula, C., and Choi, Y","venue":null,"work_id":"80af6799-b0cd-407b-b896-7c2cd74f12b4","year":2021},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.913876Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:74a429fb68a94436a13409e6c0e2698b3e319946b9830a783f5180eaadf21472","observation_id":"51a6c593-6f2c-4792-9f37-ba3063208c1f","resolution":{"observed_at":"2026-08-11T12:22:39.777147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05437","last_updated":"2024-10-07T18:59:22Z","snapshot_observed_at":"2026-08-12T22:28:49.117346Z","submitted_at":"2024-10-07T18:59:22Z","title":"ESPACE: Dimensionality Reduction of Activations for Model Compression","version":1},"cited_work":{"arxiv_id":"2410.05437","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.05437","snapshot_observed_at":"2026-08-11T12:22:39.278573Z","title":"ESPACE: Dimensionality Reduction of Activations for Model Compression","venue":"cs.LG","work_id":"ed1949cd-bef3-499e-9837-0b016fd3e2de","year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.917322Z"},"links":{"cited_paper":"/paper/2410.05437","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:f18d2a22843e3c3be5c8d7e4c3b292faeb27e66936e8f64ed7bce3ee793f0ac6","observation_id":"2f89d0e0-1866-4a9c-be81-8e66a142ad62","resolution":{"observed_at":"2026-08-11T12:22:39.284687Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:39.762139Z","title":"Social iqa: Commonsense reasoning about social interactions","venue":null,"work_id":"5906d38b-6576-464f-a1fe-85be07f00349","year":2019},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.921067Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:d9935a2b76a4a277c8e6a59f7ec05a7ac5a2b5d49b1f285cdf4593f56534d4c0","observation_id":"cd559363-2a2b-4f94-977b-17763261db36","resolution":{"observed_at":"2026-08-11T12:22:39.765854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:38.924318Z","title":"Eigen attention: Attention in low-rank space for KV cache compression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.924318Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:dbbccef14bc3cd36efd07b0349b27426ae6d172048ae1d81c4ce199cae514feb","observation_id":"1ad94519-701c-4131-85b9-67b86ff644e7","resolution":{"observed_at":"2026-08-11T12:22:38.924318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13137","last_updated":"2024-03-18T05:33:22Z","snapshot_observed_at":"2026-08-13T10:27:58.003650Z","submitted_at":"2023-08-25T02:28:35Z","title":"OmniQuant: Omnidirectionally Calibrated Quantization for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13137","snapshot_observed_at":"2026-08-11T12:22:38.927992Z","title":"OmniQuant : Omnidirectionally calibrated quantization for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.927992Z"},"links":{"cited_paper":"/paper/2308.13137","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:e8707cd81f8cc44c6bdf9670e65ff773f0ad43142d37361c21e7abada3296628","observation_id":"1c7b3e8d-46a8-40e0-ac33-5946b21554a6","resolution":{"observed_at":"2026-08-11T12:22:38.927992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:39.751138Z","title":"Post training quantization of large language models with microscaling formats","venue":null,"work_id":"85601121-0033-41d8-bb49-f78d1b92f21e","year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.931852Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:19d346403cbb45bfbb3633caa8007289d619edbc18824637fcd387cc13c9d677","observation_id":"bbdb286d-76dd-496f-968e-2e0daafb0ce1","resolution":{"observed_at":"2026-08-11T12:22:39.755113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:39.739883Z","title":"FlexGen : High-throughput generative inference of large language models with a single gpu","venue":null,"work_id":"530ef983-5412-4988-a9cb-a296676eb061","year":2023},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.935507Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:3534f81a0e03686a24537ea88b5b5e3611955afb98901993b24734852d91c514","observation_id":"c44c37e3-0c88-4b40-a9de-4b43cd10ed19","resolution":{"observed_at":"2026-08-11T12:22:39.743866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:39.729106Z","title":"CUTLASS , January 2023","venue":null,"work_id":"d4dcf0ce-234a-45e8-b521-b252f96ba8d4","year":2023},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.938871Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:419f4486f72898874ac7494355e55eaaa4ddf54700e6e184d653886a1e633d9c","observation_id":"0e18ae65-d51c-4214-8b61-b6d113c7b9a9","resolution":{"observed_at":"2026-08-11T12:22:39.732878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-11T12:22:38.942577Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.942577Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:52a930a898e96b08b4442768c1797b270d366864603da7b60dec1f0894b8bc83","observation_id":"ae6c5a15-afcb-4760-8200-43a06e826daf","resolution":{"observed_at":"2026-08-11T12:22:38.942577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04396","last_updated":"2024-06-04T04:51:52Z","snapshot_observed_at":"2026-08-13T04:24:47.509375Z","submitted_at":"2024-02-06T20:52:12Z","title":"QuIP#: Even Better LLM Quantization with Hadamard Incoherence and Lattice Codebooks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04396","snapshot_observed_at":"2026-08-11T12:22:38.946066Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.946066Z"},"links":{"cited_paper":"/paper/2402.04396","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:450c19486671ea2097038f857f6ccfbde5d7bc58975963cfc43b51ef62891743","observation_id":"e6a3954c-345d-457a-a317-1c830cb69079","resolution":{"observed_at":"2026-08-11T12:22:38.946066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-11T12:22:38.949786Z","title":"Qwen2-VL : Enhancing vision-language model's perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.949786Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:054f7dc0c389cd2920686cc00e195493e54d5d0c732a6d4fc9bebe48743b98c2","observation_id":"a24d496d-dfa2-4b16-9fb1-8f5f6267e687","resolution":{"observed_at":"2026-08-11T12:22:38.949786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.03771","last_updated":"2020-07-14T03:42:34Z","snapshot_observed_at":"2026-07-06T08:27:58.343233Z","submitted_at":"2019-10-09T03:23:22Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.03771","snapshot_observed_at":"2026-08-11T12:22:38.953613Z","title":"L., Gugger, S., Drame, M., Lhoest, Q., and Rush, A","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.953613Z"},"links":{"cited_paper":"/paper/1910.03771","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:89451bae0617c00fe1be4b323509caa81ea4e83ae09846cf5286811685b7f9d2","observation_id":"f376dde5-0c87-4d47-9ce2-ec305c96d1ec","resolution":{"observed_at":"2026-08-11T12:22:38.953613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:39.717800Z","title":"Training transformers with 4-bit integers","venue":null,"work_id":"9de5994c-7d3e-4857-adb5-ea2a0591350c","year":2023},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.957266Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:1d7ff40ef5ac040e2198579f864b2a3a2c5f705b33142f815dedf51182cd0add","observation_id":"b9d1323a-5e62-499c-b10c-edb95c4170a4","resolution":{"observed_at":"2026-08-11T12:22:39.721622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:38.960869Z","title":"Smoothquant: Accurate and efficient post-training quantization for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.960869Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:097322a0210a6665a4c1d1a19d263a21b03b8767af1d297454c4963a605f239d","observation_id":"d1cd3c1c-d13b-4952-9c5e-cf547ed10e8d","resolution":{"observed_at":"2026-08-11T12:22:38.960869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-11T12:22:38.964652Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.964652Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:196ef56b40bc9e5db9fb08e2e189c0bbf69281f180f4f487df17ca41e12a540b","observation_id":"cefbaddf-3a47-45ac-a991-1b22181e5166","resolution":{"observed_at":"2026-08-11T12:22:38.964652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18096","last_updated":"2024-02-28T06:34:54Z","snapshot_observed_at":"2026-08-13T07:57:52.161268Z","submitted_at":"2024-02-28T06:34:54Z","title":"No Token Left Behind: Reliable KV Cache Compression via Importance-Aware Mixed Precision Quantization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18096","snapshot_observed_at":"2026-08-11T12:22:38.968304Z","title":"Y., Kim, B., Bae, J., Kwon, B., Park, G., Yang, E., Kwon, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.968304Z"},"links":{"cited_paper":"/paper/2402.18096","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:6c4b29cd58966aa6a6abd3ceb518dde5c6792559f6feefe944b4cf7798542a76","observation_id":"3ba31ebb-25e1-45fb-92bd-33a7d3d2f5d6","resolution":{"observed_at":"2026-08-11T12:22:38.968304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:39.700643Z","title":"ZeroQuant : Efficient and affordable post-training quantization for large-scale transformers","venue":null,"work_id":"894a6ed3-2538-49d8-b180-94231eaaf5be","year":2022},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.972203Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:42faef637766258692eeef8a9f42df44ee0e5f1b2454884d6fb0d44bde65b5ed","observation_id":"e1b72ddd-8ca1-4837-8e6d-45c1e7ce89af","resolution":{"observed_at":"2026-08-11T12:22:39.704547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.01089","last_updated":"2023-05-17T10:07:33Z","snapshot_observed_at":"2026-08-13T12:10:16.015996Z","submitted_at":"2023-04-03T15:46:15Z","title":"RPTQ: Reorder-based Post-training Quantization for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.01089","snapshot_observed_at":"2026-08-11T12:22:38.975957Z","title":"RPTQ : Reorder-based post-training quantization for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.975957Z"},"links":{"cited_paper":"/paper/2304.01089","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:0ebfcebb4f8a15323758cd5804906da26678506560aefbefbb7da8c4f484b9e9","observation_id":"bfdc818f-8b94-49fe-811a-552d050a3e62","resolution":{"observed_at":"2026-08-11T12:22:38.975957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05821","last_updated":"2025-08-28T03:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-10T08:41:24Z","title":"ASVD: Activation-aware Singular Value Decomposition for Compressing Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05821","snapshot_observed_at":"2026-08-11T12:22:38.979639Z","title":"ASVD : Activation-aware singular value decomposition for compressing large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.979639Z"},"links":{"cited_paper":"/paper/2312.05821","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:196da467b38490fd1cfcce5d6f34039436f5aaa670eade92c235bd5ac48ee9bf","observation_id":"640b47c3-9b34-4981-8d9f-570908d32951","resolution":{"observed_at":"2026-08-11T12:22:38.979639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16502","last_updated":"2024-06-13T15:02:39Z","snapshot_observed_at":"2026-08-13T09:07:54.479155Z","submitted_at":"2023-11-27T17:33:21Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16502","snapshot_observed_at":"2026-08-11T12:22:38.983535Z","title":"MMMU : A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.983535Z"},"links":{"cited_paper":"/paper/2311.16502","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:4c622396085eb6698f00d2d8103dc486b1612cb02fe58ec8f8a75b0d27066ed1","observation_id":"62b9c7e8-dff2-47be-8ce9-34a270e56684","resolution":{"observed_at":"2026-08-11T12:22:38.983535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-08-10T16:18:23.994244Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-11T12:22:38.987961Z","title":"HellaSwag : Can a machine really finish your sentence? arXiv:1905.07830, 2019","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.987961Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:f28ae71d29794be47d3a70b498fe098dfbf73ad761e55ef1b79235af5faea83e","observation_id":"6768f08d-6eb8-4a9f-b10d-ea272f8c4cba","resolution":{"observed_at":"2026-08-11T12:22:38.987961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08554","last_updated":"2025-07-27T12:44:00Z","snapshot_observed_at":"2026-08-13T11:22:41.582420Z","submitted_at":"2024-08-16T06:39:08Z","title":"ABQ-LLM: Arbitrary-Bit Quantized Inference Acceleration for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08554","snapshot_observed_at":"2026-08-11T12:22:38.991673Z","title":"ABQ-LLM : Arbitrary-bit quantized inference acceleration for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.991673Z"},"links":{"cited_paper":"/paper/2408.08554","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:061cb6cb16c3c25e8bf95bbbdc08543ee48c36fb247f83c5a2b812b00b472c47","observation_id":"e6ec41da-6b92-4b3d-97ed-afbeef829b46","resolution":{"observed_at":"2026-08-11T12:22:38.991673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:39.689207Z","title":"Atom: Low-bit quantization for efficient and accurate llm serving","venue":null,"work_id":"a8f88621-854c-40f1-a4f8-df490deee13c","year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.995854Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:ccb8d99beeebc973194ee9b231e8456042cd8489e68393a029589de59cbd6e37","observation_id":"ba34eb41-461d-413b-98c4-71b9beb7e17e","resolution":{"observed_at":"2026-08-11T12:22:39.693096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:39.677721Z","title":"QMSum : A new benchmark for query-based multi-domain meeting summarization","venue":null,"work_id":"014d305e-a039-4cbe-896a-8fedfbd6aa2e","year":2021},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.999640Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:f41c69b277cd6af3480dfecae7282578759c988f7843e9a57cae08a8e095ec7e","observation_id":"82f4e82c-5f7c-4893-adf2-93f52d8046fc","resolution":{"observed_at":"2026-08-11T12:22:39.681667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:39.003914Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:39.003914Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:be284696ba94bcf6078bae41db048917651c9480d287b9d5978679ee64628f0a","observation_id":"0b525f8a-5d78-4922-8207-1dc469f4a69c","resolution":{"observed_at":"2026-08-11T12:22:39.003914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":1,"verified_fuzzy":17},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 9 inbound Pith citation observations for arXiv:2412.14363."}