{"as_of":"2026-08-23T08:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1f22f5c6ea4fed11de47d036a179fa9f8d61989f815797af07ddf20e0136132e","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T05:52:21.268115Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.19746/citation-record","integrity":"/paper/2504.19746/integrity","json":"/paper/2504.19746/citation-record.json","paper":"/paper/2504.19746"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:52:21.139977Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.19746","last_updated":"2025-04-28T12:47:23Z","snapshot_observed_at":"2026-08-19T14:44:30.670760Z","submitted_at":"2025-04-28T12:47:23Z","title":"FineQ: Software-Hardware Co-Design for Low-Bit Fine-Grained Mixed-Precision Quantization of LLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:21.139977Z"},"links":{"citing_paper":"/paper/2504.19746"},"observation_digest":"sha256:226da86b0fad28281bfffb2e43187a83697f7ffe4ce49ec8d2d09a9d809d8e77","observation_id":"6751774a-8f98-4987-9cbb-8bf2f4250342","resolution":{"observed_at":"2026-08-16T05:52:21.139977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-16T05:52:21.144776Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19746","last_updated":"2025-04-28T12:47:23Z","snapshot_observed_at":"2026-08-19T14:44:30.670760Z","submitted_at":"2025-04-28T12:47:23Z","title":"FineQ: Software-Hardware Co-Design for Low-Bit Fine-Grained Mixed-Precision Quantization of LLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:21.144776Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2504.19746"},"observation_digest":"sha256:885e5c03cb0c1bb9b2d3d06deb64283276a8615494b91a817ffec0488aa50cd5","observation_id":"638ce25d-5a80-4655-8c64-39e2374a410a","resolution":{"observed_at":"2026-08-16T05:52:21.144776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:52:21.770831Z","title":"ubrain: A unary brain computer interface,","venue":null,"work_id":"44cd0e8e-0545-4dbd-a65e-e94bd19a2cea","year":2022},"citing_paper":{"arxiv_id":"2504.19746","last_updated":"2025-04-28T12:47:23Z","snapshot_observed_at":"2026-08-19T14:44:30.670760Z","submitted_at":"2025-04-28T12:47:23Z","title":"FineQ: Software-Hardware Co-Design for Low-Bit Fine-Grained Mixed-Precision Quantization of LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:21.149618Z"},"links":{"citing_paper":"/paper/2504.19746"},"observation_digest":"sha256:401e342d75702491c9ec4b6d036590aacd8e8d28948f80984355516a5606be7a","observation_id":"05e56dfc-d151-491d-af8e-5d6043306928","resolution":{"observed_at":"2026-08-16T05:52:21.775631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:52:21.755607Z","title":"Up or down? adaptive rounding for post-training quantization,","venue":null,"work_id":"d1baba1e-6510-4717-b40c-87c9ed47c876","year":2020},"citing_paper":{"arxiv_id":"2504.19746","last_updated":"2025-04-28T12:47:23Z","snapshot_observed_at":"2026-08-19T14:44:30.670760Z","submitted_at":"2025-04-28T12:47:23Z","title":"FineQ: Software-Hardware Co-Design for Low-Bit Fine-Grained Mixed-Precision Quantization of LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:21.154108Z"},"links":{"citing_paper":"/paper/2504.19746"},"observation_digest":"sha256:5d73d33ec8964e74f8002d7f7005515574cc499a16c42acc720af2a588034434","observation_id":"c83e3c9b-cc66-4d61-868d-0b9ebd906c2d","resolution":{"observed_at":"2026-08-16T05:52:21.760776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-16T07:57:19.216626Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-16T05:52:21.158660Z","title":"Gptq: Accurate post-training quantization for generative pre-trained transformers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19746","last_updated":"2025-04-28T12:47:23Z","snapshot_observed_at":"2026-08-19T14:44:30.670760Z","submitted_at":"2025-04-28T12:47:23Z","title":"FineQ: Software-Hardware Co-Design for Low-Bit Fine-Grained Mixed-Precision Quantization of LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:21.158660Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2504.19746"},"observation_digest":"sha256:2db8dd39e96ef469baadc744fc3db6743e8416a6b4aa31a31e509cd39d633dde","observation_id":"eb4f35e2-de4f-447a-8f54-c965a1f6daab","resolution":{"observed_at":"2026-08-16T05:52:21.158660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:52:21.163454Z","title":"Zeroquant: Efficient and affordable post-training quantization for large- scale transformers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19746","last_updated":"2025-04-28T12:47:23Z","snapshot_observed_at":"2026-08-19T14:44:30.670760Z","submitted_at":"2025-04-28T12:47:23Z","title":"FineQ: Software-Hardware Co-Design for Low-Bit Fine-Grained Mixed-Precision Quantization of LLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:21.163454Z"},"links":{"citing_paper":"/paper/2504.19746"},"observation_digest":"sha256:ba30020416533e5324b61e5dbee55a3e5ad3779d6877eba9ecd5d2af2cddd6a8","observation_id":"4456aaf4-3e8a-4940-a502-aa661fe3f3ab","resolution":{"observed_at":"2026-08-16T05:52:21.163454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.07339","last_updated":"2022-11-10T18:14:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-15T17:08:50Z","title":"LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.07339","snapshot_observed_at":"2026-08-16T05:52:21.168361Z","title":"Llm. int8 (): 8-bit matrix multiplication for transformers at scale. corr abs/2208.07339 (2022),","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19746","last_updated":"2025-04-28T12:47:23Z","snapshot_observed_at":"2026-08-19T14:44:30.670760Z","submitted_at":"2025-04-28T12:47:23Z","title":"FineQ: Software-Hardware Co-Design for Low-Bit Fine-Grained Mixed-Precision Quantization of LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:21.168361Z"},"links":{"cited_paper":"/paper/2208.07339","citing_paper":"/paper/2504.19746"},"observation_digest":"sha256:7f7f3452930891f4a39dc678bc4ab682cad23a03ad8693e1e42577a2b29e69ad","observation_id":"9c7da2ac-8051-4cb3-85b5-2855d55cd0bd","resolution":{"observed_at":"2026-08-16T05:52:21.168361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:52:21.173072Z","title":"Awq: Activation-aware weight quanti- zation for on-device llm compression and acceleration,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19746","last_updated":"2025-04-28T12:47:23Z","snapshot_observed_at":"2026-08-19T14:44:30.670760Z","submitted_at":"2025-04-28T12:47:23Z","title":"FineQ: Software-Hardware Co-Design for Low-Bit Fine-Grained Mixed-Precision Quantization of LLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:21.173072Z"},"links":{"citing_paper":"/paper/2504.19746"},"observation_digest":"sha256:abc2c72e85fd306b4553783956766db09fbdc486a18234a214bfcef6f3725c32","observation_id":"f608a497-daff-4357-a017-dcb07b099ff8","resolution":{"observed_at":"2026-08-16T05:52:21.173072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:52:21.721819Z","title":"Owq: Outlier-aware weight quantization for efficient fine-tuning and inference of large language models,","venue":null,"work_id":"0756fcc6-7a73-476f-ba8a-49dd545b9cd4","year":2024},"citing_paper":{"arxiv_id":"2504.19746","last_updated":"2025-04-28T12:47:23Z","snapshot_observed_at":"2026-08-19T14:44:30.670760Z","submitted_at":"2025-04-28T12:47:23Z","title":"FineQ: Software-Hardware Co-Design for Low-Bit Fine-Grained Mixed-Precision Quantization of LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:21.177560Z"},"links":{"citing_paper":"/paper/2504.19746"},"observation_digest":"sha256:dcf7986b5203244cf8f79ae560e0f79530399848923ed1b35c7d8d7879d0eaaa","observation_id":"06a58058-8e0c-40d1-9a29-f14523a891d8","resolution":{"observed_at":"2026-08-16T05:52:21.727028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:52:21.706593Z","title":"Llm-mq: Mixed-precision quantization for efficient llm deployment,","venue":null,"work_id":"db85ea4d-082a-4f62-a390-c52065558296","year":2023},"citing_paper":{"arxiv_id":"2504.19746","last_updated":"2025-04-28T12:47:23Z","snapshot_observed_at":"2026-08-19T14:44:30.670760Z","submitted_at":"2025-04-28T12:47:23Z","title":"FineQ: Software-Hardware Co-Design for Low-Bit Fine-Grained Mixed-Precision Quantization of LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:21.181818Z"},"links":{"citing_paper":"/paper/2504.19746"},"observation_digest":"sha256:c83656b20b0295c754939db9c8a9ca608df85df1ef7d970d98ed9b1513d701b7","observation_id":"62505196-e02f-4ea2-808b-c0f77d7744ec","resolution":{"observed_at":"2026-08-16T05:52:21.711484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00034","last_updated":"2023-11-07T20:41:22Z","snapshot_observed_at":"2026-08-19T11:18:54.847894Z","submitted_at":"2023-09-29T14:35:27Z","title":"PB-LLM: Partially Binarized Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00034","snapshot_observed_at":"2026-08-16T05:52:21.186348Z","title":"Pb-llm: Partially binarized large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19746","last_updated":"2025-04-28T12:47:23Z","snapshot_observed_at":"2026-08-19T14:44:30.670760Z","submitted_at":"2025-04-28T12:47:23Z","title":"FineQ: Software-Hardware Co-Design for Low-Bit Fine-Grained Mixed-Precision Quantization of LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:21.186348Z"},"links":{"cited_paper":"/paper/2310.00034","citing_paper":"/paper/2504.19746"},"observation_digest":"sha256:0f555da4fd76772c570fa86538aad5bff6d53bd788d06342efbba24810f1e6bc","observation_id":"fc1bc929-847a-484a-a88b-f37e9b9c8f78","resolution":{"observed_at":"2026-08-16T05:52:21.186348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:52:21.191287Z","title":"Olive: Accelerating large language models via hardware- friendly outlier-victim pair quantization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19746","last_updated":"2025-04-28T12:47:23Z","snapshot_observed_at":"2026-08-19T14:44:30.670760Z","submitted_at":"2025-04-28T12:47:23Z","title":"FineQ: Software-Hardware Co-Design for Low-Bit Fine-Grained Mixed-Precision Quantization of LLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:21.191287Z"},"links":{"citing_paper":"/paper/2504.19746"},"observation_digest":"sha256:f8354c24ad68dda8aa15957168313151b9f62b1856bbf06d7386803e85d09c3a","observation_id":"3527ea1e-b722-4025-9e9b-c938f18f1eeb","resolution":{"observed_at":"2026-08-16T05:52:21.191287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12930","last_updated":"2024-06-16T09:51:55Z","snapshot_observed_at":"2026-08-16T13:42:35.257059Z","submitted_at":"2024-06-16T09:51:55Z","title":"Tender: Accelerating Large Language Models via Tensor Decomposition and Runtime Requantization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12930","snapshot_observed_at":"2026-08-16T05:52:21.195688Z","title":"Tender: Accelerating large language models via tensor decomposition and runtime requantization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19746","last_updated":"2025-04-28T12:47:23Z","snapshot_observed_at":"2026-08-19T14:44:30.670760Z","submitted_at":"2025-04-28T12:47:23Z","title":"FineQ: Software-Hardware Co-Design for Low-Bit Fine-Grained Mixed-Precision Quantization of LLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:21.195688Z"},"links":{"cited_paper":"/paper/2406.12930","citing_paper":"/paper/2504.19746"},"observation_digest":"sha256:bcf160342b60abe4d1f05146e577233f376ccf0679752f6b37c5bff6bfc6b9e2","observation_id":"9f2d7edb-3921-4959-865f-af6472d1851e","resolution":{"observed_at":"2026-08-16T05:52:21.195688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:52:21.200180Z","title":"Gpt3. int8 (): 8-bit matrix multiplication for transformers at scale,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19746","last_updated":"2025-04-28T12:47:23Z","snapshot_observed_at":"2026-08-19T14:44:30.670760Z","submitted_at":"2025-04-28T12:47:23Z","title":"FineQ: Software-Hardware Co-Design for Low-Bit Fine-Grained Mixed-Precision Quantization of LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:21.200180Z"},"links":{"citing_paper":"/paper/2504.19746"},"observation_digest":"sha256:a022a9c7e25c443ff35299a4831fc750c0f02d2adbf41a682c2f6127702fd36b","observation_id":"4811a75c-1c52-4c44-9085-3a46c9967802","resolution":{"observed_at":"2026-08-16T05:52:21.200180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:52:21.672329Z","title":"Abstractive long text summarization using large language models,","venue":null,"work_id":"f2859e34-580d-45dc-bac3-c5359417850b","year":2024},"citing_paper":{"arxiv_id":"2504.19746","last_updated":"2025-04-28T12:47:23Z","snapshot_observed_at":"2026-08-19T14:44:30.670760Z","submitted_at":"2025-04-28T12:47:23Z","title":"FineQ: Software-Hardware Co-Design for Low-Bit Fine-Grained Mixed-Precision Quantization of LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:21.204411Z"},"links":{"citing_paper":"/paper/2504.19746"},"observation_digest":"sha256:67669acba58faacc4bff38a3edd9be1dc48b767504fe8a069dbffcd834fb0491","observation_id":"e28c5483-fe6d-4372-bfa6-545fc1be7c74","resolution":{"observed_at":"2026-08-16T05:52:21.677369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:52:21.656697Z","title":"Transformer models used for text-based question answering systems,","venue":null,"work_id":"8bca8964-007a-44ef-be59-35c26cf3da02","year":2023},"citing_paper":{"arxiv_id":"2504.19746","last_updated":"2025-04-28T12:47:23Z","snapshot_observed_at":"2026-08-19T14:44:30.670760Z","submitted_at":"2025-04-28T12:47:23Z","title":"FineQ: Software-Hardware Co-Design for Low-Bit Fine-Grained Mixed-Precision Quantization of LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:21.208631Z"},"links":{"citing_paper":"/paper/2504.19746"},"observation_digest":"sha256:6b4ad479b4be10b9450f8d7c43888acfb661d5de0a3e9eb65e57e8de6400dc51","observation_id":"3ef05d73-7f2b-4db3-ad4c-49de2d765f03","resolution":{"observed_at":"2026-08-16T05:52:21.662057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:52:21.212800Z","title":"Efficient memory management for large language model serving with pagedattention,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19746","last_updated":"2025-04-28T12:47:23Z","snapshot_observed_at":"2026-08-19T14:44:30.670760Z","submitted_at":"2025-04-28T12:47:23Z","title":"FineQ: Software-Hardware Co-Design for Low-Bit Fine-Grained Mixed-Precision Quantization of LLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:21.212800Z"},"links":{"citing_paper":"/paper/2504.19746"},"observation_digest":"sha256:3f651b462c529807802b986294580d27775b8456bc0419004793af1e5411c916","observation_id":"438f8120-5cef-4a00-9b57-a056c1abd8b6","resolution":{"observed_at":"2026-08-16T05:52:21.212800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-08-17T01:46:43.513643Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-16T05:52:21.217234Z","title":"Pointer sentinel mixture models,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.19746","last_updated":"2025-04-28T12:47:23Z","snapshot_observed_at":"2026-08-19T14:44:30.670760Z","submitted_at":"2025-04-28T12:47:23Z","title":"FineQ: Software-Hardware Co-Design for Low-Bit Fine-Grained Mixed-Precision Quantization of LLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:21.217234Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2504.19746"},"observation_digest":"sha256:7de25fa77efaee93e414b94acbb0060a32b816045ff36ce059a138f46ed142a5","observation_id":"b2296042-e679-4ffd-8581-3eab77aea4a8","resolution":{"observed_at":"2026-08-16T05:52:21.217234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:52:21.222919Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.19746","last_updated":"2025-04-28T12:47:23Z","snapshot_observed_at":"2026-08-19T14:44:30.670760Z","submitted_at":"2025-04-28T12:47:23Z","title":"FineQ: Software-Hardware Co-Design for Low-Bit Fine-Grained Mixed-Precision Quantization of LLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:21.222919Z"},"links":{"citing_paper":"/paper/2504.19746"},"observation_digest":"sha256:faebca4893ac0ba39ec4868b7f95293b93943e6d629608363862a6a2dfaabad9","observation_id":"429d3f48-cfa7-43a3-a3ee-10f6c5f1f093","resolution":{"observed_at":"2026-08-16T05:52:21.222919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:52:21.621905Z","title":"Kurup and T","venue":null,"work_id":"39a2bcb7-63ee-4797-8cf4-71e479aa8d63","year":1997},"citing_paper":{"arxiv_id":"2504.19746","last_updated":"2025-04-28T12:47:23Z","snapshot_observed_at":"2026-08-19T14:44:30.670760Z","submitted_at":"2025-04-28T12:47:23Z","title":"FineQ: Software-Hardware Co-Design for Low-Bit Fine-Grained Mixed-Precision Quantization of LLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:21.227188Z"},"links":{"citing_paper":"/paper/2504.19746"},"observation_digest":"sha256:6a54eb1930c0c5fb72566ee4d1878f801c758fcedbf95c4ef3fc19049e4d2d44","observation_id":"c9b1d251-a023-4c40-8716-8f7cb0d88ab0","resolution":{"observed_at":"2026-08-16T05:52:21.627195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:52:21.606426Z","title":"Ascend-freepdk45: An open source standard cell library for asyn- chronous design,","venue":null,"work_id":"95118a49-118d-4d4c-bedc-22e40bbcbcb0","year":2016},"citing_paper":{"arxiv_id":"2504.19746","last_updated":"2025-04-28T12:47:23Z","snapshot_observed_at":"2026-08-19T14:44:30.670760Z","submitted_at":"2025-04-28T12:47:23Z","title":"FineQ: Software-Hardware Co-Design for Low-Bit Fine-Grained Mixed-Precision Quantization of LLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:21.231562Z"},"links":{"citing_paper":"/paper/2504.19746"},"observation_digest":"sha256:ec3751447b795040bee92a29034ebade6bc1783e80f6ec9c7b6efdeffef500c2","observation_id":"7626c832-3930-4635-975f-c69ffffbbc7a","resolution":{"observed_at":"2026-08-16T05:52:21.611495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:52:21.235917Z","title":"Efficient processing of deep neural networks: A tutorial and survey,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.19746","last_updated":"2025-04-28T12:47:23Z","snapshot_observed_at":"2026-08-19T14:44:30.670760Z","submitted_at":"2025-04-28T12:47:23Z","title":"FineQ: Software-Hardware Co-Design for Low-Bit Fine-Grained Mixed-Precision Quantization of LLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:21.235917Z"},"links":{"citing_paper":"/paper/2504.19746"},"observation_digest":"sha256:c4dc75b2d6fb809406ebce2a7d8c74d26e1041baa8616e380b6fa80ac512348e","observation_id":"4122b31b-5767-496a-92b4-3d0843d4a72d","resolution":{"observed_at":"2026-08-16T05:52:21.235917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-14T10:40:26.323157Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-16T05:52:21.240324Z","title":"A survey of large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19746","last_updated":"2025-04-28T12:47:23Z","snapshot_observed_at":"2026-08-19T14:44:30.670760Z","submitted_at":"2025-04-28T12:47:23Z","title":"FineQ: Software-Hardware Co-Design for Low-Bit Fine-Grained Mixed-Precision Quantization of LLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:21.240324Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2504.19746"},"observation_digest":"sha256:94ad259e656302e964251b7dbbca28df5a29fa444e730d2c9250e00a2f7bff81","observation_id":"74ce057f-56fe-4998-8e35-af6173c88172","resolution":{"observed_at":"2026-08-16T05:52:21.240324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-21T17:11:42.153668Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-08-16T05:52:21.244939Z","title":"Squeezellm: Dense-and-sparse quantization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19746","last_updated":"2025-04-28T12:47:23Z","snapshot_observed_at":"2026-08-19T14:44:30.670760Z","submitted_at":"2025-04-28T12:47:23Z","title":"FineQ: Software-Hardware Co-Design for Low-Bit Fine-Grained Mixed-Precision Quantization of LLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:21.244939Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2504.19746"},"observation_digest":"sha256:adfb1f48fbdf4c32b1a1be2677dc2c7d5215047cf5c19f701e212d5963736d23","observation_id":"8c4c853e-fc2a-4b1b-b7df-37648d77476c","resolution":{"observed_at":"2026-08-16T05:52:21.244939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14866","last_updated":"2024-04-16T03:18:38Z","snapshot_observed_at":"2026-08-19T14:26:23.128718Z","submitted_at":"2024-02-21T07:45:22Z","title":"APTQ: Attention-aware Post-Training Mixed-Precision Quantization for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14866","snapshot_observed_at":"2026-08-16T05:52:21.249448Z","title":"Aptq: Attention-aware post-training mixed-precision quantization for large lan- guage models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19746","last_updated":"2025-04-28T12:47:23Z","snapshot_observed_at":"2026-08-19T14:44:30.670760Z","submitted_at":"2025-04-28T12:47:23Z","title":"FineQ: Software-Hardware Co-Design for Low-Bit Fine-Grained Mixed-Precision Quantization of LLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:21.249448Z"},"links":{"cited_paper":"/paper/2402.14866","citing_paper":"/paper/2504.19746"},"observation_digest":"sha256:6b83c8b96ca7cf31661cbd64eaa6f535d75963f63af309fe8d11e3d992839a6d","observation_id":"b972c15e-35e2-4a06-877e-6224ca043421","resolution":{"observed_at":"2026-08-16T05:52:21.249448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:52:21.253975Z","title":"Understanding reuse, performance, and hardware cost of dnn dataflow: A data-centric approach,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.19746","last_updated":"2025-04-28T12:47:23Z","snapshot_observed_at":"2026-08-19T14:44:30.670760Z","submitted_at":"2025-04-28T12:47:23Z","title":"FineQ: Software-Hardware Co-Design for Low-Bit Fine-Grained Mixed-Precision Quantization of LLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:21.253975Z"},"links":{"citing_paper":"/paper/2504.19746"},"observation_digest":"sha256:9d6d6db66042b97ee296343acd8406529018d4451876ab62c2d08013575a3c83","observation_id":"7674783b-f7ee-4006-b928-3368671632ba","resolution":{"observed_at":"2026-08-16T05:52:21.253975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09145","last_updated":"2023-10-23T08:48:31Z","snapshot_observed_at":"2026-08-19T11:13:37.720416Z","submitted_at":"2023-04-18T17:34:23Z","title":"Outlier Suppression+: Accurate quantization of large language models by equivalent and optimal shifting and scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09145","snapshot_observed_at":"2026-08-16T05:52:21.258649Z","title":"Outlier suppression+: Accurate quantization of large language models by equiva- lent and optimal shifting and scaling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19746","last_updated":"2025-04-28T12:47:23Z","snapshot_observed_at":"2026-08-19T14:44:30.670760Z","submitted_at":"2025-04-28T12:47:23Z","title":"FineQ: Software-Hardware Co-Design for Low-Bit Fine-Grained Mixed-Precision Quantization of LLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:21.258649Z"},"links":{"cited_paper":"/paper/2304.09145","citing_paper":"/paper/2504.19746"},"observation_digest":"sha256:a4fa8629b2adf210283731d000daed6769f9b98b4f0b702f9a14e2167bd49cba","observation_id":"4a266efd-cef3-40aa-9bef-13ecc57e9ac1","resolution":{"observed_at":"2026-08-16T05:52:21.258649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:52:21.568943Z","title":"Mobile and edge evaluation of large language models,","venue":null,"work_id":"441c6cbe-e0e9-4899-99e9-6dbe3991771c","year":null},"citing_paper":{"arxiv_id":"2504.19746","last_updated":"2025-04-28T12:47:23Z","snapshot_observed_at":"2026-08-19T14:44:30.670760Z","submitted_at":"2025-04-28T12:47:23Z","title":"FineQ: Software-Hardware Co-Design for Low-Bit Fine-Grained Mixed-Precision Quantization of LLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:21.263315Z"},"links":{"citing_paper":"/paper/2504.19746"},"observation_digest":"sha256:e02cdebe9d5acb8110bdbb7e89ce993da966a3e2466d7a10c36c23409d4f6e71","observation_id":"25103a6c-4a20-48cc-9945-ffff86ceb0a7","resolution":{"observed_at":"2026-08-16T05:52:21.575887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:52:21.268115Z","title":"Hardware-aware parallel prompt decoding for memory-efficient acceleration of llm inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19746","last_updated":"2025-04-28T12:47:23Z","snapshot_observed_at":"2026-08-19T14:44:30.670760Z","submitted_at":"2025-04-28T12:47:23Z","title":"FineQ: Software-Hardware Co-Design for Low-Bit Fine-Grained Mixed-Precision Quantization of LLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T05:52:21.268115Z"},"links":{"citing_paper":"/paper/2504.19746"},"observation_digest":"sha256:f90a7343bce5a315637beeaa99a1169ff82383f6a4287bb122349d0faafddc90","observation_id":"8fbfc193-ed8d-4c28-bc7c-1808fd5cedab","resolution":{"observed_at":"2026-08-16T05:52:21.268115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.19746","last_updated":"2025-04-28T12:47:23Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-19T14:44:30.670760Z","submitted_at":"2025-04-28T12:47:23Z","title":"FineQ: Software-Hardware Co-Design for Low-Bit Fine-Grained Mixed-Precision Quantization of LLMs"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":9},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2504.19746."}