{"as_of":"2026-08-17T20:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f645d63b87a300621e93bf1808b23eaa9475e36602d6d1b293cf36b780a81830","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T05:05:12.928814Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:09:57.976654Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-16T12:09:58.199009Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.21553","last_updated":"2025-04-30T11:52:18Z","snapshot_observed_at":"2026-08-16T04:57:57.583738Z","submitted_at":"2025-04-30T11:52:18Z","title":"Precision Where It Matters: A Novel Spike Aware Mixed-Precision Quantization Strategy for LLaMA-based Language Models","version":1},"cited_work":{"arxiv_id":"2504.21553","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.21553","snapshot_observed_at":"2026-08-16T12:09:58.199009Z","title":"Precision Where It Matters: A Novel Spike Aware Mixed-Precision Quantization Strategy for LLaMA-based Language Models","venue":"cs.CL","work_id":"3ed00c46-34b6-494d-a29c-6ceb7c9ee9ea","year":2025},"citing_paper":{"arxiv_id":"2504.13989","last_updated":"2025-05-13T09:36:03Z","snapshot_observed_at":"2026-08-16T17:19:48.615751Z","submitted_at":"2025-04-18T13:46:58Z","title":"Gradual Binary Search and Dimension Expansion : A general method for activation quantization in LLMs","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T12:09:57.976654Z"},"links":{"cited_paper":"/paper/2504.21553","citing_paper":"/paper/2504.13989"},"observation_digest":"sha256:610ae5ac3768c12ef64982d433bc3655809722a372558788e69688879cd40681","observation_id":"98677ebc-dbe7-41d4-a815-9166739c8b99","resolution":{"observed_at":"2026-08-16T12:09:58.204110Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.21553/citation-record","integrity":"/paper/2504.21553/integrity","json":"/paper/2504.21553/citation-record.json","paper":"/paper/2504.21553"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:05:13.229080Z","title":"Advances in Neural Information Processing Systems36, 34278–34294 (2023)","venue":null,"work_id":"b12a9cba-d255-42f7-a803-5b7ee98e1b2b","year":2023},"citing_paper":{"arxiv_id":"2504.21553","last_updated":"2025-04-30T11:52:18Z","snapshot_observed_at":"2026-08-16T04:57:57.583738Z","submitted_at":"2025-04-30T11:52:18Z","title":"Precision Where It Matters: A Novel Spike Aware Mixed-Precision Quantization Strategy for LLaMA-based Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T05:05:12.838529Z"},"links":{"citing_paper":"/paper/2504.21553"},"observation_digest":"sha256:8df981fc2201a2a9325a137370d14f6d5f121d772e91af035365d9dd59f1396f","observation_id":"45c07fd1-c0f4-478a-bab6-089220b261ec","resolution":{"observed_at":"2026-08-16T05:05:13.234203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.12948","last_updated":"2021-09-27T10:57:18Z","snapshot_observed_at":"2026-08-16T17:53:49.508131Z","submitted_at":"2021-09-27T10:57:18Z","title":"Understanding and Overcoming the Challenges of Efficient Transformer Quantization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.12948","snapshot_observed_at":"2026-08-16T05:05:12.843611Z","title":"arXiv preprint arXiv:2109.12948 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.21553","last_updated":"2025-04-30T11:52:18Z","snapshot_observed_at":"2026-08-16T04:57:57.583738Z","submitted_at":"2025-04-30T11:52:18Z","title":"Precision Where It Matters: A Novel Spike Aware Mixed-Precision Quantization Strategy for LLaMA-based Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T05:05:12.843611Z"},"links":{"cited_paper":"/paper/2109.12948","citing_paper":"/paper/2504.21553"},"observation_digest":"sha256:6a56f2ae74c8f473fc00397e0f930916190d9af910089ae2e605538ffc7926cb","observation_id":"8f4fde32-7388-4520-90fe-067769996c82","resolution":{"observed_at":"2026-08-16T05:05:12.843611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:05:12.848749Z","title":"int8 (): 8-bit matrix multiplicationfortransformersatscale.AdvancesinNeuralInformationProcessing Systems 35, 30318–30332 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.21553","last_updated":"2025-04-30T11:52:18Z","snapshot_observed_at":"2026-08-16T04:57:57.583738Z","submitted_at":"2025-04-30T11:52:18Z","title":"Precision Where It Matters: A Novel Spike Aware Mixed-Precision Quantization Strategy for LLaMA-based Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T05:05:12.848749Z"},"links":{"citing_paper":"/paper/2504.21553"},"observation_digest":"sha256:a1f5e1d939bd2d622d5ebba3a12eb45eae90e37b2db4f8b815c5097c6a0d28e5","observation_id":"eda4d2bc-0b03-4630-9a0f-72709eda8d96","resolution":{"observed_at":"2026-08-16T05:05:12.848749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:05:12.853226Z","title":"Advances in Neural Information Processing Systems36 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21553","last_updated":"2025-04-30T11:52:18Z","snapshot_observed_at":"2026-08-16T04:57:57.583738Z","submitted_at":"2025-04-30T11:52:18Z","title":"Precision Where It Matters: A Novel Spike Aware Mixed-Precision Quantization Strategy for LLaMA-based Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T05:05:12.853226Z"},"links":{"citing_paper":"/paper/2504.21553"},"observation_digest":"sha256:9828c0b49b34646cec09095ba758b6f35f2ecea6285711a1f36df98c9990288e","observation_id":"fe0c0ad9-39a8-4277-802b-8f5a05ec22ae","resolution":{"observed_at":"2026-08-16T05:05:12.853226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:05:13.197128Z","title":"In: International Conference on Machine Learning","venue":null,"work_id":"b12611e9-80b1-4e15-b585-86258a3575f9","year":null},"citing_paper":{"arxiv_id":"2504.21553","last_updated":"2025-04-30T11:52:18Z","snapshot_observed_at":"2026-08-16T04:57:57.583738Z","submitted_at":"2025-04-30T11:52:18Z","title":"Precision Where It Matters: A Novel Spike Aware Mixed-Precision Quantization Strategy for LLaMA-based Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T05:05:12.857680Z"},"links":{"citing_paper":"/paper/2504.21553"},"observation_digest":"sha256:1a81926fa9a21a19c1996f49edb6ba0d78d5e8d6dea73a41faaf025f570b4361","observation_id":"337645d5-2733-468e-8c36-8c2b374579cc","resolution":{"observed_at":"2026-08-16T05:05:13.201046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-16T07:57:19.216626Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-16T05:05:12.861936Z","title":"arXiv preprint arXiv:2210.17323 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.21553","last_updated":"2025-04-30T11:52:18Z","snapshot_observed_at":"2026-08-16T04:57:57.583738Z","submitted_at":"2025-04-30T11:52:18Z","title":"Precision Where It Matters: A Novel Spike Aware Mixed-Precision Quantization Strategy for LLaMA-based Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T05:05:12.861936Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2504.21553"},"observation_digest":"sha256:5a9cafedbaa7a9cecb398fef46bb33d085088a083e804995bf10ddaf88023ca1","observation_id":"1ae82f16-f726-40cd-be1f-3b2282f3fd38","resolution":{"observed_at":"2026-08-16T05:05:12.861936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19279","last_updated":"2024-11-06T22:45:30Z","snapshot_observed_at":"2026-08-16T13:48:07.269773Z","submitted_at":"2024-05-29T17:11:28Z","title":"Understanding and Minimising Outlier Features in Neural Network Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19279","snapshot_observed_at":"2026-08-16T05:05:12.867019Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21553","last_updated":"2025-04-30T11:52:18Z","snapshot_observed_at":"2026-08-16T04:57:57.583738Z","submitted_at":"2025-04-30T11:52:18Z","title":"Precision Where It Matters: A Novel Spike Aware Mixed-Precision Quantization Strategy for LLaMA-based Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T05:05:12.867019Z"},"links":{"cited_paper":"/paper/2405.19279","citing_paper":"/paper/2504.21553"},"observation_digest":"sha256:a2d28d7589b87524ad4b8534c73e67ea8b779e8cca7daff0e5d6ec9ac8c14fc6","observation_id":"520e269d-5eea-4679-ab18-969282ee0dcf","resolution":{"observed_at":"2026-08-16T05:05:12.867019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:05:13.182933Z","title":null,"venue":null,"work_id":"63050068-1ee3-495d-8101-8a343717af82","year":2024},"citing_paper":{"arxiv_id":"2504.21553","last_updated":"2025-04-30T11:52:18Z","snapshot_observed_at":"2026-08-16T04:57:57.583738Z","submitted_at":"2025-04-30T11:52:18Z","title":"Precision Where It Matters: A Novel Spike Aware Mixed-Precision Quantization Strategy for LLaMA-based Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T05:05:12.872026Z"},"links":{"citing_paper":"/paper/2504.21553"},"observation_digest":"sha256:a01b2a562c037a74b588184a883a37a5b94b09eb49dd110a81c057513fcadb15","observation_id":"ddfe4a3b-c127-478a-a440-5e7577d41207","resolution":{"observed_at":"2026-08-16T05:05:13.187308Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T02:13:39.510069Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-16T05:05:12.876317Z","title":"arXiv preprint arXiv:2310.06825 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21553","last_updated":"2025-04-30T11:52:18Z","snapshot_observed_at":"2026-08-16T04:57:57.583738Z","submitted_at":"2025-04-30T11:52:18Z","title":"Precision Where It Matters: A Novel Spike Aware Mixed-Precision Quantization Strategy for LLaMA-based Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T05:05:12.876317Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2504.21553"},"observation_digest":"sha256:e39b290877f219745be03e6e31352259a9a93e6b790f720ec0b1bb1e4a1800f7","observation_id":"c35f00c6-773c-4eac-a5d3-9b6bfc21fe71","resolution":{"observed_at":"2026-08-16T05:05:12.876317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:05:13.168715Z","title":null,"venue":null,"work_id":"928072ee-50bf-4032-a96a-079339cf85bc","year":2023},"citing_paper":{"arxiv_id":"2504.21553","last_updated":"2025-04-30T11:52:18Z","snapshot_observed_at":"2026-08-16T04:57:57.583738Z","submitted_at":"2025-04-30T11:52:18Z","title":"Precision Where It Matters: A Novel Spike Aware Mixed-Precision Quantization Strategy for LLaMA-based Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T05:05:12.880599Z"},"links":{"citing_paper":"/paper/2504.21553"},"observation_digest":"sha256:a6435b9284d4e829c2b8f8264bebfb6c99fa1cdb4e2f5cd2e457fb763950e7dc","observation_id":"7c4dff9b-d604-4e10-b11d-1e28b491087b","resolution":{"observed_at":"2026-08-16T05:05:13.173293Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17764","last_updated":"2024-02-27T18:56:19Z","snapshot_observed_at":"2026-08-14T15:17:37.878305Z","submitted_at":"2024-02-27T18:56:19Z","title":"The Era of 1-bit LLMs: All Large Language Models are in 1.58 Bits","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17764","snapshot_observed_at":"2026-08-16T05:05:12.885301Z","title":"arXiv preprint arXiv:2402.17764 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21553","last_updated":"2025-04-30T11:52:18Z","snapshot_observed_at":"2026-08-16T04:57:57.583738Z","submitted_at":"2025-04-30T11:52:18Z","title":"Precision Where It Matters: A Novel Spike Aware Mixed-Precision Quantization Strategy for LLaMA-based Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T05:05:12.885301Z"},"links":{"cited_paper":"/paper/2402.17764","citing_paper":"/paper/2504.21553"},"observation_digest":"sha256:46a16b680318180c96a4d0bfc95e955a6b8434140e14f5b87e4bca32165a1732","observation_id":"6f0aa712-e0ad-4e49-a513-41b0ae1e7d55","resolution":{"observed_at":"2026-08-16T05:05:12.885301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.05433","last_updated":"2022-09-29T20:47:07Z","snapshot_observed_at":"2026-08-14T05:39:52.416140Z","submitted_at":"2022-09-12T17:39:55Z","title":"FP8 Formats for Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.05433","snapshot_observed_at":"2026-08-16T05:05:12.890019Z","title":"arXiv preprint arXiv:2209.05433 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.21553","last_updated":"2025-04-30T11:52:18Z","snapshot_observed_at":"2026-08-16T04:57:57.583738Z","submitted_at":"2025-04-30T11:52:18Z","title":"Precision Where It Matters: A Novel Spike Aware Mixed-Precision Quantization Strategy for LLaMA-based Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T05:05:12.890019Z"},"links":{"cited_paper":"/paper/2209.05433","citing_paper":"/paper/2504.21553"},"observation_digest":"sha256:e82bdb63fa3d93242ee535ae2701ae4b657774608a6e2534bb79cc8905fe1485","observation_id":"33c4ffb8-f0d8-4383-ae7e-e6cd0eb63ca0","resolution":{"observed_at":"2026-08-16T05:05:12.890019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20835","last_updated":"2024-06-05T09:53:18Z","snapshot_observed_at":"2026-08-16T13:47:25.358421Z","submitted_at":"2024-05-31T14:24:33Z","title":"Outliers and Calibration Sets have Diminishing Effect on Quantization of Modern LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20835","snapshot_observed_at":"2026-08-16T05:05:12.894637Z","title":"arXiv preprint arXiv:2405.20835 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21553","last_updated":"2025-04-30T11:52:18Z","snapshot_observed_at":"2026-08-16T04:57:57.583738Z","submitted_at":"2025-04-30T11:52:18Z","title":"Precision Where It Matters: A Novel Spike Aware Mixed-Precision Quantization Strategy for LLaMA-based Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T05:05:12.894637Z"},"links":{"cited_paper":"/paper/2405.20835","citing_paper":"/paper/2504.21553"},"observation_digest":"sha256:4cc5a8181ee6199fd458a86c7eeb568f6595c0efb038d4f607609c97aa5c9428","observation_id":"6b44d73b-7bf7-42d4-9b94-3d55ac77e13c","resolution":{"observed_at":"2026-08-16T05:05:12.894637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:05:13.153771Z","title":"Proceedings of Machine Learning and Sys- tems 6, 483–498 (2024)","venue":null,"work_id":"71d374d2-d73d-4e49-a82f-91283f3c0e96","year":2024},"citing_paper":{"arxiv_id":"2504.21553","last_updated":"2025-04-30T11:52:18Z","snapshot_observed_at":"2026-08-16T04:57:57.583738Z","submitted_at":"2025-04-30T11:52:18Z","title":"Precision Where It Matters: A Novel Spike Aware Mixed-Precision Quantization Strategy for LLaMA-based Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T05:05:12.898893Z"},"links":{"citing_paper":"/paper/2504.21553"},"observation_digest":"sha256:a693da99e3fa8344988cf83721948be9e21a16224450843b0ca439e71f2a2a0c","observation_id":"3cb75199-7fba-4c16-a011-927ca194a9da","resolution":{"observed_at":"2026-08-16T05:05:13.158237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12016","last_updated":"2024-10-04T06:26:20Z","snapshot_observed_at":"2026-08-16T13:42:05.922451Z","submitted_at":"2024-06-17T18:33:44Z","title":"Prefixing Attention Sinks can Mitigate Activation Outliers for Large Language Model Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12016","snapshot_observed_at":"2026-08-16T05:05:12.903254Z","title":"arXiv preprint arXiv:2406.12016 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21553","last_updated":"2025-04-30T11:52:18Z","snapshot_observed_at":"2026-08-16T04:57:57.583738Z","submitted_at":"2025-04-30T11:52:18Z","title":"Precision Where It Matters: A Novel Spike Aware Mixed-Precision Quantization Strategy for LLaMA-based Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T05:05:12.903254Z"},"links":{"cited_paper":"/paper/2406.12016","citing_paper":"/paper/2504.21553"},"observation_digest":"sha256:1e63ebebed1bef813bbcbb758f8e5e309560fcc46165f50d9ba454eb22df9d4a","observation_id":"12ebaf82-965f-4019-8fe3-47c6875bdf78","resolution":{"observed_at":"2026-08-16T05:05:12.903254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-16T05:05:12.907873Z","title":"arXiv preprint arXiv:2402.17762 (2024) Precision Where It Matters 15","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21553","last_updated":"2025-04-30T11:52:18Z","snapshot_observed_at":"2026-08-16T04:57:57.583738Z","submitted_at":"2025-04-30T11:52:18Z","title":"Precision Where It Matters: A Novel Spike Aware Mixed-Precision Quantization Strategy for LLaMA-based Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T05:05:12.907873Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2504.21553"},"observation_digest":"sha256:b6ff0b2f18ceacdbc72c555538fcde23df6090efb9d455838cd15bfa647cd511","observation_id":"45cac19a-40ed-437a-98ad-ca2e1c43b986","resolution":{"observed_at":"2026-08-16T05:05:12.907873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:05:12.912149Z","title":"https://doi.org/10.5281/zenodo.10256836, https://doi.org/10","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21553","last_updated":"2025-04-30T11:52:18Z","snapshot_observed_at":"2026-08-16T04:57:57.583738Z","submitted_at":"2025-04-30T11:52:18Z","title":"Precision Where It Matters: A Novel Spike Aware Mixed-Precision Quantization Strategy for LLaMA-based Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T05:05:12.912149Z"},"links":{"citing_paper":"/paper/2504.21553"},"observation_digest":"sha256:765ed2f872b412ce62ee48cfc692e336a976a9828b3d467ae361ed4e6c2c6575","observation_id":"c33236ec-3ad5-4f97-8a55-7ddcb28b3c77","resolution":{"observed_at":"2026-08-16T05:05:12.912149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-16T05:05:12.916285Z","title":"arXiv preprint arXiv:2307.09288 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21553","last_updated":"2025-04-30T11:52:18Z","snapshot_observed_at":"2026-08-16T04:57:57.583738Z","submitted_at":"2025-04-30T11:52:18Z","title":"Precision Where It Matters: A Novel Spike Aware Mixed-Precision Quantization Strategy for LLaMA-based Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T05:05:12.916285Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2504.21553"},"observation_digest":"sha256:da58b278eb17fadebd8f5195deca5658d8f30ee28426bacb28f025955092355b","observation_id":"1ee496d5-c5ee-46a8-9f10-5f9e9b15a31f","resolution":{"observed_at":"2026-08-16T05:05:12.916285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-15T04:43:14.762539Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-16T05:05:12.920433Z","title":"arXiv preprint arXiv:2310.11453 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.21553","last_updated":"2025-04-30T11:52:18Z","snapshot_observed_at":"2026-08-16T04:57:57.583738Z","submitted_at":"2025-04-30T11:52:18Z","title":"Precision Where It Matters: A Novel Spike Aware Mixed-Precision Quantization Strategy for LLaMA-based Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T05:05:12.920433Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2504.21553"},"observation_digest":"sha256:63cddeefe8f8f05f94af318f62300a2ee03ab8284d88abd77e2ce63cbaa92b6c","observation_id":"a59e6372-493e-4fba-9906-368a752eeb44","resolution":{"observed_at":"2026-08-16T05:05:12.920433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:05:13.139064Z","title":"In: International Conference on Machine Learning","venue":null,"work_id":"5e273cc6-ba61-49bf-8e46-df3d94f44b8e","year":2023},"citing_paper":{"arxiv_id":"2504.21553","last_updated":"2025-04-30T11:52:18Z","snapshot_observed_at":"2026-08-16T04:57:57.583738Z","submitted_at":"2025-04-30T11:52:18Z","title":"Precision Where It Matters: A Novel Spike Aware Mixed-Precision Quantization Strategy for LLaMA-based Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T05:05:12.924694Z"},"links":{"citing_paper":"/paper/2504.21553"},"observation_digest":"sha256:3e5e6b2c9d337c1893a3114bceed7f317d140233c5cdde8381240406b037892f","observation_id":"2c5c0b76-c9f0-4067-93de-6e1e8c64449c","resolution":{"observed_at":"2026-08-16T05:05:13.144216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14428","last_updated":"2024-05-23T10:54:14Z","snapshot_observed_at":"2026-08-17T01:31:28.830514Z","submitted_at":"2024-05-23T10:54:14Z","title":"Mitigating Quantization Errors Due to Activation Spikes in GLU-Based LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14428","snapshot_observed_at":"2026-08-16T05:05:12.928814Z","title":"arXiv preprint arXiv:2405.14428 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21553","last_updated":"2025-04-30T11:52:18Z","snapshot_observed_at":"2026-08-16T04:57:57.583738Z","submitted_at":"2025-04-30T11:52:18Z","title":"Precision Where It Matters: A Novel Spike Aware Mixed-Precision Quantization Strategy for LLaMA-based Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T05:05:12.928814Z"},"links":{"cited_paper":"/paper/2405.14428","citing_paper":"/paper/2504.21553"},"observation_digest":"sha256:9907898b951f3f2ce42c84e3ffc634e375ee6e0c67ab0ecbe81e9d80c0951841","observation_id":"f28bf1b0-3d02-4e9d-a8cb-8af9175b062f","resolution":{"observed_at":"2026-08-16T05:05:12.928814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.21553","last_updated":"2025-04-30T11:52:18Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T04:57:57.583738Z","submitted_at":"2025-04-30T11:52:18Z","title":"Precision Where It Matters: A Novel Spike Aware Mixed-Precision Quantization Strategy for LLaMA-based Language Models"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 1 inbound Pith citation observation for arXiv:2504.21553."}