{"as_of":"2026-08-18T02:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c59e8ab4112a056aa1589caffe72847325a546404cdb375eb6b1354a4bac3f69","coverage":[{"denominator":77,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:55:07.904113Z","state":"measured"},{"denominator":77,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":77,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.08620/citation-record","integrity":"/paper/2505.08620/integrity","json":"/paper/2505.08620/citation-record.json","paper":"/paper/2505.08620"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:07.541700Z","title":"URL: \" 'urlintro :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.541700Z"},"links":{"citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:4408b49d742a3b70db57d06c82b141cb609460cc0927c47babbd5f1e4c21b18f","observation_id":"f69522c5-a6ee-43d5-a9a1-09703cf97739","resolution":{"observed_at":"2026-08-15T21:55:07.541700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:07.590040Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.590040Z"},"links":{"citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:cb61688951abad4eecc4e747851c8be57c04390c18acc73ccf26255832e414c1","observation_id":"b67e10b3-03eb-47d7-b597-d237c942fcbe","resolution":{"observed_at":"2026-08-15T21:55:07.590040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-17T03:25:04.404839Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-15T21:55:07.594196Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.594196Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:c5df7efcf85cc78d4d737516ad5f1a16f987008f0a2c95ad26147087261971c1","observation_id":"b2f02cb7-83f1-4776-a5a3-19333a2e918e","resolution":{"observed_at":"2026-08-15T21:55:07.594196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:07.598101Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.598101Z"},"links":{"citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:aa1c7c666f0dbd9e113bd23313fdf56ae7582d68bbcb2aedb98dd31fabb73c4b","observation_id":"b044020c-f4e1-4f5b-acae-1e4b273b55ca","resolution":{"observed_at":"2026-08-15T21:55:07.598101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00625","last_updated":"2024-12-29T17:38:32Z","snapshot_observed_at":"2026-08-16T14:30:33.338152Z","submitted_at":"2024-01-01T01:12:42Z","title":"Beyond Efficiency: A Systematic Survey of Resource-Efficient Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00625","snapshot_observed_at":"2026-08-15T21:55:07.601565Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.601565Z"},"links":{"cited_paper":"/paper/2401.00625","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:0e684053a157c22ae32867eabb334e2693c63ac8194fcf7d35a9b8e2185b22a4","observation_id":"a019d1c3-53cb-437e-b95b-39da7b8f67a9","resolution":{"observed_at":"2026-08-15T21:55:07.601565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1308.3432","last_updated":"2013-08-15T15:19:34Z","snapshot_observed_at":"2026-08-14T04:51:04.817737Z","submitted_at":"2013-08-15T15:19:34Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1308.3432","snapshot_observed_at":"2026-08-15T21:55:07.605534Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.605534Z"},"links":{"cited_paper":"/paper/1308.3432","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:533e52e68e38f4322497e6c84c91b8a3d39e1ee829238457d4700a7753967548","observation_id":"390bab73-f08d-41e8-8a53-0050a6a1e801","resolution":{"observed_at":"2026-08-15T21:55:07.605534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:07.610913Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.610913Z"},"links":{"citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:5ef9fedf8caa4837f89c81cb87f4c641bcd5ad624749c203f0bd0e38d373d135","observation_id":"c448fa03-738e-4332-b0ff-a203d72bc99f","resolution":{"observed_at":"2026-08-15T21:55:07.610913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.12948","last_updated":"2021-09-27T10:57:18Z","snapshot_observed_at":"2026-08-16T17:53:49.508131Z","submitted_at":"2021-09-27T10:57:18Z","title":"Understanding and Overcoming the Challenges of Efficient Transformer Quantization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.12948","snapshot_observed_at":"2026-08-15T21:55:07.616176Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.616176Z"},"links":{"cited_paper":"/paper/2109.12948","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:7c86b626e9e647092ade97d0ac439ceeb92796d7f31b4f8a6d07f5775b422173","observation_id":"b612e36d-a5c9-4395-b7d3-b36f369f8b7e","resolution":{"observed_at":"2026-08-15T21:55:07.616176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:07.621631Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.621631Z"},"links":{"citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:0fc77079af52acf1477effda664392fea693153a705d8a03612ad695aa615f0f","observation_id":"241426de-e55b-4c35-ac6e-f4c579804349","resolution":{"observed_at":"2026-08-15T21:55:07.621631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11960","last_updated":"2024-02-19T09:04:30Z","snapshot_observed_at":"2026-08-16T14:17:25.456736Z","submitted_at":"2024-02-19T09:04:30Z","title":"DB-LLM: Accurate Dual-Binarization for Efficient LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11960","snapshot_observed_at":"2026-08-15T21:55:07.626900Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.626900Z"},"links":{"cited_paper":"/paper/2402.11960","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:abda56f3989a14bb405d3d9be746b17b10b80309bdaa29b1b508216557268680","observation_id":"ed282d8c-f2bb-4639-a96f-a74561dd6492","resolution":{"observed_at":"2026-08-15T21:55:07.626900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11722","last_updated":"2024-10-11T15:35:49Z","snapshot_observed_at":"2026-08-16T19:10:17.744457Z","submitted_at":"2024-07-16T13:42:09Z","title":"Exploring Quantization for Efficient Pre-Training of Transformer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11722","snapshot_observed_at":"2026-08-15T21:55:07.632223Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.632223Z"},"links":{"cited_paper":"/paper/2407.11722","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:5305d20b5afafd338eecfcf9a26e6c9ef16f9e6756fb7d7687cd4920deb59760","observation_id":"e1032a04-a56d-4a91-8e36-13829a648ead","resolution":{"observed_at":"2026-08-15T21:55:07.632223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.7024","last_updated":"2015-09-23T01:00:44Z","snapshot_observed_at":"2026-08-16T23:18:15.329584Z","submitted_at":"2014-12-22T15:22:45Z","title":"Training deep neural networks with low precision multiplications","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.7024","snapshot_observed_at":"2026-08-15T21:55:07.637039Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.637039Z"},"links":{"cited_paper":"/paper/1412.7024","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:015f4455effa2e55e33a95441fa7e8560325da63d1c05b19c3ab7b65d0e54ea8","observation_id":"9afc2dce-7266-4d10-a6c4-0d7f140e64d3","resolution":{"observed_at":"2026-08-15T21:55:07.637039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:09.083915Z","title":null,"venue":null,"work_id":"78ecfe5d-6dd3-4c81-830c-c2cae5b6dee6","year":2022},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.641619Z"},"links":{"citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:d5dbf666950b7f71e131194fed607e17c86f769229bcc7f9150e4f88a041551c","observation_id":"2b9f9111-fc94-4566-a901-0eef4b546c9a","resolution":{"observed_at":"2026-08-15T21:55:09.089251Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:09.071630Z","title":null,"venue":null,"work_id":"97d3cf91-5078-4023-902e-04cf91a06928","year":2023},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.645509Z"},"links":{"citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:7982355d783e58838641d21d47230cf2b4dda2292f0fd55eafdd46cce17764e8","observation_id":"317cd469-d397-4b2f-a865-7a915706a715","resolution":{"observed_at":"2026-08-15T21:55:09.075712Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06118","last_updated":"2024-09-11T07:48:26Z","snapshot_observed_at":"2026-08-16T14:28:07.514724Z","submitted_at":"2024-01-11T18:54:44Z","title":"Extreme Compression of Large Language Models via Additive Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06118","snapshot_observed_at":"2026-08-15T21:55:07.649449Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.649449Z"},"links":{"cited_paper":"/paper/2401.06118","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:71ceb624e3ae54474cf59804ebcb4c203343c62a1e2f12b2486a92d308bf50dd","observation_id":"72338d91-ff4f-4743-a570-8e04237cdb1c","resolution":{"observed_at":"2026-08-15T21:55:07.649449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07320","last_updated":"2021-02-28T21:43:34Z","snapshot_observed_at":"2026-08-15T16:21:04.443626Z","submitted_at":"2020-04-15T20:10:53Z","title":"Training with Quantization Noise for Extreme Model Compression","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07320","snapshot_observed_at":"2026-08-15T21:55:07.653191Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.653191Z"},"links":{"cited_paper":"/paper/2004.07320","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:6a1fb5c60c0a788a8ce02e7307badd83b92d09975ad9a9de10e85949a8da6f8b","observation_id":"e481b8b8-95d1-49e2-94c4-40643a0cb9a8","resolution":{"observed_at":"2026-08-15T21:55:07.653191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.12746","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:08.824376Z","title":null,"venue":null,"work_id":"41fd3a28-6392-43d6-a2c3-adf8132633fc","year":2024},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.657822Z"},"links":{"citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:5e2a9933901a528ef902098337d6f8f781aa3c687836e1e2c87ddf77326f13bf","observation_id":"9995e763-ac56-4686-a063-0205d52a322e","resolution":{"observed_at":"2026-08-15T21:55:08.830986Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-16T07:57:19.216626Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-15T21:55:07.661224Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.661224Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:d40555204ea1268ffed4bcd3f268af31f8b5560896aa1ab8f022f9e3ed0a773a","observation_id":"ee1dbec1-dc4e-460a-9dbd-cd5d45772b9b","resolution":{"observed_at":"2026-08-15T21:55:07.661224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:07.664762Z","title":"Geman and G","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.664762Z"},"links":{"citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:a1625cff79df0eaa8bc7e0e5719597715f8fade609873c12a999de7e28d8ddc7","observation_id":"73c1d871-38e5-4d10-aba5-a23e6bff121e","resolution":{"observed_at":"2026-08-15T21:55:07.664762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-15T21:55:07.668750Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.668750Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:d4d9bfddc46cb43d7d7d200916709c7f412f49e7364fa80d754e65e17b2b67f6","observation_id":"539cfbdb-cf9a-4669-81d2-011086da64dd","resolution":{"observed_at":"2026-08-15T21:55:07.668750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:09.058725Z","title":null,"venue":null,"work_id":"c381882b-f0e6-4993-bbdc-0cc110144227","year":2025},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.673703Z"},"links":{"citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:fd64801df42f2ba5d78f9c2c9f40e2ffdd970a67b16ed36bbe1716df6f3d5b64","observation_id":"cf0a92c0-193d-4bd1-8410-948fb423db71","resolution":{"observed_at":"2026-08-15T21:55:09.063610Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:09.046160Z","title":null,"venue":null,"work_id":"1e4434bb-d512-4fe1-a873-1c17e7c3b6c7","year":2022},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.677674Z"},"links":{"citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:071b359abdd7133eb2a26183f5ca9893e2fb27b66ff88dc7f6e22f253ffb67ab","observation_id":"2b255e50-2ccd-4644-b7e1-772928d9ca39","resolution":{"observed_at":"2026-08-15T21:55:09.049817Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:07.681801Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.681801Z"},"links":{"citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:ad07e160e656da9d51599abc18b84b8cffc9046dfb1be17d662565d18371cd27","observation_id":"bee96acd-57cb-44b9-bc1d-723ba9b8e24d","resolution":{"observed_at":"2026-08-15T21:55:07.681801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:07.687546Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.687546Z"},"links":{"citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:e93b71b1684ab853bcef7c1a8e66cc95522ac0f5883eb28c4e774992a22ea86d","observation_id":"5cf4727b-b398-4cd7-88de-8f469956f3cf","resolution":{"observed_at":"2026-08-15T21:55:07.687546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T21:55:07.692906Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.692906Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:b001b5b364dd66e3d7634fad30a33861c4538ca146288ef4e8cbf44ea289123a","observation_id":"2492e1ea-9beb-4a3c-b2f4-52aa7ac82601","resolution":{"observed_at":"2026-08-15T21:55:07.692906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00838","last_updated":"2024-06-07T21:59:52Z","snapshot_observed_at":"2026-08-17T12:46:02.488423Z","submitted_at":"2024-02-01T18:28:55Z","title":"OLMo: Accelerating the Science of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00838","snapshot_observed_at":"2026-08-15T21:55:07.696724Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.696724Z"},"links":{"cited_paper":"/paper/2402.00838","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:77e1f434b7bb59a7ccf5a89b91830f21528070b0b74b2980eaeca8c2ef67ab2a","observation_id":"3c14984f-ced2-4bee-9d0a-e222d17ffae7","resolution":{"observed_at":"2026-08-15T21:55:07.696724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-08-17T20:47:46.242385Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-15T21:55:07.701737Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.701737Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:50bf6b4a290fce7a62c71097292c05dde1c9bad4f03557a4c2cf92e68260b328","observation_id":"6628a72e-73b2-43af-b950-afb68f0b51f6","resolution":{"observed_at":"2026-08-15T21:55:07.701737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.00396","last_updated":"2022-08-05T17:54:38Z","snapshot_observed_at":"2026-08-14T01:02:41.198730Z","submitted_at":"2021-10-31T03:32:18Z","title":"Efficiently Modeling Long Sequences with Structured State Spaces","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.00396","snapshot_observed_at":"2026-08-15T21:55:07.706408Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.706408Z"},"links":{"cited_paper":"/paper/2111.00396","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:a92517b5e1f97d04447f67282daab835dcc5fa55d11f9c2ccb1907dd3f6c3bf7","observation_id":"56ef0392-1fcc-4b5c-b08e-647a2b76e74b","resolution":{"observed_at":"2026-08-15T21:55:07.706408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11644","last_updated":"2023-10-02T06:12:30Z","snapshot_observed_at":"2026-08-13T11:19:55.436754Z","submitted_at":"2023-06-20T16:14:25Z","title":"Textbooks Are All You Need","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11644","snapshot_observed_at":"2026-08-15T21:55:07.710554Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.710554Z"},"links":{"cited_paper":"/paper/2306.11644","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:ea4e6c621e91d3f9ade27704b3438e5fb46cbca53e7b3f5fbea655731c96340f","observation_id":"c75d3048-5815-4775-b017-ed02bbb6d2fb","resolution":{"observed_at":"2026-08-15T21:55:07.710554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:09.027215Z","title":null,"venue":null,"work_id":"d566e4e5-8408-4641-90d6-9d1b5d7d4be2","year":2015},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.714634Z"},"links":{"citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:93207e0c64370828f7dc3dca558768d4e651535ef94da15fffd5a24f10001f14","observation_id":"ddbd6b45-3fa2-45a3-8dd1-d4e5c61d9605","resolution":{"observed_at":"2026-08-15T21:55:09.030593Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1510.00149","last_updated":"2016-02-15T06:25:40Z","snapshot_observed_at":"2026-08-04T16:59:47.843960Z","submitted_at":"2015-10-01T09:03:44Z","title":"Deep Compression: Compressing Deep Neural Networks with Pruning, Trained Quantization and Huffman Coding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1510.00149","snapshot_observed_at":"2026-08-15T21:55:07.718146Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.718146Z"},"links":{"cited_paper":"/paper/1510.00149","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:de670b227716c94af89c5593c7864ef4d02de94d6c9280e3c1f6e7d8f74bedac","observation_id":"13505d0a-3213-4536-a225-9a1d7d10215f","resolution":{"observed_at":"2026-08-15T21:55:07.718146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:09.016540Z","title":null,"venue":null,"work_id":"9788b4d3-dd25-46ae-9214-96f92d24cb34","year":2016},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.722456Z"},"links":{"citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:eb37c40eb37d6a151895a739ed37c2405424510f730e3ca180ba67cf8e351a00","observation_id":"31b67e2d-1fec-48bd-a0b9-410f2b5a01c3","resolution":{"observed_at":"2026-08-15T21:55:09.020190Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1502.01852","last_updated":"2015-02-06T10:44:00Z","snapshot_observed_at":"2026-08-14T23:01:07.044616Z","submitted_at":"2015-02-06T10:44:00Z","title":"Delving Deep into Rectifiers: Surpassing Human-Level Performance on ImageNet Classification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.01852","snapshot_observed_at":"2026-08-15T21:55:07.726237Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.726237Z"},"links":{"cited_paper":"/paper/1502.01852","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:e6a9b022fc595498e35a44e742d3fe785676e5bb3b392e1f602c84430dbd9da0","observation_id":"72520311-25a9-4c86-82e3-a70da4991417","resolution":{"observed_at":"2026-08-15T21:55:07.726237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:09.005596Z","title":null,"venue":null,"work_id":"90110a2d-6a45-49bf-ab67-76198cdd04f2","year":2024},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.729384Z"},"links":{"citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:5168fa7697e7ff6ba0272086df775643459133fe7d72bcba16c78d4faedde682","observation_id":"6b512627-f919-4499-bffc-84527ac9d3e2","resolution":{"observed_at":"2026-08-15T21:55:09.009050Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04291","last_updated":"2024-05-15T13:55:12Z","snapshot_observed_at":"2026-08-16T14:21:05.484802Z","submitted_at":"2024-02-06T09:26:34Z","title":"BiLLM: Pushing the Limit of Post-Training Quantization for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04291","snapshot_observed_at":"2026-08-15T21:55:07.732645Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.732645Z"},"links":{"cited_paper":"/paper/2402.04291","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:053d2a38f1b9fe4e7817fdffa09ba43a1bd0322e8e0f9a5e1b79cbb56e1a1a93","observation_id":"31b60467-2f1c-48dc-8bba-b80e586c3443","resolution":{"observed_at":"2026-08-15T21:55:07.732645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:08.991921Z","title":null,"venue":null,"work_id":"7e979991-de2f-40bc-956a-e49f462661ce","year":2024},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.736342Z"},"links":{"citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:e91968903fab7ab58c67f49ef05b975ab5f2db4245d941500026fbbb86885c73","observation_id":"3e5637d4-01c8-4b55-8dd3-a4921b77e2d9","resolution":{"observed_at":"2026-08-15T21:55:08.995645Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.05877","last_updated":"2017-12-15T23:56:52Z","snapshot_observed_at":"2026-08-14T20:03:06.929797Z","submitted_at":"2017-12-15T23:56:52Z","title":"Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.05877","snapshot_observed_at":"2026-08-15T21:55:07.740239Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.740239Z"},"links":{"cited_paper":"/paper/1712.05877","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:f0fd139b88207ed87da05b37a74a67af86c20098fca6d91c4bc2110f94038791","observation_id":"a2e26410-c174-4e2f-9a8f-48983be6e020","resolution":{"observed_at":"2026-08-15T21:55:07.740239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:07.744183Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.744183Z"},"links":{"citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:94956d505be5e79dd9d92bd364c0bf021733b0ffbdd79910e34554016c021cd3","observation_id":"0581e8b3-7625-4085-869d-d0bbda431e7c","resolution":{"observed_at":"2026-08-15T21:55:07.744183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-15T21:55:07.747879Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.747879Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:2ee015332c3f4da7bff50292cc25d4b94d71553b623b1cbd74c793b2150a32d8","observation_id":"8030413c-c3af-4266-b404-9671b20a4ef9","resolution":{"observed_at":"2026-08-15T21:55:07.747879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16775","last_updated":"2024-06-06T13:38:26Z","snapshot_observed_at":"2026-08-16T14:15:13.149593Z","submitted_at":"2024-02-26T17:45:36Z","title":"A Comprehensive Evaluation of Quantization Strategies for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16775","snapshot_observed_at":"2026-08-15T21:55:07.751298Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.751298Z"},"links":{"cited_paper":"/paper/2402.16775","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:4d700a926ce03e3b0adfb2572c2de92a421438cc7cc0d69ce3d634c3ef3d43c8","observation_id":"91623583-dc4e-47ec-b501-ead0a05400bf","resolution":{"observed_at":"2026-08-15T21:55:07.751298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-15T21:55:07.755352Z","title":"Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.755352Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:0961d287e584fd33f0c1195b8bbfbe48f5206fb2e246f585bdb14f1b87f7d326","observation_id":"84fc88d0-9a2a-44a7-98c2-51c5908f518c","resolution":{"observed_at":"2026-08-15T21:55:07.755352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.06990","last_updated":"2021-06-02T18:09:50Z","snapshot_observed_at":"2026-08-16T18:24:38.651152Z","submitted_at":"2021-05-14T17:54:28Z","title":"BERT Busters: Outlier Dimensions that Disrupt Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.06990","snapshot_observed_at":"2026-08-15T21:55:07.759006Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.759006Z"},"links":{"cited_paper":"/paper/2105.06990","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:fad1216bd73f0b398733e421a275c40c54ef5dab62b144873066d1c430c4f4ec","observation_id":"a22e979f-9033-4976-88f9-88dd4860720f","resolution":{"observed_at":"2026-08-15T21:55:07.759006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:07.763703Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.763703Z"},"links":{"citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:a9d7ee2a6bf8652373c0030d0c6aa14d05491b596d8cefec43aedc414d416924","observation_id":"abd97295-052b-48ee-a1d6-9311a89c0d33","resolution":{"observed_at":"2026-08-15T21:55:07.763703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10849","last_updated":"2024-10-06T04:33:06Z","snapshot_observed_at":"2026-08-16T15:11:19.253004Z","submitted_at":"2024-10-06T04:33:06Z","title":"Continuous Approximations for Improving Quantization Aware Training of LLMs","version":1},"cited_work":{"arxiv_id":"2410.10849","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.10849","snapshot_observed_at":"2026-08-15T21:55:08.477294Z","title":"Continuous Approximations for Improving Quantization Aware Training of LLMs","venue":"cs.LG","work_id":"f9a632e6-4532-4d2c-baec-0cf4d9b20cf9","year":2024},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.770818Z"},"links":{"cited_paper":"/paper/2410.10849","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:cf22835b00f0a01516d6f93297f5a32ecd2882e6bf5a765163f2a85fda809d2c","observation_id":"c88b5e1e-c90d-4b8c-8475-92eaa9dec5a1","resolution":{"observed_at":"2026-08-15T21:55:08.482844Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:08.964483Z","title":null,"venue":null,"work_id":"a2dd2037-9392-49b4-9405-0dc0f808634f","year":2024},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.774992Z"},"links":{"citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:c4af13107899ca4361b85a781a854c3bdc557f88349c6183016c42c087ab9fb1","observation_id":"1c95a6d2-a684-4f1b-aef2-4a70c054fa29","resolution":{"observed_at":"2026-08-15T21:55:08.968173Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00978","last_updated":"2026-04-25T06:58:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-01T17:59:10Z","title":"AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00978","snapshot_observed_at":"2026-08-15T21:55:07.778009Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.778009Z"},"links":{"cited_paper":"/paper/2306.00978","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:f14b517c717bfe4a4d487c31cc73b3ab318d10ad40f6fd330b246dfda3d544c3","observation_id":"4f4fbe98-243a-4f87-99c3-d3d6773e5afe","resolution":{"observed_at":"2026-08-15T21:55:07.778009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04532","last_updated":"2025-05-01T02:14:05Z","snapshot_observed_at":"2026-08-16T13:54:34.341970Z","submitted_at":"2024-05-07T17:59:30Z","title":"QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04532","snapshot_observed_at":"2026-08-15T21:55:07.782932Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.782932Z"},"links":{"cited_paper":"/paper/2405.04532","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:d39f6f47ac8dd19635d598a8cc57f25425a0ce280b4f34fa183598d232257b45","observation_id":"62f8c64e-cd0c-44b1-a2b5-888e4359c5a2","resolution":{"observed_at":"2026-08-15T21:55:07.782932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-15T21:55:07.787163Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.787163Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:4d85e460e4e23de2825061640c371b9da22bde1bcfcd715409b5a2cc82c436be","observation_id":"7236cffe-940f-406e-ad5c-63f2ecc2844d","resolution":{"observed_at":"2026-08-15T21:55:07.787163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:07.791113Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.791113Z"},"links":{"citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:6bf919317505929187ce958fe330936a707e8b6e906dff0d67ff90f476a9d89b","observation_id":"c9d94162-12e3-4817-ba77-2e12764f43ec","resolution":{"observed_at":"2026-08-15T21:55:07.791113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17764","last_updated":"2024-02-27T18:56:19Z","snapshot_observed_at":"2026-08-14T15:17:37.878305Z","submitted_at":"2024-02-27T18:56:19Z","title":"The Era of 1-bit LLMs: All Large Language Models are in 1.58 Bits","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17764","snapshot_observed_at":"2026-08-15T21:55:07.794971Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.794971Z"},"links":{"cited_paper":"/paper/2402.17764","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:92aed708a4fb286bcffdfffc4ab87651861c6fc4a75a4857c4b983e9ee642345","observation_id":"5ba550af-65c3-4b9f-aab6-7ef3e791b268","resolution":{"observed_at":"2026-08-15T21:55:07.794971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.05433","last_updated":"2022-09-29T20:47:07Z","snapshot_observed_at":"2026-08-14T05:39:52.416140Z","submitted_at":"2022-09-12T17:39:55Z","title":"FP8 Formats for Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.05433","snapshot_observed_at":"2026-08-15T21:55:07.798384Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.798384Z"},"links":{"cited_paper":"/paper/2209.05433","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:44aab69663cfc5c35311b398f43b3fcbb5773a366b8b5ebb9ce04f35bcc6ae4f","observation_id":"683e553e-1eea-4b30-a8e2-392558263909","resolution":{"observed_at":"2026-08-15T21:55:07.798384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08295","last_updated":"2021-06-15T17:12:42Z","snapshot_observed_at":"2026-08-02T11:19:40.664702Z","submitted_at":"2021-06-15T17:12:42Z","title":"A White Paper on Neural Network Quantization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08295","snapshot_observed_at":"2026-08-15T21:55:07.802619Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.802619Z"},"links":{"cited_paper":"/paper/2106.08295","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:f2ef42e8ced7aaa6ab83e4d1d09cf95f0772bc62e17c2a7335bc5432a209f06f","observation_id":"2ae36f70-9e16-48f6-a26d-3f7e5633bdec","resolution":{"observed_at":"2026-08-15T21:55:07.802619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00656","last_updated":"2025-10-08T07:50:45Z","snapshot_observed_at":"2026-08-17T13:58:40.683829Z","submitted_at":"2024-12-31T21:55:10Z","title":"2 OLMo 2 Furious","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00656","snapshot_observed_at":"2026-08-15T21:55:07.808536Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.808536Z"},"links":{"cited_paper":"/paper/2501.00656","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:d9d5fe2a1ab295ada5386402d169b40650b051a4c8447d40b4ae3a92d6ce3ffd","observation_id":"ebf99f63-2438-4240-a0f0-29eddb7c528b","resolution":{"observed_at":"2026-08-15T21:55:07.808536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13048","last_updated":"2023-12-11T03:58:56Z","snapshot_observed_at":"2026-08-17T17:58:38.402665Z","submitted_at":"2023-05-22T13:57:41Z","title":"RWKV: Reinventing RNNs for the Transformer Era","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13048","snapshot_observed_at":"2026-08-15T21:55:07.812705Z","title":"Wind, Stanislaw Wozniak, Ruichong Zhang, Zhenyuan Zhang, Qihang Zhao, Peng Zhou, Qinghua Zhou, Jian Zhu, and Rui-Jie Zhu","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.812705Z"},"links":{"cited_paper":"/paper/2305.13048","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:605f5a578d6d9d8ffbbaca5de1aedad58c0e1070243cd12c47ffff56573caa36","observation_id":"64b743a7-f7db-4c10-88b1-798fc318679e","resolution":{"observed_at":"2026-08-15T21:55:07.812705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18313","last_updated":"2023-12-19T12:27:58Z","snapshot_observed_at":"2026-08-16T14:48:11.655051Z","submitted_at":"2023-10-27T17:59:51Z","title":"FP8-LM: Training FP8 Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.18313","snapshot_observed_at":"2026-08-15T21:55:07.817270Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.817270Z"},"links":{"cited_paper":"/paper/2310.18313","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:420cd75aaf8f38bdac1f74af5eda10e05f5aaeac0f43faaeb73ecebb4187b49f","observation_id":"fe5b0c0e-2db7-4bbd-8de5-f6fc9c49b100","resolution":{"observed_at":"2026-08-15T21:55:07.817270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:07.821797Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.821797Z"},"links":{"citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:34de8a2b877e65fa1c4007a6a78d0cee3b47a71fead5e27fdd0bbd00cf619ebf","observation_id":"9afee1ad-9f2f-47ff-bcb8-4c22d24e1c22","resolution":{"observed_at":"2026-08-15T21:55:07.821797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00034","last_updated":"2023-11-07T20:41:22Z","snapshot_observed_at":"2026-08-16T14:56:29.720744Z","submitted_at":"2023-09-29T14:35:27Z","title":"PB-LLM: Partially Binarized Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00034","snapshot_observed_at":"2026-08-15T21:55:07.826096Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.826096Z"},"links":{"cited_paper":"/paper/2310.00034","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:654f42c2fcbcd67f5e776e276217e7c598c2506b13465fe4fc6d11bb4016f483","observation_id":"2c7a0049-4f22-4e93-bf9c-61ee84c54c6e","resolution":{"observed_at":"2026-08-15T21:55:07.826096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07611","last_updated":"2023-10-22T00:37:06Z","snapshot_observed_at":"2026-08-16T14:53:00.911254Z","submitted_at":"2023-10-11T15:56:00Z","title":"Democratizing LLMs: An Exploration of Cost-Performance Trade-offs in Self-Refined Open-Source Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07611","snapshot_observed_at":"2026-08-15T21:55:07.829791Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.829791Z"},"links":{"cited_paper":"/paper/2310.07611","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:aee075f60775abf6f442a81fa5513d40aabf507fae844f3036f5c5415f24ade9","observation_id":"ddeb10b5-e3e7-4d32-97f1-1b75c32f4ca7","resolution":{"observed_at":"2026-08-15T21:55:07.829791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9236.36953","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:08.288069Z","title":null,"venue":null,"work_id":"05166a85-d8c0-41a5-ad85-f3dc111d04d0","year":2024},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.835328Z"},"links":{"citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:854c867e18da78eb72a60770e01bcce99d828bdca95de932e7cce116859ec140","observation_id":"7ec3369c-b2ad-43fd-b81a-0d9204c7ad44","resolution":{"observed_at":"2026-08-15T21:55:08.294400Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-15T21:55:07.839653Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.839653Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:251a068a56e0d9bfc28ffba527ec66d244b36694ae4b63cb1c0fa7f9f6c15fc9","observation_id":"df39d202-0046-41ee-887b-6abd5c9aa80d","resolution":{"observed_at":"2026-08-15T21:55:07.839653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-15T21:55:07.843300Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.843300Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:9e34fe2fac1cb48a1d1f00e5de9823e330e5f8dfc73d36927da66970eb31a50b","observation_id":"3fff1632-0f20-4d0a-b451-838739deef44","resolution":{"observed_at":"2026-08-15T21:55:07.843300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17951","last_updated":"2023-06-15T08:14:02Z","snapshot_observed_at":"2026-08-16T15:43:49.006717Z","submitted_at":"2023-03-31T10:29:17Z","title":"FP8 versus INT8 for efficient deep learning inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17951","snapshot_observed_at":"2026-08-15T21:55:07.846294Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.846294Z"},"links":{"cited_paper":"/paper/2303.17951","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:6d22558e254b126cd5e1b1cf16fbb050d59763324165a0fa610168e593282f42","observation_id":"40a72d16-bfc1-49c1-a365-f495bba7c8a8","resolution":{"observed_at":"2026-08-15T21:55:07.846294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:07.849606Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.849606Z"},"links":{"citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:9d10246c0762a7f8d859dcc751c2f2adb6ed4c5887359f567180b26ae5e7ec49","observation_id":"c743b5c6-75ca-4705-b5a7-269323e77e4d","resolution":{"observed_at":"2026-08-15T21:55:07.849606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03350","last_updated":"2024-12-28T09:18:36Z","snapshot_observed_at":"2026-08-16T13:03:19.281079Z","submitted_at":"2024-11-04T04:43:01Z","title":"A Comprehensive Survey of Small Language Models in the Era of Large Language Models: Techniques, Enhancements, Applications, Collaboration with LLMs, and Trustworthiness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03350","snapshot_observed_at":"2026-08-15T21:55:07.852727Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.852727Z"},"links":{"cited_paper":"/paper/2411.03350","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:796566ac35bc60bf0593b3e4b22ba071465e2e5d6f0ee63bfd5add9cf4b2c68d","observation_id":"fb280529-c917-4e18-9ceb-8f41d2044b19","resolution":{"observed_at":"2026-08-15T21:55:07.852727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-15T04:43:14.762539Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-15T21:55:07.856402Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.856402Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:9be4eab29fb958b8599f437e69aaec1e3d0d317cb10631251bc0c55c5f31eff7","observation_id":"a21cfa1a-5be7-4884-ba60-aff6a251ca15","resolution":{"observed_at":"2026-08-15T21:55:07.856402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-17T00:14:01.413100Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.07682","snapshot_observed_at":"2026-08-15T21:55:07.859962Z","title":"Chi, Tatsunori Hashimoto, Oriol Vinyals, Percy Liang, Jeff Dean, and William Fedus","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.859962Z"},"links":{"cited_paper":"/paper/2206.07682","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:06d3b9d11decd3b9e0d3846bc00681cee845e979c92ca6f54bb2380c57125a53","observation_id":"402abf5c-5084-427c-a65a-d9f20c138853","resolution":{"observed_at":"2026-08-15T21:55:07.859962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09145","last_updated":"2023-10-23T08:48:31Z","snapshot_observed_at":"2026-08-16T15:39:30.998681Z","submitted_at":"2023-04-18T17:34:23Z","title":"Outlier Suppression+: Accurate quantization of large language models by equivalent and optimal shifting and scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09145","snapshot_observed_at":"2026-08-15T21:55:07.863414Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.863414Z"},"links":{"cited_paper":"/paper/2304.09145","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:84eb6fdfc4a333f4b9deeee5afedcc573a37f2d3e1c2b8e0a00ce26effd463ad","observation_id":"31570def-bd1d-4203-a5d6-ef675b01d94d","resolution":{"observed_at":"2026-08-15T21:55:07.863414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:08.937003Z","title":null,"venue":null,"work_id":"439feb50-6736-4d08-b187-cf8d1b4e7942","year":2022},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.866313Z"},"links":{"citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:a89e148695f2e5876dddc13d928005200efdf53cccb4a596f3f2bb0db51f916f","observation_id":"54b24241-8fda-405e-8762-3237e277b414","resolution":{"observed_at":"2026-08-15T21:55:08.940754Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.03771","last_updated":"2020-07-14T03:42:34Z","snapshot_observed_at":"2026-07-06T08:27:58.343233Z","submitted_at":"2019-10-09T03:23:22Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.03771","snapshot_observed_at":"2026-08-15T21:55:07.869841Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.869841Z"},"links":{"cited_paper":"/paper/1910.03771","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:39c0edf5a8bc490dc709e9a8b34ad915f7dbfd9710983d4ce5840f393eabd674","observation_id":"f23f9d0f-c4b7-4dc2-b8ac-ddcaf324ea13","resolution":{"observed_at":"2026-08-15T21:55:07.869841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.10438","last_updated":"2024-03-29T19:21:58Z","snapshot_observed_at":"2026-08-16T16:15:00.962632Z","submitted_at":"2022-11-18T18:59:33Z","title":"SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.10438","snapshot_observed_at":"2026-08-15T21:55:07.873536Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.873536Z"},"links":{"cited_paper":"/paper/2211.10438","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:1bc9059a637c5208c3c5a92104ea5274398ba69a0ea775b91a1d2afb4a31b0b6","observation_id":"0952677b-5ac0-45bf-bdc4-34e0726f8c96","resolution":{"observed_at":"2026-08-15T21:55:07.873536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.01861","last_updated":"2022-06-04T00:28:21Z","snapshot_observed_at":"2026-08-16T16:55:23.882455Z","submitted_at":"2022-06-04T00:28:21Z","title":"ZeroQuant: Efficient and Affordable Post-Training Quantization for Large-Scale Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.01861","snapshot_observed_at":"2026-08-15T21:55:07.877611Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.877611Z"},"links":{"cited_paper":"/paper/2206.01861","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:0b814db0b1bedcadd8c83d4bbc94d8fd4ee5dc93aa8ed93f737d24303404df76","observation_id":"45ec0f7b-73cb-4e47-bc37-5d2b3f5d44d3","resolution":{"observed_at":"2026-08-15T21:55:07.877611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08302","last_updated":"2023-05-26T00:17:06Z","snapshot_observed_at":"2026-08-16T15:48:09.692405Z","submitted_at":"2023-03-15T01:27:15Z","title":"ZeroQuant-V2: Exploring Post-training Quantization in LLMs from Comprehensive Study to Low Rank Compensation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08302","snapshot_observed_at":"2026-08-15T21:55:07.881424Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.881424Z"},"links":{"cited_paper":"/paper/2303.08302","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:dc1c3d0a6d856b56ecb4f8d2565afe4a8a0f85d0bc6a1a85d8f64b5334af34e8","observation_id":"95b31ac0-1b8e-471c-a3b7-6cd45ee75356","resolution":{"observed_at":"2026-08-15T21:55:07.881424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.05662","last_updated":"2019-09-25T14:33:44Z","snapshot_observed_at":"2026-08-14T17:02:42.244835Z","submitted_at":"2019-03-13T18:23:43Z","title":"Understanding Straight-Through Estimator in Training Activation Quantized Neural Nets","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.05662","snapshot_observed_at":"2026-08-15T21:55:07.886040Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.886040Z"},"links":{"cited_paper":"/paper/1903.05662","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:6a099edc0ec7bbd9fb766da8a1551c624f4cc6b3ef0b681b238a5bc591787f8a","observation_id":"fb9275a2-7580-49fe-a2fa-754f1f608c9b","resolution":{"observed_at":"2026-08-15T21:55:07.886040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:55:07.890297Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.890297Z"},"links":{"citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:037ea6e05a075b973042bebdf70801bbb78445bd99e1b3d84357f2870e3fe442","observation_id":"5f74d1cf-aad8-4c85-9702-28eb2d240c09","resolution":{"observed_at":"2026-08-15T21:55:07.890297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-15T21:55:07.894631Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.894631Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:7a2f4408c16cac26397b57faa4dd2f7d67833f61f348732f492d0ca91281d408","observation_id":"988529cf-de0d-4dc4-b941-e1875361a074","resolution":{"observed_at":"2026-08-15T21:55:07.894631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14294","last_updated":"2024-07-19T04:47:36Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T15:53:08Z","title":"A Survey on Efficient Inference for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14294","snapshot_observed_at":"2026-08-15T21:55:07.900011Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.900011Z"},"links":{"cited_paper":"/paper/2404.14294","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:d96dcb39d51f1ff6e0625b6f9b168e6dbdb07c97d40552cac73f81a7a8504dc0","observation_id":"1c61e00b-4e12-4b9c-ae6b-80370319db2e","resolution":{"observed_at":"2026-08-15T21:55:07.900011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07633","last_updated":"2024-07-30T13:14:55Z","snapshot_observed_at":"2026-08-16T15:08:25.859326Z","submitted_at":"2023-08-15T08:31:05Z","title":"A Survey on Model Compression for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.07633","snapshot_observed_at":"2026-08-15T21:55:07.904113Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-15T21:55:07.904113Z"},"links":{"cited_paper":"/paper/2308.07633","citing_paper":"/paper/2505.08620"},"observation_digest":"sha256:e2468abde3a2805afc902688eb7c6f772bfa7852cd612089b4123e966f0d04d1","observation_id":"5f175c5c-0b68-40bc-82a2-495a124fb0cb","resolution":{"observed_at":"2026-08-15T21:55:07.904113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.08620","last_updated":"2025-05-13T14:39:33Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-16T23:19:04.525528Z","submitted_at":"2025-05-13T14:39:33Z","title":"Resource-Efficient Language Models: Quantization for Fast and Accessible Inference"},"reference_resolution":{"displayed":77,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":74,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":77},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 0 inbound Pith citation observations for arXiv:2505.08620."}