Pith. sign in

Paper Citation Record · LEDGER

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference

As of 22 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 0 inbound Pith citation observations for arXiv:2505.08620.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.08620 v1

Coverage vector

measured 77 of 77 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-15T21:55:07.904113Z

measured 77 of 77 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-22T06:32:14.747728+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

77 of 77 outbound references displayed

  • verified exact1
  • verified fuzzy0
  • unresolved74
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch2

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation f69522c5-a6ee-43d5-a9a1-09703cf97739 · outbound

This paper cites URL: " 'urlintro :=.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference URL: " 'urlintro :=

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.541700Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.541700Z digest=sha256:831465e649e59bdd5c5c05fa69e1613a2e64e2470a9527431f3f42b5aaaad027

Observation b67e10b3-03eb-47d7-b597-d237c942fcbe · outbound

This paper cites write newline.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference write newline

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.590040Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.590040Z digest=sha256:f00b348ba4682aebc2c1f4966650c57566a14c29626b10706d99036fc6877722

Observation b2f02cb7-83f1-4776-a5a3-19333a2e918e · outbound

This paper cites Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.594196Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.594196Z digest=sha256:14fa34d34003c9bb7c49c38cbfe4631258a97a95d6a624bae612c6c6bfa8f724

Observation b044020c-f4e1-4f5b-acae-1e4b273b55ca · outbound

This paper cites an unresolved cited work.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Unresolved cited work

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.598101Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.598101Z digest=sha256:151ed2f4845bc7820aa4d2cb5ec6f5e891e25ab199553e2e18260bb5bfeaf24b

Observation a019d1c3-53cb-437e-b95b-39da7b8f67a9 · outbound

This paper cites Beyond Efficiency: A Systematic Survey of Resource-Efficient Large Language Models.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Beyond Efficiency: A Systematic Survey of Resource-Efficient Large Language Models

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.601565Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.601565Z digest=sha256:ded9d20b0cec6e65923eb59a8e1ab1527a2d3d85ac324ea8ebe49cee8ff8955d

Observation 390bab73-f08d-41e8-8a53-0050a6a1e801 · outbound

This paper cites Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.605534Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.605534Z digest=sha256:5d03bd29f33c1c962f1dcc99377f23d7065eeb065cd454714ae0490853f208b6

Observation c448fa03-738e-4332-b0ff-a203d72bc99f · outbound

This paper cites an unresolved cited work.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Unresolved cited work

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.610913Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.610913Z digest=sha256:7409bfee8d4c91a638224c3bc490eaaa6edee9048c244fef083c31e51d1585cd

Observation b612e36d-a5c9-4395-b7d3-b36f369f8b7e · outbound

This paper cites Understanding and Overcoming the Challenges of Efficient Transformer Quantization.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Understanding and Overcoming the Challenges of Efficient Transformer Quantization

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.616176Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.616176Z digest=sha256:0be5a4d54b156da7aca42437ec360177b042d03cd0553fbd5bd1e7476768ef36

Observation 241426de-e55b-4c35-ac6e-f4c579804349 · outbound

This paper cites an unresolved cited work.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Unresolved cited work

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.621631Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.621631Z digest=sha256:3bced96c1bd76e4adebfbb28534ebb753e5fe2a77ee8724e47e15aeb4ccaffdc

Observation ed282d8c-f2bb-4639-a96f-a74561dd6492 · outbound

This paper cites DB-LLM: Accurate Dual-Binarization for Efficient LLMs.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference DB-LLM: Accurate Dual-Binarization for Efficient LLMs

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.626900Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.626900Z digest=sha256:82e988c2b50788920af4695b609dd57fb5ddafb10b25dce21e8c3c9a65d4f7b5

Observation e1032a04-a56d-4a91-8e36-13829a648ead · outbound

This paper cites Exploring Quantization for Efficient Pre-Training of Transformer Language Models.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Exploring Quantization for Efficient Pre-Training of Transformer Language Models

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.632223Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.632223Z digest=sha256:52c9205f2ce43097ec0739353b3519505f6311ec196e328ab075cd79450fd4df

Observation 9afc2dce-7266-4d10-a6c4-0d7f140e64d3 · outbound

This paper cites Training deep neural networks with low precision multiplications.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Training deep neural networks with low precision multiplications

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.637039Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.637039Z digest=sha256:a2025926c750c71bb8eebb9a9a2ee411de35faad55405532d8e8c4dcb7303b3a

Observation 2b9f9111-fc94-4566-a901-0eef4b546c9a · outbound

This paper cites an unresolved cited work.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Unresolved cited work

Reference 13

Resolution
unresolved
raw_fallback, observed 2026-08-15T21:55:09.089251Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-15T21:55:07.641619Z digest=sha256:df574779b84c2370a5d7249fd42b497d1d1772e1ff679ca42ead87fca5014324

Observation 317cd469-d397-4b2f-a865-7a915706a715 · outbound

This paper cites an unresolved cited work.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Unresolved cited work

Reference 14

Resolution
unresolved
raw_fallback, observed 2026-08-15T21:55:09.075712Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-15T21:55:07.645509Z digest=sha256:0ea11bd0c62533418d82dff07b6934e8676bad7721dbb4275c101ba37b0bf759

Observation 72338d91-ff4f-4743-a570-8e04237cdb1c · outbound

This paper cites Extreme Compression of Large Language Models via Additive Quantization.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Extreme Compression of Large Language Models via Additive Quantization

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.649449Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.649449Z digest=sha256:6ce360afed6f9c31d97e6553c5d9637b327eee6c8530f1262f446d111eca0c69

Observation e481b8b8-95d1-49e2-94c4-40643a0cb9a8 · outbound

This paper cites Training with Quantization Noise for Extreme Model Compression.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Training with Quantization Noise for Extreme Model Compression

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.653191Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.653191Z digest=sha256:0f76aa308df3021821e164c47ac2a391a59c664736f6c3858d18761d00a88d8b

Observation 9995e763-ac56-4686-a063-0205d52a322e · outbound

This paper cites an unresolved cited work.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Unresolved cited work

Reference 17

Resolution
metadata mismatch
raw_fallback, observed 2026-08-15T21:55:08.830986Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-15T21:55:07.657822Z digest=sha256:33e75f887845abce439c5363e5e8a369f53e74b98197e1620b278d895f38e4af

Observation ee1dbec1-dc4e-460a-9dbd-cd5d45772b9b · outbound

This paper cites GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.661224Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.661224Z digest=sha256:4c9f057ff1415207b420b19a04950a437b53002b2dc3d09bc6fd77251e2644dd

Observation 73c1d871-38e5-4d10-aba5-a23e6bff121e · outbound

This paper cites Geman and G.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Geman and G

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.664762Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.664762Z digest=sha256:00b6142ed623d530c6b082250e8a4027a95a4c0caa6f324c3a22c4911b478e62

Observation 539cfbdb-cf9a-4669-81d2-011086da64dd · outbound

This paper cites Gemma 2: Improving Open Language Models at a Practical Size.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Gemma 2: Improving Open Language Models at a Practical Size

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.668750Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.668750Z digest=sha256:255e0dfb31893d04ae66a289231ccdc4cc8caf7294506f9e059da5d3c1d8bea5

Observation cf0a92c0-193d-4bd1-8410-948fb423db71 · outbound

This paper cites an unresolved cited work.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Unresolved cited work

Reference 21

Resolution
unresolved
raw_fallback, observed 2026-08-15T21:55:09.063610Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-15T21:55:07.673703Z digest=sha256:399195efaecb185a65fdac837d3263da9cfc5e212a5a4aa5da435cb0ccf24139

Observation 2b255e50-2ccd-4644-b7e1-772928d9ca39 · outbound

This paper cites an unresolved cited work.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Unresolved cited work

Reference 22

Resolution
unresolved
raw_fallback, observed 2026-08-15T21:55:09.049817Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-15T21:55:07.677674Z digest=sha256:5b460585a149b1dfcbb2c10c0affd8f16dd1f660a0905b54d64b2061dc066453

Observation bee96acd-57cb-44b9-bc1d-723ba9b8e24d · outbound

This paper cites an unresolved cited work.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Unresolved cited work

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.681801Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.681801Z digest=sha256:5335fcce6602fb5f2392c948d7e3057f39ebbca9aea03eef4c11f634e14793d8

Observation 5cf4727b-b398-4cd7-88de-8f469956f3cf · outbound

This paper cites an unresolved cited work.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Unresolved cited work

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.687546Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.687546Z digest=sha256:e90e805e3c7e377174147ce7009e90472840ba83b94c86ae07bda714b27da9da

Observation 2492e1ea-9beb-4a3c-b2f4-52aa7ac82601 · outbound

This paper cites The Llama 3 Herd of Models.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference The Llama 3 Herd of Models

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.692906Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.692906Z digest=sha256:52c15ef89b100b87b89927ba7bc0ea6270496070e198404500012e1c32a66b3f

Observation 3c14984f-ced2-4bee-9d0a-e222d17ffae7 · outbound

This paper cites OLMo: Accelerating the Science of Language Models.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference OLMo: Accelerating the Science of Language Models

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.696724Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.696724Z digest=sha256:42975bb1f05158bd7b3db400f8b7c67c469cdbb7d62b00114eb251d8dc00ffaf

Observation 6628a72e-73b2-43af-b950-afb68f0b51f6 · outbound

This paper cites Mamba: Linear-Time Sequence Modeling with Selective State Spaces.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Mamba: Linear-Time Sequence Modeling with Selective State Spaces

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.701737Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.701737Z digest=sha256:f3f8e5dfa607d9ec83c987467c8c956aab926e90d156afcbe7d5aadc3980348c

Observation 56ef0392-1fcc-4b5c-b08e-647a2b76e74b · outbound

This paper cites Efficiently Modeling Long Sequences with Structured State Spaces.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Efficiently Modeling Long Sequences with Structured State Spaces

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.706408Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.706408Z digest=sha256:ae59a52d34895f9ce7bc70038b4e0698007810c96d7309094b9b934ad23a994f

Observation c75d3048-5815-4775-b017-ed02bbb6d2fb · outbound

This paper cites Textbooks Are All You Need.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Textbooks Are All You Need

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.710554Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.710554Z digest=sha256:b66352aa09ea6a5bb2a7173022c5398ec8859dcc9499a75f25bff47e2054416c

Observation ddbd6b45-3fa2-45a3-8dd1-d4e5c61d9605 · outbound

This paper cites an unresolved cited work.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Unresolved cited work

Reference 30

Resolution
unresolved
raw_fallback, observed 2026-08-15T21:55:09.030593Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-15T21:55:07.714634Z digest=sha256:c2b5b0dd72f70c9b3a6e6886001e90beabb6080a2ba8e057d263da043fd3de18

Observation 13505d0a-3213-4536-a225-9a1d7d10215f · outbound

This paper cites Deep Compression: Compressing Deep Neural Networks with Pruning, Trained Quantization and Huffman Coding.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Deep Compression: Compressing Deep Neural Networks with Pruning, Trained Quantization and Huffman Coding

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.718146Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.718146Z digest=sha256:b58289afff0bb1d887a9cd5213f5ced7686be74194f27ba89033ebd014898e1a

Observation 31b67e2d-1fec-48bd-a0b9-410f2b5a01c3 · outbound

This paper cites an unresolved cited work.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Unresolved cited work

Reference 32

Resolution
unresolved
raw_fallback, observed 2026-08-15T21:55:09.020190Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-15T21:55:07.722456Z digest=sha256:fd5ca88d9e5c69a218d11d6144e2c40d495b6879bf8789f428b4dbb5561be474

Observation 72520311-25a9-4c86-82e3-a70da4991417 · outbound

This paper cites Delving Deep into Rectifiers: Surpassing Human-Level Performance on ImageNet Classification.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Delving Deep into Rectifiers: Surpassing Human-Level Performance on ImageNet Classification

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.726237Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.726237Z digest=sha256:b771571e439f66c3cd20717ad612759814c67571c3cc8c14b1faa1bda04a39e0

Observation 6b512627-f919-4499-bffc-84527ac9d3e2 · outbound

This paper cites an unresolved cited work.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Unresolved cited work

Reference 34

Resolution
unresolved
raw_fallback, observed 2026-08-15T21:55:09.009050Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-15T21:55:07.729384Z digest=sha256:565ddb5ec35cd2f1ca07cc8c70ef17b836bb9c5edd874e4fa92bf87170953343

Observation 31b60467-2f1c-48dc-8bba-b80e586c3443 · outbound

This paper cites BiLLM: Pushing the Limit of Post-Training Quantization for LLMs.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference BiLLM: Pushing the Limit of Post-Training Quantization for LLMs

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.732645Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.732645Z digest=sha256:91464985f1dfc7ee509ab7f2a6df9ae768467892f3c138a8d10e5937a7c9826b

Observation 3e5637d4-01c8-4b55-8dd3-a4921b77e2d9 · outbound

This paper cites an unresolved cited work.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Unresolved cited work

Reference 36

Resolution
unresolved
raw_fallback, observed 2026-08-15T21:55:08.995645Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-15T21:55:07.736342Z digest=sha256:de23941f2f97efcce365eb706c5670f66aca82e69599fd9d143756b77457ce9a

Observation a2e26410-c174-4e2f-9a8f-48983be6e020 · outbound

This paper cites Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.740239Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.740239Z digest=sha256:7f394b2d9c8b02433243f58599a7bd020355019d4a9c7adc728edc18d9d95bd9

Observation 0581e8b3-7625-4085-869d-d0bbda431e7c · outbound

This paper cites an unresolved cited work.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Unresolved cited work

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.744183Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.744183Z digest=sha256:094be1ce4bf6de44facdc73d4983e78e2a70ed7bdb3ff3c449eef9fb161f1543

Observation 8030413c-c3af-4266-b404-9671b20a4ef9 · outbound

This paper cites Mistral 7B.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Mistral 7B

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.747879Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.747879Z digest=sha256:11685a3de825217b588f817d79c877de73302915a3075552cd55050f6fcb95af

Observation 91623583-dc4e-47ec-b501-ead0a05400bf · outbound

This paper cites A Comprehensive Evaluation of Quantization Strategies for Large Language Models.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference A Comprehensive Evaluation of Quantization Strategies for Large Language Models

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.751298Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.751298Z digest=sha256:c8db83a397d9cd2dad2206e0b4f4b433c8eccfa24c49b47767b9d69a34e18be4

Observation 84fc88d0-9a2a-44a7-98c2-51c5908f518c · outbound

This paper cites Scaling Laws for Neural Language Models.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Scaling Laws for Neural Language Models

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.755352Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.755352Z digest=sha256:776ebdddddc759d287a7c772b1e19e049bd57fb3f1891cf05248afcb94018b0b

Observation a22e979f-9033-4976-88f9-88dd4860720f · outbound

This paper cites BERT Busters: Outlier Dimensions that Disrupt Transformers.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference BERT Busters: Outlier Dimensions that Disrupt Transformers

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.759006Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.759006Z digest=sha256:49e6bf4f9e535e968ec88b6b45fbbd9b5624b79be3ceb367586812ba877037dc

Observation abd97295-052b-48ee-a1d6-9311a89c0d33 · outbound

This paper cites an unresolved cited work.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Unresolved cited work

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.763703Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.763703Z digest=sha256:33d6626658c6c582adf73a4f2d988f985d4753a70717702931b7308e52cd9d22

Observation c88b5e1e-c90d-4b8c-8475-92eaa9dec5a1 · outbound

This paper cites Continuous Approximations for Improving Quantization Aware Training of LLMs.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Continuous Approximations for Improving Quantization Aware Training of LLMs

Reference 44

Resolution
verified exact
local_arxiv, observed 2026-08-15T21:55:08.482844Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-15T21:55:07.770818Z digest=sha256:d29e4a9cf6c979fd2c57e70e11b98549d309eca497bdfded1982c979962f1f68

Observation 1c95a6d2-a684-4f1b-aef2-4a70c054fa29 · outbound

This paper cites an unresolved cited work.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Unresolved cited work

Reference 45

Resolution
unresolved
raw_fallback, observed 2026-08-15T21:55:08.968173Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-15T21:55:07.774992Z digest=sha256:e1ba8bb343a303d8bcabe258619737d2939147b16694bb5d8a9dce9add244b24

Observation 4f4fbe98-243a-4f87-99c3-d3d6773e5afe · outbound

This paper cites AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.778009Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.778009Z digest=sha256:cfba34be7f00b8a76e322e22afa141057ac306f6c88c033e6563ba63b405acfa

Observation 62f8c64e-cd0c-44b1-a2b5-888e4359c5a2 · outbound

This paper cites QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.782932Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.782932Z digest=sha256:dcf79041ddb815693738b44603d4a963b9414df115c2328e1791c7aa4c47d142

Observation 7236cffe-940f-406e-ad5c-63f2ecc2844d · outbound

This paper cites DeepSeek-V3 Technical Report.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference DeepSeek-V3 Technical Report

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.787163Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.787163Z digest=sha256:69e63d1e2c5bd1d38c85b204f33d94949885080970dcb597df985bf9b4589d32

Observation c9d94162-12e3-4817-ba77-2e12764f43ec · outbound

This paper cites an unresolved cited work.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Unresolved cited work

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.791113Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.791113Z digest=sha256:cc1f309ad739dff1b38e7fd24470c9e16eaa37f712431de120409c07f61efc65

Observation 5ba550af-65c3-4b9f-aab6-7ef3e791b268 · outbound

This paper cites The Era of 1-bit LLMs: All Large Language Models are in 1.58 Bits.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference The Era of 1-bit LLMs: All Large Language Models are in 1.58 Bits

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.794971Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.794971Z digest=sha256:8ac811607dd4da0d01d97c3992baa5df406b0a37ad31525693691b694ab1dbbb

Observation 683e553e-1eea-4b30-a8e2-392558263909 · outbound

This paper cites FP8 Formats for Deep Learning.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference FP8 Formats for Deep Learning

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.798384Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.798384Z digest=sha256:e88e24ee03bc67ca6dff3d08ce241b5dd74eeec56bad70a0e633549a03732b97

Observation 2ae36f70-9e16-48f6-a26d-3f7e5633bdec · outbound

This paper cites A White Paper on Neural Network Quantization.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference A White Paper on Neural Network Quantization

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.802619Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.802619Z digest=sha256:1ff7ae8921bbfbda0b2ff27b396d49ca2117c163764bb228c2c0c6fd41fb6986

Observation ebf99f63-2438-4240-a0f0-29eddb7c528b · outbound

This paper cites 2 OLMo 2 Furious.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference 2 OLMo 2 Furious

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.808536Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.808536Z digest=sha256:c79e64321b985a11afa1155e1a8cf114d4ca9d8e1e6c2e3134224cbfac9b02a6

Observation 64b743a7-f7db-4c10-88b1-798fc318679e · outbound

This paper cites RWKV: Reinventing RNNs for the Transformer Era.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference RWKV: Reinventing RNNs for the Transformer Era

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.812705Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.812705Z digest=sha256:b79d23bbab44219d30e165b121e78fdc5a55880be6abd9220dc8d0313d64169f

Observation fe5b0c0e-2db7-4bbd-8de5-f6fc9c49b100 · outbound

This paper cites FP8-LM: Training FP8 Large Language Models.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference FP8-LM: Training FP8 Large Language Models

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.817270Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.817270Z digest=sha256:7ad2fd11779050d6a908e356deb19526cc6b0c41b0f77a2f4179dbcb856f585f

Observation 9afee1ad-9f2f-47ff-bcb8-4c22d24e1c22 · outbound

This paper cites an unresolved cited work.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Unresolved cited work

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.821797Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.821797Z digest=sha256:805914c12d51e8b06f4c79174577f739ca38ea8618d626ef3303c33ab4e3a023

Observation 2c7a0049-4f22-4e93-bf9c-61ee84c54c6e · outbound

This paper cites PB-LLM: Partially Binarized Large Language Models.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference PB-LLM: Partially Binarized Large Language Models

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.826096Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.826096Z digest=sha256:56c496aea70a7e182c0121ca8cb18f1ed973dc45c6c6c74ba36b68c0447cdeee

Observation ddeb10b5-e3e7-4d32-97f1-1b75c32f4ca7 · outbound

This paper cites Democratizing LLMs: An Exploration of Cost-Performance Trade-offs in Self-Refined Open-Source Models.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Democratizing LLMs: An Exploration of Cost-Performance Trade-offs in Self-Refined Open-Source Models

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.829791Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.829791Z digest=sha256:bf11312b5d6ee9ab5c9f434510e0865dd5bfd777ab8b770934a7a7da612016ae

Observation 7ec3369c-b2ad-43fd-b81a-0d9204c7ad44 · outbound

This paper cites an unresolved cited work.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Unresolved cited work

Reference 59

Resolution
metadata mismatch
raw_fallback, observed 2026-08-15T21:55:08.294400Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-15T21:55:07.835328Z digest=sha256:adf17a05f9a32bd3000c3dcee60a6470357fbf8f1235c111c568b735d356ca59

Observation df39d202-0046-41ee-887b-6abd5c9aa80d · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference LLaMA: Open and Efficient Foundation Language Models

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.839653Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.839653Z digest=sha256:ba136da04cbd046e3bf363f5b966d426d8dca05a6760220f00708c7048b13f38

Observation 3fff1632-0f20-4d0a-b451-838739deef44 · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.843300Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.843300Z digest=sha256:176034d3668858a9de71c9d874ae9a0e62f6fba85702d36fa86acd0420ff653a

Observation 40a72d16-bfc1-49c1-a365-f495bba7c8a8 · outbound

This paper cites FP8 versus INT8 for efficient deep learning inference.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference FP8 versus INT8 for efficient deep learning inference

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.846294Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.846294Z digest=sha256:b3a5adb89b9ab54f7688ce7edd55824bb6bde18be3a827f33027cd41dc53cb6c

Observation c743b5c6-75ca-4705-b5a7-269323e77e4d · outbound

This paper cites an unresolved cited work.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Unresolved cited work

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.849606Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.849606Z digest=sha256:6f9f1e620f872e5b2bd226d6a6d1c8efae463f193a221af662bf0a5c9111fdce

Observation fb280529-c917-4e18-9ceb-8f41d2044b19 · outbound

This paper cites A Comprehensive Survey of Small Language Models in the Era of Large Language Models: Techniques, Enhancements, Applications, Collaboration with LLMs, and Trustworthiness.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference A Comprehensive Survey of Small Language Models in the Era of Large Language Models: Techniques, Enhancements, Applications, Collaboration with LLMs, and Trustworthiness

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.852727Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.852727Z digest=sha256:6761729c1029eed4b813c1648eff78f05ba7e03577a844a612e1929c8d442f80

Observation a21cfa1a-5be7-4884-ba60-aff6a251ca15 · outbound

This paper cites BitNet: Scaling 1-bit Transformers for Large Language Models.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference BitNet: Scaling 1-bit Transformers for Large Language Models

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.856402Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.856402Z digest=sha256:4cbdf1383b235cec998c79e5b9924ae35dc29dacc147f2991431dc9f9c0d90ed

Observation 402abf5c-5084-427c-a65a-d9f20c138853 · outbound

This paper cites Emergent Abilities of Large Language Models.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Emergent Abilities of Large Language Models

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.859962Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.859962Z digest=sha256:03aeef42deedf71c0c25bc414a96d911bafd31a3f4c25bc4ec40f3a8badc972c

Observation 31570def-bd1d-4203-a5d6-ef675b01d94d · outbound

This paper cites Outlier Suppression+: Accurate quantization of large language models by equivalent and optimal shifting and scaling.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Outlier Suppression+: Accurate quantization of large language models by equivalent and optimal shifting and scaling

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.863414Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.863414Z digest=sha256:e28766a34a483824362a5dd97c68e88284473d4161dca5376956d9b35e04c416

Observation 54b24241-8fda-405e-8762-3237e277b414 · outbound

This paper cites an unresolved cited work.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Unresolved cited work

Reference 68

Resolution
unresolved
raw_fallback, observed 2026-08-15T21:55:08.940754Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-15T21:55:07.866313Z digest=sha256:051633b61a34a701636ad958fdfea08d8870724acf9899c16f9e8f1c7b3d0c8a

Observation f23f9d0f-c4b7-4dc2-b8ac-ddcaf324ea13 · outbound

This paper cites HuggingFace's Transformers: State-of-the-art Natural Language Processing.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference HuggingFace's Transformers: State-of-the-art Natural Language Processing

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.869841Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.869841Z digest=sha256:bba3ff693176f8775f8ca3b9a44b549f949ec874fac61ad2ea7fd70c1c1f9077

Observation 0952677b-5ac0-45bf-bdc4-34e0726f8c96 · outbound

This paper cites SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.873536Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.873536Z digest=sha256:58c9493cf93b2d86185a2c2d6898d6a9d3ab25a480f2d9aac19f6c4a2d6234e2

Observation 45ec0f7b-73cb-4e47-bc37-5d2b3f5d44d3 · outbound

This paper cites ZeroQuant: Efficient and Affordable Post-Training Quantization for Large-Scale Transformers.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference ZeroQuant: Efficient and Affordable Post-Training Quantization for Large-Scale Transformers

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.877611Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.877611Z digest=sha256:ae6894b620fde14f0bdb91640ebd82ec15b2b901c5c25e369d305a51ae7195f8

Observation 95b31ac0-1b8e-471c-a3b7-6cd45ee75356 · outbound

This paper cites ZeroQuant-V2: Exploring Post-training Quantization in LLMs from Comprehensive Study to Low Rank Compensation.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference ZeroQuant-V2: Exploring Post-training Quantization in LLMs from Comprehensive Study to Low Rank Compensation

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.881424Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.881424Z digest=sha256:d65315d4d2c6a721066d772e6641830caa25c557ed3624e4c278bfbbac43ba14

Observation fb9275a2-7580-49fe-a2fa-754f1f608c9b · outbound

This paper cites Understanding Straight-Through Estimator in Training Activation Quantized Neural Nets.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Understanding Straight-Through Estimator in Training Activation Quantized Neural Nets

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.886040Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.886040Z digest=sha256:fab2401adac001de1533095531295b00c3ff40f5dd7b9bf13d03f3d8a3de2a3d

Observation 5f74d1cf-aad8-4c85-9702-28eb2d240c09 · outbound

This paper cites an unresolved cited work.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Unresolved cited work

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.890297Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.890297Z digest=sha256:6dca22d044c702b7ef3759b7c88f7ad658865ede5f7dd4d6831277b2ebc62f26

Observation 988529cf-de0d-4dc4-b941-e1875361a074 · outbound

This paper cites OPT: Open Pre-trained Transformer Language Models.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference OPT: Open Pre-trained Transformer Language Models

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.894631Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.894631Z digest=sha256:882c4799f728033840f2c2c9ff2fe5e8f2d27a4bf2a89ad23fd1bbc0afc9dee9

Observation 1c61e00b-4e12-4b9c-ae6b-80370319db2e · outbound

This paper cites A Survey on Efficient Inference for Large Language Models.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference A Survey on Efficient Inference for Large Language Models

Reference 76

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.900011Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.900011Z digest=sha256:a292f2db8d8e2157f749cba34a95d453c8fccdf7e34dac121bea8e576de53da9

Observation 5f175c5c-0b68-40bc-82a2-495a124fb0cb · outbound

This paper cites A Survey on Model Compression for Large Language Models.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference A Survey on Model Compression for Large Language Models

Reference 77

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.904113Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.904113Z digest=sha256:1e80ee3e284cf54643cd18f11f23ada158c6fef9ce45f331f50bf24d4f01f873

Pith citing papers

No inbound Pith citation observations are available.