{"as_of":"2026-08-19T00:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e4d60466b3639af527d0275098601dfc9dec368f2e2811437b7ec90102f2d009","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T01:00:02.155950Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:07:48.814065Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T10:38:35.586521Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02309","snapshot_observed_at":"2026-08-15T22:07:48.814065Z","title":"Optimizing LLMs for Resource- Constrained Environments: A Survey of Model Compression Techniques","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.08034","last_updated":"2025-08-14T23:53:13Z","snapshot_observed_at":"2026-08-18T08:46:56.457525Z","submitted_at":"2025-05-12T20:04:03Z","title":"Opportunities and Applications of GenAI in Smart Cities: A User-Centric Survey","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T22:07:48.814065Z"},"links":{"cited_paper":"/paper/2505.02309","citing_paper":"/paper/2505.08034"},"observation_digest":"sha256:ed5ba0fab3c0c226b1b356ed489a63c24ab124c08b2a4fb2cfc54d0a6511f0f8","observation_id":"630aa57b-db79-4a07-bbe5-cd63dbbef4f4","resolution":{"observed_at":"2026-08-15T22:07:48.814065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02309","snapshot_observed_at":"2026-08-05T11:12:42.870802Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03122","last_updated":"2026-06-18T14:14:24Z","snapshot_observed_at":"2026-08-16T12:10:09.846566Z","submitted_at":"2025-09-03T08:22:04Z","title":"From Construction to Injection: Edit-Based Fingerprints for Large Language Models","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T11:12:42.870802Z"},"links":{"cited_paper":"/paper/2505.02309","citing_paper":"/paper/2509.03122"},"observation_digest":"sha256:b43b08435751bbcf685e931a6251ca933f3bcf4d6d4554ac6506e9023171cdeb","observation_id":"f2a26418-c362-4ca8-96e0-504e52e46ff4","resolution":{"observed_at":"2026-08-05T11:12:42.870802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"cited_work":{"arxiv_id":"2505.02309","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.02309","snapshot_observed_at":"2026-08-05T10:38:35.586521Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","venue":"cs.LG","work_id":"3d365773-a875-45f5-8df9-7d5cdb1ba364","year":2025},"citing_paper":{"arxiv_id":"2509.04534","last_updated":"2025-09-04T04:18:45Z","snapshot_observed_at":"2026-08-17T09:48:51.112100Z","submitted_at":"2025-09-04T04:18:45Z","title":"Quantized Large Language Models in Biomedical Natural Language Processing: Evaluation and Recommendation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T10:38:33.384279Z"},"links":{"cited_paper":"/paper/2505.02309","citing_paper":"/paper/2509.04534"},"observation_digest":"sha256:5e1093f2d1250b6665a217021e661e8d6387d2b4f0639c7b3f496be487cc7cc2","observation_id":"a27bfd1d-3670-4dee-a185-d1e1b21b5ce8","resolution":{"observed_at":"2026-08-05T10:38:35.630644Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.02309/citation-record","integrity":"/paper/2505.02309/integrity","json":"/paper/2505.02309/citation-record.json","paper":"/paper/2505.02309"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-16T01:00:01.949970Z","title":"Gemini: A Family of Highly Capable Multimodal Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:01.949970Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:b83ad141d72ff6e2c292222cfa7c07626b0bd8b2915e03ca0859397a4c4497a8","observation_id":"bb503ec8-ccfc-44b7-88bb-dece89451bae","resolution":{"observed_at":"2026-08-16T01:00:01.949970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:03.250722Z","title":"Language models are few -shot learners","venue":null,"work_id":"55629761-da96-4ece-ba0f-c1924e1bd601","year":2020},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:01.954330Z"},"links":{"citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:0c1e16b944a5b4402d0cb5ec362a5977983c053fa4d2a57e3278b4c7a2e08926","observation_id":"f7f15967-a0d5-4bf8-861b-ee2de2c66f4f","resolution":{"observed_at":"2026-08-16T01:00:03.254250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-16T01:00:01.957957Z","title":"LLaMA: Open and Efficient Foundation Language Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:01.957957Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:8be91c454e5c252de2d8961e8918f0a3019c0be5c59178bbd8214c42da0d5918","observation_id":"7175a426-9346-4a7c-a739-6bfe3b9c4700","resolution":{"observed_at":"2026-08-16T01:00:01.957957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-16T01:00:01.961802Z","title":"The Llama 3 Herd of Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:01.961802Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:9ca12a5702ea00abccc4ef3922d14b72794d5d54395cc1a66ccbe2a41f9ea65d","observation_id":"aaaba901-5fb6-4b28-b466-a99c890c91b0","resolution":{"observed_at":"2026-08-16T01:00:01.961802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.04833","last_updated":"2018-05-13T07:07:08Z","snapshot_observed_at":"2026-08-14T19:15:59.926210Z","submitted_at":"2018-05-13T07:07:08Z","title":"Hierarchical Neural Story Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.04833","snapshot_observed_at":"2026-08-16T01:00:01.965300Z","title":"Hierarchical Neural Story Generation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:01.965300Z"},"links":{"cited_paper":"/paper/1805.04833","citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:bbc1ed44a779dc54d40af82cde04c448dbfdcb9141540805fa35ee66e44635bb","observation_id":"ec3a304c-fd6d-4af3-b215-c0d2c7e7f4f7","resolution":{"observed_at":"2026-08-16T01:00:01.965300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.08239","last_updated":"2022-02-10T16:30:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-20T15:44:37Z","title":"LaMDA: Language Models for Dialog Applications","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.08239","snapshot_observed_at":"2026-08-16T01:00:01.969343Z","title":"LaMDA: Language Models for Dialog Applications,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:01.969343Z"},"links":{"cited_paper":"/paper/2201.08239","citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:832fdf8f1da77dc8861bc1def8460905adaabe7622da37e6f538a546b5ab60f9","observation_id":"91d5e6d9-ba58-4e6e-9c51-7ca1b51981d9","resolution":{"observed_at":"2026-08-16T01:00:01.969343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:01.973262Z","title":"A Survey on Large Language Models: Applications, Challenges, Limitations, and Practical Usage,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:01.973262Z"},"links":{"citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:23d45e1aea1942b28a7dc6bd15b61bc1c937d5707ce6e1297a5030c775b7f7a3","observation_id":"1c84929a-4841-4d12-a28e-a500ddd3cb27","resolution":{"observed_at":"2026-08-16T01:00:01.973262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:01.976430Z","title":"Highly accurate protein structure prediction with AlphaFold,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:01.976430Z"},"links":{"citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:048b3eef2ff102e0fc6911e3222809ec8e39df373e3093bc4a2910b0ba6c4d48","observation_id":"dee029e6-9d60-4474-b269-f087bc3f8ef0","resolution":{"observed_at":"2026-08-16T01:00:01.976430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:01.979802Z","title":"A Survey on Model Compression for Large Language Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:01.979802Z"},"links":{"citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:2c6a0de55cf386b32250777d330880d8fc796a37e6ce4124e1dd6223546e230c","observation_id":"cf67736f-7047-4bd7-81f4-fe8540b18806","resolution":{"observed_at":"2026-08-16T01:00:01.979802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05964","last_updated":"2024-04-07T13:03:58Z","snapshot_observed_at":"2026-08-18T13:11:45.136886Z","submitted_at":"2024-02-05T12:16:28Z","title":"A Survey on Transformer Compression","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05964","snapshot_observed_at":"2026-08-16T01:00:01.983010Z","title":"A Survey on Transformer Compression,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:01.983010Z"},"links":{"cited_paper":"/paper/2402.05964","citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:4a95e9e3981b33a42f31ebb2dcee23c6fbda88223d1f1294cbc71f18bcc70536","observation_id":"1b020adb-c068-4cc9-b8e6-b7cae46f8820","resolution":{"observed_at":"2026-08-16T01:00:01.983010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-16T18:00:58.008096Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-16T01:00:01.986640Z","title":"Distilling the Knowledge in a Neural Network,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:01.986640Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:e3661f5c2efbae180c947e06c2112389b8c1236d78b2ed29b1b43edf447ace52","observation_id":"42e96f55-67f9-4ae3-8d89-f8de583f8e81","resolution":{"observed_at":"2026-08-16T01:00:01.986640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:01.990243Z","title":"Model compression,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:01.990243Z"},"links":{"citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:30fbb6a7106283820a1725d089ce459edfbe9556e70d2765c256fa75b695064e","observation_id":"dd7f1576-0d1b-4586-9f29-e9e261438601","resolution":{"observed_at":"2026-08-16T01:00:01.990243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:01.993312Z","title":"Knowledge Distillation: A Survey,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:01.993312Z"},"links":{"citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:fb35eefb8e99617642936f395c879e812cf4da738c95fea0bdbd9caf5cc697e7","observation_id":"844a8cb6-08e1-42d7-bef7-5d4af0dff5b7","resolution":{"observed_at":"2026-08-16T01:00:01.993312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-16T01:00:01.996728Z","title":"OPT: Open Pre-trained Transformer Language Models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:01.996728Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:051497d7c8031669ba665fc7553535d6e6ec556a3d93c1b0c9ece4b4ec51c635","observation_id":"fb98f24b-a989-41b7-895f-16aea4601ed2","resolution":{"observed_at":"2026-08-16T01:00:01.996728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6550","last_updated":"2015-03-27T11:52:28Z","snapshot_observed_at":"2026-08-17T23:25:45.947983Z","submitted_at":"2014-12-19T22:40:51Z","title":"FitNets: Hints for Thin Deep Nets","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6550","snapshot_observed_at":"2026-08-16T01:00:02.000476Z","title":"FitNets: Hints for Thin Deep Nets,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.000476Z"},"links":{"cited_paper":"/paper/1412.6550","citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:cfc0cfea9f457e52bc540dbf2958f3016b50f6f47113b6a68dc857fca3a9a64c","observation_id":"69004620-d6e5-4019-a45b-f3d12edbf6a6","resolution":{"observed_at":"2026-08-16T01:00:02.000476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:03.241522Z","title":"Relational knowledge distillation","venue":null,"work_id":"9b7e2d77-6779-422d-9940-a93573c0eff5","year":2019},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.003979Z"},"links":{"citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:ae8d7f02cf3e338eb8f4add8ce7511eb21880fba99801d8fc85678fe5bb5d6df","observation_id":"b8dd35fd-44d0-4394-8529-a3066d8cc569","resolution":{"observed_at":"2026-08-16T01:00:03.244887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:02.007191Z","title":"Be Your Own Teacher: Improve the Performance of Convolutional Neural Networks via Self Distillation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.007191Z"},"links":{"citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:5f2529002eac698071709ab57a6a918034d8065a8428a9ed771851d9bcc750e7","observation_id":"5f266641-ebae-49e1-92a7-0b56e2499026","resolution":{"observed_at":"2026-08-16T01:00:02.007191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:03.232021Z","title":"Born again neural networks","venue":null,"work_id":"e08a7e5b-1bd4-48c3-9f3c-4b5bb0d7c859","year":2018},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.010240Z"},"links":{"citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:b01ab691e197d4e716c1c4ead9e3babd131074354acd268bd9b795c4c07d1031","observation_id":"d820ce6a-8b9c-4c8f-b744-ce432aa76d47","resolution":{"observed_at":"2026-08-16T01:00:03.235649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:02.013447Z","title":"Learning from Multiple Teacher Networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.013447Z"},"links":{"citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:5f476fd7cb4ba933f5e7d4581ca5e7eac6b868279401b82b29dc875930cc7d48","observation_id":"be8b8f18-4f33-4c77-8fbf-e1a9f506f740","resolution":{"observed_at":"2026-08-16T01:00:02.013447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:03.221956Z","title":"On-policy distillation of language models: Learning from self -generated mistakes,","venue":null,"work_id":"cf3e6892-0b27-4de6-a3be-89ab7cd9f1c8","year":2024},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.016572Z"},"links":{"citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:b83c705716b9bca91e2eed41adbf9aa19b86f85a650c0d50f50035b3600b4ad6","observation_id":"589eb7fd-4b2d-4d42-81f6-0cb833e1c400","resolution":{"observed_at":"2026-08-16T01:00:03.225804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08543","last_updated":"2026-01-31T09:16:35Z","snapshot_observed_at":"2026-08-16T00:37:04.298248Z","submitted_at":"2023-06-14T14:44:03Z","title":"MiniLLM: On-Policy Distillation of Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08543","snapshot_observed_at":"2026-08-16T01:00:02.019423Z","title":"MiniLLM: Knowledge Distillation of Large Language Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.019423Z"},"links":{"cited_paper":"/paper/2306.08543","citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:85c74b8a0d3b192be98dec6a4108cd111d0b9c060e9a1b4d7e81642da6aa13fc","observation_id":"db837453-4376-4b5e-b5c6-7eeddaef7ef1","resolution":{"observed_at":"2026-08-16T01:00:02.019423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-16T14:21:03.535260Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-16T01:00:02.023103Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.023103Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:d74626255254fc38e369bc4c03b018f297e7ac04e35d26e2ae1ca47f387430e8","observation_id":"97676631-4632-4726-90e7-37cafba6c385","resolution":{"observed_at":"2026-08-16T01:00:02.023103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:03.212542Z","title":"GPT3.int8(): 8- bit Matrix Multiplication for Transformers at Scale,","venue":null,"work_id":"6024fa6d-896b-47b1-af1b-75aab39687d6","year":2022},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.026552Z"},"links":{"citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:ec4095313c5d6bfa7c3c3531fa1c058c44b7e035bee34354a3db96fa62a06222","observation_id":"a882c0f5-7d80-4939-9b53-5cf440cce337","resolution":{"observed_at":"2026-08-16T01:00:03.216002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-15T04:43:14.762539Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-16T01:00:02.029743Z","title":"Bitnet: Scaling 1 -bit transformers for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.029743Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:c04efa6526cb0c67d889dd142e4253685db4a9b1454d2426250300edabc57ce2","observation_id":"7511ea32-2687-4ae0-95f6-2391e05805ab","resolution":{"observed_at":"2026-08-16T01:00:02.029743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.08342","last_updated":"2018-06-21T17:32:46Z","snapshot_observed_at":"2026-08-15T01:28:14.336267Z","submitted_at":"2018-06-21T17:32:46Z","title":"Quantizing deep convolutional networks for efficient inference: A whitepaper","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.08342","snapshot_observed_at":"2026-08-16T01:00:02.033203Z","title":"Quantizing deep convolutional networks for efficient inference: A whitepaper,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.033203Z"},"links":{"cited_paper":"/paper/1806.08342","citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:27b7932737fc4edb09bcde72406fa25fd0322fa5a7663afb0a952648fc40b58a","observation_id":"95fd0ef2-6af6-435f-838c-5e78d964e3b6","resolution":{"observed_at":"2026-08-16T01:00:02.033203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:03.203187Z","title":"Towards Accurate Post-training Network Quantization via Bit-Split and Stitching,","venue":null,"work_id":"dd86ea3f-641f-4d7b-ba8c-6a09abc3ba61","year":2020},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.036462Z"},"links":{"citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:6befcdd02278e500afd96c7b258f683d7c8b42356649b22708193e4d4f58aded","observation_id":"fe19a6b1-c92d-4fed-bae4-9168ea788823","resolution":{"observed_at":"2026-08-16T01:00:03.206618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:03.193747Z","title":"Up or down? Adaptive rounding for post -training quantization","venue":null,"work_id":"fd142e3c-be19-4adc-882d-79750f9b36e7","year":2020},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.040255Z"},"links":{"citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:0499f2bd119e650d053316ccd43cf3c66747ac3e341f7cad5e9a89c588c9b73c","observation_id":"ef9811d0-8dac-4098-9a07-6df3f40d97a6","resolution":{"observed_at":"2026-08-16T01:00:03.197193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05426","last_updated":"2021-07-25T09:34:39Z","snapshot_observed_at":"2026-08-18T09:07:09.396960Z","submitted_at":"2021-02-10T13:46:16Z","title":"BRECQ: Pushing the Limit of Post-Training Quantization by Block Reconstruction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05426","snapshot_observed_at":"2026-08-16T01:00:02.043370Z","title":"BRECQ: Pushing the Limit of Post -Training Quantization by Block Reconstruction,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.043370Z"},"links":{"cited_paper":"/paper/2102.05426","citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:7c844c5c8b4244fd880b3249faf76cf485ebb0c86539842fb1947b7ef5ef23f1","observation_id":"2d4b8286-09ee-43ba-ab8d-066667137d67","resolution":{"observed_at":"2026-08-16T01:00:02.043370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:02.046889Z","title":"Quantization and Training of Neural Networks for Efficient Integer -Arithmetic-Only Inference,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.046889Z"},"links":{"citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:0494ff7732b22a2134cdcdcce4c2ac84eb29d5725298e9bd7a3f947516ee3dca","observation_id":"50e79d99-ce66-419b-af95-274a4dc6789d","resolution":{"observed_at":"2026-08-16T01:00:02.046889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-16T07:57:19.216626Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-16T01:00:02.050070Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre -trained Transformers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.050070Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:2ee7f05b415d735dc139514c7ff1cc8cab627051570b40895db11174ddfc2952","observation_id":"dd1dd798-3c06-403e-83e3-f149663186af","resolution":{"observed_at":"2026-08-16T01:00:02.050070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1308.3432","last_updated":"2013-08-15T15:19:34Z","snapshot_observed_at":"2026-08-14T04:51:04.817737Z","submitted_at":"2013-08-15T15:19:34Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1308.3432","snapshot_observed_at":"2026-08-16T01:00:02.054792Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.054792Z"},"links":{"cited_paper":"/paper/1308.3432","citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:9f48ee1afd892dfb862df34989561bc4ba9c91d205697ca58a256e90d5ef2574","observation_id":"aeb8a1d1-458c-426c-aa4c-0bf820a6a9f3","resolution":{"observed_at":"2026-08-16T01:00:02.054792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:03.184555Z","title":"A Survey of Quantization Methods for Efficient Neural Network Inference,","venue":null,"work_id":"47dc7199-ea02-4bb8-a463-78de3601fd13","year":null},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.058384Z"},"links":{"citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:60417b4fea0e04cea743bb899aaf6f729ff69c546feae44a52b1f417e421fff7","observation_id":"81f15c5e-1456-4044-a9ac-d4493d8aa247","resolution":{"observed_at":"2026-08-16T01:00:03.187943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.12948","last_updated":"2021-09-27T10:57:18Z","snapshot_observed_at":"2026-08-16T17:53:49.508131Z","submitted_at":"2021-09-27T10:57:18Z","title":"Understanding and Overcoming the Challenges of Efficient Transformer Quantization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.12948","snapshot_observed_at":"2026-08-16T01:00:02.061610Z","title":"Understanding and Overcoming the Challenges of Efficient Transformer Quantization,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.061610Z"},"links":{"cited_paper":"/paper/2109.12948","citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:d934c14e1150950cd7410a39e98e595e6b305d55a92e4a94cba24ff07c8337f1","observation_id":"a077caf8-59c0-48e3-b2b3-a40fc32dc6c2","resolution":{"observed_at":"2026-08-16T01:00:02.061610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:03.175110Z","title":"ZeroQuant: Efficient and Affordable Post -Training Quantization for Large-Scale Transformers,","venue":null,"work_id":"9b3e5a7a-01d2-4051-a33b-4545e4037149","year":2022},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.065207Z"},"links":{"citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:10bc59232ffaf95bbc2a0f8c4b0e9bee3f7653d26db476101e60661c8dc2495c","observation_id":"3d87fe92-c80b-4453-9ad9-17fb4c6ddd12","resolution":{"observed_at":"2026-08-16T01:00:03.178559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:02.068375Z","title":"HAQ: Hardware -Aware Automated Quantization With Mixed Precision,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.068375Z"},"links":{"citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:910fd2845485a10522a79358ec772d7573a9ca48f1f29d84e02e95d1a0f50f07","observation_id":"d1769770-8c9e-48d6-8058-7c9884264287","resolution":{"observed_at":"2026-08-16T01:00:02.068375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:03.165938Z","title":"Binaryconnect: Training deep neural networks with binary weights during propagations ,","venue":null,"work_id":"4dc4ee06-306e-4178-8738-0fa7dddc930d","year":2015},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.071583Z"},"links":{"citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:7a67c59f2241fdbf31318914512165bb3ee56c24d6205c1fb74227732b8915a4","observation_id":"7c73009c-662c-4081-a542-5041383dae53","resolution":{"observed_at":"2026-08-16T01:00:03.169300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:02.074499Z","title":"Ternary Weight Networks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.074499Z"},"links":{"citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:f5d2712a248e718cdebe193ac4aa779c450cafa9441c7f4d95550e9988575191","observation_id":"531a8252-53ac-47f7-8be5-437b7e5b2065","resolution":{"observed_at":"2026-08-16T01:00:02.074499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:03.156851Z","title":"Do Deep Nets Really Need to be Deep?,","venue":null,"work_id":"1deb69d2-cc34-4395-a95d-19f0c06caf4f","year":2014},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.077558Z"},"links":{"citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:00ae2f6f8a53c9a7307bfec309d6c1eb989876ff4bbe4e15a8987f710cdb5ef9","observation_id":"8be1a290-9118-4c41-98c6-a9cfa10664f3","resolution":{"observed_at":"2026-08-16T01:00:03.160241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.05668","last_updated":"2018-02-15T17:18:49Z","snapshot_observed_at":"2026-08-14T19:45:29.084859Z","submitted_at":"2018-02-15T17:18:49Z","title":"Model compression via distillation and quantization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.05668","snapshot_observed_at":"2026-08-16T01:00:02.080765Z","title":"Model compression via distillation and quantization,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.080765Z"},"links":{"cited_paper":"/paper/1802.05668","citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:93db01297fbdb57fd6fddda12cf6850133d927718d8ec9ea48da6c0bc75d1931","observation_id":"c0f32e67-cf26-4a67-aba3-52e0ee3a428f","resolution":{"observed_at":"2026-08-16T01:00:02.080765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:03.147273Z","title":"SmoothQuant: Accurate and Efficient Post -Training Quantization for Large Language Models,","venue":null,"work_id":"f8b64543-4436-47ce-9798-81c7b70eb403","year":null},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.084149Z"},"links":{"citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:2420951acdd27b7c942a19e235a9dffbabcb485df1fa4ec67a67e979281448b0","observation_id":"4253e797-0648-4734-bb73-e2471d5efed5","resolution":{"observed_at":"2026-08-16T01:00:03.150589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08302","last_updated":"2023-05-26T00:17:06Z","snapshot_observed_at":"2026-08-16T15:48:09.692405Z","submitted_at":"2023-03-15T01:27:15Z","title":"ZeroQuant-V2: Exploring Post-training Quantization in LLMs from Comprehensive Study to Low Rank Compensation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08302","snapshot_observed_at":"2026-08-16T01:00:02.087433Z","title":"ZeroQuant -V2: Exploring Post-training Quantization in LLMs from Comprehensive Study to Low Rank Compensation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.087433Z"},"links":{"cited_paper":"/paper/2303.08302","citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:e9122ae067dfaf1f939fdddecf11e46d064ba9f927992b6186635e06c8e34502","observation_id":"f40fa136-bbbf-48b3-8d36-1fd779a4d639","resolution":{"observed_at":"2026-08-16T01:00:02.087433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:02.090889Z","title":"AWQ: Activation-aware Weight Quantization for On-Device LLM Compression and Acceleration,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.090889Z"},"links":{"citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:a07b9e247bfcba5977465e5189b88985a534af5537ec4b55b6b5162f9ccee78f","observation_id":"c8dab958-1994-427c-840e-6546cba3eb66","resolution":{"observed_at":"2026-08-16T01:00:02.090889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.03635","last_updated":"2019-03-04T15:51:11Z","snapshot_observed_at":"2026-08-14T19:37:43.556604Z","submitted_at":"2018-03-09T18:51:28Z","title":"The Lottery Ticket Hypothesis: Finding Sparse, Trainable Neural Networks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.03635","snapshot_observed_at":"2026-08-16T01:00:02.094265Z","title":"The Lottery Ticket Hypothesis: Finding Sparse, Trainable Neural Networks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.094265Z"},"links":{"cited_paper":"/paper/1803.03635","citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:c77ac45542203ca2ccf406e04484ebacada34aa850ba9ce4b8eda65877f94331","observation_id":"0fdaf7d6-42ab-47b1-aaf4-fb6ede42c2fa","resolution":{"observed_at":"2026-08-16T01:00:02.094265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:03.137161Z","title":"Optimal brain damage. Advances","venue":null,"work_id":"da16afd4-f98d-4bbd-a691-24582dc2feca","year":1989},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.097705Z"},"links":{"citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:4bc995ffca40efba381f4b2301b7af8b7363b16cdc638942d4a25b40dfadc3ec","observation_id":"3d9a0f28-b55c-4446-84e2-c393e9e7bebf","resolution":{"observed_at":"2026-08-16T01:00:03.140731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:02.100632Z","title":"Optimal Brain Surgeon and general network pruning,","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.100632Z"},"links":{"citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:59de4efb2c48a14e92056ec869c1daf52056a6141459e0150bc1363a1c9fc5dd","observation_id":"cee344da-f6c1-40a9-95b3-8633093b6992","resolution":{"observed_at":"2026-08-16T01:00:02.100632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:03.127188Z","title":"Learning both weights and connections for efficient neural network","venue":null,"work_id":"5200ee4b-07e8-4e5a-b97c-519034f16bed","year":2015},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.103660Z"},"links":{"citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:ebc94633d7bb325ee8056d2a32b935a17062b033fc335b1068ddd053650bf8c0","observation_id":"075288cd-1ded-4e35-9910-d2f140780227","resolution":{"observed_at":"2026-08-16T01:00:03.130497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:03.116003Z","title":"Movement Pruning: Adaptive Sparsity by Fine-Tuning,","venue":null,"work_id":"d17e82fc-7e1f-4f76-a0ee-af034c23bd56","year":2020},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.106878Z"},"links":{"citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:ded5b985a12f025ab3be10086a258570990de66d22be24126cf034465823b6da","observation_id":"28e4ee8a-e7b1-4d5f-8f6e-7acfce1a8090","resolution":{"observed_at":"2026-08-16T01:00:03.120097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:03.105746Z","title":"AMC: AutoML for Model Compression and Acceleration on Mobile Devices,","venue":null,"work_id":"e52d5e15-75d8-4cc2-9246-9e782f1d4693","year":2018},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.109966Z"},"links":{"citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:6c95a181267e0f1c568021670b0d806966b221babeac08b04f814fabd7f4491a","observation_id":"a4187a87-bc1b-4503-82d6-232d012c5410","resolution":{"observed_at":"2026-08-16T01:00:03.109420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:02.113056Z","title":"Adaptive Mixtures of Local Experts,","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.113056Z"},"links":{"citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:9b8f814f24ec7c211bfb039b358b6555de39c7d0eefd238671158e20e6520bc2","observation_id":"961b9d44-5d51-4642-b26d-f117af87f2f4","resolution":{"observed_at":"2026-08-16T01:00:02.113056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-08-13T11:35:07.866136Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-16T01:00:02.116225Z","title":"Outrageously Large Neural Networks: The Sparsely - Gated Mixture -of-Experts Layer,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.116225Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:edc74201c2a328ed30149766bef1896152e12caf19a3445899caab30948953da","observation_id":"066102ca-6e2d-4342-bc76-13bf52190b76","resolution":{"observed_at":"2026-08-16T01:00:02.116225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:03.095311Z","title":"Glam: Efficient scaling of language models with mixture-of- experts","venue":null,"work_id":"95b5c314-d6c7-4286-920f-501cb63c098c","year":2022},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.119799Z"},"links":{"citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:466b6863bf2cce8f664a17478a11bd84b7648990870e798e3c6b0dd08d0d3770","observation_id":"053c2ce6-a4de-4b95-840f-144a03ff4eb3","resolution":{"observed_at":"2026-08-16T01:00:03.098889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:02.122887Z","title":"BranchyNet: Fast inference via early exiting from deep neural networks,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.122887Z"},"links":{"citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:d4625300cea14b4baaf7c6cdf4514796ca46985fc596f7020091f2fc077a6c31","observation_id":"ac2d43f2-ff5c-4ffd-9796-5b7caf24d3ca","resolution":{"observed_at":"2026-08-16T01:00:02.122887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:03.085636Z","title":"Retrieval-augmented generation for knowledge-intensive nlp tasks ,","venue":null,"work_id":"6ab833a1-ddd9-4410-a91a-0591b2d1589f","year":2020},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.126119Z"},"links":{"citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:99d30bbd18b7867a952f01a7ff037157a9169516e48941c16c25a4b8ec5f502a","observation_id":"8077d498-2fa8-4147-ba97-bfcea03169b2","resolution":{"observed_at":"2026-08-16T01:00:03.088933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:02.129067Z","title":"Structured Pruning of Deep Convolutional Neural Networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.129067Z"},"links":{"citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:0ef0953caad699a000343ed27d1cabe6b96cdc5cd411a9bc652f68e97596a195","observation_id":"9f338af2-e4b2-4e14-b2a1-10b564c56cba","resolution":{"observed_at":"2026-08-16T01:00:02.129067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:02.132271Z","title":"Pruning and quantization for deep neural network acceleration: A survey,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.132271Z"},"links":{"citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:91d31b20e2200491df68eb10ec9f4aee4d4fd66c6ced17601c61448e63d6fde0","observation_id":"5b0dcfe9-b2ef-4c16-b7f1-06a9e9a31012","resolution":{"observed_at":"2026-08-16T01:00:02.132271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10071","last_updated":"2023-06-13T10:55:29Z","snapshot_observed_at":"2026-08-16T16:07:24.644844Z","submitted_at":"2022-12-20T08:24:45Z","title":"Large Language Models Are Reasoning Teachers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10071","snapshot_observed_at":"2026-08-16T01:00:02.135615Z","title":"Large Language Models Are Reasoning Teachers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.135615Z"},"links":{"cited_paper":"/paper/2212.10071","citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:7a683d7fef8c54152bc3c435d1039181aa90c41d7e622fe385661ab6e3832661","observation_id":"69e3d51b-4a89-4a73-8d86-82f96ff5d67b","resolution":{"observed_at":"2026-08-16T01:00:02.135615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02301","last_updated":"2023-07-05T16:59:31Z","snapshot_observed_at":"2026-08-17T13:50:40.586963Z","submitted_at":"2023-05-03T17:50:56Z","title":"Distilling Step-by-Step! Outperforming Larger Language Models with Less Training Data and Smaller Model Sizes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02301","snapshot_observed_at":"2026-08-16T01:00:02.139093Z","title":"Distilling Step -by-Step! Outperforming Larger Language Models with Less Training Data and Smaller Model Sizes,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.139093Z"},"links":{"cited_paper":"/paper/2305.02301","citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:48350d42100fb59ce1e4ea643d2247aa792f967138376abfbec76ec0b946dad2","observation_id":"753c26f6-492c-4594-bff5-86c8f087c8e0","resolution":{"observed_at":"2026-08-16T01:00:02.139093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:03.075839Z","title":"Qlora: Efficient finetuning of quantized llms,","venue":null,"work_id":"804742bb-ea95-4799-8525-954e0d5c43d8","year":2023},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.142327Z"},"links":{"citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:0335082b8360b40b812170d2766bd8d967420f177b9d79283e5bb1d8ca9c6cac","observation_id":"3d2840ab-81b5-4ee5-b465-e6317ac87890","resolution":{"observed_at":"2026-08-16T01:00:03.079105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18377","last_updated":"2024-05-28T17:20:44Z","snapshot_observed_at":"2026-08-17T23:11:26.547525Z","submitted_at":"2024-05-28T17:20:44Z","title":"LLaMA-NAS: Efficient Neural Architecture Search for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18377","snapshot_observed_at":"2026-08-16T01:00:02.145689Z","title":"LLaMA -NAS: Efficient Neural Architecture Search for Large Language Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.145689Z"},"links":{"cited_paper":"/paper/2405.18377","citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:4ab5177a6c90472b26f9d1d7c600a5f8fecd4899602a477232a6dec3164f1e9f","observation_id":"ca54efa4-926e-401d-a1bd-5f7b22efbd9f","resolution":{"observed_at":"2026-08-16T01:00:02.145689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:03.065914Z","title":"Learning best combination for efficient n: M sparsity","venue":null,"work_id":"83b0419b-b28b-4f83-89c2-e793baf8973c","year":2022},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.149505Z"},"links":{"citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:45b8bee5d9d8c17ec99f2d9806e60d4e02b04b653975ca7b26672b2478353f12","observation_id":"ba9da55d-147a-4e1f-963d-61488fe03ff5","resolution":{"observed_at":"2026-08-16T01:00:03.069047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.05433","last_updated":"2022-09-29T20:47:07Z","snapshot_observed_at":"2026-08-14T05:39:52.416140Z","submitted_at":"2022-09-12T17:39:55Z","title":"FP8 Formats for Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.05433","snapshot_observed_at":"2026-08-16T01:00:02.152354Z","title":"FP8 Formats for Deep Learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.152354Z"},"links":{"cited_paper":"/paper/2209.05433","citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:9a1483303246cb7350d7aa1bd5d5419b4735688681c719e9c31ef70ceaed745c","observation_id":"a9fae284-dcc2-482c-a0ad-278819833061","resolution":{"observed_at":"2026-08-16T01:00:02.152354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:00:03.054196Z","title":"unsloth/DeepSeek-V3-0324-GGUF · Hugging Face","venue":null,"work_id":"f118c792-fe04-4a65-84c9-35a7f12b349d","year":2025},"citing_paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:02.155950Z"},"links":{"citing_paper":"/paper/2505.02309"},"observation_digest":"sha256:95bbeac7ee003ad0b2a94ebe47f848a665cb4bb71c64c55a75d2a84002d5c24f","observation_id":"1f918c21-784a-44b8-a88b-c1319ad3934a","resolution":{"observed_at":"2026-08-16T01:00:03.059404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.02309","last_updated":"2025-05-08T05:55:48Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T09:07:43.851937Z","submitted_at":"2025-05-05T01:27:47Z","title":"Optimizing LLMs for Resource-Constrained Environments: A Survey of Model Compression Techniques"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":21},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 3 inbound Pith citation observations for arXiv:2505.02309."}