{"as_of":"2026-08-04T04:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:776a4cfb2b0d4b80d3af642833074ce3760156c720d0e8b6de70605ba99b2721","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-22T10:07:35.063038Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-03T06:30:56.289259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-10T04:03:37.649301Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T04:06:44.643562Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"cited_work":{"arxiv_id":"2605.04062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.04062","snapshot_observed_at":"2026-07-10T04:06:44.643562Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","venue":"cs.LG","work_id":"ee0c85b0-0ed0-43f4-bdd6-7a19a4f9db30","year":2026},"citing_paper":{"arxiv_id":"2607.08643","last_updated":"2026-07-09T16:17:10Z","snapshot_observed_at":"2026-07-12T23:18:54.347392Z","submitted_at":"2026-07-09T16:17:10Z","title":"BiSCo-LLM: Lookup-Free Binary Spherical Coding for Extreme Low-Bit Large Language Model Compression","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-10T04:03:37.649301Z"},"links":{"cited_paper":"/paper/2605.04062","citing_paper":"/paper/2607.08643"},"observation_digest":"sha256:461befe47b4efb71d699f29a9c3c42efa16cabcd9caef8d662d49eeec282618c","observation_id":"4d553ebf-597f-4eb4-8fc0-b1874bbfbf04","resolution":{"observed_at":"2026-07-10T04:06:44.645477Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2605.04062/citation-record","integrity":"/paper/2605.04062/integrity","json":"/paper/2605.04062/citation-record.json","paper":"/paper/2605.04062"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"QuaRot: Outlier-free 4-bit inference in rotated LLMs","venue":null,"work_id":"a569b7f1-25b6-44f5-b7d8-f5d67a9186e5","year":2024},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:7d2a02d24fbe187f0035a868ae0a5b84702e09c1cc051c69c26a747108da04ce","observation_id":"f961b3c9-df77-4c1e-ad16-9d02f24a7aef","resolution":{"observed_at":"2026-05-22T10:16:24.395093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1308.3432","last_updated":"2013-08-15T15:19:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-08-15T15:19:34Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","version":1},"cited_work":{"arxiv_id":"1308.3432","doi":"10.48550/arxiv.1308.3432","metadata_source":"pith","pith_arxiv_id":"1308.3432","snapshot_observed_at":"2026-07-11T03:27:46.813463Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","venue":"cs.LG","work_id":"1fe8c7c8-aff7-4b94-9096-e549d7e60789","year":2013},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"cited_paper":"/paper/1308.3432","citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:e9770556f70d898c90b526db535cc0ee527867b54e7908272f7f3fbe41e4913e","observation_id":"2cd76207-a1ca-4625-9e11-5c52ba118040","resolution":{"observed_at":"2026-05-22T10:11:23.344625Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-05-19T16:22:27.235199+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T16:22:27.235199+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PIQA: Reasoning about physical commonsense in natural language","venue":null,"work_id":"7ab78788-0b11-4847-9da4-13d9d6ae072f","year":2020},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:95d878eb60e35b06d85f752db2289fc5a86f8ede3de02440ac8c76ac8df12d12","observation_id":"dc70212e-e80a-4e46-a3d8-77ca0c48d393","resolution":{"observed_at":"2026-05-22T10:16:24.402581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-07-11T03:27:46.202228Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:45fc2fbf24b4d51298fb093885f7234691f8ba5eb6f7b9871adedc52e16ba45a","observation_id":"a5c1d3fb-669c-4e2b-b13f-c17514790916","resolution":{"observed_at":"2026-05-22T10:11:23.350500Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"EfficientQAT: Efficient quantization-aware training for large language models","venue":null,"work_id":"53d562f0-36a7-46c6-9c2f-03a9ee590627","year":2025},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:893c219492bbdd2eae561cf476572905d5423f063a4586fedce6b8eb62634747","observation_id":"42279ed3-7ae8-47e3-90dd-e7314a927488","resolution":{"observed_at":"2026-05-22T10:16:24.387826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Optimize weight rounding via signed gradient descent for the quantization of LLMs","venue":null,"work_id":"a7850425-fd3a-4f86-ab37-7fc7493a6182","year":2024},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:b93238d1d27cfd52d6f1b52752b913963a2b753600cd65c2e55b64b75ec8125a","observation_id":"1f0ec0dc-2034-4cac-b634-1270240103fe","resolution":{"observed_at":"2026-05-22T10:16:24.375678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"BoolQ: Exploring the surprising difficulty of natural yes/no questions","venue":null,"work_id":"67c57282-3cc7-439f-a8ad-73aba74bfd83","year":2019},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:4fcbb17af0ea9081008a540e867aa54577462e20a2da87138ad0b38213cd009d","observation_id":"7f306b5d-20c3-4e9a-bd3a-48f489c6e267","resolution":{"observed_at":"2026-05-22T10:16:24.379982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":"1803.05457","doi":"10.1162/tacl_a_00448.https://aclanthology.org/2022.tacl-1.5","metadata_source":"pith","pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":"cs.AI","work_id":"28ea1282-d657-4c61-a83c-f1249be6d6b1","year":2018},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:1227c8adac208ce09fcce6191ba48e006c95f914a6617650a44e942478f2a001","observation_id":"125d4ba5-e555-451e-9e28-157cd1f31ace","resolution":{"observed_at":"2026-05-22T10:11:23.392490Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:b9e99cd4b29360c1ca779cdce9d3ffc34170e00ee03d6f6eb1cbb2d0003f62d3","observation_id":"8bff71ef-9420-479b-a8ae-974a5b83bb0b","resolution":{"observed_at":"2026-05-22T10:11:23.403689Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The case for 4-bit precision: K-bit inference scaling laws","venue":null,"work_id":"cdbfb9d1-fae9-4a6c-8b13-15a90d4f653e","year":2023},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:ece4ba217c9b2aea4e13337f672c3ea3b7500dfa7b83d5bb7a7d6bcfafcd0e05","observation_id":"e52770b9-8a2b-4ed4-9e06-5fa327afa278","resolution":{"observed_at":"2026-05-22T10:16:24.383791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"BitDistiller: Unleashing the potential of sub-4-bit LLMs via self-distillation","venue":null,"work_id":"e93efa0f-d672-4c3d-a6ed-0af1491b47cc","year":2024},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:11c706f96005553fc2cb40e47024dcfd6bbf62900b2c16be392f9ac5a421101d","observation_id":"2e291874-1f4a-48b9-98e1-c4b17a19cb15","resolution":{"observed_at":"2026-05-22T10:16:24.391452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Extreme compression of large language models via additive quantization","venue":null,"work_id":"a142a360-8b9b-4c05-804c-8015845b19d8","year":2024},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:986042765bb686d88d8955d0d727849dcc6a2b9b9e69de91f7d905de36d22e6f","observation_id":"a5ff85df-7574-4850-b439-4a4884658b5b","resolution":{"observed_at":"2026-05-22T10:16:24.355138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How contextual are contextualized word representations? Comparing the geometry of BERT, ELMo, and GPT-2 embeddings","venue":null,"work_id":"be6ec4bf-683e-43f9-8c93-c7cf18dd01fd","year":2019},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:e7c9f980ed37b8edd88c31c02e62de96bc00992b816fc2819b3969f3fe99806b","observation_id":"24e0a399-61a7-4a44-9562-ff6857e1072d","resolution":{"observed_at":"2026-05-22T10:16:24.364011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-07-31T03:44:36.976336Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":"2210.17323","doi":"10.48550/arxiv.2210.17323","metadata_source":"pith","pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-07-10T14:47:14.534663Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","venue":"cs.LG","work_id":"19ed8c44-202a-48f6-8169-637d5a5f2408","year":2022},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:877eba5a40788e485e5a868855dcc8ea788fcf29e09d1708d80fce570de5b050","observation_id":"1e83dd21-b734-4dc2-b2a1-9e176d8a7ce3","resolution":{"observed_at":"2026-05-22T10:11:23.398644Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-17T20:22:03.028003+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-17T20:22:03.028003+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-MME: The first-ever comprehensive evaluation benchmark of multi-modal LLMs in video analysis","venue":null,"work_id":"939d412d-f823-477b-bfa1-7bf5008894df","year":2025},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:34aceb9c9fc171f2e3f073362f74f1f34314c1f983e9680d7dc434887869f155","observation_id":"543fecd1-07ae-427f-bd77-074065051469","resolution":{"observed_at":"2026-05-22T10:16:24.371861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"APTQ: Attention-aware post- training mixed-precision quantization for large language models","venue":null,"work_id":"3a4de41b-25b9-47e3-9d83-4bf7911afc9f","year":2024},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:0200a9f8f08da8bebb7812c96c21e2d5dfbb5db73912cf22ea3ff05144cc98c1","observation_id":"8587b9ab-a66d-4359-b398-b671c248dad7","resolution":{"observed_at":"2026-05-22T10:16:24.351411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.02275","last_updated":"2023-02-17T16:08:22Z","snapshot_observed_at":"2026-08-02T16:04:58.658361Z","submitted_at":"2020-08-05T17:59:16Z","title":"Aligning AI With Shared Human Values","version":6},"cited_work":{"arxiv_id":"2008.02275","doi":"10.48550/arxiv.2008.02275","metadata_source":"pith","pith_arxiv_id":"2008.02275","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Aligning AI With Shared Human Values","venue":"cs.CY","work_id":"5e01e415-b531-432c-a080-659d1d46dfb6","year":2020},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"cited_paper":"/paper/2008.02275","citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:8bc887b443c6a480830b94cabbde15058c9bb5303ba74da1671dac247033ca3b","observation_id":"d6dfa4e6-a751-41bc-82cf-b21c37cf8780","resolution":{"observed_at":"2026-05-22T10:11:23.408621Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:49:50.195493+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:49:50.195493+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":"2009.03300","doi":"10.48550/arxiv.2009.03300","metadata_source":"pith","pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-07-11T01:37:42.666395Z","title":"Measuring Massive Multitask Language Understanding","venue":"cs.CY","work_id":"e87ec49a-544b-4ec8-8991-75298c64ff5e","year":2020},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:1430faed6decdb900aa6eb24b4928bc3c54c67e26c853933d27c27f6dc28dbc2","observation_id":"2546a4f5-db2c-413d-bb46-75a8d712738a","resolution":{"observed_at":"2026-05-22T10:11:23.378403Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T01:08:06.256034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rethinking channel dimensions to isolate outliers for low-bit weight quantization of large language models","venue":null,"work_id":"c44e734f-9bc1-4562-a50b-b1ddbb6035b5","year":2024},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:3cab67bb1aaa47cad6e0872546076d0262cf9f648430e80ae0034bd17bde02b1","observation_id":"e458e1ad-0a71-4fd2-a60b-cd8ba0c6d002","resolution":{"observed_at":"2026-05-22T10:16:24.340391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":"1503.02531","doi":"10.1109/cvpr52733.2024.01515","metadata_source":"pith","pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Distilling the Knowledge in a Neural Network","venue":"stat.ML","work_id":"d927ab1f-17b8-4002-9d09-c3d55764fbad","year":2015},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:2b399fade191734332102c0e2c122002bab4d4b598be3a9ddfcfd926c5aa0c13","observation_id":"0f7523c3-b73a-4ed3-a2f7-d7ccee8bfc62","resolution":{"observed_at":"2026-05-22T10:11:23.372678Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"BiLLM: Pushing the limit of post-training quantization for LLMs","venue":null,"work_id":"738e71b9-4314-412a-bd6b-3555482991e1","year":2024},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:d1ba4c226c75512c25d8a33a899c51f26f877b028d4732be41fa77127f27d59a","observation_id":"37b6000e-0665-460f-a48a-7aa921c62f46","resolution":{"observed_at":"2026-05-22T10:16:24.344117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SliM-LLM: Salience-driven mixed-precision quantization for large language models","venue":null,"work_id":"e85b852e-a1b5-46b4-882d-21bdbabe2c10","year":2025},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:4949917440e05879842c89bcf1abd39352dc8504f073039ffd694d14c555ccac","observation_id":"f19aace1-b7e1-4304-b652-0fce979b318a","resolution":{"observed_at":"2026-05-22T10:16:24.347766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.20214","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T02:06:26.995028Z","title":"Q-Palette: Fractional-bit quantizers toward optimal bit allocation for efficient LLM deployment","venue":null,"work_id":"6bcbc780-1311-4dbe-9a33-111bca3bc2cc","year":2025},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:6a2222003e572ef456913c4ed7c45b0ec0357d41ed10a55629057da217ad5f5f","observation_id":"f72b67e5-f8c7-4aa1-9ea4-5d0d3a931661","resolution":{"observed_at":"2026-05-22T10:11:23.361467Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11116","last_updated":"2025-06-09T06:37:15Z","snapshot_observed_at":"2026-07-06T21:41:19.199391Z","submitted_at":"2025-06-09T06:37:15Z","title":"Infinity Instruct: Scaling Instruction Selection and Synthesis to Enhance Language Models","version":1},"cited_work":{"arxiv_id":"2506.11116","doi":"10.48550/arxiv.2506.11116","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.11116","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Infinity Instruct: Scaling instruction selection and synthesis to enhance language models","venue":null,"work_id":"728884e2-e6cf-4dc9-a9ce-0c8146038e70","year":2025},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"cited_paper":"/paper/2506.11116","citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:167b6b2a84d31718b980e89593bcefb5365dd7f0ff85397bf8240ca7be8ede9f","observation_id":"c960889b-af23-4732-984f-ba40751322fe","resolution":{"observed_at":"2026-05-22T10:11:23.366758Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GPTAQ: Efficient finetuning-free quantization for asymmetric calibration","venue":null,"work_id":"b27c4801-5360-4b80-b28b-11bd6bbfa05c","year":2025},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:f19a174fd6e69c9d5caad48b0db171dd7f8b0f65d13139371e31d27697d80faa","observation_id":"55ebc97e-5b74-440a-acf2-56ae90bc073f","resolution":{"observed_at":"2026-05-22T10:16:24.367967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TGIF: A new dataset and benchmark on animated gif description","venue":null,"work_id":"43edebe2-50d3-4fbe-b0fc-96e150dddfcf","year":2016},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:27d31f2b97dbb4870557ec7b397d01a983d9e37dcce08a589397e79196d2cea8","observation_id":"7c419a65-3793-4128-ab62-1968bc5aecbf","resolution":{"observed_at":"2026-05-22T10:16:24.398820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ARB-LLM: Alternating refined binarizations for large language models","venue":null,"work_id":"0964bd40-3ccd-43a2-aa58-f8cbff011de6","year":2025},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:3904146dea26265041f0404ce1a17581ffb239e3090bbe978c1b9b2c0f714294","observation_id":"8fd72e5b-85bc-4576-8e60-04ef11418d5e","resolution":{"observed_at":"2026-05-22T10:16:24.406302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AWQ: Activation-aware weight quantization for on-device LLM compression and acceleration","venue":null,"work_id":"9c024c22-544a-4870-bba3-6b2ac41d262a","year":2024},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:9786d2d142a6a542cf71f8b7d8cda9910d647c564605bf355aa48ac176962519","observation_id":"891e9a01-59b5-488f-8974-455fd16104a7","resolution":{"observed_at":"2026-05-22T10:16:24.410266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TruthfulQA: Measuring how models mimic human falsehoods","venue":null,"work_id":"ebed03c5-16b1-4496-8414-409749ecf17a","year":2022},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:92779eb67bc4ae8e79ef86e69ec9df4e714cba1097b353c6a669436fa4818062","observation_id":"e102ee20-fbd5-41a3-82ba-28e176987e02","resolution":{"observed_at":"2026-05-22T10:16:24.302735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"QServe: W4A8KV4 quantization and system co-design for efficient LLM serving","venue":null,"work_id":"c6da7412-9748-4364-96ae-a91985c6dea5","year":2025},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:de0eb68ad5dd22da9597cbe77144c286cac9ef8966496c5e75b9eb8d7865dc98","observation_id":"2584fc4f-fd92-451e-90db-c990aa2f10c1","resolution":{"observed_at":"2026-05-22T10:16:24.284151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VPTQ: Extreme low-bit vector post-training quantization for large language models","venue":null,"work_id":"df403f3c-9e5c-4991-9849-ab219e9f8a26","year":2024},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:b1eea470384ed8155a52b32140a9f50a40bb453128b48f243fe18f219c37d532","observation_id":"0a9cdf48-9ce6-46c3-b472-f8f8e3709e78","resolution":{"observed_at":"2026-05-22T10:16:24.288864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17888","last_updated":"2023-05-29T05:22:11Z","snapshot_observed_at":"2026-07-06T15:34:36.757203Z","submitted_at":"2023-05-29T05:22:11Z","title":"LLM-QAT: Data-Free Quantization Aware Training for Large Language Models","version":1},"cited_work":{"arxiv_id":"2305.17888","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.17888","snapshot_observed_at":"2026-07-04T11:09:46.244627Z","title":"Llm-qat: Data-free quantization aware training for large language models","venue":null,"work_id":"aa772a15-dd3c-421b-a1a0-0fcfd75b9862","year":2023},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"cited_paper":"/paper/2305.17888","citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:49478b4440d580d76a593bf67c7470774336289d375c217252fcd3064ae3eb9d","observation_id":"266fad7a-5546-4724-bb32-a6709a8833ea","resolution":{"observed_at":"2026-05-22T10:11:23.356051Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.02631","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T21:08:58.110577Z","title":"ParetoQ: Scaling laws in extremely low-bit LLM quantization","venue":null,"work_id":"9005825b-a282-435f-8eda-0163175e61fd","year":2025},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:c55a1361ed76319a659f8fe3eef63bdb5fccf73b80760785218c2aa966aa493b","observation_id":"73f76727-90bf-47cd-8606-6c3c3e052658","resolution":{"observed_at":"2026-05-22T10:11:23.385125Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SpinQuant: LLM quantization with learned rotations","venue":null,"work_id":"eb0ab127-2a5a-40ef-8d70-300b80e51a42","year":2025},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:09713ee80487f2e514556fd8cc0f34627024ef54037a92a82278c32dc72a8ecd","observation_id":"b0ed9a4b-e85b-48fb-ab44-b35dc02deeb7","resolution":{"observed_at":"2026-05-22T10:16:24.298386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Can a suit of armor conduct electricity? A new dataset for open book question answering","venue":null,"work_id":"fe0ec7e7-0250-4d81-aba3-471c39403c83","year":2018},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:d2e12b637008583512c83a45cea9a377c82de39f77a7847749cb687e49cd7d62","observation_id":"214f302d-842a-4a48-be86-514406ba5182","resolution":{"observed_at":"2026-05-22T10:16:24.329191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"WinoGrande: An adversarial Winograd schema challenge at scale.Communications of the ACM, 64(9):99–106","venue":null,"work_id":"94efef25-8ace-4b08-9d89-de3f53f1cae3","year":2021},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:2c52e4d7b0dee68666e40ab452d22e7aa40b7bff31162fb0405ebe3a4d30b7f3","observation_id":"fbb6b3db-d6f5-46c9-a262-a6b31bd3d171","resolution":{"observed_at":"2026-05-22T10:16:24.259509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Social IQa: Commonsense reasoning about social interactions","venue":null,"work_id":"b0f61dde-dd63-42be-80f2-d7c948e21e04","year":2019},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:fe5ca7c3b8bafd04e123862224779c5b245b18dbc0c3cd71235a0fd735f5fcf9","observation_id":"4000a229-bd0b-4ddb-8660-c12706c09d38","resolution":{"observed_at":"2026-05-22T10:16:24.263123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"OmniQuant: Omnidirectionally calibrated quantization for large language models","venue":null,"work_id":"ce25241e-709a-4050-bd5e-9c4657c05427","year":2024},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:e5183c9128ca99b00e506c3b5d3a1b3fccf6665bbd0a525b4edc6c4cb3e6d47c","observation_id":"35718577-7606-40bb-88a4-3905d2af106d","resolution":{"observed_at":"2026-05-22T10:16:24.273605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"FlatQuant: Flatness matters for LLM quantization","venue":null,"work_id":"653c7f75-c3eb-440d-9fb5-5b1c6015ec69","year":2025},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:e69a7bdf1106f25857dd5b8718c3658e069743baf333a9110e3d1221e9d74155","observation_id":"6423fe27-80f1-44d9-8a3e-7a3341451373","resolution":{"observed_at":"2026-05-22T10:16:24.241500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MobileQuant: Mobile-friendly quantization for on-device language models","venue":null,"work_id":"25bac9ed-a345-409f-966a-3b876c3fc8a5","year":2024},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:662a299e0f34a7b74998698c5d4dd4d8325be4fb8602ff241a04f52df90d73e2","observation_id":"02cde144-33ab-48a8-a996-431fcc272a2b","resolution":{"observed_at":"2026-05-22T10:16:24.246692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"BERT rediscovers the classical NLP pipeline","venue":null,"work_id":"01a2ee62-9212-411a-b80a-80abf47dea49","year":2019},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:fb12990fe9af279562fad6dd8443184c5c832c0121e64931370c6439703d2bdf","observation_id":"f7f4e68e-bb60-4026-8998-6cd5610e9d52","resolution":{"observed_at":"2026-05-22T10:16:24.251457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"QuIP#: Even better LLM quantization with hadamard incoherence and lattice codebooks","venue":null,"work_id":"fdec81fb-765b-41f7-ad4e-b1660ccfca13","year":2024},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:6f910cf8ba9fde2c5dc430fd196dffc7a423c5e322e492e0e134bfe60f29b0d3","observation_id":"056a4481-c84e-4f8a-87c7-060a250c6fc6","resolution":{"observed_at":"2026-05-22T10:16:24.335364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"QTIP: Quantization with trellises and incoherence processing","venue":null,"work_id":"3e245dfb-7466-4c4a-b5c2-91638d847f28","year":2024},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:e30c7daccdbb5723694bf8e9c0f08f22865c465d5bb9036b6ac58a00c5d07246","observation_id":"424c0aec-9df0-49f0-8a14-5fa43f55cab9","resolution":{"observed_at":"2026-05-22T10:16:24.269743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"BitNet: 1-bit pre-training for large language models.Journal of Machine Learning Research, 26(125):1–29","venue":null,"work_id":"2d554311-4069-4a10-bbe8-f1d30bbb6d65","year":2025},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:706173d38134d43eabbc8dc93a06af90a9a8c222e00fbd49b5abe3fd9aad0ef9","observation_id":"f1e9dd44-ffb8-4759-ab2c-88fac099f431","resolution":{"observed_at":"2026-05-22T10:16:24.255773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MiniLM: Deep self-attention distillation for task-agnostic compression of pre-trained transformers","venue":null,"work_id":"df5efa6b-55bc-430c-9a18-d22894e400f5","year":2020},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:2bec1e2f7a02523ec98d757bfdaa04626bc07cafec40248df30d4b7fc2d627e0","observation_id":"c01de3a4-5157-4469-9b01-cb960ff582a5","resolution":{"observed_at":"2026-05-22T10:16:24.227990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rethinking kullback-leibler divergence in knowledge distillation for large language models","venue":null,"work_id":"c4cde6c9-ca88-44b2-a331-81b6c7a012ec","year":2025},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:172afbb46717b15fc8bc50987524f28b4fc751a3f9de014249d92f2904d1d3fe","observation_id":"ccee7f78-1218-4339-8ea6-ca5ed3940f3c","resolution":{"observed_at":"2026-05-22T10:16:24.237755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SmoothQuant: Accurate and efficient post-training quantization for large language models","venue":null,"work_id":"a10481d4-4edc-4815-9f1b-fa49cfcb1654","year":2023},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:6d55a7b6b294acb1059c11eb4434561ece052bb42b12869208a4cff82c56e95c","observation_id":"61a5580c-c0f1-42df-941d-0160b9f07012","resolution":{"observed_at":"2026-05-22T10:16:24.223236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-03T04:23:51.274879Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2503.20215","doi":"10.48550/arxiv.2503.20215","metadata_source":"pith","pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Qwen2.5-Omni Technical Report","venue":"cs.CL","work_id":"438f105c-fa9b-44aa-ad52-43acb8045cda","year":2025},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:040b771f852b1a7aaa53051b82b1984f9fc85c27d3caed658690628b5e7f2c60","observation_id":"0af928a6-7a9c-463b-aa02-34a486f50714","resolution":{"observed_at":"2026-05-22T10:11:23.328008Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:44.887499+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:44.887499+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"OneBit: Towards extremely low-bit large language models","venue":null,"work_id":"0bd9dfe1-bd76-4285-ba0d-34f103ade8a1","year":2024},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:7a498569dbbb0bc145c6a6df651d98e19ea43e123c8bfbec4ca6a4a78aad380a","observation_id":"130ee510-c540-4b5a-aa1b-de9c10d987d1","resolution":{"observed_at":"2026-05-22T10:16:24.306567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:4666dcac2bba43862f35c790d1d6d58aefc189e596c184b632ff21a47a0b3c0b","observation_id":"22b50fb2-f27a-4363-926c-09edde40133a","resolution":{"observed_at":"2026-05-22T10:11:23.333458Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05653","last_updated":"2023-10-03T02:48:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-11T17:47:22Z","title":"MAmmoTH: Building Math Generalist Models through Hybrid Instruction Tuning","version":3},"cited_work":{"arxiv_id":"2309.05653","doi":"10.48550/arxiv.2309.05653","metadata_source":"pith","pith_arxiv_id":"2309.05653","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"MAmmoTH: Building Math Generalist Models through Hybrid Instruction Tuning","venue":"cs.CL","work_id":"e74feaec-ca8a-4bdb-945e-e747355406e7","year":2023},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"cited_paper":"/paper/2309.05653","citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:ccf73daf7d68e6f4330df1594632bf2c05cabdd7079d991a41045446e1b83fc1","observation_id":"34d5ee32-dd65-4476-ad16-a1c22b8920fa","resolution":{"observed_at":"2026-05-22T10:11:23.338672Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"HellaSwag: Can a machine really finish your sentence? InProceedings of the 57th Annual Meeting of the Association for Computational Linguistics, pages 4791–4800","venue":null,"work_id":"4540c21b-b572-423c-ba01-0998d78a4ca2","year":2019},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:727310e9c3f7a8ccd61b3d847063eebf6450821a0b4f0d59f1236b3131aa825d","observation_id":"845e2352-4177-412b-ac55-3a0cee2fe63f","resolution":{"observed_at":"2026-05-22T10:16:24.213545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ABQ-LLM: Arbitrary-bit quantized inference acceleration for large language models","venue":null,"work_id":"ad154522-6f22-414c-a2e1-971557e5e832","year":2025},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:4f9d5edf7adf5e4d4c1adc385cf4beed3b805774b5a3ac89f152aaa06266f6a4","observation_id":"51fdc9ad-fc5a-4151-ab23-9814c3ca14b6","resolution":{"observed_at":"2026-05-22T10:16:24.218776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LQER: Low-rank quantization error reconstruction for LLMs","venue":null,"work_id":"ba54b6b6-5e61-4ece-b77e-c9e4ffac5529","year":2024},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:e88568548f5c4db0ea3fd11787897e90ec50cf8ca54b72e4405377c293d16b58","observation_id":"fc72bd4a-982a-4d89-aa6d-881f0a2154d4","resolution":{"observed_at":"2026-05-22T10:16:24.232871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19633","last_updated":"2025-03-25T13:19:46Z","snapshot_observed_at":"2026-07-06T20:58:23.695292Z","submitted_at":"2025-03-25T13:19:46Z","title":"1.4 Million Open-Source Distilled Reasoning Dataset to Empower Large Language Model Training","version":1},"cited_work":{"arxiv_id":"2503.19633","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19633","snapshot_observed_at":"2026-06-29T12:13:26.834380Z","title":"1.4 million open-source distilled reasoning dataset to empower large language model training","venue":null,"work_id":"916370ba-ae1f-4d71-a6db-086aa16d94e9","year":2025},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"cited_paper":"/paper/2503.19633","citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:3e37ec07a22c8025d57c9e2f0eb9732bc81c740a275fd1cc765c40cf6de3cc5a","observation_id":"f96283b2-251a-4b9d-8b9a-c3624726bb39","resolution":{"observed_at":"2026-05-22T10:11:23.322638Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A review on edge large language models: Design, execution, and applications.ACM Computing Surveys, 57(8):1–35","venue":null,"work_id":"f6f8f366-f27a-401b-82db-f2376e6d77b1","year":2025},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:79a91829011a02287390a43900b6805a6ea836ba829017daf75fed45f2ad571d","observation_id":"b1e2146a-7636-48f9-b6ea-ecf2bb61abee","resolution":{"observed_at":"2026-05-22T10:16:24.199071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.07911","doi":"10.48550/arxiv.2311.07911","metadata_source":"pith","pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-07-10T12:07:03.672931Z","title":"Instruction-Following Evaluation for Large Language Models","venue":"cs.CL","work_id":"3aa06177-125a-4f5a-8f4a-8070c5986c26","year":2023},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:523417f3c713ffa04efa62fd997bfa5f2f11ae3ed194497bc7793bfa35c195f4","observation_id":"0e836e11-0d25-41a8-80fc-22539a9af58c","resolution":{"observed_at":"2026-05-22T10:11:23.311393Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MLVU: Benchmarking multi-task long video understanding","venue":null,"work_id":"ce18a9fb-ad42-4b7a-96dd-f2396421893e","year":2025},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:1eb3a04fdde9781fb7e0cfbd2d566b2becb9104891ce7de3b202c769f54beac6","observation_id":"b991e72a-c586-4fb0-9ef4-e47fc157c210","resolution":{"observed_at":"2026-05-22T10:16:24.204218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c605e8c2-9028-4927-bfd1-dabc9ae67219","year":2004},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:f52eaead72cda4cb9f2ba7ca29da56be10104c2f8ec19be415f39ecda4d1d067","observation_id":"94564f05-3112-47e3-a246-4bfc8ab16281","resolution":{"observed_at":"2026-05-22T10:16:24.208831Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on model compression for large language models.Transactions of the Association for Computational Linguistics, 12:1556–1577","venue":null,"work_id":"d483f028-446c-4530-9178-a13f69fd1439","year":2024},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:d9a60af23afe1c08284d04f197961df695f5c99d5e4c18d9c4cf1cc8dfd84329","observation_id":"22a84477-c294-492d-bdf4-e182f91b8efc","resolution":{"observed_at":"2026-05-22T10:16:24.193948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"∼Unif[0,1]","venue":null,"work_id":"c5f50a31-b029-4eca-b4fa-5f09e025114c","year":null},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:a0a33dd90b25b107df3f96833ffa7495b10b04477bff95d317bde32cbd688588","observation_id":"d269e5dd-79ba-4038-9d96-66e7e69978de","resolution":{"observed_at":"2026-05-22T10:16:24.359335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"N−0.5 dout .(17) Since all points lie in a sub-interval of length ρ, taking t=ρ in the definition of D∗ N gives a deviation of1−ρ","venue":null,"work_id":"c9f5c09e-7611-477b-988a-7b37a2781aeb","year":null},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:1bf56526876c0f3041953e8de50735a83b50ba31765d335e39c578353982d779","observation_id":"942348bc-1744-4c97-bedc-87aa4132e2d3","resolution":{"observed_at":"2026-05-22T10:16:24.188428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1669.1936","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"\"\" Given a string, find out how many distinct characters (regardless of case) it consists of >>> count_distinct_characters(’xyzXYZ’) 3 >>> count_distinct_characters(’Jerry’) 4","venue":null,"work_id":"830b6f13-b544-4ed9-ac56-6a6fa310ccaf","year":1936},"citing_paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-22T10:07:35.063038Z"},"links":{"citing_paper":"/paper/2605.04062"},"observation_digest":"sha256:c2d33251925a12f1fbb8310fe32b8df9a47db10072def15610de9befc04fb98c","observation_id":"51320670-df27-428b-97b6-f95a52dbcc8f","resolution":{"observed_at":"2026-05-22T10:11:23.317146Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.04062","last_updated":"2026-05-21T13:07:01Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T15:49:44Z","title":"EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":17,"verified_fuzzy":44},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 1 inbound Pith citation observation for arXiv:2605.04062."}