{"as_of":"2026-08-07T08:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9f7176df32d750742341d08a89708e2dcc7f781d95b3278d8183573ac78b6dae","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T23:44:01.953344Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.06974/citation-record","integrity":"/paper/2508.06974/integrity","json":"/paper/2508.06974/citation-record.json","paper":"/paper/2508.06974"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Smollm - blazingly fast and remarkably powerful","venue":null,"work_id":"726a0ebb-db7c-418b-8452-f32cb49a4b41","year":2024},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:88686f7a415e494138c486a7ab793606bc7dc9080a5426a39416cc24c1505c4b","observation_id":"d79a5b07-aa4d-4be3-af4f-5304cca06bb9","resolution":{"observed_at":"2026-05-21T23:44:26.993566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:34:32.274562Z","title":"Pythia: A suite for analyzing large language models across training and scaling","venue":null,"work_id":"c90318f2-cefc-4ac4-9046-a2b661db3695","year":2023},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:d559778eceef780f3a9a1ef1d9e53d3bff361f893696c9a4f935ce5b515fbc6f","observation_id":"b2235490-13da-48b2-b174-0588ee5bad19","resolution":{"observed_at":"2026-05-21T23:44:26.991276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Piqa: Reasoning about physical common- sense in natural language","venue":null,"work_id":"7f33af47-f2f0-4f35-bf2c-398c0fbb5c73","year":2020},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:333030842d381d46caeca05e41c9b77937621213852ff2f171d26610c77aaa23","observation_id":"c47549a9-86aa-4048-9145-a8bdab7b8895","resolution":{"observed_at":"2026-05-21T23:44:26.989224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11960","last_updated":"2024-02-19T09:04:30Z","snapshot_observed_at":"2026-07-06T17:32:06.610773Z","submitted_at":"2024-02-19T09:04:30Z","title":"DB-LLM: Accurate Dual-Binarization for Efficient LLMs","version":1},"cited_work":{"arxiv_id":"2402.11960","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11960","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Db-llm: Accurate dual-binarization for efficient llms","venue":null,"work_id":"373a05d0-61af-4295-9edf-d7cbf23cf54a","year":2024},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"cited_paper":"/paper/2402.11960","citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:111f7d3117297a4f6bf16a4806b9b97a02b36ad685e93158c73d3d5662343080","observation_id":"43f53ec0-0e2c-48d6-b533-461b8a86d462","resolution":{"observed_at":"2026-05-21T23:44:26.571115Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-07-06T07:55:12.121264Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":"1905.10044","doi":"10.48550/arxiv.1905.10044","metadata_source":"pith","pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","venue":"cs.CL","work_id":"511eeb84-4b95-46d5-b14f-50da43f4f19f","year":2019},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:4c2ad9af6c9b32d7d96c86e76ce1adc38c50d9bbbb1f47044bad7b193b490204","observation_id":"2fe7647d-e7c1-459b-abdf-91f830724b37","resolution":{"observed_at":"2026-05-21T23:44:26.608473Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":"1803.05457","doi":"10.1162/tacl_a_00448.https://aclanthology.org/2022.tacl-1.5","metadata_source":"pith","pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":"cs.AI","work_id":"28ea1282-d657-4c61-a83c-f1249be6d6b1","year":2018},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:e31a22b1cd5a7969989b7b82f46f67d50d7a4159589d587d21762dcf8466f517","observation_id":"ae44b037-8c31-4651-a19f-79a74aab61df","resolution":{"observed_at":"2026-05-21T23:44:26.576555Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.02830","last_updated":"2016-03-17T14:54:25Z","snapshot_observed_at":"2026-07-06T04:45:31.463087Z","submitted_at":"2016-02-09T01:01:59Z","title":"Binarized Neural Networks: Training Deep Neural Networks with Weights and Activations Constrained to +1 or -1","version":3},"cited_work":{"arxiv_id":"1602.02830","doi":"10.48550/arxiv.1602.02830","metadata_source":"pith","pith_arxiv_id":"1602.02830","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Binarized Neural Networks: Training Deep Neural Networks with Weights and Activations Constrained to +1 or -1","venue":"cs.LG","work_id":"73fcd90c-53bb-4d2e-87ef-284402d02867","year":2016},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"cited_paper":"/paper/1602.02830","citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:0e7cd6a35b0a15274be2e863ccdf89261815f901f5c85ee6aa7f494a5d068618","observation_id":"826eb67d-47d2-4620-b6fa-2ac37683b083","resolution":{"observed_at":"2026-05-21T23:44:26.573928Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14314","last_updated":"2023-05-23T17:50:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-23T17:50:33Z","title":"QLoRA: Efficient Finetuning of Quantized LLMs","version":1},"cited_work":{"arxiv_id":"2305.14314","doi":"10.1007/978-3-031-86644-9","metadata_source":"pith","pith_arxiv_id":"2305.14314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"QLoRA: Efficient Finetuning of Quantized LLMs","venue":"cs.LG","work_id":"d3fdf68e-3a5e-48b5-8a18-7a9137479c55","year":2023},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"cited_paper":"/paper/2305.14314","citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:943dab6b59c667cc47e4ebe48ed1b0c6f77704cfb19d44ec520aec1759e5ed2c","observation_id":"d6f57e09-ca67-4fc3-9378-859482f219b3","resolution":{"observed_at":"2026-05-21T23:44:26.602093Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07950","last_updated":"2025-02-25T09:14:18Z","snapshot_observed_at":"2026-08-03T23:43:49.527744Z","submitted_at":"2023-12-13T07:56:27Z","title":"CBQ: Cross-Block Quantization for Large Language Models","version":5},"cited_work":{"arxiv_id":"2312.07950","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.07950","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cbq: Cross-block quantization for large language models","venue":null,"work_id":"10dcac67-91a4-4745-b792-97c260e04673","year":2023},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"cited_paper":"/paper/2312.07950","citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:2bbd41978c7747d4df007486954f7cc93afe9227b55d580e0332d9012c19428f","observation_id":"a39cb12d-e94e-4a54-a86b-a51a6c8f777e","resolution":{"observed_at":"2026-05-21T23:44:26.521848Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:f2761477c485620e1742e248ee571f182989df36f0917af8b52542040c742cae","observation_id":"c0f8836b-99b0-4261-b933-60fab890d7bb","resolution":{"observed_at":"2026-05-21T23:44:26.544029Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"lm-evaluation-harness","venue":null,"work_id":"493437af-522b-4a98-95c4-96986d37875a","year":2021},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:42d894124a8f655e40fe12430731d14589983639056db667cdf17a5572969c0e","observation_id":"c2275535-b065-42b6-8fec-ecc2f5c5e1a7","resolution":{"observed_at":"2026-05-21T23:44:26.965808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-07T05:00:52.309220Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":"2210.17323","doi":"10.48550/arxiv.2210.17323","metadata_source":"pith","pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","venue":"cs.LG","work_id":"19ed8c44-202a-48f6-8169-637d5a5f2408","year":2022},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:e7dc250b92a5a7bca5694f2876420d6c227ae83be7f1b9730d34c6918d85b852","observation_id":"b939caed-17f6-458a-b178-6179a76e0f41","resolution":{"observed_at":"2026-05-21T23:44:26.494224Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-17T20:22:03.028003+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-17T20:22:03.028003+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pt-bitnet: 1-bit large language model with post-training quantization.Available at SSRN 4987078","venue":null,"work_id":"db42f0e6-9339-4365-b278-3581548a3e2f","year":null},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:fbb67aa1e7483aba56f69609d3550f189c76f54edabefc1dce662dc90b3f10d0","observation_id":"1edfb4d1-21f7-49cf-a229-b2de744d9336","resolution":{"observed_at":"2026-05-21T23:44:26.963499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04291","last_updated":"2024-05-15T13:55:12Z","snapshot_observed_at":"2026-08-04T05:18:02.925670Z","submitted_at":"2024-02-06T09:26:34Z","title":"BiLLM: Pushing the Limit of Post-Training Quantization for LLMs","version":2},"cited_work":{"arxiv_id":"2402.04291","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04291","snapshot_observed_at":"2026-07-04T17:29:59.598269Z","title":"Billm: Pushing the limit of post-training quantization for llms","venue":null,"work_id":"5ad1f303-8e85-433c-9085-ff3267c2fb8c","year":2024},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"cited_paper":"/paper/2402.04291","citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:e26351b7f034f71d015112b5080767852747fd4d3b42a516abb5d7a5b07e0d1f","observation_id":"11bbacbb-8d30-4d7a-ba15-e6e76bdae4f2","resolution":{"observed_at":"2026-05-21T23:44:26.527117Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08659","last_updated":"2023-11-28T16:06:59Z","snapshot_observed_at":"2026-07-06T16:32:11.601334Z","submitted_at":"2023-10-12T18:34:08Z","title":"LoftQ: LoRA-Fine-Tuning-Aware Quantization for Large Language Models","version":4},"cited_work":{"arxiv_id":"2310.08659","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.08659","snapshot_observed_at":"2026-07-10T11:37:03.185820Z","title":"Loftq: Lora- fine-tuning-aware quantization for large language models","venue":"cs.CL","work_id":"ed0c9106-2097-43fb-854d-d9945b1b9488","year":2023},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"cited_paper":"/paper/2310.08659","citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:a46d177783a5d5b081e5fb3372d18f4261d4ce4923c8646b0c0155a8d6961204","observation_id":"d6550fcd-d067-451e-a83f-53a038108174","resolution":{"observed_at":"2026-05-21T23:44:26.517127Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2410.03129","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T13:48:20.631441Z","title":"Arb-llm: Alternating refined binarizations for large language models","venue":null,"work_id":"0636c9da-d379-4e28-97a6-236ce95963f3","year":2024},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:8689f47646cbfb9d48181667e80576b1ad3194618b3626dcb97cd272d309fcb6","observation_id":"36ab9c8b-9f78-45f8-b24d-30d41faff821","resolution":{"observed_at":"2026-05-21T23:44:26.612305Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Awq: Activation-aware weight quantization for on-device llm compression and acceleration","venue":null,"work_id":"41a8fe0f-1ed1-4bdc-a0d5-bf12076ab6bd","year":2024},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:d1d02a7ec09bc521ed2e797f6eba430ea9ff5b4fd254e8a68b6a0b16d9a57678","observation_id":"35d6c0e9-7f00-4215-95bf-0cc5c01f1e78","resolution":{"observed_at":"2026-05-21T23:44:26.960926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rotated binary neural network","venue":null,"work_id":"6a73ff19-9ea0-49a8-9d69-447f3646dec0","year":2020},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:5385f166d5b03b7489a5d93677e017520b87125bbee14296d9e591a4c38ca1db","observation_id":"f15300df-35d1-4eae-8119-7d1fd0d9cb86","resolution":{"observed_at":"2026-05-21T23:44:27.002649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17888","last_updated":"2023-05-29T05:22:11Z","snapshot_observed_at":"2026-07-06T15:34:36.757203Z","submitted_at":"2023-05-29T05:22:11Z","title":"LLM-QAT: Data-Free Quantization Aware Training for Large Language Models","version":1},"cited_work":{"arxiv_id":"2305.17888","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.17888","snapshot_observed_at":"2026-07-04T11:09:46.244627Z","title":"Llm-qat: Data-free quantization aware training for large language models","venue":null,"work_id":"aa772a15-dd3c-421b-a1a0-0fcfd75b9862","year":2023},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"cited_paper":"/paper/2305.17888","citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:82d300adcece467c4d9f8fb92e9ade89850cc228a391697124da0f58bbde33ee","observation_id":"6bac20f3-ce57-498f-bc25-413a448e58bd","resolution":{"observed_at":"2026-05-21T23:44:26.498527Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reactnet: Towards precise binary neural network with generalized activation functions","venue":null,"work_id":"94d057fb-8d4c-4af7-8719-4c32625c0f0c","year":2020},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:5bf212a29728c82103f571cd5be259b7040efea276ed2f93b41f717ed0fec8df","observation_id":"868cf11a-c3ea-48f2-989e-0e8669b356bb","resolution":{"observed_at":"2026-05-21T23:44:26.970668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07093","last_updated":"2024-07-09T17:59:48Z","snapshot_observed_at":"2026-07-06T18:43:51.723237Z","submitted_at":"2024-07-09T17:59:48Z","title":"FBI-LLM: Scaling Up Fully Binarized LLMs from Scratch via Autoregressive Distillation","version":1},"cited_work":{"arxiv_id":"2407.07093","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.07093","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fbi-llm: Scaling up fully binarized llms from scratch via autoregressive distillation","venue":null,"work_id":"6051f83a-b847-4b87-a952-40d7efc94f91","year":2024},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"cited_paper":"/paper/2407.07093","citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:8365dc2edf3fd90a6f615f1307d193373814ed3be123298ea687440dd9a4c2ae","observation_id":"228f981d-3990-4ee7-9114-36f5423c8cd1","resolution":{"observed_at":"2026-05-21T23:44:26.565633Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12285","last_updated":"2025-04-25T03:07:55Z","snapshot_observed_at":"2026-07-06T21:10:31.989050Z","submitted_at":"2025-04-16T17:51:43Z","title":"BitNet b1.58 2B4T Technical Report","version":2},"cited_work":{"arxiv_id":"2504.12285","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.12285","snapshot_observed_at":"2026-07-04T20:00:08.922149Z","title":"Bitnet b1","venue":null,"work_id":"40bc01dc-f02b-4154-a692-77c8e15399b3","year":2025},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"cited_paper":"/paper/2504.12285","citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:2fa9d5cbb5a4a954c27f406ea3431dd37a03c5be53de78b17e7436783c67dfd6","observation_id":"bffe5d69-1676-4f0e-895e-14c712dc2cfc","resolution":{"observed_at":"2026-05-21T23:44:26.502882Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17764","last_updated":"2024-02-27T18:56:19Z","snapshot_observed_at":"2026-08-03T00:59:01.026576Z","submitted_at":"2024-02-27T18:56:19Z","title":"The Era of 1-bit LLMs: All Large Language Models are in 1.58 Bits","version":1},"cited_work":{"arxiv_id":"2402.17764","doi":"10.18653/v1/2023.acl-long.5","metadata_source":"pith","pith_arxiv_id":"2402.17764","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Era of 1-bit LLMs: All Large Language Models are in 1.58 Bits","venue":"cs.CL","work_id":"4a49f413-bca9-4de8-8620-97aa4cb099f3","year":2024},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"cited_paper":"/paper/2402.17764","citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:0ecc0ed4954f2c27d3c12d684f214b1ea333aaae85562b24b67b1b8922de3da0","observation_id":"960f05ba-c912-4153-9768-d97c5c8f7c9f","resolution":{"observed_at":"2026-05-21T23:44:26.580598Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.05589","last_updated":"2017-11-20T17:57:58Z","snapshot_observed_at":"2026-07-06T05:51:36.145913Z","submitted_at":"2017-07-18T12:35:53Z","title":"On the State of the Art of Evaluation in Neural Language Models","version":2},"cited_work":{"arxiv_id":"1707.05589","doi":null,"metadata_source":"pith","pith_arxiv_id":"1707.05589","snapshot_observed_at":"2026-06-29T18:53:51.687415Z","title":"On the State of the Art of Evaluation in Neural Language Models","venue":"cs.CL","work_id":"ab688bcb-8407-488a-8445-6ceea09a6665","year":2017},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"cited_paper":"/paper/1707.05589","citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:f4637cfaf2cc86a0b82f55f5bb9f671273a8774d0d4c88fc8a9bc21a91514679","observation_id":"1b8318a1-4a4d-42b2-8970-983d268da28e","resolution":{"observed_at":"2026-05-21T23:44:26.546870Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-07-06T05:12:10.387914Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":"1609.07843","doi":"10.1007/978-3-030-62077-6","metadata_source":"pith","pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pointer Sentinel Mixture Models","venue":"cs.CL","work_id":"fef3833e-dc80-42a3-a1e0-ffbfafee6fff","year":2016},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:34154b4a64d0d70b20bee6634650bcdd21a6aa702b666c84b2a7dd9f96433e5d","observation_id":"34475b4e-2d20-43c1-9d9f-8336b1a268b2","resolution":{"observed_at":"2026-05-21T23:44:26.540367Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Can a suit of armor conduct electricity? a new dataset for open book question answering","venue":null,"work_id":"9a8be6f4-45c0-420c-9b3d-4144ddf69a01","year":2018},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:130dd66cd31916b5cc3105b243ec0a770366e808820f192395a3f172fb8faa03","observation_id":"544f4c9e-90aa-47d7-ac9d-7f6f7ad4eb1c","resolution":{"observed_at":"2026-05-21T23:44:26.982644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fine-tuning llms to 1.58bit: extreme quantization made easy","venue":null,"work_id":"08b6658a-d29d-469f-93be-d2a7eeec1a6a","year":2024},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:28122ba10cae444bf06f74503f167765103097de3646b33eb7ecfb4ce9d81d73","observation_id":"a159ed2f-1016-4907-9ab5-1d344a82f632","resolution":{"observed_at":"2026-05-21T23:44:26.975498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17691","last_updated":"2024-11-27T02:51:04Z","snapshot_observed_at":"2026-07-06T19:57:28.746485Z","submitted_at":"2024-11-26T18:57:58Z","title":"Low-Bit Quantization Favors Undertrained LLMs: Scaling Laws for Quantized LLMs with 100T Training Tokens","version":2},"cited_work":{"arxiv_id":"2411.17691","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.17691","snapshot_observed_at":"2026-07-04T08:19:44.242007Z","title":"Low-bit quantization favors undertrained LLMs: Scaling laws for quantized LLMs with 100t training tokens","venue":null,"work_id":"9095d0c3-b9f7-4b56-b439-d78fb9c53c24","year":2024},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"cited_paper":"/paper/2411.17691","citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:38c6c303fdca70bbd4c0653f5c381361a75582358f1f922512d8817d1e2b6b6d","observation_id":"7fddf69d-67b1-4f3b-b97f-3c33b387aaf9","resolution":{"observed_at":"2026-05-21T23:44:26.595598Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Forward and backward information retention for accurate binary neural networks","venue":null,"work_id":"8ce0cdc2-8975-4495-a112-746e05a74fa2","year":2020},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:0be0ade07c0e8ca238b7029940113d7d63aed0725445f62e7230447dfb31ae12","observation_id":"51ab51f2-d2e1-4fc5-a309-3251ba7a6d12","resolution":{"observed_at":"2026-05-21T23:44:27.000308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":"eb47c630-8bcd-4f31-bc25-f7c73903d972","year":2020},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:5c9e19678102a515923c498e996098bcc477b0632e1ecb73dd21c1101a62b4d6","observation_id":"8b65706a-f54e-4f0e-a50f-960953040056","resolution":{"observed_at":"2026-05-21T23:44:26.972869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Xnor-net: Imagenet classifi- cation using binary convolutional neural networks","venue":null,"work_id":"388087f8-925e-413c-a7b8-1dc19d24d540","year":2016},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:ae68bed1342068cfa8d0bcf2742ff4ea45dcce213ee2e97ee46278d1b34a3d08","observation_id":"2c8352a2-9ead-44b3-bead-c8ee567ea53e","resolution":{"observed_at":"2026-05-21T23:44:26.977953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Winogrande: An adversarial winograd schema challenge at scale","venue":null,"work_id":"77c34b1f-a890-4ade-b1db-49d3ff74372f","year":2021},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:4c1b71f44d68e33512dac87bedf47f8f9430a694f4c2582599bd106209a22b96","observation_id":"6ee9f74c-1bf1-4b7b-97a3-30d711128413","resolution":{"observed_at":"2026-05-21T23:44:26.986968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00034","last_updated":"2023-11-07T20:41:22Z","snapshot_observed_at":"2026-07-06T16:25:42.545425Z","submitted_at":"2023-09-29T14:35:27Z","title":"PB-LLM: Partially Binarized Large Language Models","version":2},"cited_work":{"arxiv_id":"2310.00034","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.00034","snapshot_observed_at":"2026-07-03T13:38:19.682691Z","title":"Pb-llm: Partially binarized large language models","venue":null,"work_id":"eb3e5cb2-0cc4-426a-a936-0c1e64c59042","year":2023},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"cited_paper":"/paper/2310.00034","citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:b5e43dc4b6ab0448c698adc3adaf4221af33b6e4fea533bb338da9208bcc89aa","observation_id":"514f4a66-06a9-46f2-bf2a-2466d9e24357","resolution":{"observed_at":"2026-05-21T23:44:26.507749Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13137","last_updated":"2024-03-18T05:33:22Z","snapshot_observed_at":"2026-07-06T16:10:15.694898Z","submitted_at":"2023-08-25T02:28:35Z","title":"OmniQuant: Omnidirectionally Calibrated Quantization for Large Language Models","version":3},"cited_work":{"arxiv_id":"2308.13137","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.13137","snapshot_observed_at":"2026-07-10T14:47:14.587873Z","title":"Omniquant: Omnidirectionally calibrated quantization for large lan- guage models.arXiv preprint arXiv:2308.13137","venue":"cs.LG","work_id":"3aac6f51-8082-4d19-9349-f76711c6de1c","year":2023},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"cited_paper":"/paper/2308.13137","citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:1238e1ac25655655053a6f3f535cf216938f490f1d939322d66084662a3d1d03","observation_id":"9be89c9d-141f-4c33-b32c-e71eee771ca9","resolution":{"observed_at":"2026-05-21T23:44:26.536656Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05964","last_updated":"2024-04-07T13:03:58Z","snapshot_observed_at":"2026-07-06T17:27:37.212340Z","submitted_at":"2024-02-05T12:16:28Z","title":"A Survey on Transformer Compression","version":2},"cited_work":{"arxiv_id":"2402.05964","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.05964","snapshot_observed_at":"2026-07-01T22:36:17.329300Z","title":"A survey on transformer compression","venue":null,"work_id":"bf4a434d-4895-407d-87fc-6a1636a3b767","year":2024},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"cited_paper":"/paper/2402.05964","citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:53c786ee466b187c415d4a7e914503ac57d51ad2629b04db32334788330eabd0","observation_id":"66aa30a7-72a9-4c8d-bd1d-bdd1aa3a9284","resolution":{"observed_at":"2026-05-21T23:44:26.532491Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-02T11:57:18.735747Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:8552c7215415634c5f4ce3d09f4757c8b3b627400b13990852011d4acab65e24","observation_id":"93cf768f-c094-44a4-9ad2-898333d87781","resolution":{"observed_at":"2026-05-21T23:44:26.552688Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adabin: Improving binary neural networks with adaptive binary sets","venue":null,"work_id":"33fbb113-2f3e-4c03-bd42-8e300af83aa1","year":2022},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:88ae1d6e9e0495f9f1b708350f2f956216c5a536a0993a632c42540c8068e558","observation_id":"22ea2b49-afbb-4103-960a-6908f5013168","resolution":{"observed_at":"2026-05-21T23:44:26.980502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":"2310.11453","doi":"10.48550/arxiv.2310.11453","metadata_source":"pith","pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","venue":"cs.CL","work_id":"28ad8f61-4291-4894-b120-1d42fc9937a3","year":2023},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:d3e6a0072e01bf7757fc0752f5c26b0f708509c5f9c01b95f32f25cb1a43ca79","observation_id":"705b42e2-a142-4ff5-994c-b1fc13a29a1e","resolution":{"observed_at":"2026-05-21T23:44:26.512528Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12372","last_updated":"2024-11-19T09:35:28Z","snapshot_observed_at":"2026-08-06T21:35:45.662025Z","submitted_at":"2024-11-19T09:35:28Z","title":"RedPajama: an Open Dataset for Training Large Language Models","version":1},"cited_work":{"arxiv_id":"2411.12372","doi":"10.48550/arxiv.2411.12372","metadata_source":"pith","pith_arxiv_id":"2411.12372","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Redpajama: an open dataset for training large language models","venue":"cs.CL","work_id":"b950825e-7583-4df4-922a-e7109800520c","year":2024},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"cited_paper":"/paper/2411.12372","citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:b994bed94a6b9e9ff6ba7090c441ce6151281abc4fc335be31ef2bf0aa3026da","observation_id":"e8d4a238-444a-4897-981e-b963eab614df","resolution":{"observed_at":"2026-05-21T23:44:26.591858Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"T-mac: Cpu renaissance via table lookup for low-bit llm deployment on edge","venue":null,"work_id":"b1f47ca2-07fd-4caf-a990-50d911f264c4","year":2024},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:86b3dd97123d4176fb0bd7db4ccc7af262aa76b03898ab9898e3e55febf3a1a2","observation_id":"52b8bc82-1cd3-4085-8d39-e24b832a39b1","resolution":{"observed_at":"2026-05-21T23:44:26.984654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Smoothquant: Accurate and efficient post-training quantization for large language models","venue":null,"work_id":"1864e948-9ffd-4a31-8632-52c030e0b462","year":2023},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:9597e77583d597cc513e4d40921935632a93d2eadac54de89cca902603587401","observation_id":"8d20a149-08bc-4ba9-af82-e33b9482b635","resolution":{"observed_at":"2026-05-21T23:44:26.995933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11295","last_updated":"2024-11-29T11:47:55Z","snapshot_observed_at":"2026-07-06T17:31:37.574049Z","submitted_at":"2024-02-17T14:26:57Z","title":"OneBit: Towards Extremely Low-bit Large Language Models","version":6},"cited_work":{"arxiv_id":"2402.11295","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11295","snapshot_observed_at":"2026-06-30T15:54:49.328128Z","title":"Onebit: Towards extremely low-bit large language models","venue":null,"work_id":"9e44d345-f772-45cc-94df-8f4b6591555a","year":2024},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"cited_paper":"/paper/2402.11295","citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:63dcd050c28857d91f6d895f5641fae12b349f48203deeab397c28a62a14ec01","observation_id":"d9ffc058-5768-4068-be87-316fefd80943","resolution":{"observed_at":"2026-05-21T23:44:26.598786Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T22:03:00.347701Z","title":"Qwen3 technical report","venue":null,"work_id":"0975c471-7836-4670-b384-fdfe14cbcc61","year":2025},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:bc2f269aefdc67e6f51d574e87f4aa1774901cb6a24bd6b87e4847d2f21df2d5","observation_id":"6bc37fab-5d7a-4190-bf51-678eb5f27b7f","resolution":{"observed_at":"2026-05-21T23:44:26.997946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hellaswag: Can a machine really finish your sentence? In Annual Meeting of the Association for Computational Linguistics","venue":null,"work_id":"fb08f7a3-b04f-42fb-8838-7e9858bedf0e","year":2019},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:569eaf5fa92dec01aad432d61605b02e3cdfc48ebd60c7fb7cca6b7a79fe11fa","observation_id":"50843b79-997d-4fbd-9b7c-58e42d60dda3","resolution":{"observed_at":"2026-05-21T23:44:26.968164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:7a1121353242b87747cc55c317172ad77f9cc3c6b4a57a4b88a94c833b000c39","observation_id":"f5081846-3faf-4393-b567-c1e3976d1222","resolution":{"observed_at":"2026-05-21T23:44:26.584036Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":"2303.18223","doi":"10.18653/v1/d16-1080","metadata_source":"pith","pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey of Large Language Models","venue":"cs.CL","work_id":"de1b42b5-4a0a-4b1f-8c78-1f7fe21be6c9","year":2023},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:fadcfda5646d8043f682f438e07348c77cdb3a85cb4bdb4b64b6c520c3aea367","observation_id":"650141fc-a28e-40ae-b472-ed55bc33111f","resolution":{"observed_at":"2026-05-21T23:44:26.561993Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02214","last_updated":"2025-05-04T18:43:44Z","snapshot_observed_at":"2026-07-06T21:18:45.864722Z","submitted_at":"2025-05-04T18:43:44Z","title":"An Empirical Study of Qwen3 Quantization","version":1},"cited_work":{"arxiv_id":"2505.02214","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02214","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An empirical study of qwen3 quantization","venue":null,"work_id":"2bf07629-636d-4eda-8e2f-c65100526560","year":2025},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"cited_paper":"/paper/2505.02214","citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:d915ef6bda82784718df15e088fdf95f5ca5955c86993f333c1a3a1cc1207dd1","observation_id":"37e22f10-ed19-4565-a04a-6a80c8e66a8e","resolution":{"observed_at":"2026-05-21T23:44:26.587231Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1702.03044","last_updated":"2017-08-25T13:21:18Z","snapshot_observed_at":"2026-07-06T05:29:31.198406Z","submitted_at":"2017-02-10T02:30:22Z","title":"Incremental Network Quantization: Towards Lossless CNNs with Low-Precision Weights","version":2},"cited_work":{"arxiv_id":"1702.03044","doi":"10.48550/arxiv.1702.03044","metadata_source":"pith","pith_arxiv_id":"1702.03044","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Incremental Network Quantization: Towards Lossless CNNs with Low-Precision Weights","venue":"cs.CV","work_id":"61acd1c6-876a-4e1a-a769-bb371792600a","year":2017},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"cited_paper":"/paper/1702.03044","citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:f8e5f78a8cf3f4b1e5401724480b8e73b181a0e08842700b0990260fd8ae0495","observation_id":"1130f740-eca8-49f6-9c88-899cec7966ca","resolution":{"observed_at":"2026-05-21T23:44:26.615636Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":29,"verified_fuzzy":19},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 0 inbound Pith citation observations for arXiv:2508.06974."}