{"as_of":"2026-08-11T06:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8a0b10cc518704b39b19d0623346e818cb58ad449fa6757061e58404a73a6508","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-24T05:41:15.544164Z","state":"measured"},{"denominator":98,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":98,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":78,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":78,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T04:39:36.710683Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":26,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":"2310.11453","doi":"10.48550/arxiv.2310.11453","metadata_source":"pith","pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","venue":"cs.CL","work_id":"28ad8f61-4291-4894-b120-1d42fc9937a3","year":2023},"citing_paper":{"arxiv_id":"2402.17764","last_updated":"2024-02-27T18:56:19Z","snapshot_observed_at":"2026-08-03T00:59:01.026576Z","submitted_at":"2024-02-27T18:56:19Z","title":"The Era of 1-bit LLMs: All Large Language Models are in 1.58 Bits","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-17T20:11:43.559035Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2402.17764"},"observation_digest":"sha256:fae3ddaad0f27ac847e49826bf11f47a109929fd9bc1f716e3c0f5b63e56e422","observation_id":"21ee2189-913e-44dd-a16b-bdbb9b3e81bd","resolution":{"observed_at":"2026-05-17T20:11:43.609612Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-11T04:39:36.710683Z","title":"Bitnet: Scaling 1-bit trans- formers for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18653","last_updated":"2024-12-24T19:00:02Z","snapshot_observed_at":"2026-08-11T04:33:55.415799Z","submitted_at":"2024-12-24T19:00:02Z","title":"1.58-bit FLUX","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T04:39:36.710683Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2412.18653"},"observation_digest":"sha256:de8bf48767b8393856c48bd929ef9b782d7b24967731ae43e7371c37bac2ff9e","observation_id":"af450a87-0dfe-4d07-b105-fa4e0b0ea00e","resolution":{"observed_at":"2026-08-11T04:39:36.710683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-10T22:25:00.424379Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01767","last_updated":"2025-01-08T12:11:18Z","snapshot_observed_at":"2026-08-10T22:18:41.956195Z","submitted_at":"2025-01-03T11:40:41Z","title":"LogicAD: Explainable Anomaly Detection via VLM-based Text Feature Extraction","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:00.424379Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2501.01767"},"observation_digest":"sha256:66b7c9ab82028db6abe10da09f745130fc09680c2b7ef24e8540b008262a069f","observation_id":"3d7ec4a9-fa84-4bd3-b985-0510a7e818da","resolution":{"observed_at":"2026-08-10T22:25:00.424379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-10T19:08:08.073599Z","title":"Bitnet: Scaling 1-bit transformers for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10658","last_updated":"2025-01-18T05:27:25Z","snapshot_observed_at":"2026-08-11T05:35:14.813751Z","submitted_at":"2025-01-18T05:27:25Z","title":"LUT-DLA: Lookup Table as Efficient Extreme Low-Bit Deep Learning Accelerator","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T19:08:08.073599Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2501.10658"},"observation_digest":"sha256:89c05228b13ad03e3f733a3559b653d8fa9c0e5cc859347a3a6f37dc1626592b","observation_id":"cd5792ab-8f03-4ca8-816f-b9a23f5f0670","resolution":{"observed_at":"2026-08-10T19:08:08.073599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-10T16:49:47.269829Z","title":"Bitnet: Scaling 1-bit transformers for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12896","last_updated":"2025-01-22T14:17:57Z","snapshot_observed_at":"2026-08-10T16:37:38.333189Z","submitted_at":"2025-01-22T14:17:57Z","title":"Irrational Complex Rotations Empower Low-bit Optimizers","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-10T16:49:47.269829Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2501.12896"},"observation_digest":"sha256:cdbbe1ba7476c89694dd7181a3dc1c813591480e044294d342581082802d04fe","observation_id":"9801e0f9-f370-4ab9-8502-2ca936aed9eb","resolution":{"observed_at":"2026-08-10T16:49:47.269829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-10T21:37:14.512077Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models.arXiv preprint arXiv:2310.11453, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13111","last_updated":"2025-01-08T14:38:13Z","snapshot_observed_at":"2026-08-10T21:27:53.710306Z","submitted_at":"2025-01-08T14:38:13Z","title":"iServe: An Intent-based Serving System for LLMs","version":1},"reference_index":114,"source":"pdf_text","source_observed_at":"2026-08-10T21:37:14.512077Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2501.13111"},"observation_digest":"sha256:cac891c0ffec5cc0cf7d661f40498b58d74c5fbd0088388d36f4c1cfd3965b37","observation_id":"b4b5d7a9-23b7-42db-adfc-4e5327ba1882","resolution":{"observed_at":"2026-08-10T21:37:14.512077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-09T21:34:28.369362Z","title":"BitNet: Scaling 1-bit transformers for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.19067","last_updated":"2025-05-21T12:59:55Z","snapshot_observed_at":"2026-08-10T05:35:40.700795Z","submitted_at":"2025-01-31T11:53:16Z","title":"From Low Intrinsic Dimensionality to Non-Vacuous Generalization Bounds in Deep Multi-Task Learning","version":2},"reference_index":1971,"source":"pdf_text","source_observed_at":"2026-08-09T21:34:28.369362Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2501.19067"},"observation_digest":"sha256:36586adcf317f644cbfbfd4ab06718de8daed884e270790432ce83d937b1cd46","observation_id":"a5175669-0060-4dd6-a9c9-57ea1796f11c","resolution":{"observed_at":"2026-08-09T21:34:28.369362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-08T15:08:46.271717Z","title":"Bitnet: Scaling 1-bit transformers for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06567","last_updated":"2026-05-26T13:17:29Z","snapshot_observed_at":"2026-08-09T16:12:40.050000Z","submitted_at":"2025-02-10T15:34:42Z","title":"Membership Inference Risks in Quantized Models: A Theoretical and Empirical Study","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-08T15:08:46.271717Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2502.06567"},"observation_digest":"sha256:902d45dfa3bab047fc1009cb843362c80d537aedfc1a571d0248aada6ef53658","observation_id":"5cf4885f-e370-47c6-8f1b-b1d570fd23f4","resolution":{"observed_at":"2026-08-08T15:08:46.271717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-08T11:39:09.562177Z","title":"Bitnet: Scaling 1- bit transformers for large language models.arXiv preprint arXiv:2310.11453,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07780","last_updated":"2026-07-15T12:46:32Z","snapshot_observed_at":"2026-08-09T06:26:59.031313Z","submitted_at":"2025-02-11T18:59:35Z","title":"DarwinLM: Evolutionary Structured Pruning of Large Language Models","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T11:39:09.562177Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2502.07780"},"observation_digest":"sha256:978877b7b58aaeb3128af0b64664c7fdefc303e713c52ee194f17d106b70badd","observation_id":"41190357-c3f6-47f7-829e-4829ddf01ad5","resolution":{"observed_at":"2026-08-08T11:39:09.562177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-07T23:43:16.723562Z","title":"Bitnet: Scaling 1-bit transformers for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08795","last_updated":"2025-02-12T21:19:28Z","snapshot_observed_at":"2026-08-11T05:15:06.700228Z","submitted_at":"2025-02-12T21:19:28Z","title":"Low-Resolution Neural Networks","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T23:43:16.723562Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2502.08795"},"observation_digest":"sha256:8fdf756fbe711b80593010c6bf3d3dc199eb26bece9fa28548b26abf19ae5bfe","observation_id":"668a0d09-bbdc-4015-9201-0cc2a57da9af","resolution":{"observed_at":"2026-08-07T23:43:16.723562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":"2310.11453","doi":"10.48550/arxiv.2310.11453","metadata_source":"pith","pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","venue":"cs.CL","work_id":"28ad8f61-4291-4894-b120-1d42fc9937a3","year":2023},"citing_paper":{"arxiv_id":"2503.08223","last_updated":"2026-04-09T15:28:27Z","snapshot_observed_at":"2026-07-06T20:50:33.513259Z","submitted_at":"2025-03-11T09:41:29Z","title":"Will LLMs Scaling Hit the Wall? Breaking Barriers via Distributed Resources on Massive Edge Devices","version":3},"reference_index":171,"source":"pdf_text","source_observed_at":"2026-05-23T01:03:26.037233Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2503.08223"},"observation_digest":"sha256:44a22b4daecea1e0de89a4c1969956f82d9ebdf66681eb1e3d74b078c9934ced","observation_id":"f6f92948-14c0-4486-bad2-59d166cd2bf8","resolution":{"observed_at":"2026-05-23T01:05:16.407838Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-07T15:06:29.752659Z","title":"Bitnet: Scaling 1-bit transformers for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16346","last_updated":"2025-05-23T07:21:27Z","snapshot_observed_at":"2026-08-09T04:28:51.014509Z","submitted_at":"2025-05-22T07:59:26Z","title":"How to keep pushing ML accelerator performance? Know your rooflines!","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:29.752659Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2505.16346"},"observation_digest":"sha256:c6aa75327c95af29bcd80102531f4d13731b55ff1d8417f950622593da88a752","observation_id":"0a3287c9-08c5-4d5d-a841-4c814fd7ab59","resolution":{"observed_at":"2026-08-07T15:06:29.752659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-07T14:25:39.407120Z","title":"Bitnet: Scaling 1-bit transformers for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-09T06:55:04.491282Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:39.407120Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2505.19115"},"observation_digest":"sha256:4d1ef974ce66d33d85b0d2dc8cebba6e15de383e478afe035e5359c51de7f0ce","observation_id":"87270417-b027-4778-91be-96be6f139905","resolution":{"observed_at":"2026-08-07T14:25:39.407120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-07T13:44:20.391763Z","title":"BitNet: Scaling 1-bit transform- ers for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21245","last_updated":"2025-05-27T14:25:33Z","snapshot_observed_at":"2026-08-07T13:30:31.980491Z","submitted_at":"2025-05-27T14:25:33Z","title":"Towards One-bit ASR: Extremely Low-bit Conformer Quantization Using Co-training and Stochastic Precision","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:44:20.391763Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2505.21245"},"observation_digest":"sha256:b03d7d22fa9820fc035832ce187da3ef4871e43d667ec3969057671aaf2d095e","observation_id":"6aa75516-0fdf-498d-9b6a-66664289a1ce","resolution":{"observed_at":"2026-08-07T13:44:20.391763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":"2310.11453","doi":"10.48550/arxiv.2310.11453","metadata_source":"pith","pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","venue":"cs.CL","work_id":"28ad8f61-4291-4894-b120-1d42fc9937a3","year":2023},"citing_paper":{"arxiv_id":"2505.22811","last_updated":"2026-04-21T08:01:39Z","snapshot_observed_at":"2026-08-05T01:41:20.121334Z","submitted_at":"2025-05-28T19:40:34Z","title":"Highly Efficient and Effective LLMs with Multi-Boolean Architectures","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-19T12:41:32.018036Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2505.22811"},"observation_digest":"sha256:82663e8c88e1f4677b915ef6a9a9d66756c7e165162cadfa1cdd0e45f25ffe09","observation_id":"3f11806a-12ef-4267-b70c-393e19eebf77","resolution":{"observed_at":"2026-05-19T12:42:18.461706Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-07T11:57:45.488313Z","title":"Bitnet: Scaling 1-bit transformers for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01140","last_updated":"2025-06-01T19:49:01Z","snapshot_observed_at":"2026-08-08T05:40:04.869075Z","submitted_at":"2025-06-01T19:49:01Z","title":"ReTern: Exploiting Natural Redundancy and Sign Transformations for Enhanced Fault Tolerance in Compute-in-Memory based Ternary LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:45.488313Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2506.01140"},"observation_digest":"sha256:05f73f7d21e5d0e07dbf008011827b0cbbf7040ea76365e37b3fc3abebd67417","observation_id":"1e695579-b066-4979-a643-dd4e8e27e1b1","resolution":{"observed_at":"2026-08-07T11:57:45.488313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-07T11:07:15.932038Z","title":"Bitnet: Scaling 1-bit transformers for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03515","last_updated":"2025-06-04T03:02:18Z","snapshot_observed_at":"2026-08-08T02:14:58.494663Z","submitted_at":"2025-06-04T03:02:18Z","title":"BitTTS: Highly Compact Text-to-Speech Using 1.58-bit Quantization and Weight Indexing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:07:15.932038Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2506.03515"},"observation_digest":"sha256:a5a4dc38d67c26cf3dda62e43633c4d38171e19c1c02eb15a6d38fbb791b4164","observation_id":"b01f8e91-e75b-42df-9030-4c1bb95b2a43","resolution":{"observed_at":"2026-08-07T11:07:15.932038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-07T10:18:51.557589Z","title":"Bitnet: Scaling 1-bit transformers for large language models.arXiv preprint arXiv:2310.11453, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-10T07:02:15.017963Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:51.557589Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:6c0cab78358122b248e34247667fdfa95e972dbd05bc95dd4e30974a0036bdac","observation_id":"c4638107-943c-4efa-842d-ece7443e4e08","resolution":{"observed_at":"2026-08-07T10:18:51.557589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-07T05:31:21.594653Z","title":"Llm ×mapreduce-v2: Entropy-driven convolutional test-time scaling for generating long-form articles from extremely long resources, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07900","last_updated":"2025-09-04T16:23:02Z","snapshot_observed_at":"2026-08-09T02:25:55.181285Z","submitted_at":"2025-06-09T16:16:50Z","title":"MiniCPM4: Ultra-Efficient LLMs on End Devices","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:21.594653Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2506.07900"},"observation_digest":"sha256:dfda92978feb33547b123b5e82ace88b7104f7653205fc9cafd6a7bcbfa7f007","observation_id":"b3b0c243-0bbb-408e-9f43-da719fad6c0c","resolution":{"observed_at":"2026-08-07T05:31:21.594653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":"2310.11453","doi":"10.48550/arxiv.2310.11453","metadata_source":"pith","pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","venue":"cs.CL","work_id":"28ad8f61-4291-4894-b120-1d42fc9937a3","year":2023},"citing_paper":{"arxiv_id":"2506.12040","last_updated":"2026-04-09T06:22:06Z","snapshot_observed_at":"2026-08-02T23:24:15.663595Z","submitted_at":"2025-05-24T03:57:19Z","title":"BTC-LLM: Efficient Sub-1-Bit LLM Quantization via Learnable Transformation and Binary Codebook","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-19T14:03:35.214840Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2506.12040"},"observation_digest":"sha256:f92b9ae8f870d8db6f8088d94e1ee7773923d2eda4d0952abc5c83b24723d9c0","observation_id":"2c0a36d7-c372-47c7-a414-61cd1f398242","resolution":{"observed_at":"2026-05-19T14:07:20.565116Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-06T21:58:36.149982Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23025","last_updated":"2025-06-28T22:13:43Z","snapshot_observed_at":"2026-08-09T01:19:06.931322Z","submitted_at":"2025-06-28T22:13:43Z","title":"Spectra 1.1: Scaling Laws and Efficient Inference for Ternary Language Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T21:58:36.149982Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2506.23025"},"observation_digest":"sha256:ea85037bfd51bebd7e2b604889182f8e781604d40494926048c4c02467aae6e8","observation_id":"f37302c6-31ab-4993-b7be-c8eaab8c52e0","resolution":{"observed_at":"2026-08-06T21:58:36.149982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-06T19:09:16.341546Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07145","last_updated":"2025-07-09T06:04:14Z","snapshot_observed_at":"2026-08-08T02:29:03.615649Z","submitted_at":"2025-07-09T06:04:14Z","title":"CCQ: Convolutional Code for Extreme Low-bit Quantization in LLMs","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T19:09:16.341546Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2507.07145"},"observation_digest":"sha256:c304e57d5e59e9fbe0188f3d9c366f26917735a904851e394556ee9637aeb823","observation_id":"d1f19044-b3b0-4588-b17b-4f98a31f9d69","resolution":{"observed_at":"2026-08-06T19:09:16.341546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-06T17:45:20.875360Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10059","last_updated":"2025-07-14T08:44:59Z","snapshot_observed_at":"2026-08-09T09:16:27.763879Z","submitted_at":"2025-07-14T08:44:59Z","title":"GeLaCo: An Evolutionary Approach to Layer Compression","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T17:45:20.875360Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2507.10059"},"observation_digest":"sha256:e054fa283cd2dbe0c35e90bdd045d46d945ce708c2e6008fced9f067cc7aa604","observation_id":"6dc9367d-4cfa-40b8-b7ef-7d294fe8457d","resolution":{"observed_at":"2026-08-06T17:45:20.875360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":"2310.11453","doi":"10.48550/arxiv.2310.11453","metadata_source":"pith","pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","venue":"cs.CL","work_id":"28ad8f61-4291-4894-b120-1d42fc9937a3","year":2023},"citing_paper":{"arxiv_id":"2507.16079","last_updated":"2026-04-25T14:40:47Z","snapshot_observed_at":"2026-08-03T02:40:20.493603Z","submitted_at":"2025-07-21T21:29:33Z","title":"A Lower Bound for the Number of Linear Regions of Ternary ReLU Regression Neural Networks","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-19T03:27:12.956489Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2507.16079"},"observation_digest":"sha256:5dd1baea39ea7d78c0da838a60e6c089d9e5b662fde308044af85cdb7fe14b89","observation_id":"14d024d7-449b-4378-a1f3-7b047e0b37db","resolution":{"observed_at":"2026-05-19T03:32:01.744311Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-06T15:01:33.356824Z","title":"B itnet: Scaling 1-bit transformers for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17025","last_updated":"2025-07-22T21:29:34Z","snapshot_observed_at":"2026-08-06T14:55:46.877646Z","submitted_at":"2025-07-22T21:29:34Z","title":"Evolutionary Feature-wise Thresholding for Binary Representation of NLP Embeddings","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:33.356824Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2507.17025"},"observation_digest":"sha256:7e624099611afa2ae2e56f19d8b00decc26351c24a58d0583bd4372b98e890a0","observation_id":"369cf59f-9690-49ab-ba93-5bcc530daa02","resolution":{"observed_at":"2026-08-06T15:01:33.356824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-06T14:17:45.429662Z","title":"Bitnet: Scaling 1-bit transformers for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19608","last_updated":"2025-07-25T18:23:18Z","snapshot_observed_at":"2026-08-09T12:41:48.309797Z","submitted_at":"2025-07-25T18:23:18Z","title":"DeltaLLM: A Training-Free Framework Exploiting Temporal Sparsity for Efficient Edge LLM Inference","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T14:17:45.429662Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2507.19608"},"observation_digest":"sha256:61ddb7596336a6e0e6bcc367b8ee5b6f7aa4c413a41621fc9e022c06ff4963e3","observation_id":"ae4f796b-ec81-45e0-93e2-938f5161f25c","resolution":{"observed_at":"2026-08-06T14:17:45.429662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":"2310.11453","doi":"10.48550/arxiv.2310.11453","metadata_source":"pith","pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","venue":"cs.CL","work_id":"28ad8f61-4291-4894-b120-1d42fc9937a3","year":2023},"citing_paper":{"arxiv_id":"2508.06974","last_updated":"2026-05-18T12:47:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-09T13:00:16Z","title":"Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-21T23:44:01.953344Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2508.06974"},"observation_digest":"sha256:65c200207b7d45c57de8bd832e75561e2e4e7269ac1cd3213afd04e5454f3b20","observation_id":"705b42e2-a142-4ff5-994c-b1fc13a29a1e","resolution":{"observed_at":"2026-05-21T23:44:26.512528Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T16:03:37.480444Z","title":"Bitnet: Scaling 1-bit transformers for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:37.480444Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:3803b423a8f79812b9a198c563c4e8cd4fbec2a690b423cbac2e2aafa9feeaf8","observation_id":"64b701fa-203f-4860-86af-cb433ba3e196","resolution":{"observed_at":"2026-08-05T16:03:37.480444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T14:11:15.516591Z","title":"Bitnet: Scaling 1-bit transformers for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00133","last_updated":"2025-08-29T14:17:05Z","snapshot_observed_at":"2026-08-08T20:41:35.689089Z","submitted_at":"2025-08-29T14:17:05Z","title":"Latent-Space Mean-Field Theory for Deep BitNet-like Training: Constrained Gradient Flows with Smooth Quantization and STE Limits","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T14:11:15.516591Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2509.00133"},"observation_digest":"sha256:c2fa9dc7b6d80dc98f2911b894d9146b48c06a649faee70aec51702defb7635b","observation_id":"175fea6a-4451-4bc5-8904-8290ced42696","resolution":{"observed_at":"2026-08-05T14:11:15.516591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T12:51:01.198277Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01229","last_updated":"2025-09-01T08:16:20Z","snapshot_observed_at":"2026-08-06T18:50:44.734272Z","submitted_at":"2025-09-01T08:16:20Z","title":"LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T12:51:01.198277Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2509.01229"},"observation_digest":"sha256:ee8fe44a194fa389dddaa9768909a03390fa74d134e047abd76c7a8c1c63d8a0","observation_id":"f68407fc-0970-4982-8aff-875ce0a25f00","resolution":{"observed_at":"2026-08-05T12:51:01.198277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T05:29:45.478136Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.05451","last_updated":"2025-09-05T19:09:26Z","snapshot_observed_at":"2026-08-10T01:09:37.891684Z","submitted_at":"2025-09-05T19:09:26Z","title":"Characterizing and Optimizing Realistic Workloads on a Commercial Compute-in-SRAM Device","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T05:29:45.478136Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2509.05451"},"observation_digest":"sha256:adb7608e6a8a0652b88115570c498fd93fe061a0e15c0417fd5bc2663d8bb568","observation_id":"3ed1deaf-5064-4ab3-b15f-7f429891aa37","resolution":{"observed_at":"2026-08-05T05:29:45.478136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-04T19:10:41.617689Z","title":"Bitnet: Scaling 1-bit transformers for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09424","last_updated":"2025-09-11T13:04:22Z","snapshot_observed_at":"2026-08-08T11:03:44.357154Z","submitted_at":"2025-09-11T13:04:22Z","title":"ENSI: Efficient Non-Interactive Secure Inference for Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T19:10:41.617689Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2509.09424"},"observation_digest":"sha256:b6522fc056ef97251ce4e75ae66aca475057f73087d713f32bdeeab2a1087f1e","observation_id":"a6818774-47f7-48f3-8da5-84e2c8644052","resolution":{"observed_at":"2026-08-04T19:10:41.617689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-04T09:08:17.694849Z","title":"Bitnet: Scaling 1-bit transformers for large language models.arXiv preprint arXiv:2310.11453, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.17111","last_updated":"2025-10-23T15:06:39Z","snapshot_observed_at":"2026-08-04T09:08:06.048583Z","submitted_at":"2025-10-20T02:59:45Z","title":"Efficient Vision-Language-Action Models for Embodied Manipulation: A Systematic Survey","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-04T09:08:17.694849Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2510.17111"},"observation_digest":"sha256:034eaf6794d5ca694583782db472cb27ee3d310bcafa9df9cd759329905f04a0","observation_id":"ff312cec-fd06-493d-97eb-e4020cebb7d8","resolution":{"observed_at":"2026-08-04T09:08:17.694849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":"2310.11453","doi":"10.48550/arxiv.2310.11453","metadata_source":"pith","pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","venue":"cs.CL","work_id":"28ad8f61-4291-4894-b120-1d42fc9937a3","year":2023},"citing_paper":{"arxiv_id":"2512.06443","last_updated":"2026-04-14T07:55:36Z","snapshot_observed_at":"2026-08-07T01:10:46.412155Z","submitted_at":"2025-12-06T14:14:01Z","title":"Vec-LUT: Vector Table Lookup for Parallel Ultra-Low-Bit LLM Inference on Edge Devices","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-17T00:46:48.862313Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2512.06443"},"observation_digest":"sha256:1ea313569e2780db9889761abcc5c3c2677199af24948075145f06195ef08e3e","observation_id":"83484118-23ff-4bb0-8dde-15cc42d49814","resolution":{"observed_at":"2026-05-17T00:48:45.813379Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":"2310.11453","doi":"10.48550/arxiv.2310.11453","metadata_source":"pith","pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","venue":"cs.CL","work_id":"28ad8f61-4291-4894-b120-1d42fc9937a3","year":2023},"citing_paper":{"arxiv_id":"2512.21651","last_updated":"2026-05-15T03:51:16Z","snapshot_observed_at":"2026-08-08T09:50:37.801627Z","submitted_at":"2025-12-25T12:39:36Z","title":"Rethinking Output Alignment For 1-bit Post-Training Quantization of Large Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T19:31:44.023679Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2512.21651"},"observation_digest":"sha256:340f3ea7b4d8ef012407d3e9ae8bfee99b6c36631cfb223411868dc3b2ddc633","observation_id":"979363b4-6b0b-439d-8b5d-23e60510d717","resolution":{"observed_at":"2026-05-16T19:33:20.081805Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":"2310.11453","doi":"10.48550/arxiv.2310.11453","metadata_source":"pith","pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","venue":"cs.CL","work_id":"28ad8f61-4291-4894-b120-1d42fc9937a3","year":2023},"citing_paper":{"arxiv_id":"2512.21651","last_updated":"2026-05-15T03:51:16Z","snapshot_observed_at":"2026-08-08T09:50:37.801627Z","submitted_at":"2025-12-25T12:39:36Z","title":"Rethinking Output Alignment For 1-bit Post-Training Quantization of Large Language Models","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T16:43:01.704295Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2512.21651"},"observation_digest":"sha256:2acf44a9704f44e44c762dc767367cbef4b00dc330a23120b5caaebe3462c864","observation_id":"ca5d8497-f10a-49af-a954-0ae7a44ba11b","resolution":{"observed_at":"2026-05-21T16:44:16.077956Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-03T04:37:25.885711Z","title":"Bitnet: Scaling 1-bit transformers for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.04595","last_updated":"2026-07-22T11:57:18Z","snapshot_observed_at":"2026-08-08T03:30:31.466913Z","submitted_at":"2026-02-04T14:22:08Z","title":"Harmonia: Algorithm-Hardware Co-Design for Memory- and Compute-Efficient BFP-based LLM Inference","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:25.885711Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2602.04595"},"observation_digest":"sha256:bc871953d6d612002374c0b58d313f50b38e5d7e55100d6d3962af16e5f27eb6","observation_id":"dd4ea50b-8791-45ab-b968-84992d1d78fe","resolution":{"observed_at":"2026-08-03T04:37:25.885711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":"2310.11453","doi":"10.48550/arxiv.2310.11453","metadata_source":"pith","pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","venue":"cs.CL","work_id":"28ad8f61-4291-4894-b120-1d42fc9937a3","year":2023},"citing_paper":{"arxiv_id":"2602.05243","last_updated":"2026-05-10T15:06:48Z","snapshot_observed_at":"2026-08-03T19:35:07.579864Z","submitted_at":"2026-02-05T03:03:17Z","title":"CORP: Closed-Form One-shot Representation-Preserving Structured Pruning for Transformers","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T07:38:50.252917Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2602.05243"},"observation_digest":"sha256:475772ddd62a2179bc55e88499b8e331fb8e43ad380aa6fe6b2f668767083c93","observation_id":"c58879fa-939c-45d7-b29c-bee15397dba1","resolution":{"observed_at":"2026-05-16T07:40:43.974197Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":"2310.11453","doi":"10.48550/arxiv.2310.11453","metadata_source":"pith","pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","venue":"cs.CL","work_id":"28ad8f61-4291-4894-b120-1d42fc9937a3","year":2023},"citing_paper":{"arxiv_id":"2602.06252","last_updated":"2026-04-04T16:57:05Z","snapshot_observed_at":"2026-07-06T22:44:46.690576Z","submitted_at":"2026-02-05T23:02:23Z","title":"D-Legion: A Scalable Many-Core Architecture for Accelerating Matrix Multiplication in Quantized LLMs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T06:33:14.766545Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2602.06252"},"observation_digest":"sha256:09c368a3dcb47eb3b614808e19963c6418fd30e105cfddccf58b0cfd073bd70f","observation_id":"aa525f41-afaf-4517-863d-cf7d43e601e2","resolution":{"observed_at":"2026-05-16T06:37:28.955745Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":"2310.11453","doi":"10.48550/arxiv.2310.11453","metadata_source":"pith","pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","venue":"cs.CL","work_id":"28ad8f61-4291-4894-b120-1d42fc9937a3","year":2023},"citing_paper":{"arxiv_id":"2603.18104","last_updated":"2026-06-16T01:20:48Z","snapshot_observed_at":"2026-07-13T23:03:57.527088Z","submitted_at":"2026-03-18T12:36:19Z","title":"Adaptive Domain Models: Bayesian Evolution, Warm Rotation, and Principled Training for Geometric and Neuromorphic AI","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T09:07:06.620864Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2603.18104"},"observation_digest":"sha256:a2df2c32a42d5254043a1dce1ef1500ba0acb80172cd94ff729b96091fde5342","observation_id":"88dc9324-8f25-4ce8-b0ed-f87906858bc5","resolution":{"observed_at":"2026-05-15T09:09:53.214300Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-07-13T23:03:58.008815Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.18104","last_updated":"2026-06-16T01:20:48Z","snapshot_observed_at":"2026-07-13T23:03:57.527088Z","submitted_at":"2026-03-18T12:36:19Z","title":"Adaptive Domain Models: Bayesian Evolution, Warm Rotation, and Principled Training for Geometric and Neuromorphic AI","version":5},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-13T23:03:58.008815Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2603.18104"},"observation_digest":"sha256:cfa296c500c80ef2dd67be0e4ac10d83fb7f8b05eae670b719587a3b8816cc99","observation_id":"797dfa24-425e-4683-a13e-1a41cba80de1","resolution":{"observed_at":"2026-07-13T23:03:58.008815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":"2310.11453","doi":"10.48550/arxiv.2310.11453","metadata_source":"pith","pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","venue":"cs.CL","work_id":"28ad8f61-4291-4894-b120-1d42fc9937a3","year":2023},"citing_paper":{"arxiv_id":"2604.03957","last_updated":"2026-04-05T04:25:07Z","snapshot_observed_at":"2026-07-06T22:53:01.835843Z","submitted_at":"2026-04-05T04:25:07Z","title":"BWTA: Accurate and Efficient Binarized Transformer by Algorithm-Hardware Co-design","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-13T17:26:54.609595Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2604.03957"},"observation_digest":"sha256:9f5008b421765e9dc69a52de553ceb7557b0897a1581a913e0ae825437a591eb","observation_id":"2c7f6585-7cd3-4253-9d09-0bb7edef8e23","resolution":{"observed_at":"2026-05-13T17:28:02.189572Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":"2310.11453","doi":"10.48550/arxiv.2310.11453","metadata_source":"pith","pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","venue":"cs.CL","work_id":"28ad8f61-4291-4894-b120-1d42fc9937a3","year":2023},"citing_paper":{"arxiv_id":"2604.06836","last_updated":"2026-04-09T02:16:08Z","snapshot_observed_at":"2026-07-06T22:55:15.791334Z","submitted_at":"2026-04-08T08:57:09Z","title":"STQuant: Spatio-Temporal Adaptive Framework for Optimizer Quantization in Large Multimodal Model Training","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T18:49:40.758234Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2604.06836"},"observation_digest":"sha256:dac6486825d032772958e2f25d580a488986b33c5412c7d987735b191661addd","observation_id":"78db408b-f14e-4e85-8158-3dd1ee08552e","resolution":{"observed_at":"2026-05-10T23:50:57.060744Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":"2310.11453","doi":"10.48550/arxiv.2310.11453","metadata_source":"pith","pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","venue":"cs.CL","work_id":"28ad8f61-4291-4894-b120-1d42fc9937a3","year":2023},"citing_paper":{"arxiv_id":"2604.10091","last_updated":"2026-04-11T08:23:50Z","snapshot_observed_at":"2026-07-06T22:58:47.599383Z","submitted_at":"2026-04-11T08:23:50Z","title":"SEPTQ: A Simple and Effective Post-Training Quantization Paradigm for Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T16:35:28.861765Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2604.10091"},"observation_digest":"sha256:219add81c4faf77a951bdfc12ed586fd4ab76ebb3c1c6c518e9d17cb9491fd1e","observation_id":"4a821fce-7bb2-4b57-bf3b-33109f020004","resolution":{"observed_at":"2026-05-11T08:30:58.344811Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":"2310.11453","doi":"10.48550/arxiv.2310.11453","metadata_source":"pith","pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","venue":"cs.CL","work_id":"28ad8f61-4291-4894-b120-1d42fc9937a3","year":2023},"citing_paper":{"arxiv_id":"2604.18556","last_updated":"2026-05-15T09:34:30Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:45:47Z","title":"GSQ: Highly-Accurate Low-Precision Scalar Quantization for LLMs via Gumbel-Softmax Sampling","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T05:29:51.182114Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2604.18556"},"observation_digest":"sha256:db5c20f619b1fdb2cc51999f75cc81989fb02c36501b415fd04b60efb0c018e9","observation_id":"014cca3c-90ef-4485-8e3f-d52726490bc1","resolution":{"observed_at":"2026-05-10T05:36:02.329071Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":"2310.11453","doi":"10.48550/arxiv.2310.11453","metadata_source":"pith","pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","venue":"cs.CL","work_id":"28ad8f61-4291-4894-b120-1d42fc9937a3","year":2023},"citing_paper":{"arxiv_id":"2604.18556","last_updated":"2026-05-15T09:34:30Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:45:47Z","title":"GSQ: Highly-Accurate Low-Precision Scalar Quantization for LLMs via Gumbel-Softmax Sampling","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-19T18:01:08.514022Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2604.18556"},"observation_digest":"sha256:6a1fb6bc21ede8b14184c82e4d91ac1ec2191f9aee2712971aa7406a756b1f28","observation_id":"9d272fa8-4a25-4d1c-9009-cb833c86da94","resolution":{"observed_at":"2026-05-19T18:02:42.190801Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":"2310.11453","doi":"10.48550/arxiv.2310.11453","metadata_source":"pith","pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","venue":"cs.CL","work_id":"28ad8f61-4291-4894-b120-1d42fc9937a3","year":2023},"citing_paper":{"arxiv_id":"2604.19167","last_updated":"2026-04-21T07:25:02Z","snapshot_observed_at":"2026-07-06T23:05:53.378585Z","submitted_at":"2026-04-21T07:25:02Z","title":"LBLLM: Lightweight Binarization of Large Language Models via Three-Stage Distillation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-10T03:04:14.900791Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2604.19167"},"observation_digest":"sha256:0300d4bdfc9a67a07cf916e616069d755537f4f1aa05e3b19ba5dadf9c60ffb7","observation_id":"138ccd32-2240-4867-a5f9-ac291ce8378a","resolution":{"observed_at":"2026-05-11T12:46:04.602074Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":"2310.11453","doi":"10.48550/arxiv.2310.11453","metadata_source":"pith","pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","venue":"cs.CL","work_id":"28ad8f61-4291-4894-b120-1d42fc9937a3","year":2023},"citing_paper":{"arxiv_id":"2604.24273","last_updated":"2026-04-27T10:03:37Z","snapshot_observed_at":"2026-07-06T23:10:20.676482Z","submitted_at":"2026-04-27T10:03:37Z","title":"BitRL: Reinforcement Learning with 1-bit Quantized Language Models for Resource-Constrained Edge Deployment","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-08T04:23:26.079298Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2604.24273"},"observation_digest":"sha256:500b76fef2134b59c59b1696b255fe3de35beec639a8a65ded68a7494d99a625","observation_id":"c2b980d5-62cc-403d-bb0a-5ff3d635688c","resolution":{"observed_at":"2026-05-11T21:46:42.461925Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":"2310.11453","doi":"10.48550/arxiv.2310.11453","metadata_source":"pith","pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","venue":"cs.CL","work_id":"28ad8f61-4291-4894-b120-1d42fc9937a3","year":2023},"citing_paper":{"arxiv_id":"2605.06485","last_updated":"2026-06-10T14:41:46Z","snapshot_observed_at":"2026-08-09T19:15:08.038528Z","submitted_at":"2026-05-07T16:07:39Z","title":"Litespark Inference For CPUs: Ultra-Fast SIMD Framework for Ternary (1.58-bit) Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T10:12:36.972813Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2605.06485"},"observation_digest":"sha256:7721491968bb303f7850aeec5ccc56c0ad6560a51d13dce9c88118fcdcb59163","observation_id":"d680d50c-c3e8-4e94-b8b5-9ea9acf22dbf","resolution":{"observed_at":"2026-05-11T20:11:08.781913Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":"2310.11453","doi":"10.48550/arxiv.2310.11453","metadata_source":"pith","pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","venue":"cs.CL","work_id":"28ad8f61-4291-4894-b120-1d42fc9937a3","year":2023},"citing_paper":{"arxiv_id":"2605.06485","last_updated":"2026-06-10T14:41:46Z","snapshot_observed_at":"2026-08-09T19:15:08.038528Z","submitted_at":"2026-05-07T16:07:39Z","title":"Litespark Inference For CPUs: Ultra-Fast SIMD Framework for Ternary (1.58-bit) Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T23:12:52.038253Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2605.06485"},"observation_digest":"sha256:0cdeba1c496cbff74e3f789f81919171fffae3a3ef20ae4076d80ce9e161b4ff","observation_id":"ef8122df-6ac1-4474-81b6-fa9f0e0fdb49","resolution":{"observed_at":"2026-07-01T13:25:46.093604Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":"2310.11453","doi":"10.48550/arxiv.2310.11453","metadata_source":"pith","pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","venue":"cs.CL","work_id":"28ad8f61-4291-4894-b120-1d42fc9937a3","year":2023},"citing_paper":{"arxiv_id":"2605.08755","last_updated":"2026-05-09T07:35:38Z","snapshot_observed_at":"2026-08-08T15:24:38.932256Z","submitted_at":"2026-05-09T07:35:38Z","title":"LAQuant: A Simple Overhead-free Large Reasoning Model Quantization by Layer-wise Lookahead Loss","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-12T03:32:14.749400Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2605.08755"},"observation_digest":"sha256:064d6689e4ccdecf33ae87611cce35075ce243c4d2a12804ea4eda298a4061e4","observation_id":"6bad0043-39d8-490c-99f5-d6acd3a216fe","resolution":{"observed_at":"2026-05-12T07:16:29.974116Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":"2310.11453","doi":"10.48550/arxiv.2310.11453","metadata_source":"pith","pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","venue":"cs.CL","work_id":"28ad8f61-4291-4894-b120-1d42fc9937a3","year":2023},"citing_paper":{"arxiv_id":"2605.09425","last_updated":"2026-05-10T08:56:08Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T08:56:08Z","title":"AtteConDA: Attention-Based Conflict Suppression in Multi-Condition Diffusion Models and Synthetic Data Augmentation","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-12T02:38:11.071221Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2605.09425"},"observation_digest":"sha256:6c9fb37c97e0e6ddc1742f7963fd55e63262c9d478f671832b91f3d8358c39b1","observation_id":"530b75a1-e91d-4d67-8bb1-f102b15770d0","resolution":{"observed_at":"2026-05-12T07:31:26.202596Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":"2310.11453","doi":"10.48550/arxiv.2310.11453","metadata_source":"pith","pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","venue":"cs.CL","work_id":"28ad8f61-4291-4894-b120-1d42fc9937a3","year":2023},"citing_paper":{"arxiv_id":"2605.11558","last_updated":"2026-05-12T05:41:36Z","snapshot_observed_at":"2026-08-09T00:11:26.040411Z","submitted_at":"2026-05-12T05:41:36Z","title":"A Composite Activation Function for Learning Stable Binary Representations","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-13T02:03:42.456988Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2605.11558"},"observation_digest":"sha256:70db0c361749e8db9aec6005ab6e0a8f2497697e2679c036293f2bace6e7d9e0","observation_id":"e706d0d4-37fd-4cc7-a7a2-e61f43a52145","resolution":{"observed_at":"2026-05-13T02:07:07.901449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":"2310.11453","doi":"10.48550/arxiv.2310.11453","metadata_source":"pith","pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","venue":"cs.CL","work_id":"28ad8f61-4291-4894-b120-1d42fc9937a3","year":2023},"citing_paper":{"arxiv_id":"2605.13859","last_updated":"2026-04-14T09:57:15Z","snapshot_observed_at":"2026-07-06T23:25:21.032938Z","submitted_at":"2026-04-14T09:57:15Z","title":"BiSpikCLM: A Spiking Language Model integrating Softmax-Free Spiking Attention and Spike-Aware Alignment Distillation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T07:11:46.177353Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2605.13859"},"observation_digest":"sha256:41a90b098e459ba6dbf4220d30a36775d24058e999d225dd9a5666d858374729","observation_id":"d2c493ad-79dd-4af3-a384-2ccffa38fe3c","resolution":{"observed_at":"2026-05-15T07:15:11.771153Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":"2310.11453","doi":"10.48550/arxiv.2310.11453","metadata_source":"pith","pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","venue":"cs.CL","work_id":"28ad8f61-4291-4894-b120-1d42fc9937a3","year":2023},"citing_paper":{"arxiv_id":"2605.16786","last_updated":"2026-05-16T03:43:10Z","snapshot_observed_at":"2026-07-06T23:27:52.850836Z","submitted_at":"2026-05-16T03:43:10Z","title":"Lever: Speculative LLM Inference on Smartphones","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-19T21:44:11.735963Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2605.16786"},"observation_digest":"sha256:1003061af1b9824f22417e08753bfd807cdbb278dbdbb531092e5f5ee3615cc5","observation_id":"e5b61e7b-8026-4c81-9064-08b3d4a162c9","resolution":{"observed_at":"2026-05-19T21:47:48.486580Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":"2310.11453","doi":"10.48550/arxiv.2310.11453","metadata_source":"pith","pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","venue":"cs.CL","work_id":"28ad8f61-4291-4894-b120-1d42fc9937a3","year":2023},"citing_paper":{"arxiv_id":"2605.17471","last_updated":"2026-05-17T14:20:51Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T14:20:51Z","title":"WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-20T14:53:22.233844Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2605.17471"},"observation_digest":"sha256:7070b9c22b194041be88c3a7f410eea9736bb396bebf7bbd4e3a2192731ec139","observation_id":"b850bf47-6eed-4ef3-ae19-5290f27c210c","resolution":{"observed_at":"2026-05-20T14:53:31.637256Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":"2310.11453","doi":"10.48550/arxiv.2310.11453","metadata_source":"pith","pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","venue":"cs.CL","work_id":"28ad8f61-4291-4894-b120-1d42fc9937a3","year":2023},"citing_paper":{"arxiv_id":"2605.18933","last_updated":"2026-05-18T15:36:33Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T15:36:33Z","title":"A Geometric Analysis of Sign-Magnitude Asymmetry in a ReLU + RMSNorm Block under Ternary Quantization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T13:05:50.518189Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2605.18933"},"observation_digest":"sha256:5326ec2d7809692099b4530daf05852081afd47115b3ea95a76f7f07f7b340ee","observation_id":"dbb42221-65dc-4b4f-98d1-7a40fe3a37d3","resolution":{"observed_at":"2026-05-20T13:08:17.777672Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":"2310.11453","doi":"10.48550/arxiv.2310.11453","metadata_source":"pith","pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","venue":"cs.CL","work_id":"28ad8f61-4291-4894-b120-1d42fc9937a3","year":2023},"citing_paper":{"arxiv_id":"2605.24058","last_updated":"2026-05-22T02:37:14Z","snapshot_observed_at":"2026-08-09T06:09:07.981245Z","submitted_at":"2026-05-22T02:37:14Z","title":"Signs Beat Floats: Low-Rank Double-Binary Adaptation for On-Device Fine-Tuning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-30T15:51:22.115507Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2605.24058"},"observation_digest":"sha256:540a970a133b99c8a6831f5b4b35ac750332f6b0517222a39c6949a9ec02524d","observation_id":"55f6b5ce-7208-4be8-a5a6-a36e488de98f","resolution":{"observed_at":"2026-06-30T15:54:49.327904Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":"2310.11453","doi":"10.48550/arxiv.2310.11453","metadata_source":"pith","pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","venue":"cs.CL","work_id":"28ad8f61-4291-4894-b120-1d42fc9937a3","year":2023},"citing_paper":{"arxiv_id":"2605.24144","last_updated":"2026-05-22T19:06:22Z","snapshot_observed_at":"2026-07-06T23:34:13.859813Z","submitted_at":"2026-05-22T19:06:22Z","title":"EVA: Accelerating LLM Decoding via an Efficient Vector Quantization Architecture","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-30T14:35:02.484377Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2605.24144"},"observation_digest":"sha256:1954dbe958abe316a1c82be5f12563f03b09a664ee91e81755cd756fef21a714","observation_id":"6f669e45-1c0c-4817-8370-1cd617991647","resolution":{"observed_at":"2026-06-30T14:44:45.582845Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":"2310.11453","doi":"10.48550/arxiv.2310.11453","metadata_source":"pith","pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","venue":"cs.CL","work_id":"28ad8f61-4291-4894-b120-1d42fc9937a3","year":2023},"citing_paper":{"arxiv_id":"2605.25203","last_updated":"2026-05-24T18:05:37Z","snapshot_observed_at":"2026-08-04T10:11:25.132076Z","submitted_at":"2026-05-24T18:05:37Z","title":"Influence-Inspired Spectral Rotations for Extreme Low-Bit LLM Quantization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T12:13:18.805668Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2605.25203"},"observation_digest":"sha256:191da9175a192285f1eeb305586a66470baeaf2c8d5231057b7990b2155b9c7d","observation_id":"ba5c6e62-e1fd-4e4c-b998-92f64400d022","resolution":{"observed_at":"2026-06-30T12:14:39.030087Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":"2310.11453","doi":"10.48550/arxiv.2310.11453","metadata_source":"pith","pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","venue":"cs.CL","work_id":"28ad8f61-4291-4894-b120-1d42fc9937a3","year":2023},"citing_paper":{"arxiv_id":"2605.25966","last_updated":"2026-05-25T15:42:34Z","snapshot_observed_at":"2026-08-03T22:27:49.482944Z","submitted_at":"2026-05-25T15:42:34Z","title":"Mapping the Schedule x Bit-Width Boundary in Sub-100M Quantisation-Aware Training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T23:10:47.199537Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2605.25966"},"observation_digest":"sha256:6e5d011018a103eac735000e37a4ca60152e913af2c04e75a187b18d0c79c00b","observation_id":"6bb27f9b-de85-411f-8d81-142b26c79676","resolution":{"observed_at":"2026-06-29T23:14:01.510152Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":"2310.11453","doi":"10.48550/arxiv.2310.11453","metadata_source":"pith","pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","venue":"cs.CL","work_id":"28ad8f61-4291-4894-b120-1d42fc9937a3","year":2023},"citing_paper":{"arxiv_id":"2605.26092","last_updated":"2026-05-28T05:26:15Z","snapshot_observed_at":"2026-08-06T19:30:28.330206Z","submitted_at":"2026-05-25T17:52:46Z","title":"GoQuant: Geometric Orthogonal Residual Projection for Multiplier-Free Power-of-Two Transformer Quantization","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T22:16:51.663800Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2605.26092"},"observation_digest":"sha256:16ee176bed951b8120a0086b553ed5a2606baf85e382505510a1e42d8f4db0df","observation_id":"2f929f48-9586-4cef-8211-8c1100ab4692","resolution":{"observed_at":"2026-06-29T22:24:00.709438Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":"2310.11453","doi":"10.48550/arxiv.2310.11453","metadata_source":"pith","pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","venue":"cs.CL","work_id":"28ad8f61-4291-4894-b120-1d42fc9937a3","year":2023},"citing_paper":{"arxiv_id":"2606.10932","last_updated":"2026-04-28T14:25:10Z","snapshot_observed_at":"2026-08-06T07:28:00.654805Z","submitted_at":"2026-04-28T14:25:10Z","title":"Density Field State Space Models: 1-Bit Distillation, Efficient Inference, and Knowledge Organization in Mamba-2","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-01T08:55:37.926334Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2606.10932"},"observation_digest":"sha256:582d5486971502420f8b4e7dd1819acc14a852cdc39ef435a03ac2e6f8f027c5","observation_id":"c5cd62bc-c4e0-4704-aab8-9e5f871695fa","resolution":{"observed_at":"2026-07-01T09:05:37.124870Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":"2310.11453","doi":"10.48550/arxiv.2310.11453","metadata_source":"pith","pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","venue":"cs.CL","work_id":"28ad8f61-4291-4894-b120-1d42fc9937a3","year":2023},"citing_paper":{"arxiv_id":"2606.18257","last_updated":"2026-05-06T02:21:57Z","snapshot_observed_at":"2026-08-09T09:09:59.682358Z","submitted_at":"2026-05-06T02:21:57Z","title":"From Memorization to Creation: Evaluating the Cognitive Depth of LLM-Generated Educational Questions","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T23:50:38.674342Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2606.18257"},"observation_digest":"sha256:6d6a999b5f6a2c6d10f88efd5a8a4248ce9ab855e0df40cd42e5d6e9c57f4b81","observation_id":"d87e3c09-3474-408f-9a50-b08056c78e34","resolution":{"observed_at":"2026-07-01T13:15:45.719556Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":"2310.11453","doi":"10.48550/arxiv.2310.11453","metadata_source":"pith","pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","venue":"cs.CL","work_id":"28ad8f61-4291-4894-b120-1d42fc9937a3","year":2023},"citing_paper":{"arxiv_id":"2606.25674","last_updated":"2026-07-22T12:59:40Z","snapshot_observed_at":"2026-08-02T10:15:52.954015Z","submitted_at":"2026-06-24T10:37:01Z","title":"BitNet Text Embeddings","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-25T20:48:30.687676Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2606.25674"},"observation_digest":"sha256:a62aa8374d4ce06d64f360d12c9b3e465835f19ee63b11fe32a0d749b6170d3d","observation_id":"a5242b26-efc6-4d13-8243-0b426271732b","resolution":{"observed_at":"2026-07-04T20:00:08.931745Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-02T10:15:53.861297Z","title":"Bitnet: Scaling 1-bit transformers for large language models.arXiv preprint arXiv:2310.11453, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.25674","last_updated":"2026-07-22T12:59:40Z","snapshot_observed_at":"2026-08-02T10:15:52.954015Z","submitted_at":"2026-06-24T10:37:01Z","title":"BitNet Text Embeddings","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-02T10:15:53.861297Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2606.25674"},"observation_digest":"sha256:ece292fc8e9b7cbb975f82b8badb39d85212c91e31c6ced147842decddf92372","observation_id":"9a8a2b89-6783-4bfc-8152-2bd3622b6702","resolution":{"observed_at":"2026-08-02T10:15:53.861297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":"2310.11453","doi":"10.48550/arxiv.2310.11453","metadata_source":"pith","pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","venue":"cs.CL","work_id":"28ad8f61-4291-4894-b120-1d42fc9937a3","year":2023},"citing_paper":{"arxiv_id":"2606.27759","last_updated":"2026-06-26T06:37:57Z","snapshot_observed_at":"2026-08-08T03:10:33.776132Z","submitted_at":"2026-06-26T06:37:57Z","title":"Layerwise Progressive Freezing: A Training Scaffold for Depth-Scalable Binary Networks","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-06-29T05:08:23.176105Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2606.27759"},"observation_digest":"sha256:52dc324dd08e1b74ab9be6aaaa49355b4d94f180dd95ba6dbc39bdb48b695548","observation_id":"5e37ee72-003c-49c9-95b0-c9a8879f2fff","resolution":{"observed_at":"2026-06-29T05:13:06.438130Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-07-12T06:20:07.112455Z","title":"BitNet: Scaling 1-bit transformers for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02893","last_updated":"2026-07-03T02:42:04Z","snapshot_observed_at":"2026-08-06T14:41:53.505619Z","submitted_at":"2026-07-03T02:42:04Z","title":"Variable Bit-width Quantization: Learning Per-Group Precision for \"Bigger-but-Smaller\" Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-12T06:20:07.112455Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2607.02893"},"observation_digest":"sha256:a2d37a9cb98df82e40312c091267f6d2f9e4b2074d22828c59751dbafe68c0bb","observation_id":"a938dd76-9e7a-4734-8305-a0b0382df0da","resolution":{"observed_at":"2026-07-12T06:20:07.112455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-07-12T00:55:09.690245Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03652","last_updated":"2026-07-04T00:52:06Z","snapshot_observed_at":"2026-08-07T04:49:22.708900Z","submitted_at":"2026-07-04T00:52:06Z","title":"ELiTeFormer: An Efficient Transformer for FPGAs","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-12T00:55:09.690245Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2607.03652"},"observation_digest":"sha256:6fd5bf543266e1345795d0d87f34f6db4aecb72def8af79144a320b3056feb59","observation_id":"bfe9c772-00d1-44d0-a100-e8d2291a6647","resolution":{"observed_at":"2026-07-12T00:55:09.690245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":"2310.11453","doi":"10.48550/arxiv.2310.11453","metadata_source":"pith","pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","venue":"cs.CL","work_id":"28ad8f61-4291-4894-b120-1d42fc9937a3","year":2023},"citing_paper":{"arxiv_id":"2607.06217","last_updated":"2026-07-07T12:41:36Z","snapshot_observed_at":"2026-08-10T11:08:41.375709Z","submitted_at":"2026-07-07T12:41:36Z","title":"EeveeDark: A Binary Neural Framework for Low-Light Video Enhancement via Event-Guided Sensor-Level Fusion","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-08T13:04:15.723725Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2607.06217"},"observation_digest":"sha256:98090aba247decc1083446332f67e8aeabe7a90ac12484c2d376165ce9de1d65","observation_id":"6c38c4cb-ac0a-4152-88e8-bb635051e773","resolution":{"observed_at":"2026-07-08T13:04:56.647182Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-02T05:02:32.401384Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13511","last_updated":"2026-07-15T07:04:32Z","snapshot_observed_at":"2026-08-09T18:22:29.760947Z","submitted_at":"2026-07-15T07:04:32Z","title":"ExTernD: Expanded-Rank Ternary Decomposition Ternary LLM PTQ with Accuracy Approaching Any Quantization Level","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T05:02:32.401384Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2607.13511"},"observation_digest":"sha256:be0c1f81fd25a551768f92b0d42f6e32588b3461da2b103eee524840e0d91345","observation_id":"76f403ad-57b6-4908-83fe-b848d56cd727","resolution":{"observed_at":"2026-08-02T05:02:32.401384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-02T01:37:48.534738Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14622","last_updated":"2026-07-16T06:38:49Z","snapshot_observed_at":"2026-08-08T11:05:08.970524Z","submitted_at":"2026-07-16T06:38:49Z","title":"ExaGEMM: Exploration Framework for CPU-Driven ML Inference via Associative In-Register Computing for Low-Bit GEMM","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T01:37:48.534738Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2607.14622"},"observation_digest":"sha256:9a1be5893e3706d96d21d66d1fdaa5f7286369b1a7c92eec5e4198467aa8c1e5","observation_id":"994d6475-6180-442b-8d20-37997f46b20a","resolution":{"observed_at":"2026-08-02T01:37:48.534738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-02T01:35:43.133161Z","title":"Wang et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14630","last_updated":"2026-07-16T06:47:52Z","snapshot_observed_at":"2026-08-08T01:00:35.370812Z","submitted_at":"2026-07-16T06:47:52Z","title":"Cross-Layer Error Compensation and Finite-Sample Feature-Statistics Matching for Extreme Low-Bit Quantization of Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T01:35:43.133161Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2607.14630"},"observation_digest":"sha256:949a56a950e745bc782196eaa0c19771de45545342ce54104efaa990bb7f217e","observation_id":"e3d625a9-23ef-48cf-93ad-4ed24f282cd6","resolution":{"observed_at":"2026-08-02T01:35:43.133161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-03T07:51:22.169971Z","title":"arXiv preprint arXiv:2310.11453 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29397","last_updated":"2026-08-04T16:14:13Z","snapshot_observed_at":"2026-08-07T23:39:15.799185Z","submitted_at":"2026-07-31T13:15:11Z","title":"Studying quantization trade-offs for efficient inference deployment in machine translation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-03T07:51:22.169971Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2607.29397"},"observation_digest":"sha256:dbac6d4e39b8d68da5aceaa4fc272b963ca1f458bc92281966b4797a6aeff5b8","observation_id":"40e10248-eb2f-44c7-979b-e0324383394c","resolution":{"observed_at":"2026-08-03T07:51:22.169971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T04:25:22.032406Z","title":"arXiv preprint arXiv:2310.11453 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29397","last_updated":"2026-08-04T16:14:13Z","snapshot_observed_at":"2026-08-07T23:39:15.799185Z","submitted_at":"2026-07-31T13:15:11Z","title":"Studying quantization trade-offs for efficient inference deployment in machine translation","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-05T04:25:22.032406Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2607.29397"},"observation_digest":"sha256:77b28fb59c4a86efc0af2722309b34962436975274189032cf612305cf7b77ce","observation_id":"04547caf-33d9-435d-bb32-145bd0ae45c8","resolution":{"observed_at":"2026-08-05T04:25:22.032406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-07T00:13:50.303135Z","title":"cuEquivariance: CUDA-accelerated equivariant operations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02735","last_updated":"2026-08-03T18:00:03Z","snapshot_observed_at":"2026-08-09T16:48:28.234553Z","submitted_at":"2026-08-03T18:00:03Z","title":"Virtues and Vices of Equivariant Transformers","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:50.303135Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2608.02735"},"observation_digest":"sha256:fe0f73ea2f1b307fae68b4744ded75179e37a113cd69f8bbda84e4503bf3fa11","observation_id":"8992d22e-b04f-4fd1-a3ec-189b0ac6bcd7","resolution":{"observed_at":"2026-08-07T00:13:50.303135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-08T17:34:28.081712Z","title":"2023 , archiveprefix =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05240","last_updated":"2026-08-05T14:04:50Z","snapshot_observed_at":"2026-08-10T00:46:32.997383Z","submitted_at":"2026-08-05T14:04:50Z","title":"One Qubit Can Beat One Bit: Quantum Advantage for Post-Training Quantization","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-08T17:34:28.081712Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2608.05240"},"observation_digest":"sha256:b720f63054c55384ca1f4c601ae5ce55c0a506ac71ae411e50910e9f21aa522b","observation_id":"50ef30cd-f3af-4ebe-af1b-46baba5b0803","resolution":{"observed_at":"2026-08-08T17:34:28.081712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-07T18:23:08.539810Z","title":"Bitnet: Scaling 1-bit transformers for large language models.arXiv preprint arXiv:2310.11453, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06007","last_updated":"2026-08-06T13:12:45Z","snapshot_observed_at":"2026-08-10T22:51:17.921341Z","submitted_at":"2026-08-06T13:12:45Z","title":"TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:08.539810Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2608.06007"},"observation_digest":"sha256:e1112f994309e2423fabaeabaa388c5d2e1e4846a37b60362c277af04765b57f","observation_id":"47d81dd6-1a6f-458a-91d8-0c0eb459dba6","resolution":{"observed_at":"2026-08-07T18:23:08.539810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2310.11453/citation-record","integrity":"/paper/2310.11453/integrity","json":"/paper/2310.11453/citation-record.json","paper":"/paper/2310.11453"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.10403","last_updated":"2023-09-13T20:35:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:46:53Z","title":"PaLM 2 Technical Report","version":3},"cited_work":{"arxiv_id":"2305.10403","doi":"10.48550/arxiv.2305.10403","metadata_source":"pith","pith_arxiv_id":"2305.10403","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaLM 2 Technical Report","venue":"cs.CL","work_id":"905ee9a7-ea61-4a94-bd62-2600cbe3e315","year":2023},"citing_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-24T05:41:15.544164Z"},"links":{"cited_paper":"/paper/2305.10403","citing_paper":"/paper/2310.11453"},"observation_digest":"sha256:1342a93c5db6da7422cf220b57e745150b90a76689515bffeec542f019962cff","observation_id":"d117de25-16a6-4bea-8593-3a6417169903","resolution":{"observed_at":"2026-05-24T05:43:56.582578Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1308.3432","last_updated":"2013-08-15T15:19:34Z","snapshot_observed_at":"2026-08-11T05:54:56.124984Z","submitted_at":"2013-08-15T15:19:34Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","version":1},"cited_work":{"arxiv_id":"1308.3432","doi":"10.48550/arxiv.1308.3432","metadata_source":"pith","pith_arxiv_id":"1308.3432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","venue":"cs.LG","work_id":"1fe8c7c8-aff7-4b94-9096-e549d7e60789","year":2013},"citing_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-24T05:41:15.544164Z"},"links":{"cited_paper":"/paper/1308.3432","citing_paper":"/paper/2310.11453"},"observation_digest":"sha256:4b0723ce6a1c4ee8e520b54135a9812b4c65dcd69daab9af3f842614c4928a58","observation_id":"879df1de-162d-44e7-960e-94a8aa05bce1","resolution":{"observed_at":"2026-05-24T05:43:56.578008Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-19T16:22:27.235199+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T16:22:27.235199+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"XNOR-Net++: improved binary neural networks","venue":null,"work_id":"07af3873-b172-455f-9b65-15a25ada46dd","year":2019},"citing_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-24T05:41:15.544164Z"},"links":{"citing_paper":"/paper/2310.11453"},"observation_digest":"sha256:3284c7aa47fdc296fced4bcf7e72b9d54c5f6f338448e913108e2e1d4f118210","observation_id":"79313ec0-d7fa-4757-ac64-1b3d9a7c0b51","resolution":{"observed_at":"2026-05-24T05:46:01.313095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13304","last_updated":"2024-01-15T21:54:28Z","snapshot_observed_at":"2026-08-07T08:10:21.413901Z","submitted_at":"2023-07-25T07:44:06Z","title":"QuIP: 2-Bit Quantization of Large Language Models With Guarantees","version":2},"cited_work":{"arxiv_id":"2307.13304","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.13304","snapshot_observed_at":"2026-07-04T10:29:45.542647Z","title":"QuIP: 2-bit quantization of large language models with guarantees","venue":null,"work_id":"bd3fe3b4-ccc3-419b-969e-9a80ded56858","year":2023},"citing_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-24T05:41:15.544164Z"},"links":{"cited_paper":"/paper/2307.13304","citing_paper":"/paper/2310.11453"},"observation_digest":"sha256:fdd59aca60d722baebe37077f9e915d74e639a16ba23e462ddee641c8fa52cd1","observation_id":"38b35aa6-fd58-4bd0-befd-ecc9c1cc7451","resolution":{"observed_at":"2026-05-24T05:43:56.573108Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":"2204.02311","doi":"10.48550/arxiv.2204.02311","metadata_source":"pith","pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaLM: Scaling Language Modeling with Pathways","venue":"cs.CL","work_id":"a94f3ef7-2c49-4445-93fe-6ec16aafd966","year":2022},"citing_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-24T05:41:15.544164Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2310.11453"},"observation_digest":"sha256:12ed51c5ff953913f50d8b05eb4f062163013b978cf783071cfdbcb89bca5b12","observation_id":"b90303a1-a5a3-41f8-a580-5c162d608a11","resolution":{"observed_at":"2026-05-24T05:43:56.616667Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:25:21.411055+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:25:21.411055+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":"2307.08691","doi":"10.48550/arxiv.2307.08691","metadata_source":"pith","pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","venue":"cs.LG","work_id":"fff3953b-5efb-4753-bee4-002f59995810","year":2023},"citing_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-24T05:41:15.544164Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2310.11453"},"observation_digest":"sha256:320ff3481bd6e5cfc4e1e9dbf577747ab21c6f8d0ad873de8ca37c6f7497dd15","observation_id":"4e217fa2-b915-4ab1-80d3-5701da38f2ac","resolution":{"observed_at":"2026-05-24T05:43:56.597615Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:18.243793+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:18.243793+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":"2203.15556","doi":"10.1098/rsta.2024.0522","metadata_source":"pith","pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training Compute-Optimal Large Language Models","venue":"cs.CL","work_id":"b2faf28d-86b7-429c-bc42-469458efc246","year":2022},"citing_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-24T05:41:15.544164Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2310.11453"},"observation_digest":"sha256:3f7258869072f821260181f49e4ccd48fc1fea23ce6ee461c72d437b0ae802c4","observation_id":"b76660d8-9d32-4a5a-8395-61918991be23","resolution":{"observed_at":"2026-05-24T05:43:56.559339Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14701","last_updated":"2020-11-06T04:16:36Z","snapshot_observed_at":"2026-07-06T10:09:17.078776Z","submitted_at":"2020-10-28T02:17:24Z","title":"Scaling Laws for Autoregressive Generative Modeling","version":2},"cited_work":{"arxiv_id":"2010.14701","doi":"10.48550/arxiv.2010.14701","metadata_source":"pith","pith_arxiv_id":"2010.14701","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Laws for Autoregressive Generative Modeling","venue":"cs.LG","work_id":"1f180c21-02d6-4b11-9dfc-08d7f0d8fc81","year":2020},"citing_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-24T05:41:15.544164Z"},"links":{"cited_paper":"/paper/2010.14701","citing_paper":"/paper/2310.11453"},"observation_digest":"sha256:7bc7630b3ca30a81019c8704d8ce24d6bee192f5a155a144fc3287dc3e9d4b2d","observation_id":"762a5256-8426-4f67-aefe-98588ad40b67","resolution":{"observed_at":"2026-05-24T05:43:56.611684Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"1.1 computing’s energy problem (and what we can do about it)","venue":null,"work_id":"85c69f95-61c6-46d7-a2cd-7076728504f6","year":2014},"citing_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-24T05:41:15.544164Z"},"links":{"citing_paper":"/paper/2310.11453"},"observation_digest":"sha256:8fcb3967e890949ab3302fe0a9ee4e460d2646bcde18381826258270e4199b49","observation_id":"e3df615d-ccb1-4367-8b06-e53bdc2c71fd","resolution":{"observed_at":"2026-05-24T05:46:01.303686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":"2001.08361","doi":"10.1145/3616855.3635845","metadata_source":"pith","pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Laws for Neural Language Models","venue":"cs.LG","work_id":"b7dd8749-9c45-4977-ab9b-64478dce1ae8","year":2020},"citing_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-24T05:41:15.544164Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2310.11453"},"observation_digest":"sha256:57fb18b9d367d4cced1f2991f50eadce5362bee85c6f8f51636add8e40595c62","observation_id":"665176a4-5f7a-4b2f-931c-f9f496fa5204","resolution":{"observed_at":"2026-05-24T05:43:56.566258Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fast inference from transformers via speculative decoding","venue":null,"work_id":"19210c2d-2afb-4612-863f-202cb6879278","year":2023},"citing_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-24T05:41:15.544164Z"},"links":{"citing_paper":"/paper/2310.11453"},"observation_digest":"sha256:8289642961083a3e7fb101cec77a56cc303ec957a0bb7af660207a38e1a0cb83","observation_id":"c94fd3d4-f8ca-4fb9-b4c2-e7ae7eb89fa6","resolution":{"observed_at":"2026-05-24T05:46:01.306632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How do adam and training strategies help bnns optimization","venue":null,"work_id":"74e4cc75-f390-4b81-8db5-c17ba430b174","year":2021},"citing_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-24T05:41:15.544164Z"},"links":{"citing_paper":"/paper/2310.11453"},"observation_digest":"sha256:ea45bd4b7ab75d9ec8ba71b46f4264c085bda4340bc5d189a26f0a4dcbbb143f","observation_id":"f0de4a86-1266-4bf9-b865-b5945dc80294","resolution":{"observed_at":"2026-05-24T05:46:01.309736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1604.01696","last_updated":"2016-04-06T17:15:10Z","snapshot_observed_at":"2026-08-02T13:14:17.832691Z","submitted_at":"2016-04-06T17:15:10Z","title":"A Corpus and Evaluation Framework for Deeper Understanding of Commonsense Stories","version":1},"cited_work":{"arxiv_id":"1604.01696","doi":"10.48550/arxiv.1604.01696","metadata_source":"pith","pith_arxiv_id":"1604.01696","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Corpus and Evaluation Framework for Deeper Understanding of Commonsense Stories","venue":"cs.CL","work_id":"57863a72-4f75-4a4c-8747-c34f79541821","year":2016},"citing_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-24T05:41:15.544164Z"},"links":{"cited_paper":"/paper/1604.01696","citing_paper":"/paper/2310.11453"},"observation_digest":"sha256:e5fcad0a8856dc30d52734cf239d2dd76ce78034b656f24e1ab53750d46fd713","observation_id":"09fb1cc6-ae5d-4c37-90ce-b93ae0d45776","resolution":{"observed_at":"2026-05-24T05:43:56.554542Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-24T05:41:15.544164Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2310.11453"},"observation_digest":"sha256:42bf57e8f547149f492416401fb890ec95e0e4da17b152f8fd09a1075c877929","observation_id":"275a1185-5e5e-4637-86f2-187e240597cc","resolution":{"observed_at":"2026-05-24T05:43:56.602370Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"XNOR-Net: imagenet classification using binary convolutional neural networks","venue":null,"work_id":"06f53151-efcc-43d9-974d-ca69647f4a2b","year":2016},"citing_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-24T05:41:15.544164Z"},"links":{"citing_paper":"/paper/2310.11453"},"observation_digest":"sha256:35ce6df7c6bb24cf494ee9e856a75035e52d296817b6353e661b52e9a15eb10b","observation_id":"71eb0375-9d2a-4f26-9320-524a3129f3b4","resolution":{"observed_at":"2026-05-24T05:46:01.300844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":"1909.08053","doi":"10.48550/arxiv.1909.08053","metadata_source":"pith","pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","venue":"cs.CL","work_id":"c888e6d1-0b1d-43d6-9ef5-f0912a0efa1b","year":2019},"citing_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-24T05:41:15.544164Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2310.11453"},"observation_digest":"sha256:8542956502f3c5be861155cd3dec814a87263effda3911b471cddc5e0fd3c39c","observation_id":"9a04fcf6-8bc0-4098-ae6a-9d3ed5b5d8f6","resolution":{"observed_at":"2026-05-24T05:43:56.587719Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-24T05:41:15.544164Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2310.11453"},"observation_digest":"sha256:e4af383d821f3eb1012f37992f7badd2aa7de0a5e4a3a4749034aa7711d30ec4","observation_id":"cd2d8663-1027-468e-a0d3-1b28cffbea3e","resolution":{"observed_at":"2026-05-24T05:43:56.606858Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:17.350515+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:17.350515+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-24T05:41:15.544164Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2310.11453"},"observation_digest":"sha256:6b45362ebbe0641d845187c9bf98dee316af7425266953c5527cb462c35c4d87","observation_id":"160bcbd3-a855-4031-8923-bc1e7e469c9a","resolution":{"observed_at":"2026-05-24T05:43:56.592548Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SmoothQuant: accurate and efficient post-training quantization for large language models","venue":null,"work_id":"f9789808-64f2-4de0-81a1-ee0f415eb384","year":2023},"citing_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-24T05:41:15.544164Z"},"links":{"citing_paper":"/paper/2310.11453"},"observation_digest":"sha256:aa523bf4ccb5a600e0e0e44822b04de21058d8c270d25d59f7cf7d937d085e7d","observation_id":"3d944d78-0ad6-411f-9de3-1062c8831416","resolution":{"observed_at":"2026-05-24T05:46:01.294902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fb2a5bc4-0543-4a58-bcb9-70d3a601a76b","year":2048},"citing_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-24T05:41:15.544164Z"},"links":{"citing_paper":"/paper/2310.11453"},"observation_digest":"sha256:234728b6b4e87e0da764a68e2c286ea79b058dc59c00b49567511cb6b1adc3ce","observation_id":"2a778ac3-69da-4d1a-a120-a027d986017d","resolution":{"observed_at":"2026-05-24T05:46:01.297872Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":1,"verified_exact":9,"verified_fuzzy":6},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 78 inbound Pith citation observations for arXiv:2310.11453."}