{"as_of":"2026-08-09T02:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e01843ba6b4ba4bf8c1c4b9fcd76a5dd5fb519e664497d1df94902b5cfe812bf","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":44,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T19:01:09.214424Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":4,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2202.12837","last_updated":"2022-10-20T14:04:10Z","snapshot_observed_at":"2026-08-01T15:23:39.998892Z","submitted_at":"2022-02-25T17:25:19Z","title":"Rethinking the Role of Demonstrations: What Makes In-Context Learning Work?","version":2},"reference_index":167,"source":"arxiv_source","source_observed_at":"2026-05-15T09:51:46.701149Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2202.12837"},"observation_digest":"sha256:003e5e873221ba147d1278b1bcc6d707f9a5869ae2f16b35eef58cbe73a1f580","observation_id":"ddd28ee3-33c2-46e9-9363-080b227bd50a","resolution":{"observed_at":"2026-05-15T09:51:46.844616Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2501.07237","last_updated":"2026-04-27T13:03:55Z","snapshot_observed_at":"2026-07-06T20:20:14.452585Z","submitted_at":"2025-01-13T11:35:09Z","title":"GWT: Scalable Optimizer State Compression for Large Language Model Training","version":5},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-23T05:57:09.276224Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2501.07237"},"observation_digest":"sha256:a347c70df895f0315a1a74719a9e0f803ea67af303647e51092ff9e403fc1b48","observation_id":"80ea1a75-f208-4640-a79c-4e6dd5496c74","resolution":{"observed_at":"2026-05-23T05:57:36.672293Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2501.17549","last_updated":"2026-05-18T07:20:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T10:35:41Z","title":"Query-Aware Learnable Graph Pooling Tokens as Prompt for Large Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-23T04:36:06.247071Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2501.17549"},"observation_digest":"sha256:8541c78db13095f15cb8cd862f3cfe02afea262f2a65ffb339077e4ea94f73a9","observation_id":"10c0fdfc-4e48-4586-bc29-41a1ab6ee0f0","resolution":{"observed_at":"2026-05-23T04:37:32.089763Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-08T19:01:09.214424Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05539","last_updated":"2025-02-08T12:06:58Z","snapshot_observed_at":"2026-08-08T18:53:14.872373Z","submitted_at":"2025-02-08T12:06:58Z","title":"SSH: Sparse Spectrum Adaptation via Discrete Hartley Transformation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T19:01:09.214424Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2502.05539"},"observation_digest":"sha256:58373345817a261632960f732aed6cac0eea1265f8de0261e24512508a2cf8a1","observation_id":"b6f0a2ef-2891-483c-8653-7110ecacb8e6","resolution":{"observed_at":"2026-08-08T19:01:09.214424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-07T15:43:37.149873Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14742","last_updated":"2025-05-29T22:04:36Z","snapshot_observed_at":"2026-08-07T15:40:11.053954Z","submitted_at":"2025-05-20T07:19:36Z","title":"Quaff: Quantized Parameter-Efficient Fine-Tuning under Outlier Spatial Stability Hypothesis","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:37.149873Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2505.14742"},"observation_digest":"sha256:a8e2b532de72950e32fbaa6478708907b5d38d16ef8ec9c3159f99fa95036cc2","observation_id":"e64fa1bc-0016-42d3-8344-8e797838f702","resolution":{"observed_at":"2026-08-07T15:43:37.149873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-07T15:16:00.585372Z","title":"8-bit optimizers via block-wise quantization, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17116","last_updated":"2025-05-21T16:27:51Z","snapshot_observed_at":"2026-08-08T04:05:44.729912Z","submitted_at":"2025-05-21T16:27:51Z","title":"Comparative Evaluation of Prompting and Fine-Tuning for Applying Large Language Models to Grid-Structured Geospatial Data","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T15:16:00.585372Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2505.17116"},"observation_digest":"sha256:a06cd6684678bc5085df3a63cc99e4040642ad0d303c58f3622f3d5af89afee3","observation_id":"1d85fe88-6af5-4a02-a9ad-a0323c9912d8","resolution":{"observed_at":"2026-08-07T15:16:00.585372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-07T11:55:13.250462Z","title":"8-bit optimizers via block-wise quantization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:13.250462Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:5071c1c8dac413fcf59942a0d76dcd190cee2295da0a1ddea6109eacf3b281fa","observation_id":"f320d63e-c91c-46e4-9a45-535ee198c85f","resolution":{"observed_at":"2026-08-07T11:55:13.250462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-07T10:42:23.400254Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04603","last_updated":"2025-06-05T03:40:57Z","snapshot_observed_at":"2026-08-07T10:35:43.791290Z","submitted_at":"2025-06-05T03:40:57Z","title":"A MISMATCHED Benchmark for Scientific Natural Language Inference","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T10:42:23.400254Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2506.04603"},"observation_digest":"sha256:fe1bcde7ced3467dabaa2bcfbb3aa424d2c066add7343cfe6df5fb512a54ba84","observation_id":"46ab0f85-5288-406a-9555-ca4a273f1bd3","resolution":{"observed_at":"2026-08-07T10:42:23.400254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-07T04:19:41.968247Z","title":"Dettmers, M","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.10885","last_updated":"2025-06-12T16:49:40Z","snapshot_observed_at":"2026-08-07T04:12:56.093282Z","submitted_at":"2025-06-12T16:49:40Z","title":"Slimming Down LLMs Without Losing Their Minds","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:19:41.968247Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2506.10885"},"observation_digest":"sha256:66d7228f1447972a56a8f0c10bd2259fdd2b6b6652786ac5aae748712f6b8e1a","observation_id":"f082671f-8362-49d4-9d86-5122c2bd84f8","resolution":{"observed_at":"2026-08-07T04:19:41.968247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-06T18:35:40.111493Z","title":"8-bit optimizers via block-wise quantization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-08T23:54:01.601611Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.111493Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:078d03c8366b0ac41a43562b7dc44e8ed67f810bcfe5712c03df97775697e61d","observation_id":"37add5ea-1f3f-4a0b-8e0b-d16bbe160b7b","resolution":{"observed_at":"2026-08-06T18:35:40.111493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-06T17:56:21.261233Z","title":"8-bit optimizers via block-wise quantization,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09665","last_updated":"2025-07-13T14:58:19Z","snapshot_observed_at":"2026-08-08T22:10:15.646478Z","submitted_at":"2025-07-13T14:58:19Z","title":"Is Quantization a Deal-breaker? Empirical Insights from Large Code Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:56:21.261233Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2507.09665"},"observation_digest":"sha256:f680a2b6af25e72d297034890a4d3388d9886db8b24e5ef1433643f45796c83e","observation_id":"2c8cc62a-b52d-42d7-8929-54e27d22a9fa","resolution":{"observed_at":"2026-08-06T17:56:21.261233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T15:10:34.440764Z","title":"8-bit optimizers via block-wise quantization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.440764Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:3a4a8abde9d22d35239236e2028b4fcdd88d8e05099637c1c7db58669a3b7290","observation_id":"19effd8d-d214-47d5-95bf-bc6f0dd197a3","resolution":{"observed_at":"2026-08-05T15:10:34.440764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T10:38:35.001738Z","title":"& Zettlemoyer, L","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.04534","last_updated":"2025-09-04T04:18:45Z","snapshot_observed_at":"2026-08-06T05:31:52.923420Z","submitted_at":"2025-09-04T04:18:45Z","title":"Quantized Large Language Models in Biomedical Natural Language Processing: Evaluation and Recommendation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T10:38:35.001738Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2509.04534"},"observation_digest":"sha256:ade30944cf9e7ba725509b1779acbf3936ab8ee575fc0745f3c31edf247d0c6f","observation_id":"ebfa13f1-ea5b-4b2e-b086-13096f9b453b","resolution":{"observed_at":"2026-08-05T10:38:35.001738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2510.25977","last_updated":"2026-04-23T22:27:02Z","snapshot_observed_at":"2026-08-02T11:49:00.583840Z","submitted_at":"2025-10-29T21:22:08Z","title":"NeuronMLP: Efficient LLM Inference via Singular Value Decomposition Compression and Tiling on AWS Trainium","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T02:51:19.275111Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2510.25977"},"observation_digest":"sha256:ff5861afe5640f23d40f1247131cafb126a28489bf9532dde1f367833457e343","observation_id":"b1810150-1745-434f-8810-5bcf97bc4d58","resolution":{"observed_at":"2026-05-18T02:52:21.861968Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2512.12677","last_updated":"2026-05-25T16:57:18Z","snapshot_observed_at":"2026-08-03T16:38:10.732856Z","submitted_at":"2025-12-14T13:02:06Z","title":"Fine-Tuning Causal LLMs for Text Classification: Embedding-Based vs. Instruction-Based Approaches","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-25T07:23:53.703286Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2512.12677"},"observation_digest":"sha256:fba45b59e49394fdb5f82b9e20d28076377169df3c9c04f2d6cc814945bcc9d0","observation_id":"7ed4500e-3886-4ab4-98d1-7d5c1c067285","resolution":{"observed_at":"2026-05-25T07:25:29.063199Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-03T16:38:13.326091Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.12677","last_updated":"2026-05-25T16:57:18Z","snapshot_observed_at":"2026-08-03T16:38:10.732856Z","submitted_at":"2025-12-14T13:02:06Z","title":"Fine-Tuning Causal LLMs for Text Classification: Embedding-Based vs. Instruction-Based Approaches","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T16:38:13.326091Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2512.12677"},"observation_digest":"sha256:8274d8b5719477afa837cf9e7e7b243121c2ed7467d9407e5b72896513c7e078","observation_id":"d63b4287-f6aa-4180-bd21-fae2a57d8e46","resolution":{"observed_at":"2026-08-03T16:38:13.326091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-03T14:52:19.865798Z","title":"8-bit optimizers via block-wise quantization.arXiv preprint arXiv:2110.02861, (arXiv:2110.02861), June 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.18934","last_updated":"2026-06-30T23:57:23Z","snapshot_observed_at":"2026-08-06T02:17:15.385139Z","submitted_at":"2025-12-22T00:51:39Z","title":"When Less is More: 8-bit Quantization Improves Continual Learning in Large Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T14:52:19.865798Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2512.18934"},"observation_digest":"sha256:3824152addaf8005664d8129b89ae79656fe2f5a2548725ca2a8492e2eab289f","observation_id":"f61e057b-ad46-4ba0-92f0-230c6f43287b","resolution":{"observed_at":"2026-08-03T14:52:19.865798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2601.11568","last_updated":"2026-04-29T11:50:41Z","snapshot_observed_at":"2026-08-05T06:39:07.257844Z","submitted_at":"2025-12-27T14:11:08Z","title":"AdaFRUGAL: Adaptive Memory-Efficient Training with Dynamic Control","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T19:13:30.177633Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2601.11568"},"observation_digest":"sha256:554da9217558f4a808f626907ecf7eb98ffe03421e2e77706d1b57b31a3febfb","observation_id":"6566ab8f-907b-452e-8a8d-5848c03cdb55","resolution":{"observed_at":"2026-05-16T19:18:19.272518Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2601.13684","last_updated":"2026-04-18T08:34:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T07:35:06Z","title":"HeteroCache: A Dynamic Retrieval Approach to Heterogeneous KV Cache Compression for Long-Context LLM Inference","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T13:16:31.568604Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2601.13684"},"observation_digest":"sha256:acf035320daa11f96fe1fc75647eb76668296209bc0af4571d162439a5e47fca","observation_id":"45df5dfe-cff6-47ea-8b13-d22114a12d93","resolution":{"observed_at":"2026-05-16T13:17:54.857068Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2603.26603","last_updated":"2026-05-20T17:48:34Z","snapshot_observed_at":"2026-08-08T16:50:54.146177Z","submitted_at":"2026-03-27T17:00:25Z","title":"Sustainability Is Not Linear: Quantifying Performance, Energy, and Privacy Trade-offs in On-Device Intelligence","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-21T09:27:34.204972Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2603.26603"},"observation_digest":"sha256:bc93e622cfb8b83a1e1bca1ac8e147177af5f373e88f0e6227802b132cbf9633","observation_id":"bcd8a09d-2f6c-48b1-9b12-d1c0a94e7295","resolution":{"observed_at":"2026-05-21T09:29:56.963343Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2604.06836","last_updated":"2026-04-09T02:16:08Z","snapshot_observed_at":"2026-07-06T22:55:15.791334Z","submitted_at":"2026-04-08T08:57:09Z","title":"STQuant: Spatio-Temporal Adaptive Framework for Optimizer Quantization in Large Multimodal Model Training","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T18:49:40.758234Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2604.06836"},"observation_digest":"sha256:41fa5a061b9264a2062c4da749c864216d4a01574336e83a8c805a016e37c310","observation_id":"b35a8172-04e3-4064-94fa-f70c1bbedace","resolution":{"observed_at":"2026-05-10T23:55:49.370629Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2604.18556","last_updated":"2026-05-15T09:34:30Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:45:47Z","title":"GSQ: Highly-Accurate Low-Precision Scalar Quantization for LLMs via Gumbel-Softmax Sampling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T05:29:51.182114Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2604.18556"},"observation_digest":"sha256:66d8973b5be92c43c90c45b73cb460838f0e1a671a87acac80b42f7c7387b572","observation_id":"d071ecff-fe92-4659-b28a-fbb1d5822426","resolution":{"observed_at":"2026-05-10T05:36:02.321113Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2604.18556","last_updated":"2026-05-15T09:34:30Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:45:47Z","title":"GSQ: Highly-Accurate Low-Precision Scalar Quantization for LLMs via Gumbel-Softmax Sampling","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-19T18:01:08.514022Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2604.18556"},"observation_digest":"sha256:28ab2517cc426dd9704bc242d9a6970e387cd96f98ad9e3e9983abc2d442cd52","observation_id":"6faadd91-7601-44f0-92b8-aad68f6d1ee2","resolution":{"observed_at":"2026-05-19T18:02:42.154497Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2604.23467","last_updated":"2026-04-25T23:19:53Z","snapshot_observed_at":"2026-07-06T23:09:43.659053Z","submitted_at":"2026-04-25T23:19:53Z","title":"Hybrid JIT-CUDA Graph Optimization for Low-Latency Large Language Model Inference","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T08:13:51.176435Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2604.23467"},"observation_digest":"sha256:967cf40a520a80deff5232dca988e83a17b26f0388213e0e76e78dac379dda7d","observation_id":"2c8c744a-9be6-4545-8a47-d364c764bd8c","resolution":{"observed_at":"2026-05-11T20:41:14.307289Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2604.24785","last_updated":"2026-08-03T13:28:35Z","snapshot_observed_at":"2026-08-06T23:31:02.471585Z","submitted_at":"2026-04-24T14:57:57Z","title":"Cloud to Edge: Benchmarking LLM Inference On Hardware-Accelerated Single-Board Computers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T09:22:05.851456Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2604.24785"},"observation_digest":"sha256:38240c6525d622c8b7fb564fb7aef296363fd1737c48f9d240b0b3015696739d","observation_id":"f4cdca61-a59f-4ba4-b976-b4889318014b","resolution":{"observed_at":"2026-05-11T20:21:12.025263Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-04T05:34:06.504733Z","title":"8-bit optimizers via block-wise quantization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.24785","last_updated":"2026-08-03T13:28:35Z","snapshot_observed_at":"2026-08-06T23:31:02.471585Z","submitted_at":"2026-04-24T14:57:57Z","title":"Cloud to Edge: Benchmarking LLM Inference On Hardware-Accelerated Single-Board Computers","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T05:34:06.504733Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2604.24785"},"observation_digest":"sha256:6fa49ab637a6431ce987e95f2c43b35e94af5740c5c0204126ed71dccaedbd38","observation_id":"bf3171ca-d31b-4492-843c-437b112ec8b7","resolution":{"observed_at":"2026-08-04T05:34:06.504733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2604.24820","last_updated":"2026-04-27T14:06:21Z","snapshot_observed_at":"2026-07-31T06:39:38.066325Z","submitted_at":"2026-04-27T14:06:21Z","title":"Salca: A Sparsity-Aware Hardware Accelerator for Efficient Long-Context Attention Decoding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-07T17:56:39.124969Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2604.24820"},"observation_digest":"sha256:30a32ecef26ae423aac317218040fc0378091243d8348a40de2026823bf82dcc","observation_id":"ae91f5d5-1d90-4616-9f9c-86e39e8b2b4f","resolution":{"observed_at":"2026-05-11T23:11:18.879146Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2605.01870","last_updated":"2026-05-03T13:32:06Z","snapshot_observed_at":"2026-08-08T13:28:29.995118Z","submitted_at":"2026-05-03T13:32:06Z","title":"Maistros: A Greek Large Language Model Adapted Through Knowledge Distillation From Large Reasoning Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-08T19:08:09.259620Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2605.01870"},"observation_digest":"sha256:f9cd6035104e3a86612955eaf70fbadea70df97014883a96eb230d67095c12cc","observation_id":"009929a1-0701-4642-b55f-4e2b9d833f13","resolution":{"observed_at":"2026-05-09T06:00:37.376768Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2605.05794","last_updated":"2026-05-07T07:32:27Z","snapshot_observed_at":"2026-07-30T14:24:32.368109Z","submitted_at":"2026-05-07T07:32:27Z","title":"Revealing Modular Gradient Noise Imbalance in LLMs: Calibrating Adam via Signal-to-Noise Ratio","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-09T15:39:51.611115Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2605.05794"},"observation_digest":"sha256:8f3769a27361f2ce983501faf46bca238da4abd2ff441e8099fc5debfc2ec778","observation_id":"6eccfed7-6512-4a67-81f8-5f484d422187","resolution":{"observed_at":"2026-05-11T16:41:05.506387Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2605.17552","last_updated":"2026-05-17T17:23:23Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T17:23:23Z","title":"Q-LocalAdam: Memory-Efficient Client-Side Adaptive Optimization for Edge Federated Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T14:11:53.371521Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2605.17552"},"observation_digest":"sha256:584a3c77061d73cbc053b595ee4af09bce8ac92ae493c68a63d7eca5e94438ea","observation_id":"45819efa-d7c1-4c4e-b210-3528816a4eb4","resolution":{"observed_at":"2026-05-20T14:13:21.230707Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2605.27737","last_updated":"2026-05-26T22:27:58Z","snapshot_observed_at":"2026-08-01T07:53:04.594255Z","submitted_at":"2026-05-26T22:27:58Z","title":"Bounded-Compute Multimodal Regression for Product-Rating Prediction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T17:58:58.353336Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2605.27737"},"observation_digest":"sha256:b67b3c6595dacda29fc03736f9079762d0c1a8ef3dde9badd7d41c8008a7bd78","observation_id":"4fcba71d-9a04-47dc-b5a5-b08b92e64a1c","resolution":{"observed_at":"2026-06-29T18:03:48.009935Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2606.00539","last_updated":"2026-05-30T05:11:13Z","snapshot_observed_at":"2026-07-06T23:41:15.410587Z","submitted_at":"2026-05-30T05:11:13Z","title":"GNMR: Runtime Stability Control for Low-Precision Large Language Model Training","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T18:53:47.187437Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2606.00539"},"observation_digest":"sha256:6f674370082b208b12c3948f9faef294b62a3b880a9f51d66579b2f5adab711c","observation_id":"7efc0b72-f121-45fc-96f7-7b3f49829d79","resolution":{"observed_at":"2026-06-28T19:42:36.064792Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2606.02624","last_updated":"2026-05-29T12:12:08Z","snapshot_observed_at":"2026-07-06T23:42:58.036516Z","submitted_at":"2026-05-29T12:12:08Z","title":"TadA-Bench: A Million-Variant Benchmark for Future-Round Discovery Toward Agentic Protein Engineering","version":1},"reference_index":109,"source":"arxiv_source","source_observed_at":"2026-06-28T20:01:10.638647Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2606.02624"},"observation_digest":"sha256:ef0072691dda9ed0576aa73121877e7a0925a73aeffbf42431dc6f011350349d","observation_id":"73323cac-f7b3-4759-85c9-0fa8bc9595ce","resolution":{"observed_at":"2026-06-28T20:12:37.861872Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2606.09864","last_updated":"2026-06-01T02:02:20Z","snapshot_observed_at":"2026-08-03T01:43:21.917246Z","submitted_at":"2026-06-01T02:02:20Z","title":"Alignment Collapse Under KV Cache Quantization: Diagnosis and Mitigation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-28T15:37:34.129339Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2606.09864"},"observation_digest":"sha256:bb9c79a79d3e3ddd12b76f964eb9726ccf324b6e74d6b80864801fab487b0244","observation_id":"33ab8464-441b-4381-a4b9-634d871b16c5","resolution":{"observed_at":"2026-07-01T22:16:16.038824Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"8-bit optimizers via block-wise quantization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-06T19:19:15.546228Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:519617b9ba8937a1bfb31f2de0cfb97d2941fcd0ab4a2b6f6def62450eb90f66","observation_id":"85af1874-7e65-4b84-a222-377e963a6480","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2606.14970","last_updated":"2026-06-22T08:40:27Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T21:46:54Z","title":"Zero-order Parameter-free Optimization for LMO-based Methods: Novel Approach for Efficient Fine-tuning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T04:33:10.554853Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2606.14970"},"observation_digest":"sha256:6b8284d9483641edd15abcc6c311fd3bfbe31cbee4032f55d8c5ac0fc1642f33","observation_id":"c95ffa89-222d-4498-8419-fc0785e05f02","resolution":{"observed_at":"2026-07-03T17:08:43.652628Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-08-06T23:10:29.022464Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:e7f722c08b6a6a2dae4b838b088be829476b7e899c299d11016440b398132e9c","observation_id":"a8f6dc79-f9db-49f2-b0a0-efad0d2b543e","resolution":{"observed_at":"2026-07-03T20:48:55.723997Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2606.24447","last_updated":"2026-06-23T11:34:28Z","snapshot_observed_at":"2026-08-07T17:24:33.181681Z","submitted_at":"2026-06-23T11:34:28Z","title":"P-MTP: Efficient Document Parsing via Multi-Token Prediction with Progressive Depth Scaling","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T00:18:07.278889Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2606.24447"},"observation_digest":"sha256:2b9542de8c85001eb28ca53d4574eb9c1cba60fc0fc41f0126ff830d19a6ce62","observation_id":"1329faa3-a8a5-4a9c-8cb6-774a33d77948","resolution":{"observed_at":"2026-07-04T16:39:58.543364Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-07-11T22:10:49.683444Z","title":"8-bit optimizers via block-wise quantization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04033","last_updated":"2026-07-04T21:27:05Z","snapshot_observed_at":"2026-08-07T05:07:10.107694Z","submitted_at":"2026-07-04T21:27:05Z","title":"OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-11T22:10:49.683444Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2607.04033"},"observation_digest":"sha256:b0bbb8bf9f3599fcd06342807771621c334577bed39608d0d7cb11742182b0f8","observation_id":"c8eb76c7-31e2-4905-8db5-7b2165347bce","resolution":{"observed_at":"2026-07-11T22:10:49.683444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-07-11T19:17:59.044982Z","title":"8-bit optimizers via block-wise quantization.arXiv preprint arXiv:2110.02861, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04422","last_updated":"2026-07-05T17:31:36Z","snapshot_observed_at":"2026-08-04T03:31:46.106169Z","submitted_at":"2026-07-05T17:31:36Z","title":"Full-Stack FP4: Stable LLM Pretraining with Quantized Projections, Optimizers, and Attention","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-11T19:17:59.044982Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2607.04422"},"observation_digest":"sha256:90b4b762afbe16c5c16894ce0e20e57eb482db8e9c2cbf8022858bdeb3a80576","observation_id":"0814f2e2-e831-447a-8c90-bd2e633f1f36","resolution":{"observed_at":"2026-07-11T19:17:59.044982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-01T14:30:35.482308Z","title":"8-bit Optimizers via Block-wise Quantiza- tion,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18756","last_updated":"2026-07-21T06:25:46Z","snapshot_observed_at":"2026-08-06T03:18:43.212808Z","submitted_at":"2026-07-21T06:25:46Z","title":"RAGAL: A Frugal, Fully Local Retrieval-Augmented Assistant for Technical Support at a Government Agency","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T14:30:35.482308Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2607.18756"},"observation_digest":"sha256:49ab3a0919c5a2c4e5422bebefa7c9abf15dd603f6394e60c3cb04f222f35d39","observation_id":"aec9d49b-5138-48d3-979d-83f9af323cdb","resolution":{"observed_at":"2026-08-01T14:30:35.482308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-01T13:15:34.905327Z","title":"Dettmers, T., Lewis, M., Shleifer, S., and Zettlemoyer, L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19181","last_updated":"2026-07-21T15:15:56Z","snapshot_observed_at":"2026-08-07T22:32:59.398321Z","submitted_at":"2026-07-21T15:15:56Z","title":"Reasoning Before Translation: Enhancing Legal Machine Translation with Structured Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T13:15:34.905327Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2607.19181"},"observation_digest":"sha256:a2505f133822b1c032a534ce6cf59df0158ace5e4af13a3214108c459482c1a3","observation_id":"7dafb524-0f23-4066-8a28-05a8baa2d963","resolution":{"observed_at":"2026-08-01T13:15:34.905327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-02T08:23:07.462482Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21624","last_updated":"2026-07-07T10:18:25Z","snapshot_observed_at":"2026-08-08T06:52:26.281349Z","submitted_at":"2026-07-07T10:18:25Z","title":"FBLayout: Optimizing Memory Layout for Efficient LLM Finetuning on Mobile GPUs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T08:23:07.462482Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2607.21624"},"observation_digest":"sha256:40c576b52e01ef240edf348edf475d4878cf8d368ebc69c92238d0d8a0b1a290","observation_id":"de6d4400-f87c-4cdc-ac9f-1dfc53ca0cea","resolution":{"observed_at":"2026-08-02T08:23:07.462482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T18:20:39.185565Z","title":"8-bit optimizers via block-wise quantization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03480","last_updated":"2026-08-04T11:17:54Z","snapshot_observed_at":"2026-08-09T01:10:27.880942Z","submitted_at":"2026-08-04T11:17:54Z","title":"Efficient Multilingual Neural Machine Translation via Corpus-Driven Vocabulary Pruning: An English-Arabic Case Study","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-05T18:20:39.185565Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2608.03480"},"observation_digest":"sha256:46d705f8d1351037cea13a39ff5735202f5a5b20593f2ff6d42ab4614eb598f4","observation_id":"3c39e27b-609a-4a3b-8538-d8b0576acda7","resolution":{"observed_at":"2026-08-05T18:20:39.185565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2110.02861/citation-record","integrity":"/paper/2110.02861/integrity","json":"/paper/2110.02861/citation-record.json","paper":"/paper/2110.02861"},"outbound":[],"paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 44 inbound Pith citation observations for arXiv:2110.02861."}