{"as_of":"2026-08-19T08:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1433e0e463c1090148f3362aa473938f477a6ae05f163f7eb5fce3fb6aac9dac","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T10:54:30.919036Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03867/citation-record","integrity":"/paper/2608.03867/integrity","json":"/paper/2608.03867/citation-record.json","paper":"/paper/2608.03867"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:32.251417Z","title":"AMD Instinct™ MI350 Series GPUs,","venue":null,"work_id":"470d91a0-024c-4e88-a30d-9ed89d3d73da","year":2025},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:28.061738Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:e8bb3c7d1648544a9a2051f467a9a68e7b09b59c7645e9663a64b06291b08b57","observation_id":"c9c12499-2e2b-41b5-a52a-a149e625ea0b","resolution":{"observed_at":"2026-08-05T10:54:32.254496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:32.242447Z","title":"System Card: Claude Opus 4 & Claude Sonnet 4,","venue":null,"work_id":"5530771b-d79c-4e74-824d-44bb74b6c2b5","year":2025},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:28.148840Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:3f26c343ef79ea9466316c8b98477cd817251298f19e4127b1d1ccb4dc9015c0","observation_id":"38f6080c-a363-4330-adc0-61b81412f0f8","resolution":{"observed_at":"2026-08-05T10:54:32.245420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:32.233373Z","title":"QuaRot: outlier-free 4-bit inference in rotated llms,","venue":null,"work_id":"68a7bc42-6b1f-4965-b5ae-2cc0d6041019","year":2024},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:28.229286Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:fac9af77acd255108cd7abf2bbd347b45de6f4726eaa9fdab293282784a4d6dc","observation_id":"83a2abac-bb0c-4fd5-a249-0cb396aaaee0","resolution":{"observed_at":"2026-08-05T10:54:32.236474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:28.263418Z","title":"Cacti 7: New tools for interconnect exploration in innovative off-chip memories,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:28.263418Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:08a164790e8dfe6bd9766353f04cff3655e7441c95576ed497ac01937ecac239","observation_id":"949f57d1-a545-4f46-8424-af02b4034e2e","resolution":{"observed_at":"2026-08-05T10:54:28.263418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:32.224243Z","title":"Piqa: Reasoning about physical commonsense in natural language,","venue":null,"work_id":"eb950564-9a5b-46db-bb53-df6bdf928390","year":2019},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:28.329216Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:26287fe38a9bcbd30a10bb7e9f20602a21dcc402ea04298af3611ccf92ff16f1","observation_id":"d98bff83-0c8f-406b-ba1f-0fbe50a22354","resolution":{"observed_at":"2026-08-05T10:54:32.227307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:28.401800Z","title":"Int v.s. fp: A comprehensive study of fine-grained low-bit quantization formats,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:28.401800Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:1dfdb3bd5d60caebc80f1c3b0346a345ebd238b46d445dd083cf617300dd8eab","observation_id":"8fc5a00d-0a28-4996-9cd6-cc39ec0b7450","resolution":{"observed_at":"2026-08-05T10:54:28.401800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-08-17T14:44:42.060038Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-08-05T10:54:28.471068Z","title":"Boolq: Exploring the surprising difficulty of natural yes/no questions,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:28.471068Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:5a0166fc92919c8de0c0bc60e7f381b5ff6116a69ad5154d426d0a066b7f83b3","observation_id":"5c2c8913-fb8f-4491-af78-b5ec33739032","resolution":{"observed_at":"2026-08-05T10:54:28.471068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-05T10:54:28.580769Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:28.580769Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:39e02aa6902a854fd87ab57d26dd693293cdd4e56cba8cf1fb97e112bba3999e","observation_id":"48277872-e5ae-49e4-8e7e-4aab138abb8c","resolution":{"observed_at":"2026-08-05T10:54:28.580769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02010","last_updated":"2026-05-09T05:39:54Z","snapshot_observed_at":"2026-08-12T20:11:32.365290Z","submitted_at":"2025-12-01T18:59:45Z","title":"Four Over Six: More Accurate NVFP4 Quantization with Adaptive Block Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.02010","snapshot_observed_at":"2026-08-05T10:54:28.676839Z","title":"Four over six: More accurate nvfp4 quantization with adaptive block scaling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:28.676839Z"},"links":{"cited_paper":"/paper/2512.02010","citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:414fc2e9fc33c814481bdf218c1701463fe4c704dc69cadb2f16c20a61ec5198","observation_id":"f9a7d5da-ac93-47c1-997c-294233991dce","resolution":{"observed_at":"2026-08-05T10:54:28.676839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:28.699322Z","title":"Efficient precision-scalable hardware for microscaling (mx) processing in robotics learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:28.699322Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:b64521738ee7d637eec43387652a48c6aca04994af8e73c20ea1602e4470f3dc","observation_id":"a83d7654-d208-40e5-858c-cd7b06bc6112","resolution":{"observed_at":"2026-08-05T10:54:28.699322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:28.792184Z","title":"With shared microexponents, a little shifting goes a long way,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:28.792184Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:4d5624867ec426258765b03fe4a0bec04b27f03de92c22db8b96abf05b2e34f9","observation_id":"d0573c81-314f-4b28-a94e-022414ad12b4","resolution":{"observed_at":"2026-08-05T10:54:28.792184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:28.907764Z","title":"Deepseek-v4: Towards highly efficient million-token context intelligence,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:28.907764Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:2a8f59b0f1227430d533c78b726694f131636efe96f9d89cce766c7d502dde20","observation_id":"479b6f3c-623a-4d54-bc5a-2de962b1b321","resolution":{"observed_at":"2026-08-05T10:54:28.907764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:32.208690Z","title":"LLM.int8(): 8-bit matrix multiplication for transformers at scale,","venue":null,"work_id":"ddcaad44-3bbe-4df3-b051-2a24b3511ba7","year":2022},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:29.005235Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:df5728fdc4f6aa89998cda806942ee8dc7fa77ce424b6551018b286406d2082a","observation_id":"b762538d-8fec-4633-999c-c990af96b4c5","resolution":{"observed_at":"2026-08-05T10:54:32.212025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-08-17T19:57:48.664476Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-08-05T10:54:29.065972Z","title":"Spqr: A sparse- quantized representation for near-lossless llm weight compression,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:29.065972Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:9815782aadf1d4320aff9b64c09fa1597fb89e9a77191d3bd389bf01c01ba774","observation_id":"0d52327e-a994-4712-a432-e8aace3f64cc","resolution":{"observed_at":"2026-08-05T10:54:29.065972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:32.199719Z","title":"Extreme compression of large language models via additive quantization,","venue":null,"work_id":"4ea43baf-9241-486f-b8a7-9c9ca582e208","year":2024},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:29.143132Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:a15a6197a2e3e5de8f1ae0ef1269bf702982a901593f9d77f08d64f6d6198801","observation_id":"b83e9f0c-927d-4c3f-8660-7c00c0204d1c","resolution":{"observed_at":"2026-08-05T10:54:32.202728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-16T07:57:19.216626Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-05T10:54:29.303924Z","title":"GPTQ: Accurate post-training compression for generative pretrained transformers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:29.303924Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:46ef2a00afd1be4011510113f53b759ccb04c43d2e81b72553f5d17c2ffced46","observation_id":"35899f3b-85b2-4c86-97ea-076263ccede1","resolution":{"observed_at":"2026-08-05T10:54:29.303924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:29.417903Z","title":"The language model evaluation harness,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:29.417903Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:b5b25982cdaea1a5af07e2935aebfeacd8836ed9f582e6b37abaa685dd87c5a9","observation_id":"cf638634-a821-4b27-9813-0eabcd400783","resolution":{"observed_at":"2026-08-05T10:54:29.417903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:32.191013Z","title":"Gemma 4 Model Overview,","venue":null,"work_id":"a0d60c5a-ef32-44b5-845d-24db28368eaa","year":2026},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:29.550359Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:3feca59c6771bdc5ab4ac55407cec4b2f8d3d654794d8c2f1d33c28a362744a6","observation_id":"2a8c3788-d6d7-416c-a0aa-37bb6bd0f321","resolution":{"observed_at":"2026-08-05T10:54:32.193835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:32.181668Z","title":"ANT: Exploiting adaptive numerical data type for low-bit deep neural network quantization,","venue":null,"work_id":"5fe0c023-2b17-4e86-8cd3-3b77ed023a86","year":2022},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:29.637719Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:24addd7736220e7630a3de9c24e241a205b0bd79e0df48835d03a601b14136ab","observation_id":"e7b05792-47c7-4ea6-b42d-3ec3fdfafa03","resolution":{"observed_at":"2026-08-05T10:54:32.184673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:29.770682Z","title":"BBAL: A bidirectional block floating point-based quantisation accelerator for large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:29.770682Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:fc3e7941986ddb04aa296e14661dff45b5de2fef4402c2a98fa6734a06f88a89","observation_id":"8029f34d-20a4-4469-bd82-df0ecdd958b5","resolution":{"observed_at":"2026-08-05T10:54:29.770682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-05T10:54:29.896018Z","title":"Measuring massive multitask language understanding,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:29.896018Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:97069b0ac69e53e4077337bce310a4fccbaf04b3aee585290441fc4f740354de","observation_id":"125c4c63-2891-4ec1-a961-9cf9aef6f499","resolution":{"observed_at":"2026-08-05T10:54:29.896018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:30.016464Z","title":"1.1 computing’s energy problem (and what we can do about it),","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.016464Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:1ae9e9628f0261beceb98a65a7590a12352041b72fa46001e3df0f824307800a","observation_id":"d5f515fe-86d0-4f6a-870e-042bcc1a7de5","resolution":{"observed_at":"2026-08-05T10:54:30.016464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-08-18T14:33:16.365411Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T10:54:30.113712Z","title":"Ruler: What’s the real context size of your long- context language models?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.113712Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:31bcf5279a745ddef55b6df0265f4e04faa8d95d6ba41de63be67666bcb8662f","observation_id":"17875c65-6793-40a3-bcbd-cb21bf5e4199","resolution":{"observed_at":"2026-08-05T10:54:30.113712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:32.165707Z","title":"M-ANT: Efficient low-bit group quantization for llms via mathematically adaptive numerical type,","venue":null,"work_id":"719830a4-b6a2-461d-b30b-1e259fce5ff5","year":2025},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.264778Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:cd22dfee2a5178db99e0f6b88aa184b4c42b7ed708678f8c651a388eb824ee6e","observation_id":"4770c4e1-84c9-40a2-820f-f86281e27bae","resolution":{"observed_at":"2026-08-05T10:54:32.169110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:30.375670Z","title":"M2XFP: A metadata-augmented microscaling data format for efficient low-bit quantization,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.375670Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:6eb5c2caf5775c8d3cee7ea1fe7a45fd6bce1ca812a063ceff542cad339fe0a1","observation_id":"8a9df075-b593-4db8-b489-565517638e7b","resolution":{"observed_at":"2026-08-05T10:54:30.375670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:32.154971Z","title":"Blockdialect: block-wise fine-grained mixed format quantization for energy-efficient llm inference,","venue":null,"work_id":"98c67522-86d4-4c85-89f1-0ac06e42d201","year":2025},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.535766Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:ecd97d0de6bfd3bbfea465517083e1141fc6b9fd331b4d4e3c7f547e37a4a601","observation_id":"3c1f572b-6924-49b8-b55a-265e253bf2fd","resolution":{"observed_at":"2026-08-05T10:54:32.158601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:32.144517Z","title":"A diagram is worth a dozen images,","venue":null,"work_id":"0ae251a1-c328-48c7-99fe-9b09cf43042e","year":2016},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.700003Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:0bb2743373b763a0527d62b8d460fe1fc4ddbb9cf95385d6149ffa431d632300","observation_id":"1942b81a-3f95-47fc-ac60-9edbe07e590e","resolution":{"observed_at":"2026-08-05T10:54:32.147849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:32.134411Z","title":"14.2 a 16nm 216kb, 188.4tops/w and 133.5tflops/w microscaling multi- mode gain-cell cim macro edge-ai devices,","venue":null,"work_id":"1493b71b-7ab1-41ed-8ec5-ebca0a6a32a5","year":2025},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.799634Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:4468cddc86ad0597c05b90ed456dde5839218c7d5fc6ac09044f171cc9fea34b","observation_id":"5fb49d37-4664-4019-8491-513e06c21bb3","resolution":{"observed_at":"2026-08-05T10:54:32.138096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:32.124443Z","title":"SqueezeLLM: dense-and-sparse quantiza- tion,","venue":null,"work_id":"afd0c63b-7e94-4704-a511-11ded97a5ba0","year":2024},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.802603Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:cd98569e8974fb0c869bcfc529d42d69d12de2e508ba69e2a77b54ec820c2e44","observation_id":"9293ecb2-7281-40f4-9ea4-f69183e2d117","resolution":{"observed_at":"2026-08-05T10:54:32.127987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:32.114925Z","title":"Tender: Accelerating large language models via tensor decomposition and runtime requantization,","venue":null,"work_id":"0888a680-abce-4aa4-9a10-e84b42af2e59","year":2024},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.805468Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:cea19895f66133e9b7c6a2861c8b742550709cb5a5b5029f5801f3cd1aa59421","observation_id":"1f446c27-ee3b-44c2-b0aa-87ce14dce278","resolution":{"observed_at":"2026-08-05T10:54:32.118081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:30.808079Z","title":"MX+: Pushing the limits of microscaling formats for efficient large language model serving,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.808079Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:5e926a703b1a999cae5db1e2c0c73160649ce7f434cd86d4da2248d30d0360a1","observation_id":"68b802df-f590-4a37-8d47-e15787d70166","resolution":{"observed_at":"2026-08-05T10:54:30.808079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:30.810712Z","title":"AWQ: Activation-aware weight quantization for on-device llm compression and acceleration,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.810712Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:ee0be549c333d8f7972a97e1b2c908e4d6339bb97ec7a8a05f601ad63a973850","observation_id":"9b42c4bc-c813-4322-9aeb-87e3d7147472","resolution":{"observed_at":"2026-08-05T10:54:30.810712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:30.813720Z","title":"Qserve: W4a8kv4 quantization and system co-design for efficient llm serving,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.813720Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:fba403bc2a4c84881985db8053893c4539476147cb750be2cdb3a85cccb64fe0","observation_id":"7d175522-191d-485b-864f-3e336d846344","resolution":{"observed_at":"2026-08-05T10:54:30.813720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19821","last_updated":"2024-12-15T22:18:20Z","snapshot_observed_at":"2026-08-18T00:25:54.134031Z","submitted_at":"2024-12-15T22:18:20Z","title":"Nanoscaling Floating-Point (NxFP): NanoMantissa, Adaptive Microexponents, and Code Recycling for Direct-Cast Compression of Large Language Models","version":1},"cited_work":{"arxiv_id":"2412.19821","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.19821","snapshot_observed_at":"2026-08-05T10:54:31.239932Z","title":"Nanoscaling Floating-Point (NxFP): NanoMantissa, Adaptive Microexponents, and Code Recycling for Direct-Cast Compression of Large Language Models","venue":"cs.AR","work_id":"7550d691-3612-4b78-a183-14f645f9ab0b","year":2024},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.816676Z"},"links":{"cited_paper":"/paper/2412.19821","citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:c65c6fbcdc8583f0ae99143e435cbd1a1a2d03fecf0db493f320d113e85148ed","observation_id":"fe303a0a-7967-48ef-bba0-6916b10b4dd8","resolution":{"observed_at":"2026-08-05T10:54:31.243463Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:30.820251Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.820251Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:9a8c9bcd7916522c48273317f82463d14ab6efc877f01bcedb201aac85109d3a","observation_id":"da2dd973-057b-4547-84f8-d408236063a4","resolution":{"observed_at":"2026-08-05T10:54:30.820251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:32.093079Z","title":"Pointer sentinel mixture models,","venue":null,"work_id":"5825a4e7-b655-49b0-904f-4d1c0a079869","year":2017},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.823013Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:93522c8d849013cdbace971e58213ca7f52a40b731e39a571e143574a2b484ae","observation_id":"dbf06264-3899-4c5b-ba41-699d6a484938","resolution":{"observed_at":"2026-08-05T10:54:32.095906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-05T10:54:30.825891Z","title":"The Llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.825891Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:5445a2d48c3d9a123dd5f0d8373e251b45428c790286119575ce7a990a663573","observation_id":"ce95d21e-1406-4669-98a4-0523f4c90fca","resolution":{"observed_at":"2026-08-05T10:54:30.825891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:32.083442Z","title":"Four MTIA Chips in Two Years: Scaling AI Experi- ences for Billions,","venue":null,"work_id":"79752b4f-ba82-4cf8-b694-b9b905dd3e11","year":2026},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.828823Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:d31742a1701aaa9f5f4d77336562a778b5b3df3c0b388783157ec0781e63e5d0","observation_id":"28354834-da05-47a8-a1f2-f1e269bb85d5","resolution":{"observed_at":"2026-08-05T10:54:32.086557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-13T17:08:54.114895Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08027","snapshot_observed_at":"2026-08-05T10:54:30.832174Z","title":"Recipes for pre- training llms with mxfp8,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.832174Z"},"links":{"cited_paper":"/paper/2506.08027","citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:57ede5bb63a93463426c66cf146f1c20db64606ab39fbd89507bff64b71e4f62","observation_id":"4524645d-eafa-4379-bd0b-c0b96d1facf0","resolution":{"observed_at":"2026-08-05T10:54:30.832174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:32.074123Z","title":"NVIDIA H100 Tensor Core GPU Datasheet,","venue":null,"work_id":"5988bbd6-9a03-43f8-97c2-894bd5166084","year":null},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.835513Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:bd94caca6d0d0b6144be1fba3c0a252015f5de71131be4a8d66d1ee90dfaf1a4","observation_id":"89dd0de1-3794-4a65-81dd-6b76de128c2f","resolution":{"observed_at":"2026-08-05T10:54:32.077146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:32.055140Z","title":"NVIDIA Blackwell Architecture Technical Brief,","venue":null,"work_id":"b1e2f860-6ab2-47a3-8c4c-b56f25ee54d8","year":2024},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.841679Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:a2131df1eed02d01c49116222242b8f4849f3987462e052a84b99b5a23330803","observation_id":"ede43b36-648a-4bc5-8422-66a65e77d04c","resolution":{"observed_at":"2026-08-05T10:54:32.058539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:32.044977Z","title":"OCP Microscaling Formats (MX) Specification,","venue":null,"work_id":"138875a2-315b-40f0-af86-4112f0df5c6e","year":2023},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.844766Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:bb932107e8224ce91a2d57a6117adeb069206479c84fb477c32963ac802535af","observation_id":"c378b2c6-7f03-425e-8096-0634641038ae","resolution":{"observed_at":"2026-08-05T10:54:32.048394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:32.034380Z","title":"OpenAI GPT-5 System Card,","venue":null,"work_id":"716beac0-e890-4ac2-8196-63e25f0f6910","year":2025},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.847687Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:e2261add64eab69623d75e46def9daf81bd18cf0205bdfe100e0e578e0bd0e9b","observation_id":"96f60da0-4c40-4a88-a26d-c01fe9b2c159","resolution":{"observed_at":"2026-08-05T10:54:32.037525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:30.850566Z","title":"Paszke, S","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.850566Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:0c12bbcd4307b55ca6c2cf8386532162d06ab75787b7739a6488fe9df907c4f5","observation_id":"9235f464-15d1-4964-82b4-eab6716076e7","resolution":{"observed_at":"2026-08-05T10:54:30.850566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:32.016253Z","title":"Scale-sim v3: A modular cycle-accurate systolic accelerator simulator for end-to-end system analysis,","venue":null,"work_id":"10c5bf2c-6e78-49d8-a0b1-72d40ea99e7b","year":2025},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.853377Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:767400e25ea1accfd50d41059122a4b77db2c0e2ba0bc2b3cc6a251d959387a5","observation_id":"026e5800-ad1d-4268-b9f8-e02e0ec0b35a","resolution":{"observed_at":"2026-08-05T10:54:32.019795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"5053.37309","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:31.207008Z","title":"Microscopiq: Accelerating foundational models through outlier-aware microscaling quantization,","venue":null,"work_id":"32b36db8-2539-4e16-acf4-6fdf7746edce","year":2025},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.856127Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:f5e1b3183732753c65377e5df787d1bd2efa1662e2599ab347665b7f704b5db1","observation_id":"6faf28f5-d8e9-49bf-8d03-f2d1878ab052","resolution":{"observed_at":"2026-08-05T10:54:31.211877Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-05T10:54:30.858903Z","title":"Gemma 2: Improving open language models at a practical size,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.858903Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:207da44cf7a60a787a23cfb9f5810f8b7e81ca290a54d28c368b639a97197e30","observation_id":"988dd783-6710-4168-9800-8fa23fba956c","resolution":{"observed_at":"2026-08-05T10:54:30.858903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:32.005525Z","title":"Pushing the limits of narrow precision inferencing at cloud scale with microsoft floating point,","venue":null,"work_id":"074e1fab-42da-40e1-8161-6d52a3dcbbfd","year":2020},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.862614Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:2cf93c0b93bb40a68941a60d6086c641be19acc4845b06c63198c570ff7b7d43","observation_id":"0d5b7539-4204-4fde-a6af-5cf1f3177c2b","resolution":{"observed_at":"2026-08-05T10:54:32.008859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-08-16T14:51:41.930241Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-08-05T10:54:30.865642Z","title":"Microscaling data formats for deep learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.865642Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:f81a72054e481b23812996cac7ffac1de5a241bde09dc0c6d3a3c629916994a0","observation_id":"f8149f9c-a0c1-4b1e-84be-2c3e9c5b26d4","resolution":{"observed_at":"2026-08-05T10:54:30.865642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:30.869033Z","title":"Winogrande: an adversarial winograd schema challenge at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.869033Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:d836f56dbd90d5d346fddc62d9fb6420dd4f66780a2f6eadf74906185d6e544c","observation_id":"d1b68ba9-8e7e-4d30-9af9-23f8051ab664","resolution":{"observed_at":"2026-08-05T10:54:30.869033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13137","last_updated":"2024-03-18T05:33:22Z","snapshot_observed_at":"2026-08-16T15:05:54.961547Z","submitted_at":"2023-08-25T02:28:35Z","title":"OmniQuant: Omnidirectionally Calibrated Quantization for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13137","snapshot_observed_at":"2026-08-05T10:54:30.872438Z","title":"Omniquant: Omnidirectionally calibrated quan- tization for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.872438Z"},"links":{"cited_paper":"/paper/2308.13137","citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:a2973aeafb3fdcec9d2c126fdd32e3567a887e02fd34b7e49a8269d9d6480d6d","observation_id":"3c3f1d7f-18c7-44ab-b77e-62787b4c2eaa","resolution":{"observed_at":"2026-08-05T10:54:30.872438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:31.994820Z","title":"Towards vqa models that can read,","venue":null,"work_id":"e47865d4-6fc3-4e84-af03-4071809f83d2","year":2019},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.876298Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:414574c0ff13d1182b6b90be86b471493b15594c68699e81e8e88babfbc730e6","observation_id":"c817380b-ca78-47b7-a649-d41cb3bb13ef","resolution":{"observed_at":"2026-08-05T10:54:31.998117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:31.984538Z","title":"Commonsenseqa: A question answering challenge targeting commonsense knowledge,","venue":null,"work_id":"6cc20448-9d0c-4cd8-b6a2-ef633e806c7a","year":null},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.879465Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:0e3f5b6eb22c0babf623f478833714d625822e29669031ee5991212807b901dd","observation_id":"ea0eed34-34b1-4b9b-b1c9-15b74de6e25a","resolution":{"observed_at":"2026-08-05T10:54:31.988088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:31.973979Z","title":"A microscaling multi-mode gain-cell computing-in- memory macro for advanced ai edge device,","venue":null,"work_id":"6dade61b-3e63-4c80-ae21-392d9d976de5","year":2026},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.885660Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:9917b3f30a827b90c17eea9e8981c6e7e2e819ccdcdbe2042d143ee40e7011cc","observation_id":"92f0e344-78fd-40aa-ac6a-384dabf9c983","resolution":{"observed_at":"2026-08-05T10:54:31.977638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:31.963075Z","title":"Quip#: Even better llm quantization with hadamard incoherence and lattice codebooks,","venue":null,"work_id":"46720f8f-d654-4f38-9de5-fe8b1d9e76b1","year":2024},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.888361Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:4d46a4bea1784170ba2ac57e2d31de312a72edc298fe7d9a89b2ed086b19ee3d","observation_id":"0f9c46a0-8a74-49b2-ad29-c854ada80fd8","resolution":{"observed_at":"2026-08-05T10:54:31.966233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:31.953245Z","title":"30.1 a 28nm 127.54tflops/w mxfp6 and 117.42tflops/w mxfp8 compute-in-memory macro with adaptive- preserved-bit-width and serial-dual-bit-sliding schemes,","venue":null,"work_id":"eb232c40-143c-4a1e-af2a-fddb05199126","year":2026},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.890967Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:e4b9bf1e4aa93e9167890a7ed83b5f954867741ee659bd1efb0a44f43945c148","observation_id":"c8c0dbc9-5fda-4415-a49b-b34e1914798e","resolution":{"observed_at":"2026-08-05T10:54:31.956423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:30.894125Z","title":"Accelergy: An architecture- level energy estimation methodology for accelerator designs,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.894125Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:7908186702e9cfb04cdce2c5173c9708dafa59b1c5866a5fa5a0524c41e56d6c","observation_id":"e41a0196-9109-443b-97d9-14fa97783159","resolution":{"observed_at":"2026-08-05T10:54:30.894125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:31.936373Z","title":"SmoothQuant: Accurate and efficient post-training quantization for large language models,","venue":null,"work_id":"d7c20f69-ed08-4e8e-9019-9504f6b36284","year":2023},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.896961Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:17c41b24c376df96893ecb9e1eef37222b1f109baf44fd566146c7ad7863c429","observation_id":"63e2bea2-e0a6-42cc-b28d-a2181327298e","resolution":{"observed_at":"2026-08-05T10:54:31.939793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"custom-ai-accelerat/4229118","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:31.088200Z","title":"Inside Maia 100: Revolutionizing AI Workloads with Microsoft’s Custom AI Accelerator,","venue":null,"work_id":"81a5ef3f-a0e9-4f0e-ad4a-04c7d611f766","year":2024},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.899617Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:0c2b9199992fb6942ea4b3460cf642dc0985325421d25daa9e7f61396b6cfdf7","observation_id":"14e1b5ac-698f-466e-81f7-f6a81c81dbbc","resolution":{"observed_at":"2026-08-05T10:54:31.096960Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:31.925472Z","title":"An empirical study of microscaling formats for low-precision llm training,","venue":null,"work_id":"f6d2d92c-5080-426d-90ad-f7fb47127f59","year":2025},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.902228Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:5589a0db22690352c78ef1a9a8fec263f0f74119b2fc483779a2846ed431e3f1","observation_id":"ce701b2b-ff15-4e2e-ac69-3e6a1a2eefa3","resolution":{"observed_at":"2026-08-05T10:54:31.928622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T10:54:30.904865Z","title":"Qwen2.5 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.904865Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:d057fc211535a521789358e727374b7ec4e6f25b12f709fa8659ed0c585c77b9","observation_id":"a94af574-4fab-41b3-be30-29247e664c8b","resolution":{"observed_at":"2026-08-05T10:54:30.904865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:31.915913Z","title":"ZeroQuant: efficient and affordable post-training quantization for large- scale transformers,","venue":null,"work_id":"6607a765-93aa-4519-ad0f-624f16b4ead7","year":2022},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.907783Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:4ff7fce086f3fdb21ccb0458452dc864b9662335ec9f5df11c0313f30ca26f64","observation_id":"e4480135-ffae-484b-a485-d5b94840eeef","resolution":{"observed_at":"2026-08-05T10:54:31.919045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:31.905713Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi,","venue":null,"work_id":"a225cb72-0ba6-4e18-96c9-2b5dc57a4da6","year":2024},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.910696Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:52fef827408b2ba4a951ac7d069b4ff1b5a3cee386d384b8e172e2e4b50cab24","observation_id":"c371b86c-9450-4eaa-aa06-56caf514d875","resolution":{"observed_at":"2026-08-05T10:54:31.909352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:31.896194Z","title":"Hellaswag: Can a machine really finish your sentence?","venue":null,"work_id":"9247d8bf-22bc-40d5-bff9-27f5fabf4d55","year":2019},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.913180Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:f3e46dc007ce564b74e4451b82b9d7d529b5b6a08857f16eb32e8a5f48203315","observation_id":"a5732eb2-2ab1-4f99-a65c-9ab9668675d8","resolution":{"observed_at":"2026-08-05T10:54:31.899313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:30.916143Z","title":"Sageattention3: Microscaling fp4 attention for inference and an exploration of 8-bit training,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.916143Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:ac150866702b27c0d17a46266cd4eaaac1247059f4ee4e6e89812784615b538b","observation_id":"2fedea90-72f7-44d1-b563-6394105f8d4b","resolution":{"observed_at":"2026-08-05T10:54:30.916143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:31.886063Z","title":"Atom: Low-bit quantization for efficient and accurate llm serving,","venue":null,"work_id":"047e2aa0-dc5f-47b1-8bef-f5ef7f4bf538","year":2024},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.919036Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:ab80df7cfd807368a54f6fa03b7061d6795330b1bbe3b2ed781fc253b393fceb","observation_id":"e0425dbc-440e-4ee4-84bc-020d68b61a3d","resolution":{"observed_at":"2026-08-05T10:54:31.889954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00937","last_updated":"2019-03-15T18:02:58Z","snapshot_observed_at":"2026-08-14T18:05:06.623407Z","submitted_at":"2018-11-02T15:34:29Z","title":"CommonsenseQA: A Question Answering Challenge Targeting Commonsense Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00937","snapshot_observed_at":"2026-08-05T10:54:30.882544Z","title":"Available: https://arxiv.org/abs/1811.00937","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.882544Z"},"links":{"cited_paper":"/paper/1811.00937","citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:60bf06387684e40fd66f42438ee6ed36b7299f81b3587c7ecb64e8906c948f4c","observation_id":"ebe5e4cd-69d1-4586-a98f-f71b09d188b4","resolution":{"observed_at":"2026-08-05T10:54:30.882544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:32.064757Z","title":"Available: https://resources.nvidia.com/en-us-gpu- resources/h100-datasheet-24306","venue":null,"work_id":"7da5b304-3121-4ec7-bad9-1a47c78a24f1","year":null},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.838691Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:1ab8a80bb2044bacd32384c578533efba6a9c046599a44ea663f5032087fcfce","observation_id":"2d2a2b2c-93a8-4238-84da-dbd2ecbd8d5d","resolution":{"observed_at":"2026-08-05T10:54:32.068016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","latest_version":1,"primary_category":"cs.AR","snapshot_observed_at":"2026-08-18T06:24:20.935343Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":31,"verified_exact":2,"verified_fuzzy":34},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 0 inbound Pith citation observations for arXiv:2608.03867."}