A wafer-scale, FP4-only inference architecture is projected to deliver 1.5 zettaFLOPS in one rack, about 1,000x beyond GPU racks, if its unverified engineering assumptions hold.
Title resolution pending
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.DC 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
ZettaLith: An Architectural Exploration of Extreme-Scale AI Inference Acceleration
A wafer-scale, FP4-only inference architecture is projected to deliver 1.5 zettaFLOPS in one rack, about 1,000x beyond GPU racks, if its unverified engineering assumptions hold.