AI Architecture & Systems

Quantization: Algorithms and Numerical Methods

6.20.1PTQ, QAT, and Quantization-Aware Distillation#

6.20.2Symmetric/Asymmetric and Uniform/Non-Uniform Quantization#

6.20.3Per-Tensor, Per-Channel, Per-Group, and Per-Token Scaling#

6.20.4Weight, Activation, and KV Cache Quantization#

6.20.5GPTQ, AWQ, SmoothQuant, and Error Compensation#

6.20.6Rotation-Based Quantization: QuaRot and SpinQuant#

6.20.7Outliers, Clipping, Calibration, and Sensitivity Analysis#

6.20.8Mixed Precision, Block Scaling, and Precision Budgets#