A calibration or training process chooses scales and zero points that map continuous values into a smaller numeric range. Lower precision reduces memory and can speed computation, but approximation error may affect quality.
Quantization represents model weights or activations with fewer bits than their original training precision.
A calibration or training process chooses scales and zero points that map continuous values into a smaller numeric range. Lower precision reduces memory and can speed computation, but approximation error may affect quality.