Formato numérico de entero con signo de 8 bits, capaz de representar valores de -128 a 127. En el contexto de la inteligencia artificial es el tipo de dato más habitual para la inferencia en una NPU. Los modelos se entrenan con números en coma flotante de 16 o 32 bits (FP16, FP32) y luego se cuantizan a INT8, un proceso que reduce el tamaño del modelo y el consumo de memoria, y acelera los cálculos con una pérdida de precisión mínima. Por eso las cifras de rendimiento de las NPU, medidas en TOPS, suelen indicarse precisamente en INT8.



