♥ 3
⚡ 0
LLMOps en Producción · Lección 22

¿Qué tradeoff se acepta al aplicar cuantización (reducir la precisión numérica de los pesos) a un modelo LLM para reducir su tamaño y costo de inferencia?

Se reduce el uso de memoria y se acelera la inferencia, a cambio de una posible pequeña pérdida de calidad en las respuestas generadas, que suele ser aceptable en muchos casos de uso
La cuantización siempre mejora la calidad de las respuestas del modelo sin ningún costo asociado
Solo puede aplicarse a modelos que ya están cuantizados previamente, no a modelos con precisión completa
Elimina por completo la necesidad de tener cualquier tipo de GPU para la inferencia
LLMOps en Producción · Lección 22

Completa el código

Un modelo cuantizado a 4 bits ocupa significativamente menos
LLMOps en Producción · Lección 22

¿Por qué una aplicación con un caso de uso tolerante a pequeñas imprecisiones (como generación de resúmenes casuales) podría beneficiarse más de la cuantización que una aplicación de diagnóstico médico crítico?

✓

¡Lección completada!

Cuantización de modelos LLM

0
XP ganado
3
Vidas restantes