LLMOps en Producción · Lección 22
¿Qué tradeoff se acepta al aplicar cuantización (reducir la precisión numérica de los pesos) a un modelo LLM para reducir su tamaño y costo de inferencia?
Se reduce el uso de memoria y se acelera la inferencia, a cambio de una posible pequeña pérdida de calidad en las respuestas generadas, que suele ser aceptable en muchos casos de uso
La cuantización siempre mejora la calidad de las respuestas del modelo sin ningún costo asociado
Solo puede aplicarse a modelos que ya están cuantizados previamente, no a modelos con precisión completa
Elimina por completo la necesidad de tener cualquier tipo de GPU para la inferencia
LLMOps en Producción · Lección 22
Completa el código
Un modelo cuantizado a 4 bits ocupa significativamente menos
Revisa: ocupa significativamente menos memoria que su versión de precisión completa.
LLMOps en Producción · Lección 22
¿Por qué una aplicación con un caso de uso tolerante a pequeñas imprecisiones (como generación de resúmenes casuales) podría beneficiarse más de la cuantización que una aplicación de diagnóstico médico crítico?
Pista: en un caso de uso donde una pequeña imprecisión ocasional tiene consecuencias mínimas, el ahorro de costo y velocidad de la cuantización compensa claramente ese riesgo menor; en un caso crítico donde un error podría tener consecuencias graves, ese mismo tradeoff podría no ser aceptable.
✓
¡Lección completada!
Cuantización de modelos LLM
0
XP ganado
3
Vidas restantes