LLMOps en Producción · Lección 21
¿Qué optimización clave introduce un motor de inferencia especializado como vLLM al servir modelos LLM, comparado con un servidor de inferencia genérico sin optimizaciones específicas?
Técnicas como PagedAttention que gestionan de forma más eficiente la memoria usada durante la generación de texto, permitiendo atender más peticiones concurrentes con el mismo hardware
vLLM elimina por completo la necesidad de tener GPUs reales para servir el modelo
Solo funciona con modelos de menos de 1 millón de parámetros en total
Requiere reescribir completamente la arquitectura interna del modelo LLM para poder usarse
LLMOps en Producción · Lección 21
Completa el código
La técnica que optimiza el uso de memoria de la caché de atención se llama Paged
Revisa: se llama PagedAttention.
LLMOps en Producción · Lección 21
¿Por qué poder atender más peticiones concurrentes con el mismo hardware GPU reduce directamente el costo por petición de una aplicación LLM de alto volumen?
Pista: si el mismo hardware costoso de GPU puede atender un número mayor de peticiones simultáneas gracias a un uso más eficiente de la memoria, el costo fijo de esa GPU se distribuye entre más peticiones, reduciendo el costo promedio por cada respuesta individual generada.
✓
¡Lección completada!
Serving de LLMs — vLLM y motores de inferencia
0
XP ganado
3
Vidas restantes