Ollama y LLMs Self-Hosted · Lección 18
¿Qué consideración especial es importante al desplegar Ollama dentro de un cluster de Kubernetes con nodos que tienen GPU disponible?
Configurar correctamente la solicitud de recursos GPU en el manifiesto del Pod (como nvidia.com/gpu), además de un volumen persistente para los modelos descargados
Ollama no puede desplegarse bajo ninguna circunstancia dentro de un cluster de Kubernetes
Solo puede desplegarse si el cluster de Kubernetes tiene exactamente un único nodo total
Elimina por completo la necesidad de tener un volumen persistente configurado para los modelos
Ollama y LLMs Self-Hosted · Lección 18
Completa el código
La GPU se solicita en el Pod mediante el recurso extendido
Revisa: se solicita mediante el recurso extendido nvidia.com/gpu.
Ollama y LLMs Self-Hosted · Lección 18
¿Por qué desplegar Ollama dentro de Kubernetes (en vez de un servidor único fuera del cluster) facilita integrarlo con el resto de la infraestructura y aplicaciones que ya corren en ese mismo cluster?
Pista: al vivir dentro del mismo cluster de Kubernetes, otras aplicaciones que también corren ahí pueden comunicarse con Ollama de forma directa e interna, aprovechando además toda la infraestructura de gestión, escalado y monitoreo que el cluster ya provee, en vez de operar Ollama como un sistema completamente aislado y separado.
✓
¡Lección completada!
Ollama en Kubernetes
0
XP ganado
3
Vidas restantes