♥ 3
⚡ 0
Ollama y LLMs Self-Hosted · Lección 20

¿Qué estrategia se usa típicamente para escalar la capacidad de servir peticiones cuando una única instancia de Ollama no da abasto con el volumen de tráfico?

Desplegar múltiples réplicas de Ollama (potencialmente en distintos nodos con su propia GPU) detrás de un balanceador de carga que distribuya las peticiones entrantes entre ellas
Es técnicamente imposible ejecutar más de una única instancia de Ollama simultáneamente en cualquier circunstancia
Solo se puede escalar aumentando la memoria de una única instancia existente, sin ninguna otra estrategia posible
El balanceo de carga entre instancias de Ollama elimina por completo la necesidad de tener GPUs reales en cada nodo
Ollama y LLMs Self-Hosted · Lección 20

Completa el código

Un balanceador de carga distribuye las peticiones entrantes entre las réplicas
Ollama y LLMs Self-Hosted · Lección 20

¿Por qué escalar horizontalmente con múltiples réplicas de Ollama en distintos nodos permite atender más peticiones concurrentes que intentar forzar toda la carga hacia una única instancia sobrecargada?

✓

¡Lección completada!

Escalado de Ollama — múltiples réplicas

0
XP ganado
3
Vidas restantes