Ollama y LLMs Self-Hosted · Lección 24
¿Qué desafío particular presenta atender múltiples peticiones concurrentes de distintos usuarios hacia la misma instancia de Ollama, comparado con atender una única petición a la vez?
La instancia debe gestionar y compartir de forma eficiente los recursos limitados de cómputo (especialmente GPU) entre las distintas peticiones simultáneas, lo que puede afectar la latencia individual de cada una si el volumen es alto
Ollama no puede atender bajo ninguna circunstancia más de una única petición a la vez en toda su arquitectura
Atender múltiples peticiones concurrentes siempre mejora la latencia individual de cada una sin ningún tradeoff real
Solo es relevante si todas las peticiones concurrentes provienen exactamente del mismo usuario único
Ollama y LLMs Self-Hosted · Lección 24
Completa el código
La capacidad de atender peticiones simultáneas está limitada por los recursos de
Revisa: está limitada por los recursos de hardware disponibles, especialmente GPU.
Ollama y LLMs Self-Hosted · Lección 24
¿Por qué agregar más réplicas de Ollama en distintos nodos con su propia GPU es una solución más efectiva para atender alto volumen de peticiones concurrentes que intentar forzar todo ese tráfico hacia una única instancia limitada?
Pista: una única instancia de Ollama tiene un límite real de capacidad de cómputo (GPU) que debe compartir entre todas las peticiones concurrentes que recibe, degradando potencialmente la latencia de cada una si el volumen es alto; distribuir esa carga entre múltiples réplicas con su propio hardware dedicado permite atender un volumen mucho mayor sin ese mismo nivel de degradación por recurso compartido.
✓
¡Lección completada!
Batch de peticiones concurrentes
0
XP ganado
3
Vidas restantes