♥ 3
⚡ 0
Ollama y LLMs Self-Hosted · Lección 24

¿Qué desafío particular presenta atender múltiples peticiones concurrentes de distintos usuarios hacia la misma instancia de Ollama, comparado con atender una única petición a la vez?

La instancia debe gestionar y compartir de forma eficiente los recursos limitados de cómputo (especialmente GPU) entre las distintas peticiones simultáneas, lo que puede afectar la latencia individual de cada una si el volumen es alto
Ollama no puede atender bajo ninguna circunstancia más de una única petición a la vez en toda su arquitectura
Atender múltiples peticiones concurrentes siempre mejora la latencia individual de cada una sin ningún tradeoff real
Solo es relevante si todas las peticiones concurrentes provienen exactamente del mismo usuario único
Ollama y LLMs Self-Hosted · Lección 24

Completa el código

La capacidad de atender peticiones simultáneas está limitada por los recursos de
Ollama y LLMs Self-Hosted · Lección 24

¿Por qué agregar más réplicas de Ollama en distintos nodos con su propia GPU es una solución más efectiva para atender alto volumen de peticiones concurrentes que intentar forzar todo ese tráfico hacia una única instancia limitada?

✓

¡Lección completada!

Batch de peticiones concurrentes

0
XP ganado
3
Vidas restantes