♥ 3
⚡ 0
Ollama y LLMs Self-Hosted · Lección 12

¿Qué ventaja de experiencia de usuario ofrece consumir la API de Ollama en modo streaming, en vez de esperar la respuesta completa de una sola vez?

El cliente recibe fragmentos de la respuesta a medida que el modelo los va generando, permitiendo mostrar texto progresivamente en vez de una espera silenciosa hasta que toda la respuesta esté lista
El streaming reduce el tiempo total real que tarda el modelo en generar la respuesta completa
Solo funciona si la respuesta del modelo tiene menos de 10 tokens en total
Elimina por completo la necesidad de tener cualquier tipo de indicador de progreso en la interfaz del cliente
Ollama y LLMs Self-Hosted · Lección 12

Completa el código

En el modo streaming, cada fragmento se envía como un objeto JSON separado, línea por
Ollama y LLMs Self-Hosted · Lección 12

¿Por qué ver texto apareciendo progresivamente (aunque el tiempo total sea igual) mejora la experiencia percibida por el usuario en una aplicación de chat que consume Ollama, comparado con una pantalla en blanco esperando la respuesta completa?

✓

¡Lección completada!

Streaming de respuestas con la API

0
XP ganado
3
Vidas restantes