♥ 3
⚡ 0
LLMOps en Producción · Lección 23

¿Qué ventaja de experiencia de usuario ofrece transmitir la respuesta de un LLM token por token (streaming) en vez de esperar a que la respuesta completa esté lista?

El usuario empieza a ver texto apareciendo casi de inmediato, reduciendo la percepción de espera aunque el tiempo total de generación sea el mismo
El streaming reduce el tiempo total real que tarda el modelo en generar la respuesta completa
Solo funciona si la respuesta del modelo tiene menos de 10 tokens en total
Elimina por completo la necesidad de tener cualquier tipo de indicador de carga en la interfaz
LLMOps en Producción · Lección 23

Completa el código

El streaming envía la respuesta al cliente token por
LLMOps en Producción · Lección 23

¿Por qué ver texto apareciendo progresivamente (aunque el tiempo total sea igual) se percibe como más rápido por el usuario que una pantalla en blanco seguida de la respuesta completa de golpe?

✓

¡Lección completada!

Streaming de respuestas — UX y arquitectura

0
XP ganado
3
Vidas restantes