LLMOps en Producción · Lección 23
¿Qué ventaja de experiencia de usuario ofrece transmitir la respuesta de un LLM token por token (streaming) en vez de esperar a que la respuesta completa esté lista?
El usuario empieza a ver texto apareciendo casi de inmediato, reduciendo la percepción de espera aunque el tiempo total de generación sea el mismo
El streaming reduce el tiempo total real que tarda el modelo en generar la respuesta completa
Solo funciona si la respuesta del modelo tiene menos de 10 tokens en total
Elimina por completo la necesidad de tener cualquier tipo de indicador de carga en la interfaz
LLMOps en Producción · Lección 23
Completa el código
El streaming envía la respuesta al cliente token por
Revisa: envía la respuesta al cliente token por token, a medida que se genera.
LLMOps en Producción · Lección 23
¿Por qué ver texto apareciendo progresivamente (aunque el tiempo total sea igual) se percibe como más rápido por el usuario que una pantalla en blanco seguida de la respuesta completa de golpe?
Pista: ver contenido apareciendo de inmediato confirma al usuario que el sistema está funcionando activamente y da una sensación de progreso continuo, mientras una pantalla en blanco sin ninguna señal genera incertidumbre sobre si la aplicación está realmente procesando algo, aunque el tiempo real de espera total sea idéntico.
✓
¡Lección completada!
Streaming de respuestas — UX y arquitectura
0
XP ganado
3
Vidas restantes