Python para IA · Lección 24
¿Qué patrón de código sigue típicamente el consumo de una respuesta en modo streaming desde una API de LLM en Python, en vez de esperar a recibir la respuesta completa de una sola vez?
Se itera sobre un flujo de fragmentos (chunks) que la API va enviando progresivamente a medida que el modelo genera la respuesta, procesando o mostrando cada fragmento tan pronto como llega, en vez de acumular toda la respuesta antes de hacer algo con ella
El streaming en Python requiere obligatoriamente usar programación asíncrona, siendo técnicamente imposible implementar streaming con código síncrono tradicional
Solo es relevante el modo streaming si la respuesta completa del modelo tiene exactamente un único token en total generado
Consumir una respuesta en modo streaming reduce el tiempo total real que tarda el modelo en terminar de generar la respuesta completa
Python para IA · Lección 24
Completa el código
Se itera sobre un flujo de fragmentos que la API envía
Revisa: se itera sobre un flujo de fragmentos que la API envía progresivamente.
Python para IA · Lección 24
¿Por qué procesar cada fragmento de la respuesta tan pronto como llega (en vez de esperar a acumular toda la respuesta completa) permite mostrar contenido al usuario final casi de inmediato en una aplicación de chat?
Pista: si el código de la aplicación itera sobre cada fragmento de texto tan pronto como llega y lo muestra de inmediato en la interfaz, el usuario ve contenido apareciendo progresivamente; si en cambio el código esperara a acumular toda la respuesta completa antes de mostrar nada, el usuario no vería ningún contenido hasta que el modelo terminara de generar la respuesta completa, perdiendo esa experiencia de aparición progresiva del texto.
✓
¡Lección completada!
Streaming de respuestas con Python
0
XP ganado
3
Vidas restantes