LLMOps en Producción · Lección 24
¿Qué tipo de peticiones a un LLM son buenas candidatas para cachear la respuesta, evitando una nueva llamada costosa al modelo?
Peticiones con el mismo prompt exacto (o muy similar) que se repiten con frecuencia, donde la respuesta esperada no cambia significativamente entre una llamada y otra
Absolutamente todas las peticiones sin ninguna excepción, sin importar si son únicas o repetidas
Solo peticiones que involucren datos aleatorios generados en tiempo real, ningún otro tipo
El caching de respuestas de LLM es técnicamente imposible de implementar bajo cualquier circunstancia
LLMOps en Producción · Lección 24
Completa el código
Cachear una respuesta evita pagar el costo de una nueva llamada al
Revisa: evita pagar el costo de una nueva llamada al modelo.
LLMOps en Producción · Lección 24
¿Por qué cachear la respuesta a una pregunta frecuente idéntica (como '¿cuál es el horario de atención?') es una optimización de costo mucho más efectiva que cachear respuestas a preguntas altamente personalizadas y únicas por usuario?
Pista: una pregunta que se repite frecuentemente y de forma idéntica entre muchos usuarios distintos se beneficia enormemente de servir la misma respuesta cacheada una y otra vez, mientras una pregunta única y personalizada por cada usuario nunca tendría una coincidencia previa en la caché que aprovechar.
✓
¡Lección completada!
Caching de respuestas y prompts
0
XP ganado
3
Vidas restantes