Ollama y LLMs Self-Hosted · Lección 21
¿Qué factor tiene un impacto directo en la velocidad de generación de texto (tokens por segundo) al ejecutar un modelo localmente con Ollama?
El tamaño del modelo (número de parámetros) y el nivel de cuantización usado, ya que modelos más grandes o con mayor precisión requieren más cómputo por cada token generado
El color del tema visual configurado en alguna interfaz gráfica que consuma la API de Ollama
El número de commits en el repositorio de la aplicación que consume la API de Ollama
La cantidad de tests unitarios ejecutados en el pipeline de CI de la aplicación cliente
Ollama y LLMs Self-Hosted · Lección 21
Completa el código
Un modelo más pequeño (menos parámetros) genera texto generalmente más
Revisa: genera texto generalmente más rápido, a costa potencialmente de menor calidad.
Ollama y LLMs Self-Hosted · Lección 21
¿Por qué un modelo de 7 mil millones de parámetros genera texto más rápido que un modelo de 70 mil millones de parámetros en el mismo hardware exacto?
Pista: un modelo con más parámetros requiere realizar más operaciones matemáticas para generar cada token individual de la respuesta; en el mismo hardware exacto, procesar esa carga de cómputo mayor del modelo de 70B naturalmente toma más tiempo por token que la carga menor que requiere el modelo más pequeño de 7B.
✓
¡Lección completada!
Optimización de rendimiento de inferencia local
0
XP ganado
3
Vidas restantes