♥ 3
⚡ 0
Ollama y LLMs Self-Hosted · Lección 21

¿Qué factor tiene un impacto directo en la velocidad de generación de texto (tokens por segundo) al ejecutar un modelo localmente con Ollama?

El tamaño del modelo (número de parámetros) y el nivel de cuantización usado, ya que modelos más grandes o con mayor precisión requieren más cómputo por cada token generado
El color del tema visual configurado en alguna interfaz gráfica que consuma la API de Ollama
El número de commits en el repositorio de la aplicación que consume la API de Ollama
La cantidad de tests unitarios ejecutados en el pipeline de CI de la aplicación cliente
Ollama y LLMs Self-Hosted · Lección 21

Completa el código

Un modelo más pequeño (menos parámetros) genera texto generalmente más
Ollama y LLMs Self-Hosted · Lección 21

¿Por qué un modelo de 7 mil millones de parámetros genera texto más rápido que un modelo de 70 mil millones de parámetros en el mismo hardware exacto?

✓

¡Lección completada!

Optimización de rendimiento de inferencia local

0
XP ganado
3
Vidas restantes