Ollama y LLMs Self-Hosted · Lección 03
¿Qué es el formato GGUF usado comúnmente por Ollama para distribuir modelos de lenguaje?
Un formato de archivo optimizado para almacenar modelos cuantizados de forma eficiente, diseñado específicamente para facilitar la inferencia rápida en hardware de consumo con recursos limitados
GGUF es un lenguaje de programación usado para escribir aplicaciones de inteligencia artificial
Solo puede usarse con modelos de un único tamaño específico, sin ninguna variación posible
Elimina por completo la necesidad de tener cualquier tipo de hardware de cómputo para ejecutar el modelo
Ollama y LLMs Self-Hosted · Lección 03
Completa el código
La cuantización reduce la precisión numérica de los pesos para ahorrar
Revisa: reduce la precisión numérica de los pesos para ahorrar memoria.
Ollama y LLMs Self-Hosted · Lección 03
¿Por qué un modelo cuantizado a 4 bits puede ejecutarse en una laptop con recursos limitados, mientras la versión de precisión completa del mismo modelo podría no caber en esa misma memoria disponible?
Pista: al representar cada peso del modelo con menos bits (por ejemplo, 4 bits en vez de 16 o 32), el tamaño total del modelo en memoria se reduce significativamente, permitiendo que quepa en el hardware limitado de una laptop, mientras la versión de precisión completa ocuparía mucho más espacio del disponible.
✓
¡Lección completada!
Modelos GGUF y cuantización
0
XP ganado
3
Vidas restantes