♥ 3
⚡ 0
Ollama y LLMs Self-Hosted · Lección 22

¿Qué permite hacer la técnica de 'offloading' de capas entre CPU y GPU cuando un modelo es demasiado grande para caber completamente en la memoria de la GPU disponible?

Distribuye algunas capas del modelo para ejecutarse en la GPU (más rápida) y otras en la CPU (con más memoria disponible pero más lenta), permitiendo ejecutar modelos que de otra forma no cabrían completamente en la GPU
El offloading elimina por completo la necesidad de tener una GPU física presente en el sistema
Solo funciona si el modelo cabe completamente en la memoria de la CPU sin necesitar ninguna GPU en absoluto
Requiere que el modelo se divida manualmente por el usuario en archivos completamente separados antes de poder ejecutarse
Ollama y LLMs Self-Hosted · Lección 22

Completa el código

El offloading permite ejecutar modelos más grandes de lo que cabría solo en la memoria de la
Ollama y LLMs Self-Hosted · Lección 22

¿Por qué el offloading, aunque permite ejecutar un modelo más grande de lo que la GPU sola podría manejar, generalmente resulta en una velocidad de generación más lenta que si el modelo completo cupiera en la GPU?

✓

¡Lección completada!

Offloading de capas entre CPU y GPU

0
XP ganado
3
Vidas restantes