Ollama y LLMs Self-Hosted · Lección 22
¿Qué permite hacer la técnica de 'offloading' de capas entre CPU y GPU cuando un modelo es demasiado grande para caber completamente en la memoria de la GPU disponible?
Distribuye algunas capas del modelo para ejecutarse en la GPU (más rápida) y otras en la CPU (con más memoria disponible pero más lenta), permitiendo ejecutar modelos que de otra forma no cabrían completamente en la GPU
El offloading elimina por completo la necesidad de tener una GPU física presente en el sistema
Solo funciona si el modelo cabe completamente en la memoria de la CPU sin necesitar ninguna GPU en absoluto
Requiere que el modelo se divida manualmente por el usuario en archivos completamente separados antes de poder ejecutarse
Ollama y LLMs Self-Hosted · Lección 22
Completa el código
El offloading permite ejecutar modelos más grandes de lo que cabría solo en la memoria de la
Revisa: permite ejecutar modelos más grandes de lo que cabría solo en la memoria de la GPU.
Ollama y LLMs Self-Hosted · Lección 22
¿Por qué el offloading, aunque permite ejecutar un modelo más grande de lo que la GPU sola podría manejar, generalmente resulta en una velocidad de generación más lenta que si el modelo completo cupiera en la GPU?
Pista: las capas que se ejecutan en la CPU (más lenta que la GPU para este tipo de cómputo) introducen un cuello de botella real en el proceso general; aunque el offloading hace posible ejecutar un modelo que de otra forma no cabría, el resultado es más lento que si todo el modelo pudiera procesarse completamente en la GPU más rápida, representando un tradeoff real entre viabilidad y velocidad.
✓
¡Lección completada!
Offloading de capas entre CPU y GPU
0
XP ganado
3
Vidas restantes