Ollama y LLMs Self-Hosted · Lección 04
¿Qué ventaja de rendimiento ofrece ejecutar un modelo con Ollama usando GPU, comparado con ejecutarlo exclusivamente en CPU?
Una GPU puede procesar las operaciones matriciales masivas de la inferencia mucho más rápido que una CPU, resultando en una generación de texto significativamente más veloz
Ollama no puede ejecutarse bajo ninguna circunstancia sin una GPU física presente en el sistema
La GPU solo mejora la calidad de las respuestas generadas, sin ningún efecto real en la velocidad
Usar CPU en vez de GPU siempre produce resultados de mayor calidad en las respuestas del modelo
Ollama y LLMs Self-Hosted · Lección 04
Completa el código
La velocidad de generación de texto se mide en tokens por
Revisa: se mide en tokens por segundo.
Ollama y LLMs Self-Hosted · Lección 04
¿Por qué un modelo que tarda varios segundos por respuesta en CPU podría responder casi instantáneamente al ejecutarse en una GPU compatible, para el mismo modelo exacto?
Pista: las GPUs están diseñadas específicamente para realizar en paralelo las operaciones matriciales masivas que requiere la inferencia de un LLM, mientras una CPU procesa esas mismas operaciones de forma mucho más secuencial y limitada, resultando en una diferencia de velocidad significativa para exactamente la misma carga de trabajo.
✓
¡Lección completada!
Requisitos de hardware — CPU vs GPU
0
XP ganado
3
Vidas restantes