♥ 3
⚡ 0
Kubeflow en Producción · Lección 17

¿Qué ventaja de rendimiento busca lograr el entrenamiento distribuido de un modelo usando múltiples Pods worker coordinados, en vez de entrenar en un único Pod?

Reducir el tiempo total de entrenamiento al paralelizar el cómputo entre múltiples nodos, especialmente valioso para modelos grandes o datasets masivos
El entrenamiento distribuido siempre reduce el uso total de recursos de cómputo del cluster completo
Solo tiene sentido si el dataset de entrenamiento es menor a 1MB de tamaño total
Elimina por completo la necesidad de tener GPUs o cómputo real para el entrenamiento
Kubeflow en Producción · Lección 17

Completa el código

Cada worker procesa un subconjunto distinto de los datos de forma
Kubeflow en Producción · Lección 17

¿Por qué entrenar un modelo muy grande en un único Pod podría no ser viable si el modelo o el dataset excede la memoria disponible en una sola máquina?

✓

¡Lección completada!

Entrenamiento distribuido con PyTorchJob

0
XP ganado
3
Vidas restantes