Curso 5 · Unidad 3
IA distribuida
Forma parte de Nivel avanzado (opcional): especializaciones
- 7 lecciones
- ≈ 21 h de estudio
- Nivel: avanzado
Temas que cubre
- Sistemas distribuidos
- Paralelismo de datos
- Paralelismo de modelo
- Entrenamiento distribuido
- Inferencia distribuida
- Tolerancia a fallos
- Orquestación
Lecciones de la unidad
- Paralelismo de datos y all-reduce 70 min
Replicar el modelo en N GPUs, repartir el batch y promediar gradientes con un all-reduce en anillo para entrenar como si tuvieras una sola GPU gigante. - Sharding de modelo y optimizador (ZeRO y FSDP) 70 min
Dejar de guardar N copias de todo, repartir estados del optimizador, gradientes y parámetros entre GPUs, y calcular cuánta memoria necesita cada una. - Tolerancia a fallos, checkpoints y reanudación 70 min
En un clúster grande algo falla cada día. Aprende a guardar un checkpoint que permita reanudar exactamente donde lo dejaste y a elegir cada cuánto guardarlo. - Paralelismo tensorial a fondo — el bloque Transformer completo 80 min
De partir una matmul a partir un Transformer entero — atención por cabezas, los operadores f y g del backward, paralelismo de secuencia y la entropía cruzada con el vocabulario repartido. - Planificaciones de pipeline — GPipe, 1F1B e intercalada 70 min
El pipeline con forward y backward de verdad — por qué GPipe y 1F1B tardan lo mismo pero no gastan la misma memoria, cómo se calcula la burbuja y qué ganan las planificaciones intercaladas. - Precisión mixta, escalado de la pérdida y solapar la comunicación 75 min
Por qué se entrena en fp16/bf16 con copia maestra en fp32, cómo el escalado dinámico de la pérdida rescata los gradientes diminutos, y cómo DDP agrupa gradientes en buckets para comunicar mientras el backward sigue calculando. - Inferencia distribuida — servir un modelo que no cabe en una GPU 70 min
Cómo se sirve un LLM repartido entre varias GPUs - paralelismo tensorial y de pipeline en el decode, reparto de la KV cache por cabezas y por capas, réplicas y enrutado, y cómo elegir la configuración que da más throughput sin romper la latencia prometida.
Requisitos previos
Antes de esta unidad conviene haber hecho:
- Rendimiento de LLMs (Curso 5 · Unidad 2)
Las explicaciones completas, los ejercicios con corrección automática, los exámenes y los proyectos están dentro de la academia.
Cada lección que completes te da 10 yang, la moneda de la academia, y cada examen de unidad aprobado, 50.
¿Empezamos?
Crea tu cuenta y activa tu suscripción: tendrás todo el temario desde el primer día.