Marsof Academy
Curso 5 · Unidad 3

IA distribuida

Forma parte de Nivel avanzado (opcional): especializaciones

  • 7 lecciones
  • ≈ 21 h de estudio
  • Nivel: avanzado

Temas que cubre

  • Sistemas distribuidos
  • Paralelismo de datos
  • Paralelismo de modelo
  • Entrenamiento distribuido
  • Inferencia distribuida
  • Tolerancia a fallos
  • Orquestación

Lecciones de la unidad

  1. Paralelismo de datos y all-reduce 70 min
    Replicar el modelo en N GPUs, repartir el batch y promediar gradientes con un all-reduce en anillo para entrenar como si tuvieras una sola GPU gigante.
  2. Sharding de modelo y optimizador (ZeRO y FSDP) 70 min
    Dejar de guardar N copias de todo, repartir estados del optimizador, gradientes y parámetros entre GPUs, y calcular cuánta memoria necesita cada una.
  3. Tolerancia a fallos, checkpoints y reanudación 70 min
    En un clúster grande algo falla cada día. Aprende a guardar un checkpoint que permita reanudar exactamente donde lo dejaste y a elegir cada cuánto guardarlo.
  4. Paralelismo tensorial a fondo — el bloque Transformer completo 80 min
    De partir una matmul a partir un Transformer entero — atención por cabezas, los operadores f y g del backward, paralelismo de secuencia y la entropía cruzada con el vocabulario repartido.
  5. Planificaciones de pipeline — GPipe, 1F1B e intercalada 70 min
    El pipeline con forward y backward de verdad — por qué GPipe y 1F1B tardan lo mismo pero no gastan la misma memoria, cómo se calcula la burbuja y qué ganan las planificaciones intercaladas.
  6. Precisión mixta, escalado de la pérdida y solapar la comunicación 75 min
    Por qué se entrena en fp16/bf16 con copia maestra en fp32, cómo el escalado dinámico de la pérdida rescata los gradientes diminutos, y cómo DDP agrupa gradientes en buckets para comunicar mientras el backward sigue calculando.
  7. Inferencia distribuida — servir un modelo que no cabe en una GPU 70 min
    Cómo se sirve un LLM repartido entre varias GPUs - paralelismo tensorial y de pipeline en el decode, reparto de la KV cache por cabezas y por capas, réplicas y enrutado, y cómo elegir la configuración que da más throughput sin romper la latencia prometida.

Requisitos previos

Antes de esta unidad conviene haber hecho:

Las explicaciones completas, los ejercicios con corrección automática, los exámenes y los proyectos están dentro de la academia.

Cada lección que completes te da 10 yang, la moneda de la academia, y cada examen de unidad aprobado, 50.

¿Empezamos?

Crea tu cuenta y activa tu suscripción: tendrás todo el temario desde el primer día.