Marsof Academy
Curso 5 · Unidad 2

Rendimiento de LLMs

Forma parte de Nivel avanzado (opcional): especializaciones

  • 5 lecciones
  • ≈ 16 h de estudio
  • Nivel: avanzado

Temas que cubre

  • Cuantización
  • Pruning
  • Destilación
  • Batching
  • KV cache
  • Optimización de memoria
  • Optimización de inferencia
  • Paralelismo tensorial
  • Paralelismo de pipeline

Lecciones de la unidad

  1. Memoria de entrenamiento e inferencia 65 min
    Dónde se va cada byte de la GPU — pesos, gradientes, estados de Adam, activaciones y KV cache — y cómo calcularlo antes de pulsar «ejecutar».
  2. Cuantización, pruning y destilación 85 min
    Tres formas de hacer un modelo más pequeño o más barato — y cómo medir lo que cuesta en calidad.
  3. Batching, throughput y latencia 75 min
    Cómo sirve un LLM a muchos usuarios a la vez — prefill y decode, TTFT y TPOT, batching estático, dinámico y continuo, colas, ley de Little y percentiles.
  4. Paralelismo tensorial y de pipeline 85 min
    Cómo repartir un modelo que no cabe en una GPU — datos, ZeRO, paralelismo tensorial por columnas y filas, pipeline y su burbuja — y cuánto cuesta comunicarse.
  5. Fusión de kernels y FlashAttention — la softmax online 70 min
    Cómo calcular una softmax exacta en una sola pasada sobre datos que llegan por trozos, y cómo FlashAttention usa ese truco para fusionar la atención en un kernel que nunca escribe la matriz N × N en memoria.

Requisitos previos

Antes de esta unidad conviene haber hecho:

Las explicaciones completas, los ejercicios con corrección automática, los exámenes y los proyectos están dentro de la academia.

Cada lección que completes te da 10 yang, la moneda de la academia, y cada examen de unidad aprobado, 50.

¿Empezamos?

Crea tu cuenta y activa tu suscripción: tendrás todo el temario desde el primer día.