Curso 5 · Unidad 2
Rendimiento de LLMs
Forma parte de Nivel avanzado (opcional): especializaciones
- 5 lecciones
- ≈ 16 h de estudio
- Nivel: avanzado
Temas que cubre
- Cuantización
- Pruning
- Destilación
- Batching
- KV cache
- Optimización de memoria
- Optimización de inferencia
- Paralelismo tensorial
- Paralelismo de pipeline
Lecciones de la unidad
- Memoria de entrenamiento e inferencia 65 min
Dónde se va cada byte de la GPU — pesos, gradientes, estados de Adam, activaciones y KV cache — y cómo calcularlo antes de pulsar «ejecutar». - Cuantización, pruning y destilación 85 min
Tres formas de hacer un modelo más pequeño o más barato — y cómo medir lo que cuesta en calidad. - Batching, throughput y latencia 75 min
Cómo sirve un LLM a muchos usuarios a la vez — prefill y decode, TTFT y TPOT, batching estático, dinámico y continuo, colas, ley de Little y percentiles. - Paralelismo tensorial y de pipeline 85 min
Cómo repartir un modelo que no cabe en una GPU — datos, ZeRO, paralelismo tensorial por columnas y filas, pipeline y su burbuja — y cuánto cuesta comunicarse. - Fusión de kernels y FlashAttention — la softmax online 70 min
Cómo calcular una softmax exacta en una sola pasada sobre datos que llegan por trozos, y cómo FlashAttention usa ese truco para fusionar la atención en un kernel que nunca escribe la matriz N × N en memoria.
Requisitos previos
Antes de esta unidad conviene haber hecho:
- GPU y CUDA (Curso 5 · Unidad 1)
Las explicaciones completas, los ejercicios con corrección automática, los exámenes y los proyectos están dentro de la academia.
Cada lección que completes te da 10 yang, la moneda de la academia, y cada examen de unidad aprobado, 50.
¿Empezamos?
Crea tu cuenta y activa tu suscripción: tendrás todo el temario desde el primer día.