Curso 3 · Unidad 5
Transformers
Forma parte de Deep learning y Transformers
- 5 lecciones
- ≈ 19 h de estudio
- Nivel: intermedio-avanzado
Construir un Transformer pequeño y funcional pieza a pieza.
Temas que cubre
- Token embeddings
- Codificación posicional
- Atención
- Scaled dot-product attention
- Multi-head attention
- MLP
- Conexiones residuales
- LayerNorm
- Bloque Transformer
- Máscara causal
- Cabeza de lenguaje
Lecciones de la unidad
- Embeddings y codificación posicional — de ids a vectores que saben dónde están 95 min
Convierte ids de tokens en vectores y dales una noción de orden con codificación sinusoidal, posiciones aprendidas y RoPE. - Multi-head attention — muchas miradas a la vez, sin un solo bucle 100 min
Pasa de la cabeza de atención en Python puro a la atención causal multi-cabeza vectorizada, con las formas (B, T, C) → (B, h, T, d) bajo control. - El bloque Transformer — residual, LayerNorm y MLP 85 min
Ensambla atención, MLP con GELU, LayerNorm y conexiones residuales en el bloque pre-norm que se repite N veces en todo GPT. - El decoder completo — de ids a logits, pérdida y texto generado 100 min
Apila N bloques, añade la LayerNorm final y la cabeza de lenguaje, calcula la entropía cruzada con objetivos desplazados, cuenta los parámetros y genera texto token a token. - Entrenar un modelo de lenguaje pequeño — datos, gradientes y curvas que hablan 80 min
Construye batches de secuencias a partir de un flujo de tokens, entrena un modelo de lenguaje diminuto con gradientes escritos a mano en NumPy y aprende a leer lo que dicen sus curvas de pérdida.
Requisitos previos
Antes de esta unidad conviene haber hecho:
- Procesamiento del lenguaje (Curso 3 · Unidad 4)
Las explicaciones completas, los ejercicios con corrección automática, los exámenes y los proyectos están dentro de la academia.
Cada lección que completes te da 10 yang, la moneda de la academia, y cada examen de unidad aprobado, 50.
¿Empezamos?
Crea tu cuenta y activa tu suscripción: tendrás todo el temario desde el primer día.