Curso 3 · Unidad 4
Procesamiento del lenguaje
Forma parte de Deep learning y Transformers
- 5 lecciones
- ≈ 13 h de estudio
- Nivel: intermedio-avanzado
Temas que cubre
- Procesamiento de texto
- Tokenización
- Embeddings
- Modelado de secuencias
- Atención
- Modelado del lenguaje
- Transformers
Lecciones de la unidad
- Texto como datos 65 min
Un modelo de lenguaje no ve letras ni palabras, ve enteros. Aquí construyes el puente entre ambos. - Tokenización BPE desde cero 55 min
El algoritmo de compresión de 1994 que tokeniza el texto de GPT, Llama y casi todos los LLM actuales. - Modelos de lenguaje n-grama 55 min
El primer modelo de lenguaje de verdad, hecho solo contando. Es la línea base que tu Transformer tendrá que batir. - Embeddings — tokens como vectores 65 min
Un id no dice nada sobre su significado; un vector sí. Así entra el texto en una red neuronal. - Atención — cada token mira a los demás 70 min
El mecanismo que hace funcionar a los Transformers, calculado primero a mano y luego en Python puro.
Requisitos previos
Antes de esta unidad conviene haber hecho:
- Ingeniería con PyTorch (Curso 3 · Unidad 2)
Las explicaciones completas, los ejercicios con corrección automática, los exámenes y los proyectos están dentro de la academia.
Cada lección que completes te da 10 yang, la moneda de la academia, y cada examen de unidad aprobado, 50.
¿Empezamos?
Crea tu cuenta y activa tu suscripción: tendrás todo el temario desde el primer día.