Marsof Academy
Curso 3 · Unidad 4

Procesamiento del lenguaje

Forma parte de Deep learning y Transformers

  • 5 lecciones
  • ≈ 13 h de estudio
  • Nivel: intermedio-avanzado

Temas que cubre

  • Procesamiento de texto
  • Tokenización
  • Embeddings
  • Modelado de secuencias
  • Atención
  • Modelado del lenguaje
  • Transformers

Lecciones de la unidad

  1. Texto como datos 65 min
    Un modelo de lenguaje no ve letras ni palabras, ve enteros. Aquí construyes el puente entre ambos.
  2. Tokenización BPE desde cero 55 min
    El algoritmo de compresión de 1994 que tokeniza el texto de GPT, Llama y casi todos los LLM actuales.
  3. Modelos de lenguaje n-grama 55 min
    El primer modelo de lenguaje de verdad, hecho solo contando. Es la línea base que tu Transformer tendrá que batir.
  4. Embeddings — tokens como vectores 65 min
    Un id no dice nada sobre su significado; un vector sí. Así entra el texto en una red neuronal.
  5. Atención — cada token mira a los demás 70 min
    El mecanismo que hace funcionar a los Transformers, calculado primero a mano y luego en Python puro.

Requisitos previos

Antes de esta unidad conviene haber hecho:

Las explicaciones completas, los ejercicios con corrección automática, los exámenes y los proyectos están dentro de la academia.

Cada lección que completes te da 10 yang, la moneda de la academia, y cada examen de unidad aprobado, 50.

¿Empezamos?

Crea tu cuenta y activa tu suscripción: tendrás todo el temario desde el primer día.