Marsof Academy
Curso 5 · Unidad 7

Frontera de la IA

Forma parte de Nivel avanzado (opcional): especializaciones

  • 8 lecciones
  • ≈ 26 h de estudio
  • Nivel: avanzado

Área viva que evoluciona con el campo. Razonamiento y cómputo en inferencia, contexto largo, Mixture of Experts, datos sintéticos y alineamiento con preferencias. La compresión de modelos, los agentes y la multimodalidad tienen sus propias unidades («Rendimiento de LLMs», «Agentes de IA» e «IA multimodal»).

Temas que cubre

  • Sistemas de razonamiento
  • Cómputo en inferencia
  • Contexto largo
  • Arquitecturas eficientes
  • Mixture of Experts
  • Datos sintéticos
  • Alineamiento
  • Modelos de recompensa
  • RLHF
  • DPO
  • Evaluación del alineamiento

Lecciones de la unidad

  1. Razonamiento y cómputo en inferencia 85 min
    Cadenas de razonamiento, self-consistency, best-of-n con verificadores y por qué gastar más cómputo al responder ayuda… hasta donde ayuda.
  2. Contexto largo y atención eficiente 80 min
    Por qué la atención cuesta O(n²), cuánto ocupa la KV cache, cómo se estira RoPE con interpolación de posiciones y qué prometen (y qué no) la atención dispersa y la lineal.
  3. Mixture of Experts 85 min
    Cómo un router envía cada token a unos pocos expertos, por qué hace falta una pérdida de balanceo y qué ocurre cuando un experto se llena.
  4. Alineamiento y datos sintéticos 90 min
    RLHF, RLAIF y Constitutional AI a nivel conceptual, la pérdida de preferencias de Bradley–Terry, y cómo generar, filtrar y deduplicar datos sintéticos sin caer en el model collapse.
  5. El modelo de recompensa — de rankings humanos a un número 70 min
    Cómo se entrena el reward model de RLHF — de rankings a pares, el gradiente de Bradley–Terry, por qué cada prompt cuenta una vez, el techo de exactitud que imponen los desacuerdos humanos y los sesgos que el modelo aprende sin que nadie se lo pida.
  6. RLHF con PPO — recompensa con KL, ventajas y recorte 75 min
    Las piezas numéricas de la etapa de RL de RLHF — la recompensa por token con penalización KL, los estimadores de KL, las ventajas con GAE, el objetivo recortado de PPO y su variante sin crítico, GRPO.
  7. DPO — la derivación completa y por qué funciona 70 min
    De la política óptima del objetivo con KL a la pérdida de Direct Preference Optimization, paso a paso, con su gradiente, lo que significa la «recompensa implícita», y una comprobación numérica de que optimizar DPO recupera exactamente la política óptima.
  8. Evaluar el alineamiento — reward hacking, sobreoptimización y jueces sesgados 70 min
    Cómo saber si un modelo alineado es mejor de verdad — la ley de Goodhart en números, la curva de sobreoptimización de best-of-n, el KL de best-of-n, y cómo medir y corregir los sesgos de posición y longitud de un juez.

Requisitos previos

Antes de esta unidad conviene haber hecho:

Las explicaciones completas, los ejercicios con corrección automática, los exámenes y los proyectos están dentro de la academia.

Cada lección que completes te da 10 yang, la moneda de la academia, y cada examen de unidad aprobado, 50.

¿Empezamos?

Crea tu cuenta y activa tu suscripción: tendrás todo el temario desde el primer día.