Curso 5 · Unidad 7
Frontera de la IA
Forma parte de Nivel avanzado (opcional): especializaciones
- 8 lecciones
- ≈ 26 h de estudio
- Nivel: avanzado
Área viva que evoluciona con el campo. Razonamiento y cómputo en inferencia, contexto largo, Mixture of Experts, datos sintéticos y alineamiento con preferencias. La compresión de modelos, los agentes y la multimodalidad tienen sus propias unidades («Rendimiento de LLMs», «Agentes de IA» e «IA multimodal»).
Temas que cubre
- Sistemas de razonamiento
- Cómputo en inferencia
- Contexto largo
- Arquitecturas eficientes
- Mixture of Experts
- Datos sintéticos
- Alineamiento
- Modelos de recompensa
- RLHF
- DPO
- Evaluación del alineamiento
Lecciones de la unidad
- Razonamiento y cómputo en inferencia 85 min
Cadenas de razonamiento, self-consistency, best-of-n con verificadores y por qué gastar más cómputo al responder ayuda… hasta donde ayuda. - Contexto largo y atención eficiente 80 min
Por qué la atención cuesta O(n²), cuánto ocupa la KV cache, cómo se estira RoPE con interpolación de posiciones y qué prometen (y qué no) la atención dispersa y la lineal. - Mixture of Experts 85 min
Cómo un router envía cada token a unos pocos expertos, por qué hace falta una pérdida de balanceo y qué ocurre cuando un experto se llena. - Alineamiento y datos sintéticos 90 min
RLHF, RLAIF y Constitutional AI a nivel conceptual, la pérdida de preferencias de Bradley–Terry, y cómo generar, filtrar y deduplicar datos sintéticos sin caer en el model collapse. - El modelo de recompensa — de rankings humanos a un número 70 min
Cómo se entrena el reward model de RLHF — de rankings a pares, el gradiente de Bradley–Terry, por qué cada prompt cuenta una vez, el techo de exactitud que imponen los desacuerdos humanos y los sesgos que el modelo aprende sin que nadie se lo pida. - RLHF con PPO — recompensa con KL, ventajas y recorte 75 min
Las piezas numéricas de la etapa de RL de RLHF — la recompensa por token con penalización KL, los estimadores de KL, las ventajas con GAE, el objetivo recortado de PPO y su variante sin crítico, GRPO. - DPO — la derivación completa y por qué funciona 70 min
De la política óptima del objetivo con KL a la pérdida de Direct Preference Optimization, paso a paso, con su gradiente, lo que significa la «recompensa implícita», y una comprobación numérica de que optimizar DPO recupera exactamente la política óptima. - Evaluar el alineamiento — reward hacking, sobreoptimización y jueces sesgados 70 min
Cómo saber si un modelo alineado es mejor de verdad — la ley de Goodhart en números, la curva de sobreoptimización de best-of-n, el KL de best-of-n, y cómo medir y corregir los sesgos de posición y longitud de un juez.
Requisitos previos
Antes de esta unidad conviene haber hecho:
- IA multimodal (Curso 5 · Unidad 6)
Las explicaciones completas, los ejercicios con corrección automática, los exámenes y los proyectos están dentro de la academia.
Cada lección que completes te da 10 yang, la moneda de la academia, y cada examen de unidad aprobado, 50.
¿Empezamos?
Crea tu cuenta y activa tu suscripción: tendrás todo el temario desde el primer día.