Curso 5 · Unidad 6
IA multimodal
Forma parte de Nivel avanzado (opcional): especializaciones
- 5 lecciones
- ≈ 18 h de estudio
- Nivel: avanzado
Temas que cubre
- Visión-lenguaje
- Audio
- Voz
- Generación de imágenes
- Embeddings multimodales
- Agentes multimodales
Lecciones de la unidad
- Aprendizaje contrastivo y CLIP — imágenes y textos en el mismo mapa 85 min
Cómo entrenar dos codificadores para que una foto y su descripción caigan en el mismo punto, y cómo usar ese espacio para clasificar sin entrenar. - Audio y voz — del micrófono al espectrograma mel 85 min
Muestreo, Nyquist y aliasing, ventanas y DFT, espectrogramas y escala mel; cómo el audio se convierte en algo que una red puede leer. - Modelos visión-lenguaje y agentes multimodales 85 min
Cómo se conecta un codificador de imagen a un LLM (codificador → proyector → tokens), cuánto cuesta una imagen en contexto y cómo se construye un agente que ve la pantalla. - Modelos generativos — autoencoders, VAEs y GANs 70 min
Cómo pasar de clasificar imágenes a fabricarlas — comprimir en un espacio latente, el VAE y su ELBO con el truco de reparametrización, y el duelo entre generador y discriminador de las GANs, con su colapso de modos. - Generación de imágenes — modelos de difusión 105 min
Cómo se genera hoy una imagen a partir de texto — destruir datos con ruido gaussiano y aprender a deshacerlo paso a paso, la fórmula cerrada del proceso hacia delante, el objetivo de predecir el ruido, el muestreo, la guía sin clasificador, la difusión latente y cómo se mide la calidad con FID.
Requisitos previos
Antes de esta unidad conviene haber hecho:
- Research Engineering (Curso 5 · Unidad 5)
- Visión por computador (Curso 3 · Unidad 3)
Las explicaciones completas, los ejercicios con corrección automática, los exámenes y los proyectos están dentro de la academia.
Cada lección que completes te da 10 yang, la moneda de la academia, y cada examen de unidad aprobado, 50.
¿Empezamos?
Crea tu cuenta y activa tu suscripción: tendrás todo el temario desde el primer día.