Marsof Academy
Curso 5 · Unidad 6

IA multimodal

Forma parte de Nivel avanzado (opcional): especializaciones

  • 5 lecciones
  • ≈ 18 h de estudio
  • Nivel: avanzado

Temas que cubre

  • Visión-lenguaje
  • Audio
  • Voz
  • Generación de imágenes
  • Embeddings multimodales
  • Agentes multimodales

Lecciones de la unidad

  1. Aprendizaje contrastivo y CLIP — imágenes y textos en el mismo mapa 85 min
    Cómo entrenar dos codificadores para que una foto y su descripción caigan en el mismo punto, y cómo usar ese espacio para clasificar sin entrenar.
  2. Audio y voz — del micrófono al espectrograma mel 85 min
    Muestreo, Nyquist y aliasing, ventanas y DFT, espectrogramas y escala mel; cómo el audio se convierte en algo que una red puede leer.
  3. Modelos visión-lenguaje y agentes multimodales 85 min
    Cómo se conecta un codificador de imagen a un LLM (codificador → proyector → tokens), cuánto cuesta una imagen en contexto y cómo se construye un agente que ve la pantalla.
  4. Modelos generativos — autoencoders, VAEs y GANs 70 min
    Cómo pasar de clasificar imágenes a fabricarlas — comprimir en un espacio latente, el VAE y su ELBO con el truco de reparametrización, y el duelo entre generador y discriminador de las GANs, con su colapso de modos.
  5. Generación de imágenes — modelos de difusión 105 min
    Cómo se genera hoy una imagen a partir de texto — destruir datos con ruido gaussiano y aprender a deshacerlo paso a paso, la fórmula cerrada del proceso hacia delante, el objetivo de predecir el ruido, el muestreo, la guía sin clasificador, la difusión latente y cómo se mide la calidad con FID.

Requisitos previos

Antes de esta unidad conviene haber hecho:

Las explicaciones completas, los ejercicios con corrección automática, los exámenes y los proyectos están dentro de la academia.

Cada lección que completes te da 10 yang, la moneda de la academia, y cada examen de unidad aprobado, 50.

¿Empezamos?

Crea tu cuenta y activa tu suscripción: tendrás todo el temario desde el primer día.