Marsof Academy
Curso 3 · Unidad 3

Visión por computador

Forma parte de Deep learning y Transformers

  • 4 lecciones
  • ≈ 13 h de estudio
  • Nivel: intermedio-avanzado

Temas que cubre

  • CNN
  • Clasificación
  • Detección de objetos
  • Segmentación
  • Embeddings
  • Vision Transformers
  • Visión multimodal

Lecciones de la unidad

  1. Convolución — una lupa que recorre la imagen 80 min
    La operación que permite a una red «ver» bordes, texturas y formas, calculada a mano y luego con NumPy.
  2. Redes convolucionales — apilar miradas cada vez más amplias 70 min
    Convoluciones, activaciones y pooling encadenados en una CNN completa; campo receptivo, recuento de parámetros y aumento de datos.
  3. Detección y segmentación — qué hay y dónde está 80 min
    Cajas, IoU, supresión de no máximos y average precision; las piezas con las que se construye y se evalúa cualquier detector.
  4. Vision Transformers — una imagen vale 16 × 16 palabras 75 min
    Cortar la imagen en parches, convertirlos en tokens y dejar que la atención haga el resto; formas, parámetros y coste.

Requisitos previos

Antes de esta unidad conviene haber hecho:

Las explicaciones completas, los ejercicios con corrección automática, los exámenes y los proyectos están dentro de la academia.

Cada lección que completes te da 10 yang, la moneda de la academia, y cada examen de unidad aprobado, 50.

¿Empezamos?

Crea tu cuenta y activa tu suscripción: tendrás todo el temario desde el primer día.