Curso 3 · Unidad 3
Visión por computador
Forma parte de Deep learning y Transformers
- 4 lecciones
- ≈ 13 h de estudio
- Nivel: intermedio-avanzado
Temas que cubre
- CNN
- Clasificación
- Detección de objetos
- Segmentación
- Embeddings
- Vision Transformers
- Visión multimodal
Lecciones de la unidad
- Convolución — una lupa que recorre la imagen 80 min
La operación que permite a una red «ver» bordes, texturas y formas, calculada a mano y luego con NumPy. - Redes convolucionales — apilar miradas cada vez más amplias 70 min
Convoluciones, activaciones y pooling encadenados en una CNN completa; campo receptivo, recuento de parámetros y aumento de datos. - Detección y segmentación — qué hay y dónde está 80 min
Cajas, IoU, supresión de no máximos y average precision; las piezas con las que se construye y se evalúa cualquier detector. - Vision Transformers — una imagen vale 16 × 16 palabras 75 min
Cortar la imagen en parches, convertirlos en tokens y dejar que la atención haga el resto; formas, parámetros y coste.
Requisitos previos
Antes de esta unidad conviene haber hecho:
- Ingeniería con PyTorch (Curso 3 · Unidad 2)
Las explicaciones completas, los ejercicios con corrección automática, los exámenes y los proyectos están dentro de la academia.
Cada lección que completes te da 10 yang, la moneda de la academia, y cada examen de unidad aprobado, 50.
¿Empezamos?
Crea tu cuenta y activa tu suscripción: tendrás todo el temario desde el primer día.