Curso 1 · Unidad 4
Datos para IA
Forma parte de Fundamentos: programación y datos
- 7 lecciones
- ≈ 23 h de estudio
- Nivel: principiante
Las herramientas con las que se prepara cualquier dataset antes de entrenar nada. NumPy a fondo, pandas, SQL, visualización y un flujo de limpieza y análisis exploratorio que evita las fugas de información.
Temas que cubre
- NumPy
- Arrays
- dtypes
- Broadcasting
- Vectorización
- Vistas y copias
- Indexado avanzado
- pandas
- DataFrame
- groupby
- merge
- Valores ausentes
- Series temporales
- SQL
- SQLite
- JOIN
- Funciones de ventana
- Índices
- Visualización
- Histogramas
- ECDF
- Gráficos engañosos
- Limpieza de datos
- EDA
- Outliers
- Fugas de información
Lecciones de la unidad
- NumPy a fondo 60 min
Arrays, dtypes, broadcasting, vistas y copias e indexado avanzado; por qué el código vectorizado es decenas de veces más rápido que un bucle. - pandas (I): seleccionar, filtrar y agrupar 75 min
Series, DataFrame e índice, un primer vistazo a cualquier tabla, selección con columnas, loc, iloc y máscaras, columnas nuevas, ordenar, contar y resumir por grupos con groupby, pensando siempre en columnas y no en filas. - pandas (II): unir tablas, valores ausentes y series temporales 105 min
merge sin multiplicar filas, transform para cálculos por grupo, valores ausentes y dtypes, y series temporales con resample, rolling y shift, comprobando cada paso con conteos. - SQL con sqlite3 (I): consultar, agrupar y unir 85 min
Desde cero — tablas, SELECT y WHERE, ORDER BY y LIMIT, agregaciones con GROUP BY y HAVING, NULL, INNER y LEFT JOIN, y cómo lanzarlo todo desde Python con sqlite3 y parámetros. - SQL con sqlite3 (II): funciones de ventana, CTE e índices 105 min
Funciones de ventana (ROW_NUMBER, SUM OVER, LAG) para calcular por grupo sin perder filas, CTE con WITH para escribir consultas por pasos, e índices y EXPLAIN QUERY PLAN para que sean rápidas. - Visualización — ver los datos antes de modelarlos 50 min
Elegir el gráfico según la pregunta, leer distribuciones con histogramas, ECDF y cuantiles, y reconocer los gráficos que engañan. - Limpieza de datos y análisis exploratorio 70 min
Un flujo de EDA reproducible — tipos, ausentes, duplicados, valores imposibles y outliers — y las fugas de información que hacen que un modelo brille en el notebook y fracase en producción.
Requisitos previos
Antes de esta unidad conviene haber hecho:
- Ingeniería con Python (Curso 1 · Unidad 2)
Las explicaciones completas, los ejercicios con corrección automática, los exámenes y los proyectos están dentro de la academia.
Cada lección que completes te da 10 yang, la moneda de la academia, y cada examen de unidad aprobado, 50.
¿Empezamos?
Crea tu cuenta y activa tu suscripción: tendrás todo el temario desde el primer día.