Marsof Academy
Curso 1 · Unidad 4

Datos para IA

Forma parte de Fundamentos: programación y datos

  • 7 lecciones
  • ≈ 23 h de estudio
  • Nivel: principiante

Las herramientas con las que se prepara cualquier dataset antes de entrenar nada. NumPy a fondo, pandas, SQL, visualización y un flujo de limpieza y análisis exploratorio que evita las fugas de información.

Temas que cubre

  • NumPy
  • Arrays
  • dtypes
  • Broadcasting
  • Vectorización
  • Vistas y copias
  • Indexado avanzado
  • pandas
  • DataFrame
  • groupby
  • merge
  • Valores ausentes
  • Series temporales
  • SQL
  • SQLite
  • JOIN
  • Funciones de ventana
  • Índices
  • Visualización
  • Histogramas
  • ECDF
  • Gráficos engañosos
  • Limpieza de datos
  • EDA
  • Outliers
  • Fugas de información

Lecciones de la unidad

  1. NumPy a fondo 60 min
    Arrays, dtypes, broadcasting, vistas y copias e indexado avanzado; por qué el código vectorizado es decenas de veces más rápido que un bucle.
  2. pandas (I): seleccionar, filtrar y agrupar 75 min
    Series, DataFrame e índice, un primer vistazo a cualquier tabla, selección con columnas, loc, iloc y máscaras, columnas nuevas, ordenar, contar y resumir por grupos con groupby, pensando siempre en columnas y no en filas.
  3. pandas (II): unir tablas, valores ausentes y series temporales 105 min
    merge sin multiplicar filas, transform para cálculos por grupo, valores ausentes y dtypes, y series temporales con resample, rolling y shift, comprobando cada paso con conteos.
  4. SQL con sqlite3 (I): consultar, agrupar y unir 85 min
    Desde cero — tablas, SELECT y WHERE, ORDER BY y LIMIT, agregaciones con GROUP BY y HAVING, NULL, INNER y LEFT JOIN, y cómo lanzarlo todo desde Python con sqlite3 y parámetros.
  5. SQL con sqlite3 (II): funciones de ventana, CTE e índices 105 min
    Funciones de ventana (ROW_NUMBER, SUM OVER, LAG) para calcular por grupo sin perder filas, CTE con WITH para escribir consultas por pasos, e índices y EXPLAIN QUERY PLAN para que sean rápidas.
  6. Visualización — ver los datos antes de modelarlos 50 min
    Elegir el gráfico según la pregunta, leer distribuciones con histogramas, ECDF y cuantiles, y reconocer los gráficos que engañan.
  7. Limpieza de datos y análisis exploratorio 70 min
    Un flujo de EDA reproducible — tipos, ausentes, duplicados, valores imposibles y outliers — y las fugas de información que hacen que un modelo brille en el notebook y fracase en producción.

Requisitos previos

Antes de esta unidad conviene haber hecho:

Las explicaciones completas, los ejercicios con corrección automática, los exámenes y los proyectos están dentro de la academia.

Cada lección que completes te da 10 yang, la moneda de la academia, y cada examen de unidad aprobado, 50.

¿Empezamos?

Crea tu cuenta y activa tu suscripción: tendrás todo el temario desde el primer día.