Para empezar en inteligencia artificial necesitas menos matemáticas de las que imaginas, pero no ninguna. El núcleo cabe en cuatro bloques: saber leer funciones, logaritmos y sumatorios; vectores y matrices; la idea de derivada y gradiente (y la intuición de la regla de la cadena); y probabilidad y estadística básicas. Con eso entiendes cómo aprende un modelo y por qué a veces falla.

Lo que puedes dejar para después depende de tu objetivo. Si quieres construir aplicaciones con modelos de lenguaje (LLMs), te basta con una base ligera. Si quieres ser ingeniero de machine learning, necesitas el núcleo bien asentado y practicado en código. Y si te atrae la investigación, entonces sí toca profundizar mucho más. En este artículo verás cada bloque con ejemplos, una tabla según tu objetivo y un poco de código para comprobar que no es para tanto.

Por qué la IA usa matemáticas (y por qué no debería asustarte)

Un modelo de IA no ve palabras ni imágenes: ve listas de números. Entrenarlo consiste en ajustar otros números (sus parámetros) para que una medida de error, la función de pérdida, sea lo más pequeña posible. Casi todas las matemáticas que vas a necesitar sirven para describir alguna parte de esa frase:

  • Las listas de números son vectores y matrices (álgebra lineal).
  • «Ajustar para que el error baje» es derivadas y gradientes (cálculo).
  • «El modelo no está seguro» o «los datos tienen ruido» es probabilidad y estadística.

La buena noticia es que hoy trabajas con estas ideas a través de código: no vas a calcular derivadas a mano durante horas. Si ya programas un poco en Python (si no, empieza por Python para IA: por dónde empezar), la mitad del camino está hecha: un sumatorio es un bucle for, un vector es una lista y una función matemática es una función de Python.

Idea clave: en IA, entender una fórmula significa poder explicarla con palabras, calcularla con dos o tres números inventados y escribirla en unas pocas líneas de Python.

Las matemáticas que sí necesitas

1. Funciones, potencias, logaritmos y sumatorios

Es el «puente» desde las matemáticas del instituto. Necesitas sentirte cómodo con:

  • Funciones y gráficas: qué significa f(x), cómo se ve una recta, una parábola o una exponencial.
  • Exponenciales y logaritmos: aparecen en todas partes. La función de pérdida más usada en clasificación (la log-loss o entropía cruzada) es un logaritmo, y la función softmax, que convierte puntuaciones en probabilidades, usa exponenciales. Un LLM la usa cada vez que elige la siguiente palabra.
  • Notación de sumatorio: Σ no es más que «suma todo esto». Si lo lees como un bucle que acumula, deja de dar miedo.
  • Leer fórmulas: letras griegas, subíndices, la flecha de «actualiza». Es más un diccionario que una habilidad difícil.

Un ejemplo que verás mil veces es la regla de actualización del entrenamiento: θ ← θ − η·∇L(θ). Leída en voz alta: «actualiza los parámetros restándoles un poquito de la lista de pendientes de la pérdida». Al terminar este artículo sabrás qué es cada pieza.

2. Vectores y matrices

Es el bloque más importante en la práctica. Una imagen en escala de grises de 28×28 píxeles es un vector de 784 números. Una palabra dentro de un modelo de lenguaje es un embedding: un vector de cientos o miles de números. Una tabla de datos es una matriz.

Lo que necesitas dominar:

  • Sumar vectores, multiplicarlos por un número y calcular su longitud (norma).
  • El producto escalar (dot product): multiplicar posición a posición y sumar. Mide cuánto «apuntan en la misma dirección» dos vectores, y es la base de la búsqueda semántica y de mecanismos como la atención de los Transformers.
  • La multiplicación de matrices: una capa de una red neuronal es, en esencia, una matriz por un vector (más un sesgo y una función de activación).
  • Las dimensiones (shapes): saber qué tamaño tiene cada cosa evita la mayoría de errores reales.

Aquí tienes el producto escalar en acción con NumPy, usando la similitud coseno, que es lo que hace un buscador semántico para comparar textos:

import numpy as np

# Tres "embeddings" de juguete (los reales tienen cientos de números)
vacaciones = np.array([0.9, 0.1, 0.3])
dias_libres = np.array([0.8, 0.2, 0.4])
factura = np.array([0.1, 0.9, 0.2])

def similitud_coseno(a, b):
    return np.dot(a, b) / (np.linalg.norm(a) * np.linalg.norm(b))

print(round(similitud_coseno(vacaciones, dias_libres), 3))  # 0.984
print(round(similitud_coseno(vacaciones, factura), 3))      # 0.271

«Vacaciones» y «días libres» no comparten palabras, pero sus vectores apuntan casi en la misma dirección (similitud cercana a 1). «Factura» apunta hacia otro lado. Esa misma idea, a gran escala, es la que hay detrás de sistemas como RAG.

3. Derivadas, gradientes y la regla de la cadena

No necesitas ser un experto en cálculo. Necesitas tres intuiciones:

  • La derivada es una pendiente: te dice si la función sube o baja en un punto y con qué fuerza.
  • El gradiente es la lista de pendientes: cuando una función depende de muchos parámetros, el gradiente te da una pendiente por cada uno. Es el famoso ∇L de la fórmula de antes.
  • La regla de la cadena: si una cosa depende de otra que depende de otra, las pendientes se multiplican a lo largo de la cadena. Esto es exactamente lo que hace el backpropagation para entrenar redes neuronales capa a capa.

Con esas tres ideas entiendes el descenso de gradiente, el algoritmo con el que aprenden casi todos los modelos: estás en una montaña con niebla, notas la pendiente bajo tus pies y das un paso cuesta abajo. Repites. En código, con una función de una sola variable:

def f(x):
    return (x - 3) ** 2        # la "pérdida": mínima en x = 3

def derivada(x):
    return 2 * (x - 3)         # la pendiente de f en cada punto

x = 0.0                        # punto de partida
eta = 0.1                      # learning rate (tamaño del paso)

for paso in range(50):
    x = x - eta * derivada(x)  # un paso cuesta abajo

print(f"x = {x:.5f}")          # x = 2.99996, muy cerca de 3

Fíjate en el signo menos: la derivada apunta cuesta arriba y tú quieres bajar. Si cambias eta a 1.1, los pasos son tan largos que te pasas del valle una y otra vez y te alejas (tras 10 pasos, x vale aproximadamente −15,58). Eso es, en miniatura, lo que ocurre cuando un entrenamiento real «explota» y alguien te dice «baja el learning rate».

4. Probabilidad y estadística básicas

Los modelos trabajan con incertidumbre. Un clasificador no dice «es spam», dice «90 % de probabilidad de que sea spam». Un LLM elige la siguiente palabra a partir de una distribución de probabilidades. Necesitas:

  • Probabilidad básica: eventos, probabilidad condicionada y la intuición del teorema de Bayes (cómo actualizar una creencia con nueva evidencia).
  • Distribuciones: sobre todo la normal (la campana) y saber qué es una distribución discreta sobre varias opciones.
  • Estadística descriptiva: media, mediana, varianza, desviación típica.
  • Evaluar con honestidad: separar datos de entrenamiento y de prueba, desconfiar de un resultado demasiado bueno y entender por qué la exactitud (accuracy) engaña cuando las clases están desequilibradas.

Las matemáticas que puedes dejar para más tarde

Hay temas que aparecen en listas de «requisitos» y que, para empezar, puedes posponer sin problema:

  • Demostraciones formales: en trabajos aplicados vas a usar resultados y comprobarlos en código, no a demostrar teoremas.
  • Cálculo integral avanzado: basta con saber qué representa una integral (el área bajo una curva).
  • Álgebra lineal abstracta: espacios vectoriales generales, descomposiciones avanzadas… Los autovalores vienen bien más adelante, pero no el primer mes.
  • Optimización convexa teórica, teoría de la medida, estadística bayesiana avanzada: son terreno de investigación o de especialización.
  • Calcular a mano: saber hacer a mano una multiplicación de matrices grande no aporta; saber qué shape va a salir, sí.

«Dejar para más tarde» no significa «nunca». Significa que no deberían bloquearte para empezar a construir cosas.

Qué necesitas según tu objetivo

No todos los caminos en IA piden lo mismo. Esta tabla es una orientación, no una regla estricta:

ObjetivoImprescindibleRecomendablePuedes posponer
Aplicaciones con LLMs (chatbots, RAG, agentes)Leer fórmulas básicas, vectores y similitud coseno, probabilidad intuitivaEstadística para evaluar resultados, idea de gradienteCálculo formal, álgebra lineal avanzada
Machine learning engineerLos cuatro bloques del núcleo, practicados en códigoAutovalores, optimizadores (momentum, Adam), regla de la cadena en detalleDemostraciones, teoría de la medida
Investigación (research)Todo el núcleo con soltura, cálculo multivariable, álgebra lineal sólidaProbabilidad y estadística avanzadas, optimización teóricaPoco: aquí se profundiza en casi todo

Para aplicaciones con LLMs puedes crear cosas útiles muy pronto: montar un RAG o un agente requiere más ingeniería de software que matemáticas. Aun así, entender embeddings, probabilidades y cómo evaluar marca la diferencia. Si quieres saber más sobre qué hace este perfil, lee Qué es un AI engineer y qué hace.

Cómo aprender estas matemáticas sin agobiarte

Algunos consejos prácticos que funcionan mejor que «estudiar primero toda la teoría»:

  1. Aprende cada concepto junto a su uso. El producto escalar se entiende de verdad cuando comparas dos embeddings; la derivada, cuando ves bajar una curva de pérdida.
  2. Programa cada fórmula. Si puedes escribirla con NumPy y probarla con números pequeños, la has entendido.
  3. Empieza por lo mínimo. Construye algo y vuelve a profundizar cuando lo necesites.
  4. Repasa. Volver a los temas a intervalos (repaso espaciado) funciona mucho mejor que un atracón.

Si quieres ver primero la intuición sin fórmulas, tienes Machine learning explicado sin matemáticas. Y si buscas un mapa general de por dónde empezar, Cómo aprender inteligencia artificial desde cero.

Como recursos gratuitos, la documentación oficial de NumPy tiene buenas guías para principiantes, y hay cursos gratuitos de álgebra lineal y cálculo con ejemplos visuales en plataformas universitarias y de vídeo.

Si quieres un camino guiado

En Marsof Academy las matemáticas no son un curso aparte que tengas que superar antes de empezar: están dentro del curso de machine learning. Primero, un puente de matemáticas que repasa lo del instituto (funciones, potencias, logaritmos, sumatorios, leer fórmulas); después, matemáticas para IA: vectores, matrices, derivadas, descenso de gradiente, probabilidad, Bayes, estadística y regla de la cadena, siempre con Python real que se ejecuta en el navegador, sin instalar nada. Un tutor IA te da pistas en forma de preguntas, no soluciones.

Es una opción entre varias. Puedes consultar el temario completo y los precios (suscripción mensual o anual, cancelable cuando quieras) para ver si encaja contigo.

Preguntas frecuentes

¿Puedo aprender IA si se me daban mal las matemáticas en el instituto?

Sí. Lo que necesitas al principio es una base concreta y muy ligada al código, no el temario completo del bachillerato. Muchas personas descubren que, con ejemplos en Python, las ideas se entienden mejor que en la pizarra.

¿Necesito matemáticas para usar ChatGPT o crear un chatbot?

Para usar un chatbot, no. Para construir aplicaciones con LLMs, basta con una base ligera: entender embeddings, similitud y algo de probabilidad para evaluar resultados.

¿Qué es más importante, álgebra lineal o cálculo?

En la práctica diaria, el álgebra lineal (vectores, matrices y sus dimensiones) aparece más a menudo. El cálculo lo necesitas sobre todo para entender cómo aprenden los modelos: derivadas, gradientes y regla de la cadena.

¿Debo aprender todas las matemáticas antes de programar?

No es lo recomendable. Suele funcionar mejor aprender Python primero y después cada concepto matemático junto a un ejemplo en código, volviendo a profundizar cuando un proyecto lo pida.