Ir al contenido
σestadistica.ar
M14 · MultivariadoAvanzadoConcepto

Aprendizaje supervisado y no supervisado

El vocabulario del aprendizaje automático traducido al de la estadística: qué cambia de nombre, qué cambia de enfoque y qué no cambia.

1 · La división

SupervisadoNo supervisado
Hay una variable respuestano
Preguntapredecir yy a partir de xxencontrar estructura en xx
Evaluaciónerror de predicción, medibleinterpretabilidad
En estadísticaregresión, clasificaciónreducción de dimensiones, clusters

2 · La tabla de traducción

Aprendizaje automáticoEstadística
Featuresvariables, predictoras
Target, etiquetavariable respuesta
Trainingajuste, estimación
Pesoscoeficientes
Learningestimación
Overfittingsobreajuste
Regularizationpenalización, contracción
Clasificacióndiscriminación
Clusteringanálisis de conglomerados

3 · Lo que sí cambia: el énfasis

Estadística clásicaAprendizaje automático
Objetivoexplicar e inferirpredecir
Modelointerpretable, con supuestospuede ser una caja negra
Evaluaciónsupuestos, significaciónerror fuera de la muestra
Cantidad de variablespocas, elegidasmuchas, automáticas
Incertidumbreintervalos, valores pmenos central

En sentido inverso, el aporte de la estadística es la pregunta por la incertidumbre y por los supuestos: un modelo que predice bien puede no servir para decidir una política si no se sabe de dónde viene su desempeño.

4 · Los métodos, ordenados

Supervisados:

RespuestaMétodos
Cuantitativaregresión lineal, regresión penalizada, árboles, bosques aleatorios
Categóricalogística, discriminante, árboles, SVM, redes

No supervisados:

ObjetivoMétodos
Reducir dimensionesPCA, t-SNE, UMAP, autoencoders
Agruparjerárquico, k-medias, DBSCAN
Detectar anomalíasdistancia de Mahalanobis, isolation forest

5 · La diferencia que no se puede saltear

Es el malentendido más caro de la última década: confundir capacidad predictiva con conocimiento causal.

6 · Qué conviene saber de cada lado

Para quien viene de la estadística:

  • Validar fuera de la muestra, siempre.
  • Que un modelo interpretable a veces predice peor, y eso puede estar bien.
  • Que con muchas variables hacen falta métodos de regularización.

Para quien viene del aprendizaje automático:

  • Que el diseño del muestreo determina a quién se generaliza.
  • Que la incertidumbre de una predicción importa tanto como su valor.
  • Que un modelo puede predecir bien por razones equivocadas: correlaciones espurias, fugas de datos, sesgos del conjunto de entrenamiento.

7 · Errores frecuentes

  • Confundir predicción con explicación.
  • Interpretar coeficientes de un modelo optimizado solo para predecir.
  • Evaluar con los datos de entrenamiento.
  • Ignorar el sesgo del conjunto de datos: un modelo aprende lo que hay, incluidos los sesgos históricos.
  • Usar métodos complejos donde una regresión alcanza.
  • Creer que “el algoritmo es objetivo”. Cada decisión metodológica —qué variables, qué métrica, qué umbral— es una decisión humana.

8 · En el software

# R — tidymodels o caret unifican la interfaz
library(caret)
train(y ~ ., data = datos, method = "rf",
      trControl = trainControl(method = "cv", number = 10))
# Python — scikit-learn es el estándar
from sklearn.model_selection import cross_val_score, train_test_split
from sklearn.ensemble import RandomForestClassifier

X_ent, X_pru, y_ent, y_pru = train_test_split(X, y, random_state=2026)
cross_val_score(RandomForestClassifier(random_state=2026), X_ent, y_ent, cv=5)
Cómo citar esta entrada

APA (7.ª edición)

Montivero, J. L. (2026). Aprendizaje supervisado y no supervisado. estadistica.ar. https://estadistica.ar/conceptos/supervisado-y-no-supervisado

BibTeX

@misc{estadistica_ar_supervisado_y_no_supervisado,
  author       = {Montivero, Jorge Luis},
  title        = {{Aprendizaje supervisado y no supervisado}},
  year         = {2026},
  howpublished = {\url{https://estadistica.ar/conceptos/supervisado-y-no-supervisado}},
  note         = {estadistica.ar. Consultado el \today},
  urldate      = {2026-09-19}
}

Última actualización: 19 de septiembre de 2026. El contenido está bajo licencia CC BY-NC-SA 4.0: se puede reutilizar citando la fuente y sin fines comerciales.