Ir al contenido
σestadistica.ar
M13 · RegresiónAvanzadoConcepto

Sobreajuste y validación

Cuando el modelo aprende el ruido de la muestra: cómo se detecta, cómo se mide la capacidad predictiva real y por qué el R² no alcanza.

1 · Qué es

Un modelo sobreajustado aprende no solo la estructura de la población sino también el ruido específico de esta muestra. Ajusta muy bien a los datos con los que se lo construyó y falla con datos nuevos.

Llevado al extremo, un polinomio de grado n1n-1 pasa exactamente por nn puntos: R2=1R^2 = 1 y cero capacidad predictiva.

2 · Cuándo aparece

FactorRiesgo
Muchas variables respecto de los casosalto
Muestra chicaalto
Selección de variables mirando los datosalto
Modelos flexibles: polinomios, árboles, redesalto
Pocas variables y nn grandebajo

La regla de los 10 a 20 casos por variable es una defensa de primer orden.

3 · Cómo se detecta

Partiendo los datos: se ajusta con una parte y se evalúa con la otra.

nnR2R^2
Entrenamiento9.8900,139
Prueba4.2390,173

Que el R2R^2 de prueba sea mayor que el de entrenamiento no es raro: es variabilidad muestral. Lo preocupante es lo inverso, y por un margen grande.

4 · Las estrategias de validación

MétodoCómoCuándo
Partición simple70/30 o 80/20nn grande
Validación cruzada en kk partesrotar cuál es la de pruebael estándar; k=5k = 5 o 10
Leave-one-outk=nk = nnn chico
Conjunto de validación separadotres partes: entrenar, ajustar, probarsi se comparan muchos modelos
Validación externaotra muestra, otro lugar, otro momentola prueba definitiva

5 · Lo que la validación no resuelve

No arregla un mal diseño. Si la muestra está sesgada, el modelo va a predecir bien dentro de ese sesgo y mal en la población real.

No garantiza validez externa. Un modelo validado en Buenos Aires puede fallar en Catamarca: la validación cruzada usa datos del mismo conjunto, con la misma estructura.

No dice nada sobre causalidad. Un modelo puede predecir excelentemente sin que ninguna de sus variables cause nada.

6 · El equilibrio sesgo-varianza

ModeloSesgoVarianzaProblema
Demasiado simplealtobajasubajuste
Demasiado complejobajoaltasobreajuste
Equilibradomoderadomoderada

El error de predicción se descompone en esos dos términos más el ruido irreducible. Elegir un modelo es elegir un punto en ese equilibrio, y por eso “el modelo que mejor ajusta” casi nunca es “el que mejor predice”.

7 · Errores frecuentes

  • Evaluar el modelo con los datos de entrenamiento.
  • Usar el conjunto de prueba para elegir y después reportarlo como validación.
  • Hacer la selección de variables antes de partir los datos. La selección también tiene que estar dentro de la validación cruzada.
  • Confiar en el R2R^2 como medida de capacidad predictiva.
  • Partir datos con estructura —series de tiempo, conglomerados— al azar: hay que respetar la estructura.
  • No fijar la semilla.

8 · En el software

# R — partición simple
set.seed(2026)
i <- sample(nrow(d), 0.7 * nrow(d))
ent <- d[i, ]; prue <- d[-i, ]

m <- lm(ingreso ~ horas + edad + mujer, data = ent)
pred <- predict(m, prue)
1 - sum((prue$ingreso - pred)^2) / sum((prue$ingreso - mean(ent$ingreso))^2)

# Validación cruzada
library(caret)
train(ingreso ~ horas + edad + mujer, data = d, method = "lm",
      trControl = trainControl(method = "cv", number = 10))
# Python
from sklearn.model_selection import train_test_split, cross_val_score
X_ent, X_pru, y_ent, y_pru = train_test_split(X, y, test_size=0.3,
                                              random_state=2026)
cross_val_score(modelo, X, y, cv=10, scoring='r2')
Cómo citar esta entrada

APA (7.ª edición)

Montivero, J. L. (2026). Sobreajuste y validación. estadistica.ar. https://estadistica.ar/conceptos/sobreajuste-y-validacion

BibTeX

@misc{estadistica_ar_sobreajuste_y_validacion,
  author       = {Montivero, Jorge Luis},
  title        = {{Sobreajuste y validación}},
  year         = {2026},
  howpublished = {\url{https://estadistica.ar/conceptos/sobreajuste-y-validacion}},
  note         = {estadistica.ar. Consultado el \today},
  urldate      = {2026-09-19}
}

Última actualización: 19 de septiembre de 2026. El contenido está bajo licencia CC BY-NC-SA 4.0: se puede reutilizar citando la fuente y sin fines comerciales.