Selección de variables
Cómo se decide qué entra en el modelo, por qué los métodos automáticos tienen mala prensa y qué hacer en su lugar.
1 · La pregunta
Con muchas predictoras candidatas, ¿cuáles entran al modelo?
2 · Depende de para qué sea el modelo
| Objetivo | Criterio de inclusión |
|---|---|
| Estimar un efecto causal | las variables que el conocimiento del tema indica como confusoras, estén o no significativas |
| Predecir | lo que mejore la predicción fuera de la muestra |
| Explorar | lo que interese, declarándolo como exploratorio |
3 · Los métodos automáticos
| Método | Cómo procede |
|---|---|
| Hacia adelante | arranca vacío y agrega la mejor variable en cada paso |
| Hacia atrás | arranca completo y saca la peor |
| Por pasos (stepwise) | combina las dos, pudiendo revertir decisiones |
| Todas las regresiones posibles | evalúa los modelos |
Suenan razonables y tienen problemas bien documentados:
- Los valores p resultantes no son válidos. El modelo se eligió mirando los datos, así que la inferencia posterior está contaminada: es selección múltiple encubierta.
- Los coeficientes están sesgados hacia arriba, porque sobreviven los que salieron grandes por azar.
- Son inestables: cambiar unos pocos casos cambia el modelo elegido.
- No garantizan encontrar el mejor modelo.
- Ignoran el conocimiento del tema.
4 · Qué hacer en su lugar
Para explicar:
- Definir el efecto de interés.
- Dibujar el orden causal supuesto entre las variables.
- Incluir las confusoras; excluir mediadores y colisionadores. Ver variables de confusión.
- Reportar el modelo completo, no el depurado.
Para predecir:
- Separar datos de entrenamiento y de prueba.
- Comparar modelos por validación cruzada.
- Considerar métodos de regularización —lasso, ridge, elastic net—, que seleccionan y estiman a la vez y manejan mejor la incertidumbre.
5 · La regla de los casos por variable
| Modelo | Mínimo razonable |
|---|---|
| Regresión lineal | 10–20 casos por predictora |
| Regresión logística | 10–20 eventos por predictora |
En logística lo que cuenta no es el total sino la cantidad del resultado menos frecuente: con 1.000 casos y 40 eventos, el límite son 2 a 4 predictoras, no 50.
6 · El modelo más grande no es el mejor
Agregar variables siempre sube el —incluso con ruido puro— pero:
- Aumenta la varianza de las estimaciones.
- Puede introducir multicolinealidad.
- Empeora la predicción fuera de la muestra.
- Complica la interpretación.
El equilibrio se llama parsimonia, y los criterios que lo formalizan son el AIC y el BIC.
7 · Errores frecuentes
- Usar stepwise y reportar los valores p como si fueran válidos.
- Sacar confusoras por no ser significativas.
- Incluir mediadores y concluir que el efecto desapareció.
- Probar muchas especificaciones y reportar solo la que gustó.
- Más variables que casos. El modelo no tiene solución única.
- No declarar el proceso de selección. Es parte del método y va en el informe.
- Seleccionar y validar con los mismos datos.
8 · En el software
# R — existe, pero con las advertencias de arriba
step(modelo_completo, direction = "both")
# Todas las regresiones posibles
leaps::regsubsets(ingreso ~ ., data = d)
# Regularización: la alternativa recomendable para predecir
library(glmnet)
cv.glmnet(X, y, alpha = 1) # lasso, con validación cruzada
# Comparar modelos anidados, que es lo correcto para explicar
anova(m_sin_variable, m_con_variable)
# Python
from sklearn.linear_model import LassoCV
LassoCV(cv=5).fit(X, y)
from sklearn.model_selection import cross_val_score
cross_val_score(modelo, X, y, cv=5, scoring='r2')Cómo citar esta entrada
APA (7.ª edición)
Montivero, J. L. (2026). Selección de variables. estadistica.ar. https://estadistica.ar/conceptos/seleccion-de-variables
BibTeX
@misc{estadistica_ar_seleccion_de_variables,
author = {Montivero, Jorge Luis},
title = {{Selección de variables}},
year = {2026},
howpublished = {\url{https://estadistica.ar/conceptos/seleccion-de-variables}},
note = {estadistica.ar. Consultado el \today},
urldate = {2026-09-19}
}Última actualización: 19 de septiembre de 2026. El contenido está bajo licencia CC BY-NC-SA 4.0: se puede reutilizar citando la fuente y sin fines comerciales.