Ir al contenido
σestadistica.ar
M13 · RegresiónIntermedioProcedimiento

Regresión lineal múltiple

Varias predictoras a la vez: qué significa 'controlar por', cuánto aporta cada variable y los problemas que aparecen al agregarlas.

1 · El modelo

Y=β0+β1x1+β2x2++βkxk+εY = \beta_0 + \beta_1 x_1 + \beta_2 x_2 + \dots + \beta_k x_k + \varepsilon

2 · Qué significa “controlar por”

Es la idea central del módulo y merece decirse con precisión.

β1\beta_1 es el cambio esperado en YY por una unidad de x1x_1 entre casos que tienen el mismo valor en todas las demás variables del modelo.

3 · El ejemplo

TérminobbLectura
Horas semanales14.557a igual edad, sexo y educación
Edad10.076por año
Mujer−269.859frente a un varón con iguales horas, edad y educación
Secundario249.541frente a primario
Superior726.490frente a primario
R2=0,146Raj2=0,146s=941.484R^2 = 0{,}146 \qquad R^2_{\text{aj}} = 0{,}146 \qquad s = 941.484

El R2R^2 pasó de 0,062 —solo horas— a 0,146. Sumar cuatro variables duplicó la capacidad explicativa, y aun así el modelo explica el 15 %.

4 · Cómo cambian los coeficientes al agregar variables

Es lo más informativo del proceso:

ModeloCoeficiente de horas
Solo horas15.610
Con edad, sexo y educación14.557

La pendiente de las horas baja un 7 % al controlar. Parte de lo que parecía efecto de las horas era en realidad efecto de las otras variables, correlacionadas con ellas.

5 · Qué se puede meter en el modelo

TipoCómo entra
Cuantitativadirectamente
Categóricacomo variables dummy
Relación curvacon x2x^2, log(x)\log(x) o splines
Efecto que depende de otracomo interacción

Por eso el modelo lineal es mucho más flexible de lo que su nombre sugiere: lo lineal son los parámetros, no la forma de la relación.

6 · Los problemas que aparecen

ProblemaEntrada
Predictoras muy correlacionadasmulticolinealidad
Demasiadas variablessobreajuste
Cuáles incluirselección de variables
Controlar lo que no se debemediadores y colisionadores

7 · Cuántos casos hacen falta

Reglas prácticas: entre 10 y 20 casos por predictora como mínimo, y bastante más si se buscan interacciones o si las predictoras están correlacionadas.

Con 14.129 casos y 5 predictoras, el ejemplo está holgado. Con 60 casos y 8 predictoras, el modelo estaría contando ruido.

8 · Errores frecuentes

  • Interpretar los coeficientes sin el “manteniendo constante”.
  • Controlar por mediadores y concluir que no hay efecto.
  • Meter todas las variables disponibles sin un orden causal pensado.
  • Concluir causalidad por haber “controlado”.
  • Ignorar la multicolinealidad.
  • Comparar coeficientes de distintas unidades sin estandarizar.
  • Usar el R2R^2 crudo para comparar modelos con distinta cantidad de variables.

9 · En el software

# R
modelo <- lm(ingreso ~ horas + edad + mujer + secundario + superior, data = d)
summary(modelo)
confint(modelo)

# Comparar el crudo con el ajustado
coef(lm(ingreso ~ horas, data = d))["horas"]        # 15610
coef(modelo)["horas"]                                # 14557

car::vif(modelo)
# Python
import statsmodels.formula.api as smf
modelo = smf.ols("ingreso ~ horas + edad + mujer + secundario + superior",
                 data=d).fit()
modelo.summary()
SPSS:     Analizar › Regresión › Lineales, con varias independientes
Cómo citar esta entrada

APA (7.ª edición)

Montivero, J. L. (2026). Regresión lineal múltiple. estadistica.ar. https://estadistica.ar/conceptos/regresion-lineal-multiple

BibTeX

@misc{estadistica_ar_regresion_lineal_multiple,
  author       = {Montivero, Jorge Luis},
  title        = {{Regresión lineal múltiple}},
  year         = {2026},
  howpublished = {\url{https://estadistica.ar/conceptos/regresion-lineal-multiple}},
  note         = {estadistica.ar. Consultado el \today},
  urldate      = {2026-09-19}
}

Última actualización: 19 de septiembre de 2026. El contenido está bajo licencia CC BY-NC-SA 4.0: se puede reutilizar citando la fuente y sin fines comerciales.