Ir al contenido
σestadistica.ar

Caso con datos reales

Ingreso y nivel educativo: seis grupos y un ANOVA

El ejemplo que recorre todo el módulo de ANOVA: seis niveles educativos, un F de 223 y un eta cuadrado de apenas 0,068.

La pregunta

¿El ingreso difiere según el nivel educativo alcanzado?

Son 15.365 ocupados de 18 años o más de la EPH del primer trimestre de 2026, con ingreso positivo de la ocupación principal, clasificados en los seis niveles educativos del relevamiento.

Los seis grupos

Nivel educativonnMediaDesvíoMediana
Primario incompleto349$629.074$696.463$500.000
Primario completo1.683$701.356$598.292$600.000
Secundario incompleto2.399$753.550$848.004$600.000
Secundario completo5.075$917.169$903.934$800.000
Superior incompleto2.190$981.895$820.499$800.000
Superior completo3.669$1.428.475$1.317.167$1.100.000
Total15.365$992.760

El orden es el esperado y el salto grande está al final: quienes completaron el nivel superior ganan un 45 % más que el grupo inmediato anterior.

El ANOVA

FuenteSuma de cuadradosglCuadrado medioFF
Entre grupos1,0522×10151{,}0522 \times 10^{15}52,1043×10142{,}1043 \times 10^{14}223,23
Dentro de los grupos1,4479×10161{,}4479 \times 10^{16}15.3599,4268×10119{,}4268 \times 10^{11}
Total1,5531×10161{,}5531 \times 10^{16}15.364
F(5;15.359)=223,23p<10230η2=0,068ω2=0,067F(5;\, 15.359) = 223{,}23 \qquad p < 10^{-230} \qquad \eta^2 = 0{,}068 \qquad \omega^2 = 0{,}067

Dicho de otro modo: la variabilidad dentro de cada nivel educativo es catorce veces mayor que la que hay entre los niveles. Saber cuánto estudió una persona mejora poco la predicción de su ingreso.

Los supuestos, que no se cumplen

SupuestoDiagnóstico
Homogeneidad de varianzasViolado: Levene p<0,001p < 0{,}001; la varianza mayor es 4,85 veces la menor
Normalidad de los residuosViolado: asimetría 10,9
IndependenciaDudoso: el diseño de la EPH es por conglomerados

La alternativa no paramétrica coincide: Kruskal-Wallis da H=1.768,1H = 1.768{,}1 con 5 grados de libertad, p<0,001p < 0{,}001. Las conclusiones no cambian.

Las comparaciones post hoc

El FF dice que al menos dos niveles difieren. Tukey dice cuáles: de los 15 pares posibles, 11 son significativos y 4 no.

Los cuatro que no se distinguen:

ParDiferenciapp
Primario incompleto vs. Primario completo$72.2810,804
Primario incompleto vs. Secundario incompleto$124.4750,221
Primario completo vs. Secundario incompleto$52.1940,538
Secundario completo vs. Superior incompleto$64.7250,095

Es un hallazgo sustantivo que el ANOVA global no muestra y que aparece solo al hacer las comparaciones de a pares.

Dos factores: educación y sexo

VaronesMujeresBrecha
Hasta secundario incompleto$860.221$473.819$386.402
Secundario completo o más$1.269.380$935.802$333.577

Las dos brechas son parecidas en pesos —$386 mil contra $334 mil—, así que en escala absoluta la interacción es débil: el efecto del sexo es más o menos el mismo en los dos niveles educativos.

Pero en términos relativos la historia cambia: las mujeres sin secundario ganan un 45 % menos que sus pares varones, y las que lo completaron, un 26 % menos.

Reproducirlo

# R
d <- eph |> filter(ESTADO == 1, P21 > 0, CH06 >= 18, NIVEL_ED %in% 1:6)

modelo <- aov(P21 ~ factor(NIVEL_ED), data = d)
summary(modelo)                       # F = 223.23
effectsize::eta_squared(modelo)       # 0.068

car::leveneTest(P21 ~ factor(NIVEL_ED), data = d)
kruskal.test(P21 ~ factor(NIVEL_ED), data = d)
TukeyHSD(modelo)

oneway.test(P21 ~ factor(NIVEL_ED), data = d)   # Welch, sin homocedasticidad
# Python
from scipy import stats
stats.f_oneway(*grupos)
stats.kruskal(*grupos)
stats.levene(*grupos, center="median")

import statsmodels.formula.api as smf
modelo = smf.ols("P21 ~ C(NIVEL_ED)", data=d).fit()
import statsmodels.api as sm
sm.stats.anova_lm(modelo)

El script completo es datos/eph/preparar-anova-m11.py.