Prueba t para dos muestras independientes
Comparar las medias de dos grupos: la versión de Welch, la clásica, cuál usar y qué significa el resultado.
1 · Cuándo se usa
Para comparar las medias de dos grupos independientes: personas distintas en cada grupo, sin emparejamiento.
Lo que cambia entre las dos versiones de la prueba es cómo se calcula ese error estándar.
2 · Las dos versiones
De Welch —varianzas distintas, la que conviene por defecto—:
con grados de libertad dados por una fórmula que suele arrojar decimales.
Clásica o pooled —varianzas iguales—:
donde es el desvío combinado, un promedio ponderado de los dos.
3 · Un ejemplo con datos reales
¿Difiere el ingreso de la ocupación principal entre varones y mujeres?
| Varones | Mujeres | |
|---|---|---|
| 8.364 | 7.084 | |
| Media | $1.123.989 | $832.239 |
| $1.145.718 | $775.612 |
Se rechaza . IC del 95 % para la diferencia: $261.268 a $322.232.
4 · El tamaño del efecto es imprescindible acá
Un de 0,29 se considera pequeño. Con 15.448 casos, un efecto pequeño da un valor p astronómicamente chico.
5 · Supuestos
- Independencia entre grupos y dentro de cada grupo. El crítico.
- Normalidad de las medias muestrales, garantizada por el TCL con suficiente.
- Homogeneidad de varianzas, solo para la versión clásica. Con Welch no hace falta.
| Problema | Alternativa |
|---|---|
| chico y asimetría fuerte | Mann-Whitney |
| Varianzas muy distintas | Welch, que ya lo resuelve |
| Datos apareados | t pareada |
| Más de dos grupos | ANOVA |
6 · Por qué no comparar los intervalos individuales
Un error visual muy extendido: mirar si los IC de cada grupo se solapan y concluir de ahí.
Que dos intervalos individuales se solapen no implica que la diferencia sea no significativa. Lo que hay que mirar es el intervalo de la diferencia, que es el que la prueba entrega, y si contiene o no al cero.
7 · Errores frecuentes
- Usar la clásica sin verificar varianzas —o, peor, elegirla porque da un valor p más chico—.
- Aplicarla a datos apareados. Desperdicia el emparejamiento y pierde potencia.
- Usarla con más de dos grupos, de a pares. Infla el error tipo I: va ANOVA.
- Comparar los IC individuales en lugar del IC de la diferencia.
- Reportar solo el valor p sin ni intervalo.
- Concluir causalidad desde datos observacionales. La brecha por sexo no prueba discriminación sin controlar ocupación, horas y sector.
8 · En el software
# R — Welch es el comportamiento por defecto
t.test(ingreso ~ sexo) # Welch
t.test(ingreso ~ sexo, var.equal = TRUE) # clásica
car::leveneTest(ingreso ~ sexo) # homogeneidad
effectsize::cohens_d(ingreso ~ sexo) # d de Cohen
# Python
from scipy import stats
stats.ttest_ind(v, m, equal_var=False) # Welch
stats.levene(v, m, center='median')
SPSS: Analizar › Comparar medias › Prueba T para muestras independientes
La salida trae las dos filas: "se asumen varianzas iguales" y no.
Herramientas de este tema
Cómo citar esta entrada
APA (7.ª edición)
Montivero, J. L. (2026). Prueba t para dos muestras independientes. estadistica.ar. https://estadistica.ar/conceptos/prueba-t-para-dos-muestras
BibTeX
@misc{estadistica_ar_prueba_t_para_dos_muestras,
author = {Montivero, Jorge Luis},
title = {{Prueba t para dos muestras independientes}},
year = {2026},
howpublished = {\url{https://estadistica.ar/conceptos/prueba-t-para-dos-muestras}},
note = {estadistica.ar. Consultado el \today},
urldate = {2026-09-18}
}Última actualización: 18 de septiembre de 2026. El contenido está bajo licencia CC BY-NC-SA 4.0: se puede reutilizar citando la fuente y sin fines comerciales.