Calculadora
Intervalos de confianza
Para una media, una proporción, la diferencia entre dos grupos o una varianza. Con el intervalo dibujado, los supuestos que hay que verificar y la oración lista para el informe.
¿Qué querés estimar?
Intervalo de confianza del 95 %
1.121.362,91 a 1.278.637,09
Los números
- Estimación puntual
- 1.200.000
- Margen de error
- 78.637,09
- Error estándar
- 40.000
- Valor crítico (t)
- 1,9659
- Grados de libertad
- 399
- Ancho del intervalo
- 157.274,18
Cómo se lee
Si se repitiera el muestreo muchas veces y se calculara este intervalo cada vez, el 95 % de esos intervalos contendría al valor poblacional verdadero. La estimación puntual es 1.200.000, con un margen de 78.637,09.
Lo que no significa: que haya un 95 % de probabilidad de que el parámetro esté dentro de estos dos números. El parámetro es fijo; lo que varía de muestra a muestra es el intervalo.
Redacción sugerida
La media estimada fue de 1.200.000 (IC 95 %: 1.121.362,91 – 1.278.637,09), con un margen de error de 78.637,09.
Revisala antes de usarla: hay que completar de qué variable y de qué población se trata.
Cómo están calculados estos números
- Medias. Distribución t con n−1 grados de libertad, salvo que marques σ conocida. Para dos grupos, Welch por defecto, con los grados de libertad de Welch-Satterthwaite, que casi nunca son enteros.
- Proporciones. Wilson por defecto, que es el recomendado: invierte la prueba de puntaje en vez de suponer normalidad de la proporción muestral. Wald es la fórmula clásica de los libros y falla con n chico; Clopper-Pearson es exacto y algo más ancho.
- Varianza. Chi-cuadrado con n−1 grados de libertad. Es el intervalo menos robusto de todos ante el incumplimiento de la normalidad.
- Población finita. Factor √((N−n)/(N−1)), que achica el margen cuando la muestra es una parte grande de la población.
- Verificado. Los cálculos se comparan contra scipy y statsmodels sobre 50 casos, con un error relativo máximo de 6e-14.
- Nada sale de tu navegador.
La frase que hay que evitar
"Hay un 95 % de probabilidad de que la media poblacional esté entre estos dos números." Es la interpretación que sale sola, y es incorrecta. La media poblacional es un número fijo: o está adentro del intervalo o no está. No tiene una distribución de probabilidad.
Lo que tiene el 95 % es el método: si repitieras el muestreo muchas veces y calcularas el intervalo cada vez, el 95 % de esos intervalos contendría al valor verdadero. La confianza está en el procedimiento, no en el intervalo que te tocó.
La distinción parece un tecnicismo y no lo es: el objeto que sí admite la lectura intuitiva existe, y se llama intervalo de credibilidad, pero pertenece al enfoque bayesiano y se calcula de otra manera.
Por qué el método importa en las proporciones
La fórmula que enseñan casi todos los libros —p ± z·√(p(1−p)/n)— se llama método de Wald, y funciona mal justo donde más se la usa: con muestras chicas y con proporciones cercanas a 0 o a 1. En el caso extremo da intervalos absurdos: si observás 0 éxitos en 30 casos, Wald devuelve un intervalo de ancho cero, como si tuvieras certeza total.
Por eso la calculadora usa Wilson por defecto. Su intervalo no está centrado en la proporción observada sino corrido hacia 0,5, y eso, que parece raro, es exactamente lo que le da mejor cobertura. Podés comparar los tres métodos con el selector.
Cuándo corresponde la corrección por población finita
Cuando la muestra es una parte grande de la población y el muestreo es sin reposición. La regla habitual es aplicarla si la muestra supera el 5 % de la población, aunque el factor se puede usar siempre: con poblaciones grandes tiende a 1 y no cambia nada.
Tiene una consecuencia que sorprende: si relevás a toda la población, el margen de error se vuelve cero. Y es correcto, porque ahí no hay error de muestreo: hiciste un censo. Lo que queda son otros errores —de medición, de cobertura, de no respuesta— que ningún intervalo de confianza captura.
Lo que el intervalo no incluye
El margen de error mide solo el error de muestreo: la variabilidad que viene de haber medido a unos y no a otros. No incluye el sesgo de no respuesta, ni los errores de medición, ni el efecto de un marco muestral desactualizado, ni las decisiones de diseño.
En encuestas reales eso importa mucho. Si tus datos vienen de un diseño complejo —conglomerados, estratos, ponderadores— estos intervalos se quedan cortos, y a veces por mucho: en la EPH, el error estándar real del ingreso medio es 2,23 veces el que devuelve la fórmula de s/√n.