Caso con datos reales
Educación y empleo registrado: una tabla para toda la probabilidad
Una sola tabla de dos por dos con datos reales de la EPH alcanza para ver probabilidad conjunta, condicional, independencia, Bayes y valor predictivo.
La tabla
Todo el módulo de probabilidad se puede recorrer con una sola tabla. Esta sale de la EPH del primer trimestre de 2026, sobre los asalariados de 18 años o más que declararon si les descuentan jubilación: 13.864 casos en la muestra, que representan a 9.613.294 personas.
Dos variables, dos categorías cada una:
- — nivel educativo: hasta secundario incompleto o secundario completo o más.
- — condición del empleo: no registrado (sin descuento jubilatorio) o registrado.
Personas, en miles:
| No registrado | Registrado | Total | |
|---|---|---|---|
| Hasta secundario incompleto | 1.436 | 1.001 | 2.437 |
| Secundario completo o más | 2.183 | 4.994 | 7.177 |
| Total | 3.619 | 5.995 | 9.613 |
Probabilidades, que es la misma tabla dividida por el total:
| no reg. | reg. | Marginal | |
|---|---|---|---|
| hasta sec. incompleto | 0,1494 | 0,1042 | 0,2535 |
| secundario completo+ | 0,2271 | 0,5194 | 0,7465 |
| Marginal | 0,3764 | 0,6236 | 1,0000 |
Qué se lee en cada casilla
Probabilidad conjunta. Elegida una persona al azar, la probabilidad de que tenga a la vez secundario incompleto y empleo no registrado es 0,1494. Son las celdas del interior.
Probabilidad marginal. La probabilidad de que no esté registrada, sin importar su educación, es 0,3764. Son los bordes.
Probabilidad condicional. Acá aparece lo que la tabla tiene para decir:
Casi 70 % contra 41 %. Condicionar por el nivel educativo cambia la probabilidad en 29 puntos porcentuales.
Por qué no son independientes
Si la educación y la registración fueran independientes, cada celda sería el producto de sus marginales. Para la primera:
y la celda observada vale 0,1494, un 57 % más. Hay más personas con secundario incompleto y empleo no registrado de las que habría si las dos cosas no tuvieran relación.
Dar vuelta el condicionamiento
Las condicionales en el otro sentido responden otra pregunta:
Los dos números salen de la misma celda y no son iguales: 40 % contra 59 %. El primero describe la composición educativa de los no registrados; el segundo, el riesgo de no estar registrado entre quienes no terminaron el secundario. Confundir uno con otro es el error que el teorema de Bayes viene a corregir.
La misma tabla como prueba diagnóstica
Si se usara “no haber terminado el secundario” como señal para detectar quién tiene un empleo no registrado, la tabla daría:
| Indicador | Valor | Qué significa |
|---|---|---|
| Prevalencia | 0,3764 | Proporción de no registrados |
| Sensibilidad | 0,3968 | De los no registrados, cuántos detecta la señal |
| Especificidad | 0,8330 | De los registrados, cuántos descarta bien |
| Valor predictivo positivo | 0,5891 | Dada la señal, probabilidad de no registrado |
| Valor predictivo negativo | 0,6958 | Sin la señal, probabilidad de registrado |
La señal tiene especificidad alta y sensibilidad baja: casi todos los que terminaron el secundario quedan bien clasificados, pero se le escapan seis de cada diez trabajadores no registrados. Es un mal detector, y la tabla lo muestra sin necesidad de ninguna prueba estadística.
Reproducirlo
# R
library(dplyr)
d <- eph |>
filter(ESTADO == 1, CAT_OCUP == 3, CH06 >= 18, PP07H %in% c(1, 2)) |>
mutate(sec = NIVEL_ED %in% 4:6, reg = PP07H == 1)
# Tabla conjunta ponderada
tab <- xtabs(PONDERA ~ sec + reg, data = d)
prop.table(tab) # conjunta
prop.table(tab, 1) # condicional por nivel educativo
# Python
import pandas as pd
tab = pd.crosstab(d.sec, d.reg, values=d.PONDERA, aggfunc="sum")
tab / tab.values.sum() # conjunta
tab.div(tab.sum(axis=1), axis=0) # condicional
El script completo es datos/eph/preparar-probabilidad-m06.py y escribe
datos/eph/probabilidad-m06.json con todos los valores citados acá.