Ir al contenido
σestadistica.ar

Caso con datos reales

El ingreso de los ocupados, según la EPH

Un solo conjunto de datos reales para entender por qué la media y la mediana no coinciden, qué es la asimetría y cuándo un valor alto es un dato y no un error.

La pregunta

¿Cuánto gana un trabajador argentino?

Parece una pregunta con una sola respuesta numérica. No la tiene, y entender por qué es la mitad de la estadística descriptiva.

Los datos

Encuesta Permanente de Hogares del INDEC, base usuario del 1º trimestre de 2026, total de los 31 aglomerados urbanos que releva la encuesta.

El universo son las personas ocupadas que declararon un ingreso por su ocupación principal: 15.448 casos en la muestra, que representan a 13.127.975 personas.

Cómo se reparte el ingreso

2 % 4 % 6 % 8 % 10 % 12 % 14 % 0 0,5 M 1 M 1,5 M 2 M 2,5 M 3 M Ingreso de la ocupación principal (millones de pesos) Mediana $900.000 Media $1.104.227
La mayor parte de los ocupados se concentra en la franja baja, y la distribución se estira hacia la derecha.El eje corta en $3.000.000: el 3,4 % de los casos queda fuera del gráfico y llega hasta $40.000.000.Fuente: INDEC, EPH, 1º trimestre de 2026. Cálculo propio con ponderadores.

La forma dice casi todo. No es una campana simétrica: hay un amontonamiento a la izquierda y una cola larga a la derecha. Eso es una distribución asimétrica a la derecha, y es la forma habitual de cualquier variable de ingreso, en cualquier país y en cualquier época.

Media y mediana no coinciden

MedidaValor
Media$1.104.227
Mediana$900.000
Razón entre ambas1,23

La media es un 23 % más alta que la mediana. Y de ahí sale el dato que conviene tener siempre a mano:

No es una paradoja ni un error de cálculo. La media suma todos los ingresos y los reparte en partes iguales, así que un puñado de ingresos muy altos la empuja hacia arriba sin mover a nadie de lugar. La mediana, en cambio, parte a la población al medio: la mitad gana menos de $900.000 y la mitad gana más.

Por eso, cuando la distribución es asimétrica, la mediana describe mejor “el caso típico”. Y por eso el INDEC informa la mediana del ingreso, no el promedio, cuando quiere describir a la persona de en medio.

Los deciles

DecilHasta
D1$240.000
D2$400.000
D3$600.000
D4$750.000
D5 (mediana)$900.000
D6$1.000.000
D7$1.200.000
D8$1.500.000
D9$2.000.000

El 10 % que menos gana no llega a $240.000. El 10 % que más gana arranca en $2.000.000 y se queda con el 36,8 % de la masa total de ingresos.

Cuánto varían

MedidaValor
Desvío estándar$1.063.114
Coeficiente de variación0,96
Rango intercuartílico (RIC)$900.000
Asimetría+5,46

El coeficiente de variación de 0,96 significa que el desvío estándar es casi tan grande como la media: una dispersión enorme. El coeficiente de asimetría positivo y grande confirma numéricamente lo que se ve en el gráfico.

Fijate que el desvío estándar ($1.063.114) es más grande que la mediana ($900.000). Cuando eso pasa, informar “media ± desvío” es directamente engañoso: sugiere que hay gente con ingreso negativo. En distribuciones así se informa mediana y rango intercuartílico, no media y desvío.

Atípicos, o simplemente la cola

Q1 $500.000 Mediana $900.000 Q3 $1.400.000 Media $1.104.227 5.5 % de los ocupados supera los $2.750.000 → 0 0,5 M 1 M 1,5 M 2 M 2,5 M 3 M
La caja va del primer al tercer cuartil; la línea es la mediana y la punteada, la media.La regla del boxplot marca como atípico todo lo que supera $2.750.000, que acá es el 5,5 % de los ocupados.Fuente: INDEC, EPH, 1º trimestre de 2026. Cálculo propio con ponderadores.

La regla habitual del diagrama de caja marca como atípico todo lo que supere Q3+1,5RICQ_3 + 1{,}5 \cdot \mathrm{RIC}, que acá da $2.750.000. Por encima de ese límite hay un 5,5 % de los ocupados.

Es la lección más importante del caso. “Atípico” es una categoría estadística, no un veredicto sobre la calidad del dato. Borrar esos casos para que la distribución quede más linda es falsificar el resultado: haría desaparecer justamente la desigualdad que la variable está midiendo.

Un valor se descarta cuando hay motivo sustantivo para creer que está mal — un ingreso de $40.000.000 merece que uno lo mire de cerca—, nunca porque una fórmula lo señaló.

Cómo se informa

Entre los ocupados de los 31 aglomerados urbanos relevados por la EPH, el ingreso mediano de la ocupación principal fue de $900.000 en el primer trimestre de 2026 (RIC: $500.000 – $1.400.000; n = 15.448). La distribución resultó marcadamente asimétrica a la derecha (asimetría = 5,46), con una media de $1.104.227, superior a la mediana en un 23 %: el 65,5 % de los ocupados percibió ingresos por debajo del promedio.

Tres cosas que no pueden faltar: la medida de posición acompañada de una de dispersión, el nn y el universo al que se refiere.

Rehacer las cuentas

El extracto reducido está en el panel de la derecha. Tiene una fila por persona y las columnas ingreso_ocup_principal y ponderador, que son las que importan.

# R
library(dplyr)

d <- read.csv("ingresos-eph.csv")

# Sin ponderar da distinto — y da mal
mean(d$ingreso_ocup_principal)

# Con ponderadores
weighted.mean(d$ingreso_ocup_principal, d$ponderador)

# Mediana y cuartiles ponderados
library(Hmisc)
wtd.quantile(d$ingreso_ocup_principal, d$ponderador, probs = c(.25, .5, .75))
# Python
import numpy as np
import pandas as pd

d = pd.read_csv("ingresos-eph.csv")
x = d["ingreso_ocup_principal"].to_numpy(float)
w = d["ponderador"].to_numpy(float)

media = (w * x).sum() / w.sum()

def cuantil_ponderado(x, w, q):
    o = np.argsort(x)
    xs, ws = x[o], w[o]
    p = (np.cumsum(ws) - 0.5 * ws) / ws.sum()
    return np.interp(q, p, xs)

cuantil_ponderado(x, w, [0.25, 0.50, 0.75])

Ficha técnica

FuenteINDEC, Encuesta Permanente de Hogares, base usuario
Período1º trimestre de 2026
Cobertura31 aglomerados urbanos
UniversoOcupados con ingreso declarado de la ocupación principal
VariableP21 — ingreso de la ocupación principal
PonderadorPONDIIO
Casos15.448 (muestra) · 13.127.975 (población representada)
ProcesamientoCálculo propio. El script que genera este caso está en datos/eph/

Los datos originales son de acceso público y se descargan del sitio del INDEC. El extracto publicado acá conserva solo las variables usadas en este caso.