Ir al contenido
σestadistica.ar

Caso con datos reales

Treinta y dos aglomerados y diez indicadores

Componentes principales y conglomerados sobre una matriz de la EPH: el análisis encuentra la Patagonia sin que nadie le diga dónde queda.

La matriz

32 aglomerados urbanos, 10 indicadores cada uno, todos calculados con la misma fuente —la EPH del primer trimestre de 2026— y con sus ponderadores:

IndicadorUnidad
Tasa de desocupación% de la PEA
Tasa de empleo% de la población
Tasa de actividad% de la población
Ingreso mediopesos
Ingreso medianopesos
Coeficiente de Gini0 a 1
Población de 18+ con secundario completo%
Asalariados no registrados%
Edad mediaaños
Población de 65 y más%

Primero: la matriz de correlaciones

Par de variablesrr
Edad media / población de 65++0,961
Ingreso medio / ingreso mediano+0,960
Empleo / actividad+0,921
Ingreso mediano / no registrados−0,844
Ingreso medio / no registrados−0,820

La cuarta es sustantiva: donde hay más informalidad, los ingresos son más bajos, con una correlación de −0,84.

Componentes principales

ComponenteVarianzaAcumulada
CP134,6 %34,6 %
CP222,6 %57,3 %
CP314,9 %72,2 %
CP413,4 %85,6 %

Cuatro componentes tienen valor propio mayor a 1 —el criterio de Kaiser—, y los dos primeros resumen el 57 % de la información de las diez variables originales.

Las cargas del primer componente:

VariableCarga
Ingreso medio+0,446
Ingreso mediano+0,429
Edad media+0,370
No registrados−0,334
Actividad+0,329
Población 65++0,315

Dónde cae cada aglomerado

Bahia Blanca CABA Comodoro Rivadavia Concordia Corrientes Formosa Gran Catamarca Gran Córdoba Gran La Plata Gran Mendoza Gran Paraná Gran Resistencia Gran Rosario Gran San Juan Gran Santa Fe Gran Tucumán Jujuy La Rioja Mar del Plata Neuquén Partidos del GBA Posadas Rawson Rio Cuarto Rio Gallegos Salta San Luis San Nicolas Santa Rosa Santiago del Ester Ushuaia Viedma Componente 1 (34.6% de la varianza) Componente 2 (22.6%)
Los 32 aglomerados en el plano de los dos primeros componentes principales. El color distingue los grupos del análisis de conglomerados.Cada punto es un aglomerado; la posición resume sus diez indicadores.Fuente: EPH continua, 1T 2026, INDEC. Elaboración propia.
Extremo negativo del CP1Extremo positivo
Concordia−3,41CABA+5,73
Santiago del Estero - La Banda−2,55Mar del Plata - Batán+2,92
Formosa−1,84Neuquén - Plottier+2,56

CABA está a 5,7 desvíos del promedio en el eje principal: es el caso más atípico de los 32, con enorme distancia respecto del segundo.

Los conglomerados

Método de Ward sobre las variables estandarizadas, tres grupos:

Viedma - Carmen de Patagon Rio Cuarto San Luis - El Chorrillo Gran Paraná Gran Santa Fe Concordia Santiago del Estero - La B Formosa Gran Resistencia Gran Catamarca Salta Corrientes Posadas La Rioja Gran San Juan Jujuy - Palpalá Comodoro Rivadavia - Rada Rio Gallegos Neuquén - Plottier Ushuaia - Rio Grande CABA Santa Rosa - Toay Partidos del GBA Gran Mendoza Gran Tucumán - Tafi Viejo Gran La Plata Gran Córdoba Gran Rosario Bahia Blanca - Cerri Mar del Plata - Batán Rawson - Trelew San Nicolas - Villa Consti ← Distancia de fusión (Ward)
Dendrograma de los 32 aglomerados. La altura de cada fusión indica cuán distintos son los grupos que se unen.Distancia euclídea sobre variables estandarizadas, método de Ward.Fuente: EPH continua, 1T 2026, INDEC. Elaboración propia.
GruponnDesocupaciónIngreso medioNo registradosSecundario+
1165,0 %$846.59740,0 %67,2 %
245,6 %$1.537.81717,4 %67,3 %
3128,0 %$1.153.79335,7 %64,9 %

Quiénes son los cuatro del grupo 2:

Comodoro Rivadavia - Rada Tilly · Neuquén - Plottier · Río Gallegos · Ushuaia - Río Grande

El grupo 1 reúne aglomerados del norte y el litoral, con ingresos bajos y mucha informalidad. El grupo 3 son las grandes áreas metropolitanas, con la desocupación más alta.

El codo, que no siempre aparece

Inercia intra-grupo según la cantidad de conglomerados:

kkInercia
1310,0
2244,0
3206,5
4183,0
5162,7
6160,1

Reproducirlo

# R
X <- scale(datos[, variables])        # estandarizar es obligatorio

pca <- prcomp(X)
summary(pca)                          # varianza explicada
pca$rotation[, 1:2]                   # las cargas
biplot(pca)

d <- dist(X)
hc <- hclust(d, method = "ward.D2")
plot(hc); rect.hclust(hc, k = 3)
grupos <- cutree(hc, k = 3)

set.seed(2026)
km <- kmeans(X, centers = 3, nstart = 25)
# Python
from sklearn.preprocessing import StandardScaler
from sklearn.decomposition import PCA
from sklearn.cluster import AgglomerativeClustering, KMeans

Z = StandardScaler().fit_transform(X)
pca = PCA().fit(Z)
pca.explained_variance_ratio_

AgglomerativeClustering(n_clusters=3, linkage='ward').fit_predict(Z)
KMeans(n_clusters=3, random_state=2026, n_init=25).fit_predict(Z)

El script completo es datos/eph/preparar-multivariado-m14.py, con semilla 2026.