Conglomerados jerárquicos
Agrupar casos parecidos construyendo un árbol: los métodos de enlace, cómo se lee un dendrograma y dónde cortarlo.
1 · Cómo funciona
El método aglomerativo empieza con cada caso como un grupo propio y, en cada paso, une los dos grupos más cercanos. Después de pasos queda un solo grupo con todo.
2 · Los métodos de enlace
La distancia entre casos está definida; la distancia entre grupos, no. Cada respuesta da un método:
| Método | Distancia entre grupos | Tiende a producir |
|---|---|---|
| Simple (vecino más cercano) | la mínima entre sus miembros | cadenas largas |
| Completo (vecino más lejano) | la máxima | grupos compactos |
| Promedio | el promedio de todas las distancias | intermedio |
| Centroide | entre los centros | puede invertir el árbol |
| Ward | el que menos aumenta la varianza interna | grupos de tamaño parecido |
3 · El dendrograma
Cómo se lee:
- Cada hoja es un caso.
- Cada unión es una fusión de grupos.
- La altura de la unión indica cuán distintos eran: uniones bajas, casos muy parecidos.
- Cortar a una altura da una cantidad de grupos.
4 · Dónde cortar
| Criterio | Idea |
|---|---|
| Salto grande en las alturas | cortar antes de una fusión costosa |
| Cantidad de grupos deseada | por razones prácticas |
| Interpretabilidad | el criterio que decide en la práctica |
| Índices de validación | silueta, Calinski-Harabasz |
5 · El resultado del ejemplo
Cortando en tres grupos:
| Grupo | Ingreso medio | No registrados | |
|---|---|---|---|
| 1 | 16 | $846.597 | 40,0 % |
| 2 | 4 | $1.537.817 | 17,4 % |
| 3 | 12 | $1.153.793 | 35,7 % |
El grupo 2 son Comodoro Rivadavia, Neuquén, Río Gallegos y Ushuaia.
6 · Sus límites
Es determinista pero irreversible: una fusión hecha en un paso temprano no se deshace, aunque después resulte mala.
No escala. Con más de unos miles de casos, la matriz de distancias se vuelve impracticable; ahí va k-medias.
Siempre devuelve grupos, aunque los datos sean ruido uniforme. Hay que validar que la estructura sea real.
Es sensible a la distancia y al método de enlace: conviene probar varias combinaciones y quedarse con la que sea estable.
7 · Errores frecuentes
- No estandarizar antes de calcular distancias.
- Usar enlace simple con datos cuantitativos.
- Leer el orden horizontal del dendrograma como si significara algo.
- Elegir la cantidad de grupos después de ver cuál conviene al relato.
- No validar que la estructura sea real.
- No describir los grupos con sus perfiles: un número de grupo sin perfil no sirve.
- Aplicarlo a decenas de miles de casos.
8 · En el software
# R
Z <- scale(X)
d <- dist(Z) # euclídea
hc <- hclust(d, method = "ward.D2")
plot(hc, hang = -1)
rect.hclust(hc, k = 3)
grupos <- cutree(hc, k = 3)
# Perfil de cada grupo, que es lo que se interpreta
aggregate(X, by = list(grupo = grupos), FUN = mean)
# Validación
cluster::silhouette(grupos, d)
# Python
from scipy.cluster.hierarchy import linkage, dendrogram, fcluster
L = linkage(Z, method='ward')
dendrogram(L, labels=nombres)
grupos = fcluster(L, 3, criterion='maxclust')
from sklearn.metrics import silhouette_score
silhouette_score(Z, grupos)
SPSS: Analizar › Clasificar › Conglomerados jerárquicosCómo citar esta entrada
APA (7.ª edición)
Montivero, J. L. (2026). Conglomerados jerárquicos. estadistica.ar. https://estadistica.ar/conceptos/analisis-de-conglomerados-jerarquico
BibTeX
@misc{estadistica_ar_analisis_de_conglomerados_jerarquico,
author = {Montivero, Jorge Luis},
title = {{Conglomerados jerárquicos}},
year = {2026},
howpublished = {\url{https://estadistica.ar/conceptos/analisis-de-conglomerados-jerarquico}},
note = {estadistica.ar. Consultado el \today},
urldate = {2026-09-19}
}Última actualización: 19 de septiembre de 2026. El contenido está bajo licencia CC BY-NC-SA 4.0: se puede reutilizar citando la fuente y sin fines comerciales.