Conglomerados por k-medias
El algoritmo de agrupamiento más usado: cómo funciona, cómo se elige k y las formas de grupo que no puede encontrar.
1 · El algoritmo
- Elegir y ubicar centroides iniciales.
- Asignar cada caso al centroide más cercano.
- Recalcular cada centroide como la media de sus casos.
- Repetir 2 y 3 hasta que las asignaciones no cambien.
2 · Sus dos características incómodas
Hay que elegir de antemano. A diferencia del jerárquico, no construye toda la estructura.
El resultado depende del punto de partida. Con centroides iniciales distintos puede converger a soluciones distintas: el algoritmo encuentra un mínimo local, no necesariamente el mejor.
3 · Cómo se elige k
| Método | Idea |
|---|---|
| Codo | graficar la inercia contra y buscar el quiebre |
| Silueta | cuán bien está asignado cada caso; maximizar el promedio |
| Gap statistic | comparar contra datos uniformes |
| Conocimiento del problema | el criterio que más pesa |
| Inercia | |
|---|---|
| 1 | 310,0 |
| 2 | 244,0 |
| 3 | 206,5 |
| 4 | 183,0 |
| 5 | 162,7 |
| 6 | 160,1 |
4 · Qué formas puede encontrar
| Si los grupos son | Método adecuado |
|---|---|
| Esféricos, tamaño parecido | k-medias |
| De formas arbitrarias | DBSCAN, clustering espectral |
| De densidades distintas | DBSCAN |
| Con solapamiento | mezclas gaussianas |
| Con atípicos | k-medoides (PAM), más robusto |
El k-medoides usa casos reales como centros en lugar de promedios, lo que lo vuelve robusto a valores extremos.
5 · K-medias o jerárquico
| K-medias | Jerárquico | |
|---|---|---|
| Cantidad de casos | miles o millones | hasta unos pocos miles |
| hay que fijarlo | se decide después | |
| Resultado | depende del inicio | determinista |
| Salida visual | ninguna propia | dendrograma |
| Costo | bajo | alto |
6 · Validar los grupos
Ningún método dice si los grupos existen de verdad. K-medias con sobre ruido uniforme devuelve tres grupos igual de prolijos.
Las verificaciones razonables:
- Silueta promedio: por encima de 0,5 indica estructura razonable; cerca de 0 o negativa, que no hay grupos.
- Estabilidad: correrlo sobre submuestras y ver si los grupos se mantienen.
- Perfil sustantivo: que los grupos se distingan en variables que no se usaron para formarlos.
7 · Errores frecuentes
- No estandarizar.
- Correrlo una sola vez sin repetir inicios.
- No fijar la semilla, lo que impide reproducir el resultado.
- Elegir por conveniencia narrativa.
- Usarlo con grupos de forma no esférica.
- Aplicarlo a variables categóricas codificadas como números.
- Presentar los grupos como reales sin ninguna validación.
- No describir los perfiles.
8 · En el software
# R
set.seed(2026)
Z <- scale(X)
km <- kmeans(Z, centers = 3, nstart = 25) # nstart es imprescindible
km$cluster; km$centers; km$tot.withinss
# El codo
inercia <- sapply(1:8, function(k) kmeans(Z, k, nstart = 25)$tot.withinss)
plot(1:8, inercia, type = "b")
# Silueta
factoextra::fviz_nbclust(Z, kmeans, method = "silhouette")
# Robusto a atípicos
cluster::pam(Z, k = 3)
# Python
from sklearn.cluster import KMeans
from sklearn.metrics import silhouette_score
km = KMeans(n_clusters=3, n_init=25, random_state=2026).fit(Z)
km.labels_; km.cluster_centers_; km.inertia_
silhouette_score(Z, km.labels_)
SPSS: Analizar › Clasificar › Conglomerados de K mediasCómo citar esta entrada
APA (7.ª edición)
Montivero, J. L. (2026). Conglomerados por k-medias. estadistica.ar. https://estadistica.ar/conceptos/k-medias
BibTeX
@misc{estadistica_ar_k_medias,
author = {Montivero, Jorge Luis},
title = {{Conglomerados por k-medias}},
year = {2026},
howpublished = {\url{https://estadistica.ar/conceptos/k-medias}},
note = {estadistica.ar. Consultado el \today},
urldate = {2026-09-19}
}Última actualización: 19 de septiembre de 2026. El contenido está bajo licencia CC BY-NC-SA 4.0: se puede reutilizar citando la fuente y sin fines comerciales.