Ir al contenido
σestadistica.ar
M14 · MultivariadoAvanzadoProcedimiento

Conglomerados por k-medias

El algoritmo de agrupamiento más usado: cómo funciona, cómo se elige k y las formas de grupo que no puede encontrar.

1 · El algoritmo

  1. Elegir kk y ubicar kk centroides iniciales.
  2. Asignar cada caso al centroide más cercano.
  3. Recalcular cada centroide como la media de sus casos.
  4. Repetir 2 y 3 hasta que las asignaciones no cambien.

2 · Sus dos características incómodas

Hay que elegir kk de antemano. A diferencia del jerárquico, no construye toda la estructura.

El resultado depende del punto de partida. Con centroides iniciales distintos puede converger a soluciones distintas: el algoritmo encuentra un mínimo local, no necesariamente el mejor.

3 · Cómo se elige k

MétodoIdea
Codograficar la inercia contra kk y buscar el quiebre
Siluetacuán bien está asignado cada caso; maximizar el promedio
Gap statisticcomparar contra datos uniformes
Conocimiento del problemael criterio que más pesa
kkInercia
1310,0
2244,0
3206,5
4183,0
5162,7
6160,1

4 · Qué formas puede encontrar

Si los grupos sonMétodo adecuado
Esféricos, tamaño parecidok-medias
De formas arbitrariasDBSCAN, clustering espectral
De densidades distintasDBSCAN
Con solapamientomezclas gaussianas
Con atípicosk-medoides (PAM), más robusto

El k-medoides usa casos reales como centros en lugar de promedios, lo que lo vuelve robusto a valores extremos.

5 · K-medias o jerárquico

K-mediasJerárquico
Cantidad de casosmiles o milloneshasta unos pocos miles
kkhay que fijarlose decide después
Resultadodepende del iniciodeterminista
Salida visualninguna propiadendrograma
Costobajoalto

6 · Validar los grupos

Ningún método dice si los grupos existen de verdad. K-medias con k=3k = 3 sobre ruido uniforme devuelve tres grupos igual de prolijos.

Las verificaciones razonables:

  • Silueta promedio: por encima de 0,5 indica estructura razonable; cerca de 0 o negativa, que no hay grupos.
  • Estabilidad: correrlo sobre submuestras y ver si los grupos se mantienen.
  • Perfil sustantivo: que los grupos se distingan en variables que no se usaron para formarlos.

7 · Errores frecuentes

  • No estandarizar.
  • Correrlo una sola vez sin repetir inicios.
  • No fijar la semilla, lo que impide reproducir el resultado.
  • Elegir kk por conveniencia narrativa.
  • Usarlo con grupos de forma no esférica.
  • Aplicarlo a variables categóricas codificadas como números.
  • Presentar los grupos como reales sin ninguna validación.
  • No describir los perfiles.

8 · En el software

# R
set.seed(2026)
Z <- scale(X)

km <- kmeans(Z, centers = 3, nstart = 25)    # nstart es imprescindible
km$cluster; km$centers; km$tot.withinss

# El codo
inercia <- sapply(1:8, function(k) kmeans(Z, k, nstart = 25)$tot.withinss)
plot(1:8, inercia, type = "b")

# Silueta
factoextra::fviz_nbclust(Z, kmeans, method = "silhouette")

# Robusto a atípicos
cluster::pam(Z, k = 3)
# Python
from sklearn.cluster import KMeans
from sklearn.metrics import silhouette_score

km = KMeans(n_clusters=3, n_init=25, random_state=2026).fit(Z)
km.labels_; km.cluster_centers_; km.inertia_
silhouette_score(Z, km.labels_)
SPSS:     Analizar › Clasificar › Conglomerados de K medias
Cómo citar esta entrada

APA (7.ª edición)

Montivero, J. L. (2026). Conglomerados por k-medias. estadistica.ar. https://estadistica.ar/conceptos/k-medias

BibTeX

@misc{estadistica_ar_k_medias,
  author       = {Montivero, Jorge Luis},
  title        = {{Conglomerados por k-medias}},
  year         = {2026},
  howpublished = {\url{https://estadistica.ar/conceptos/k-medias}},
  note         = {estadistica.ar. Consultado el \today},
  urldate      = {2026-09-19}
}

Última actualización: 19 de septiembre de 2026. El contenido está bajo licencia CC BY-NC-SA 4.0: se puede reutilizar citando la fuente y sin fines comerciales.