La matriz de correlaciones
El primer paso de todo análisis multivariado: cómo se lee, cómo se grafica y qué indica sobre si vale la pena seguir.
1 · Qué es
Una tabla cuadrada con la correlación de cada par de variables. Es simétrica, tiene unos en la diagonal, y con variables contiene correlaciones distintas.
2 · Qué buscar
| Par | Qué indica | |
|---|---|---|
| Edad media / población 65+ | +0,961 | redundancia: miden lo mismo |
| Ingreso medio / mediano | +0,960 | redundancia |
| Empleo / actividad | +0,921 | redundancia |
| Ingreso mediano / no registrados | −0,844 | relación sustantiva |
Correlaciones muy altas (> 0,9) entre dos variables señalan que una sobra, o que conviene combinarlas. Son un aviso de multicolinealidad si el destino es una regresión.
Bloques de variables correlacionadas entre sí y poco con el resto sugieren dimensiones latentes: es lo que el análisis factorial formaliza.
Correlaciones cercanas a cero en toda la matriz indican que no hay estructura que reducir, y que un PCA no va a servir de nada.
3 · Cómo se grafica
| Recurso | Para qué |
|---|---|
| Mapa de calor | ver la estructura global de un vistazo |
| Correlograma con círculos | tamaño y color codifican magnitud y signo |
| Reordenado por conglomerados | agrupa las variables relacionadas; lo más útil |
| Matriz de dispersión | ver la forma de cada relación, no solo el número |
4 · Sus límites
Solo mide relaciones lineales. Una relación en U aparece como correlación cero. Ver correlación de Pearson.
Es sensible a atípicos. Un solo caso extremo puede crear o destruir una correlación en una muestra chica.
Son correlaciones de a pares. No dicen si la relación entre dos variables persiste al controlar por una tercera: para eso están las correlaciones parciales.
5 · Si el destino es un PCA o un factorial
Hay dos verificaciones estándar antes de seguir:
| Prueba | Qué evalúa | Criterio |
|---|---|---|
| KMO (Kaiser-Meyer-Olkin) | si las correlaciones parciales son chicas | > 0,6 aceptable, > 0,8 bueno |
| Esfericidad de Bartlett | si la matriz difiere de la identidad | debe rechazar |
6 · Errores frecuentes
- Saltearla y pasar directo al método multivariado.
- Interpretar correlaciones de a pares como si fueran efectos controlados.
- No mirar los diagramas de dispersión, y perderse las relaciones curvas.
- Incluir variables casi idénticas y sorprenderse de que dominen el primer componente.
- Leer significación en vez de magnitud. Con muchos casos, todo da significativo.
- Mezclar variables de distinta naturaleza sin pensar si la correlación de Pearson corresponde.
7 · En el software
# R
R <- cor(X, use = "complete.obs")
round(R, 2)
library(corrplot)
corrplot(R, method = "circle", order = "hclust", addrect = 3)
# Correlaciones parciales
ppcor::pcor(X)$estimate
# Verificaciones previas al factorial
psych::KMO(R)
psych::cortest.bartlett(R, n = nrow(X))
# Python
import seaborn as sns
sns.heatmap(df.corr(), annot=True, fmt='.2f', cmap='RdBu_r',
center=0, vmin=-1, vmax=1)
sns.clustermap(df.corr(), cmap='RdBu_r', center=0)Cómo citar esta entrada
APA (7.ª edición)
Montivero, J. L. (2026). La matriz de correlaciones. estadistica.ar. https://estadistica.ar/conceptos/matriz-de-correlaciones
BibTeX
@misc{estadistica_ar_matriz_de_correlaciones,
author = {Montivero, Jorge Luis},
title = {{La matriz de correlaciones}},
year = {2026},
howpublished = {\url{https://estadistica.ar/conceptos/matriz-de-correlaciones}},
note = {estadistica.ar. Consultado el \today},
urldate = {2026-09-19}
}Última actualización: 19 de septiembre de 2026. El contenido está bajo licencia CC BY-NC-SA 4.0: se puede reutilizar citando la fuente y sin fines comerciales.