Ir al contenido
σestadistica.ar
M14 · MultivariadoIntermedioProcedimiento

Estandarizar antes de analizar

Por qué casi ningún método multivariado funciona sin estandarizar, qué transformación usar y cuándo no corresponde.

1 · El problema

En la matriz de aglomerados conviven variables como estas:

VariableRango aproximado
Coeficiente de Gini0,3 a 0,5
Tasa de desocupación3 a 10
Edad media30 a 40
Ingreso medio800.000 a 1.700.000

2 · La transformación estándar

z=xxˉsz = \frac{x - \bar{x}}{s}

Deja cada variable con media 0 y desvío 1, así que todas pesan igual. Es el mismo puntaje z de la descriptiva, aplicado a cada columna.

3 · Las alternativas

MétodoFórmulaResultadoCuándo
Estandarización (z)(xxˉ)/s(x-\bar{x})/smedia 0, desvío 1la habitual
Normalización min-max(xmin)/(maxmin)(x-\min)/(\max-\min)entre 0 y 1redes neuronales, índices
Robusta(xMe)/IQR(x - \text{Me})/IQRcentrada en la medianacon atípicos
Solo centrarxxˉx - \bar{x}media 0, escala originalcuando la escala importa

4 · Qué métodos la necesitan

Método¿Estandarizar?
Componentes principales, salvo que las unidades sean comparables
Conglomerados, k-mediassí, siempre
Distancias
Regresiónno hace falta
Árboles de decisiónno
Regresión penalizada (lasso, ridge)

5 · Cuándo NO estandarizar

  • Cuando todas las variables están en la misma unidad y sus diferencias de escala son informativas: un cuestionario donde todos los ítems van de 1 a 5.
  • Cuando se quiere que una variable pese más a propósito, con una justificación declarada.
  • Cuando la variabilidad relativa es el objeto de estudio.

6 · El detalle que arruina un análisis

7 · Errores frecuentes

  • No estandarizar cuando el método lo requiere.
  • Estandarizar cuando no corresponde, borrando diferencias de escala que importaban.
  • Usar min-max con atípicos.
  • Estandarizar la variable respuesta en una regresión sin necesidad, lo que complica la interpretación.
  • Calcular media y desvío con todo el conjunto en un esquema de validación.
  • Estandarizar variables dummy, que ya están en una escala común.
  • No guardar los parámetros usados, lo que impide aplicar el modelo a datos nuevos.

8 · En el software

# R
Z <- scale(X)                       # z por defecto
attr(Z, "scaled:center")            # las medias usadas
attr(Z, "scaled:scale")             # los desvíos

# Otras versiones
apply(X, 2, function(v) (v - min(v)) / diff(range(v)))   # min-max
apply(X, 2, function(v) (v - median(v)) / IQR(v))        # robusta
# Python — el escalador guarda los parámetros
from sklearn.preprocessing import StandardScaler, MinMaxScaler, RobustScaler
esc = StandardScaler().fit(X_entrenamiento)
Z_ent = esc.transform(X_entrenamiento)
Z_pru = esc.transform(X_prueba)      # los mismos parámetros
Cómo citar esta entrada

APA (7.ª edición)

Montivero, J. L. (2026). Estandarizar antes de analizar. estadistica.ar. https://estadistica.ar/conceptos/estandarizacion-de-variables

BibTeX

@misc{estadistica_ar_estandarizacion_de_variables,
  author       = {Montivero, Jorge Luis},
  title        = {{Estandarizar antes de analizar}},
  year         = {2026},
  howpublished = {\url{https://estadistica.ar/conceptos/estandarizacion-de-variables}},
  note         = {estadistica.ar. Consultado el \today},
  urldate      = {2026-09-19}
}

Última actualización: 19 de septiembre de 2026. El contenido está bajo licencia CC BY-NC-SA 4.0: se puede reutilizar citando la fuente y sin fines comerciales.