Variables dummy
Cómo entran las variables categóricas en un modelo: la categoría de referencia, la trampa de las dummy y cómo se leen los coeficientes.
1 · Qué son
Variables que valen 0 o 1 y representan la pertenencia a una categoría.
Con categorías se crean dummy. La categoría que no recibe dummy es la de referencia, y todos los coeficientes se leen contra ella.
2 · La trampa de las dummy
Si se incluyen todas las categorías más la constante, el modelo es indeterminado: las dummy suman exactamente 1 en cada caso, que es lo que vale la columna de la constante.
3 · El ejemplo
Nivel educativo en tres categorías, con primario como referencia:
| Categoría | secundario | superior |
|---|---|---|
| Hasta primario completo | 0 | 0 |
| Secundario | 1 | 0 |
| Superior | 0 | 1 |
| Coeficiente | Valor | Lectura |
|---|---|---|
secundario | +249.541 | contra primario |
superior | +726.490 | contra primario |
| Diferencia entre ellos | 476.949 | por resta |
4 · Cómo elegir la referencia
| Criterio | Ejemplo |
|---|---|
| La categoría más frecuente | da errores estándar más chicos |
| El grupo control | en un experimento |
| Un orden natural | la categoría más baja, en variables ordinales |
| La más interpretable | la que el lector espera como base |
La elección no cambia el ajuste del modelo —el , los predichos y el son idénticos— pero sí cambia qué comparaciones son directas.
5 · Dummy y ANOVA son lo mismo
Una regresión con solo dummy es exactamente un ANOVA de un factor:
| ANOVA | Regresión con dummy |
|---|---|
| del factor | del bloque de dummy |
| Medias de cada grupo | constante + coeficiente de cada dummy |
6 · Las otras codificaciones
| Codificación | Los coeficientes comparan contra |
|---|---|
| Tratamiento (dummy 0/1) | la categoría de referencia |
| Suma (efecto) | la media general |
| Helmert | cada categoría contra la media de las anteriores |
| Polinómica | tendencias lineal, cuadrática… en variables ordinales |
La de tratamiento es la que usan R y Python por defecto y la que se interpreta más fácil. La polinómica es útil cuando la categórica tiene un orden con espaciado razonable.
7 · Errores frecuentes
- Incluir las dummy con constante.
- No declarar cuál es la referencia al reportar.
- Tratar una categórica codificada 1, 2, 3 como numérica. El modelo supone entonces que el paso de 1 a 2 vale lo mismo que de 2 a 3, y estima un solo coeficiente en lugar de .
- Comparar dos categorías no de referencia sin recalcular el error estándar.
- Crear dummy con categorías de muy pocos casos.
- Olvidar que los coeficientes cambian si cambia la referencia.
8 · En el software
# R — declarar como factor y listo
d$nivel <- factor(d$nivel, levels = c("Primario", "Secundario", "Superior"))
modelo <- lm(ingreso ~ horas + nivel, data = d) # crea las dummy solo
# Cambiar la referencia
d$nivel <- relevel(d$nivel, ref = "Superior")
# Contrastes distintos
contrasts(d$nivel) <- contr.sum(3)
# Python — C() marca la categórica
smf.ols("ingreso ~ horas + C(nivel)", data=d).fit()
smf.ols("ingreso ~ horas + C(nivel, Treatment(reference='Superior'))",
data=d).fit()
pd.get_dummies(d.nivel, drop_first=True) # a mano
SPSS: Regresión lineal no crea dummy solo:
hay que generarlas con Transformar › Recodificar
Cómo citar esta entrada
APA (7.ª edición)
Montivero, J. L. (2026). Variables dummy. estadistica.ar. https://estadistica.ar/conceptos/variables-dummy
BibTeX
@misc{estadistica_ar_variables_dummy,
author = {Montivero, Jorge Luis},
title = {{Variables dummy}},
year = {2026},
howpublished = {\url{https://estadistica.ar/conceptos/variables-dummy}},
note = {estadistica.ar. Consultado el \today},
urldate = {2026-09-19}
}Última actualización: 19 de septiembre de 2026. El contenido está bajo licencia CC BY-NC-SA 4.0: se puede reutilizar citando la fuente y sin fines comerciales.