Ir al contenido
σestadistica.ar
M02 · DescriptivaIntermedioProcedimiento

Cálculos con datos agrupados

Cómo se calculan la media, la mediana y el desvío cuando lo único que se tiene es una tabla de frecuencias, y cuánto se pierde en el camino.

1 · Definición

Los datos agrupados son los que solo están disponibles como tabla de frecuencias por intervalos, sin los valores individuales.

2 · Cuándo hace falta

Cada vez menos, pero todavía pasa:

  • Cuando la fuente publica una tabla y no la base. Muchos anuarios estadísticos e informes antiguos son así.
  • Cuando se trabaja con datos históricos de los que solo sobrevivió el tabulado.
  • En un ejercicio de examen, donde el objetivo es entender el mecanismo.

Fuera de esos casos, agrupar para después calcular es tirar precisión sin ganar nada.

3 · El supuesto que hace todo posible

Todos los métodos de esta entrada descansan en una sola suposición:

Ese supuesto es razonable cuando los intervalos son angostos y la distribución no cambia bruscamente dentro de ellos. Es malo cuando los intervalos son muy anchos o cuando hay mucha concentración en un extremo del intervalo — que es lo que pasa con el último intervalo de una distribución de ingresos.

4 · La media

Se trata cada intervalo como si todos sus casos valieran la marca de clase, y se promedia ponderando por la frecuencia:

xˉi=1kxinin\bar{x} \approx \frac{\sum_{i=1}^{k} x_i \, n_i}{n}

donde xix_i es la marca de clase del intervalo ii y nin_i su frecuencia. Es exactamente una media ponderada.

5 · La mediana

Se ubica el intervalo donde la frecuencia acumulada cruza el 50 % —el intervalo mediano— y se interpola dentro de él:

x~Li+n2Ni1niai\tilde{x} \approx L_i + \frac{\frac{n}{2} - N_{i-1}}{n_i} \cdot a_i

donde LiL_i es el límite inferior del intervalo mediano, Ni1N_{i-1} la acumulada hasta el intervalo anterior, nin_i la frecuencia del intervalo mediano y aia_i su amplitud.

Se lee así: arrancá en el borde del intervalo y avanzá la fracción que falta para llegar a la mitad de los casos.

6 · Un ejemplo

Con la edad de los ocupados de la EPH agrupada en tramos de diez años:

Intervaloxix_inin_i (miles)NiN_i (miles)
[15, 25)201.3681.368
[25, 35)303.2804.648
[35, 45)403.4348.082
[45, 55)503.01911.101
[55, 65)601.73412.835
[65, 75)7052413.360

Media agrupada. Ponderando las marcas de clase por las frecuencias se obtiene 41,5 años.

Mediana agrupada. La mitad de 13.359 es 6.680, que cae en el intervalo [35, 45). Entonces:

x~35+6.6804.6483.43410=35+5,9=40,9\tilde{x} \approx 35 + \frac{6.680 - 4.648}{3.434} \cdot 10 = 35 + 5{,}9 = 40{,}9

Los valores exactos, calculados sobre los datos sin agrupar, son 41,0 años de media y 40,0 de mediana.

AgrupadoExactoError
Media41,541,0+0,5
Mediana40,940,0+0,9

Las dos aproximaciones se van para arriba, y la mediana casi un año. Con intervalos de diez años el error ya es perceptible, y crece con la amplitud: es el precio de haber perdido los datos originales.

7 · El desvío estándar

Mismo principio, usando las marcas de clase:

s2i=1k(xixˉ)2nin1s^2 \approx \frac{\sum_{i=1}^{k} (x_i - \bar{x})^2 \, n_i}{n-1}

Este es el cálculo que peor se porta de los tres, porque la dispersión dentro de cada intervalo se pierde por completo. El resultado tiende a subestimar la dispersión real.

8 · Errores frecuentes

  • Calcular con datos agrupados teniendo los originales. Es el error de concepto: se pierde precisión a cambio de nada.
  • Presentar el resultado como exacto. Siempre lleva “aproximadamente”.
  • Usar el límite inferior en vez de la marca de clase. Subestima la media de manera sistemática.
  • Intentarlo con un intervalo abierto. “65 y más” no tiene marca de clase. O se le asigna un valor razonable y se declara, o no se puede calcular la media.
  • Interpolar la mediana con la marca de clase. La fórmula arranca en el límite inferior del intervalo mediano, no en su centro.
  • Olvidar que el supuesto de uniformidad falla en las colas. En una distribución asimétrica, el último intervalo casi nunca tiene sus casos repartidos de manera uniforme.

9 · En el software

# R — a partir de marcas de clase y frecuencias
marcas <- c(20, 30, 40, 50, 60, 70)
frec   <- c(1368, 3280, 3434, 3019, 1734, 524)

media <- weighted.mean(marcas, frec)
desvio <- sqrt(sum(frec * (marcas - media)^2) / (sum(frec) - 1))
# Python
import numpy as np
marcas = np.array([20, 30, 40, 50, 60, 70])
frec   = np.array([1368, 3280, 3434, 3019, 1734, 524])

media = np.average(marcas, weights=frec)
desvio = np.sqrt(np.average((marcas - media)**2, weights=frec))
Excel:    =SUMAPRODUCTO(marcas; frecuencias) / SUMA(frecuencias)

Herramientas de este tema

Cómo citar esta entrada

APA (7.ª edición)

Montivero, J. L. (2026). Cálculos con datos agrupados. estadistica.ar. https://estadistica.ar/conceptos/datos-agrupados-y-sin-agrupar

BibTeX

@misc{estadistica_ar_datos_agrupados_y_sin_agrupar,
  author       = {Montivero, Jorge Luis},
  title        = {{Cálculos con datos agrupados}},
  year         = {2026},
  howpublished = {\url{https://estadistica.ar/conceptos/datos-agrupados-y-sin-agrupar}},
  note         = {estadistica.ar. Consultado el \today},
  urldate      = {2026-09-18}
}

Última actualización: 18 de septiembre de 2026. El contenido está bajo licencia CC BY-NC-SA 4.0: se puede reutilizar citando la fuente y sin fines comerciales.