Cargar datos sin generar errores
Cómo se arma la planilla de carga para que los errores no entren: validaciones, códigos, doble carga y los controles que hay que correr antes de analizar.
1 · Definición
La carga de datos es el paso de trasladar la información del instrumento —cuestionario en papel, planilla de campo, registro— a la matriz de datos.
2 · Por qué importa tanto
Porque un error de carga es invisible. Un ingreso con un cero de más no levanta ninguna alarma: se convierte en un dato más, entra en los promedios, y solo aparece —con suerte— cuando alguien mira los extremos.
Y porque el análisis no puede corregirlo. Si el dato entró mal, todas las cuentas posteriores están mal, por más sofisticado que sea el método.
3 · Cómo se arma la planilla
Una hoja, sin adornos. Primera fila los nombres de variable, una fila por caso, nada más. Sin títulos arriba, sin celdas combinadas, sin totales.
Un identificador único por caso. Una columna id con un número correlativo
que permita volver al cuestionario original. Sin eso, un dato sospechoso no se
puede verificar.
Validaciones en cada columna. Es lo que más rinde:
- Listas desplegables para las variables categóricas, con las categorías del diccionario. Así no se puede escribir “Femenino”, “femenino” y “F” en la misma columna.
- Rangos permitidos para las numéricas. Si la edad va de 18 a 99, que la planilla rechace un 180.
- Formato de fecha único y declarado.
Códigos explícitos para los faltantes. Nunca un blanco ambiguo: un código para “no contestó” y otro para “no corresponde”.
Bloqueo de lo que no se toca. Los encabezados y las fórmulas se protegen.
4 · La doble carga
Es el control más efectivo que existe y el menos usado: dos personas cargan los mismos datos de forma independiente y después se comparan las dos bases. Donde difieren, hay un error, y se va al cuestionario original.
No detecta los errores que las dos personas cometen igual —leer mal un número borroso— pero elimina prácticamente todos los de tipeo.
Cuando no hay recursos para cargar todo dos veces, se hace sobre una submuestra del 10 %: no corrige la base entera, pero estima la tasa de error y avisa si es alta.
5 · Los controles antes de analizar
Cargada la base, cinco controles que llevan diez minutos:
- Contar filas. ¿Coincide con la cantidad de cuestionarios? Si no, hay duplicados o pérdidas.
- Buscar identificadores repetidos. Un
idduplicado es un caso cargado dos veces. - Mínimos y máximos de cada variable numérica. Es donde aparecen los ceros de más y las edades imposibles.
- Tabla de frecuencias de cada categórica. Ahí saltan las categorías inventadas, los errores de tipeo y los códigos que no existen en el diccionario.
- Contar faltantes por columna. Una variable con muchos más vacíos de los esperados indica un problema de carga o de campo.
Ninguno de los cinco requiere saber estadística. Todos deberían correrse siempre.
6 · Errores frecuentes
- Cargar sin identificador. Sin
idno se puede volver al original y ningún error se puede verificar. - Usar el mismo símbolo para faltante y para cero. Un ingreso vacío y un ingreso de cero son cosas distintas, y confundirlos corre todos los promedios.
- Escribir unidades en la celda. “45 kg” convierte la columna en texto y ningún cálculo funciona. La unidad va en el diccionario y en el nombre de la variable.
- Usar colores para marcar casos dudosos. El color no se exporta. Si una marca importa, va en una columna.
- Cargar categorías a mano libre. Sin lista desplegable, la misma categoría aparece escrita de cinco formas.
- Hacer correcciones sobre el archivo original. La base cruda no se toca nunca: las correcciones van en un script o en una copia, con registro de qué se cambió.
- Empezar a analizar sin correr los controles. Diez minutos ahorrados que cuestan una semana.
7 · En el software
# R — los cinco controles
nrow(datos) # cantidad de casos
sum(duplicated(datos$id)) # identificadores repetidos
summary(datos) # mínimos, máximos y NA de una
lapply(datos[categoricas], table) # categorías inesperadas
colSums(is.na(datos)) # faltantes por columna
# Python
len(datos)
datos["id"].duplicated().sum()
datos.describe(include="all")
datos["sexo"].value_counts(dropna=False)
datos.isna().sum()
Excel: Datos › Validación de datos listas y rangos permitidos
Revisar › Proteger hoja bloquear encabezados
Formato condicional resaltar duplicados al cargar
SPSS: Datos › Validación › Cargar reglasHerramientas de este tema
- PlantillaPlanilla de carga con validaciones· en preparación
Cómo citar esta entrada
APA (7.ª edición)
Montivero, J. L. (2026). Cargar datos sin generar errores. estadistica.ar. https://estadistica.ar/conceptos/carga-de-datos-sin-errores
BibTeX
@misc{estadistica_ar_carga_de_datos_sin_errores,
author = {Montivero, Jorge Luis},
title = {{Cargar datos sin generar errores}},
year = {2026},
howpublished = {\url{https://estadistica.ar/conceptos/carga-de-datos-sin-errores}},
note = {estadistica.ar. Consultado el \today},
urldate = {2026-09-18}
}Última actualización: 18 de septiembre de 2026. El contenido está bajo licencia CC BY-NC-SA 4.0: se puede reutilizar citando la fuente y sin fines comerciales.