Análisis de contenido cuantitativo
Convertir textos en datos: cómo se construye un libro de códigos, cómo se mide el acuerdo entre codificadores y qué aporta el análisis automático.
1 · Qué es
Un método para analizar textos —noticias, discursos, respuestas abiertas, documentos, publicaciones— convirtiéndolos en datos cuantificables de manera sistemática y replicable.
2 · Los pasos
1. Definir el universo y la unidad de análisis: ¿el artículo completo, el párrafo, la oración, la palabra?
2. Construir el libro de códigos: qué categorías hay, qué incluye cada una, qué la distingue de las vecinas, con ejemplos de casos límite.
3. Entrenar a los codificadores con material de prueba.
4. Medir el acuerdo entre codificadores en una submuestra.
5. Codificar el corpus completo.
6. Analizar con las técnicas cuantitativas habituales.
3 · La confiabilidad entre codificadores
Dos personas codifican el mismo material y se mide cuánto coinciden.
| Medida | Característica |
|---|---|
| Porcentaje de acuerdo | no corrige por azar: engañoso |
| Kappa de Cohen | corrige por el acuerdo esperable por azar; dos codificadores |
| Fleiss kappa | varios codificadores |
| Alfa de Krippendorff | admite cualquier cantidad, faltantes y todo tipo de escala |
| Acuerdo | |
|---|---|
| < 0,40 | pobre |
| 0,40 – 0,60 | moderado |
| 0,60 – 0,80 | bueno |
| > 0,80 | muy bueno |
4 · Manual o automático
| Codificación manual | Automática | |
|---|---|---|
| Volumen | cientos o miles | millones |
| Categorías complejas, ironía, contexto | sí | mal |
| Replicabilidad | requiere medirla | perfecta por construcción |
| Costo | alto | bajo |
| Validación | entre codificadores | contra codificación manual |
5 · Las técnicas automáticas
| Técnica | Qué hace |
|---|---|
| Frecuencias de términos | conteo simple, con normalización |
| TF-IDF | pondera términos por su especificidad |
| Diccionarios | cuenta palabras de listas predefinidas |
| Análisis de sentimiento | clasifica polaridad |
| Modelos de tópicos (LDA) | descubre temas latentes, sin supervisión |
| Clasificadores supervisados | aprenden de ejemplos codificados |
Los modelos de tópicos son el equivalente textual del análisis factorial: buscan dimensiones latentes, y como allá, la interpretación de cada tópico la pone el analista.
6 · Sus límites
Lo que se cuenta no siempre es lo que importa. La frecuencia de una palabra no mide su peso argumental ni su posición en el texto.
El contexto se pierde. La mayoría de las técnicas automáticas trata el texto como una bolsa de palabras: ignora el orden, la negación y la ironía.
Los diccionarios no se trasladan. Un diccionario de sentimiento en inglés no funciona en castellano, y uno de castellano peninsular no funciona igual en rioplatense.
El corpus condiciona todo. Si las fuentes están sesgadas, el resultado también.
7 · Errores frecuentes
- Reportar el porcentaje de acuerdo sin corregir por azar.
- No medir la confiabilidad entre codificadores.
- Cambiar el libro de códigos a mitad de la codificación.
- Usar un solo codificador sin ninguna verificación.
- Aplicar diccionarios de otro idioma o de otra variedad.
- Usar análisis de sentimiento sin validarlo contra codificación manual.
- Interpretar tópicos que no tienen coherencia semántica.
- Confundir frecuencia con importancia.
8 · En el software
# R
library(quanteda); library(irr)
corp <- corpus(textos)
dfm <- dfm(tokens(corp, remove_punct = TRUE),
remove = stopwords("spanish"))
topfeatures(dfm, 20)
kappa2(cbind(codificador1, codificador2)) # kappa de Cohen
kripp.alpha(t(cbind(c1, c2, c3))) # alfa de Krippendorff
library(topicmodels)
LDA(convert(dfm, to = "topicmodels"), k = 5)
# Python
from sklearn.feature_extraction.text import TfidfVectorizer
from sklearn.decomposition import LatentDirichletAllocation
from sklearn.metrics import cohen_kappa_score
X = TfidfVectorizer(stop_words=stopwords_es).fit_transform(textos)
LatentDirichletAllocation(n_components=5, random_state=2026).fit(X)
cohen_kappa_score(c1, c2)Cómo citar esta entrada
APA (7.ª edición)
Montivero, J. L. (2026). Análisis de contenido cuantitativo. estadistica.ar. https://estadistica.ar/conceptos/analisis-de-contenido-cuantitativo
BibTeX
@misc{estadistica_ar_analisis_de_contenido_cuantitativo,
author = {Montivero, Jorge Luis},
title = {{Análisis de contenido cuantitativo}},
year = {2026},
howpublished = {\url{https://estadistica.ar/conceptos/analisis-de-contenido-cuantitativo}},
note = {estadistica.ar. Consultado el \today},
urldate = {2026-09-19}
}Última actualización: 19 de septiembre de 2026. El contenido está bajo licencia CC BY-NC-SA 4.0: se puede reutilizar citando la fuente y sin fines comerciales.