Índice alfabético
Las 311 entradas de la enciclopedia, de la A a la Z. Si sabés cómo se llama lo que buscás, esta es la vía más corta.
A
Cómo se reparte el tamaño de muestra entre los estratos, qué gana cada criterio y por qué la afijación no proporcional obliga a ponderar.
Cómo se ajusta una tendencia a una serie y hasta dónde se la puede proyectar, que es mucho menos de lo que parece.
Los tres principios del diseño experimental: por qué el azar es lo único que controla lo desconocido y qué hace cada pieza.
Cómo se reducen muchas variables correlacionadas a unas pocas dimensiones: qué son los componentes, cuántos retener y cómo se interpretan.
Convertir textos en datos: cómo se construye un libro de códigos, cómo se mide el acuerdo entre codificadores y qué aporta el análisis automático.
El equivalente del PCA para variables categóricas: cómo se representa una tabla de contingencia en un plano y qué se puede leer en él.
ANOVA con una covariable continua: cómo ajusta las medias, cuánta potencia gana y el supuesto que casi nadie verifica.
Por qué las fórmulas del curso no sirven para la EPH ni para ninguna encuesta por conglomerados, y qué hay que declarar en su lugar.
Cuando el dato es la relación entre casos y no el caso: medidas de centralidad, estructura y por qué la independencia se rompe del todo.
Analizar el tiempo hasta que ocurre un evento: qué es la censura y por qué ninguna técnica anterior del curso sirve sin ella.
Clasificar casos en grupos conocidos a partir de varias variables: el método clásico, sus supuestos y su competencia con la regresión logística.
Buscar las dimensiones latentes detrás de un conjunto de indicadores: el modelo, sus supuestos y en qué se diferencia del PCA.
Cuando hay dos variables de agrupación a la vez: efectos principales, interacción y por qué conviene analizarlos juntos.
Cuando los mismos sujetos se miden varias veces: más potencia, un supuesto extra y las alternativas cuando no se cumple.
Cómo comparar las medias de tres o más grupos sin inflar el error tipo I, y por qué una prueba sobre varianzas decide sobre medias.
El indicador que pesa las muertes según cuán prematuras son, y que reordena por completo el ranking de causas.
El vocabulario del aprendizaje automático traducido al de la estadística: qué cambia de nombre, qué cambia de enfoque y qué no cambia.
Cuándo se puede reemplazar una binomial por una normal, la corrección por continuidad y por qué esto sostiene todo el trabajo con proporciones.
Hacia qué lado se estira la distribución, cómo se mide y por qué es lo que decide si conviene informar la media o la mediana.
Las tres reglas de Kolmogórov de las que se deduce todo lo demás, y las propiedades que conviene tener a mano para verificar un resultado.
B
Estimar la incertidumbre remuestreando los propios datos: cómo funciona, para qué sirve y el caso real donde falla.
Las reglas que hacen que un gráfico se entienda solo: qué lleva, qué sobra, cómo se usa el color y qué tiene que decir el epígrafe.
C
Cómo se calculan la media, la mediana y el desvío cuando lo único que se tiene es una tabla de frecuencias, y cuánto se pierde en el camino.
Cómo se traslada un índice a otra base y cómo se unen dos series con metodologías distintas, con sus límites.
Cómo se arma la planilla de carga para que los errores no entren: validaciones, códigos, doble carga y los controles que hay que correr antes de analizar.
Las tres formas de producir datos estadísticos, qué puede responder cada una y cuáles son sus límites, con los ejemplos del sistema estadístico argentino.
El estadístico visto como medida descriptiva: qué mide, por qué no sirve para comparar tablas y qué hay que hacer con él.
Contrastar si una distribución observada se ajusta a una teórica: frecuencias esperadas, grados de libertad y las condiciones que hay que verificar.
La misma cuenta que la prueba de independencia con una pregunta distinta: si varias poblaciones se distribuyen igual.
La prueba para tablas de contingencia: si dos variables categóricas están asociadas, con el cálculo completo y la medida de intensidad que hay que agregarle.
La medida estándar de asociación lineal entre dos variables cuantitativas: qué mide exactamente y qué no detecta.
Qué proporción de la variabilidad explica el modelo, cómo se descompone la suma de cuadrados y por qué un R² alto no garantiza nada.
La dispersión relativa a la media: la medida que permite comparar la variabilidad de dos variables medidas en unidades distintas.
Contar grupos donde el orden no importa: el número combinatorio, sus propiedades y por qué aparece en la fórmula de la binomial.
El procedimiento paso a paso para construir una tabla de frecuencias, con la notación de cada columna y las verificaciones que no hay que saltear.
Las preguntas que siempre aparecen en una defensa, qué contesta bien cada una y por qué reconocer un límite es más fuerte que justificarlo.
Qué hace falta para fundamentar un n, cuáles son los tres caminos legítimos y qué hacer cuando el tamaño lo impone la realidad y no el cálculo.
Qué mirar primero en una tabla de resultados, qué significan las columnas que siempre aparecen y cómo detectar que el programa calculó otra cosa.
La estructura de carpetas y los nombres de archivo que hacen que el trabajo se entienda meses después, sin pensar en cada decisión.
Qué acompaña a cada tipo de resultado para que sea evaluable: la lista de lo que va siempre, con ejemplos de redacción para cada análisis.
La diferencia entre la tabla de trabajo y la que va en el informe: qué lleva, qué se saca y cómo se ordena para que se lea sola.
Qué significa un r de 0,25 o de 0,8, por qué las tablas de umbrales engañan y qué hay que mirar además del número.
La frase exacta con la que se lee un coeficiente de regresión múltiple, y las cinco maneras de leerla mal.
La frase correcta para leer un OR ajustado, por qué no es un riesgo relativo y cómo convertirlo en algo que se entienda.
La salida estándar del ANOVA columna por columna, con las verificaciones que detectan un error antes de interpretar.
Por qué hacer muchas pruebas garantiza encontrar algo, las decisiones que inflan el error sin que nadie lo note, y cómo se corrige.
Después de rechazar el ANOVA, qué grupos difieren: los métodos disponibles, cuál elegir y cómo se controla el error acumulado.
Si el instrumento mide de manera consistente: qué es el alfa, cómo se interpreta y las tres cosas que no dice aunque se las atribuyan.
Agrupar casos parecidos construyendo un árbol: los métodos de enlace, cómo se lee un dendrograma y dónde cortarlo.
El algoritmo de agrupamiento más usado: cómo funciona, cómo se elige k y las formas de grupo que no puede encontrar.
Cómo se redacta una pregunta que no induzca la respuesta, cómo se ordena el cuestionario y por qué la prueba piloto no es opcional.
Cómo se combina un conjunto de indicadores en un solo número: las cuatro decisiones que lo determinan y por qué ninguna es técnica.
La idea de Shewhart: distinguir la variación que es parte del proceso de la que indica que algo cambió.
Cuando la muestra es una parte grande de la población, el error real es menor: cuándo aplicar el factor de corrección y cuánto cambia.
La correlación calculada sobre los puestos en vez de los valores: robusta a atípicos, válida con ordinales y capaz de detectar relaciones no lineales.
Las cinco explicaciones posibles de una asociación, qué hace falta para afirmar una causa y por qué la frase se repite tanto y se aplica tan poco.
La medida de cómo varían dos variables juntas: su signo se interpreta, su magnitud no, y por eso existe la correlación.
Quién entra al estudio y quién no: cómo se definen los criterios, por qué van antes del relevamiento y qué diferencia hay con excluir casos después.
Qué significa realmente 'no paramétrica', las cuatro situaciones donde corresponde y las tres donde se las usa por error.
Los valores que parten la distribución ordenada en partes iguales, cómo se calculan y por qué distintos programas pueden dar resultados algo distintos.
Los diseños no probabilísticos: cuándo son la única opción, qué permiten afirmar y cómo se declaran sin fingir que son otra cosa.
El peso de las colas de una distribución comparado con el de la normal: qué mide realmente la curtosis y qué no mide, pese a lo que suele decirse.
Cómo se mide la desigualdad de una distribución: la curva, el coeficiente que la resume y lo que ese único número no puede distinguir.
Cómo se estima y se lee una curva de supervivencia con datos censados, y cómo se comparan dos grupos.
D
Los tres tipos de faltante, por qué importa distinguirlos y cuáles son las opciones reales de tratamiento, incluida la de no hacer nada.
El último paso, que casi no se enseña: cómo se traduce una tabla de resultados en oraciones que un lector entiende y puede evaluar.
Cómo se comparan montos de distintos años en un país con inflación: la operación más necesaria y peor hecha de cualquier informe argentino.
La identidad que parte la variabilidad total en explicada y residual: el motor del ANOVA, de la regresión y del R².
Cómo se quita el patrón anual de una serie para poder comparar meses consecutivos, y por qué los datos desestacionalizados se revisan.
Los indicadores más citados y peor entendidos: sus denominadores, sus definiciones operativas y lo que dejan afuera.
El promedio de las distancias a la media en valor absoluto: la medida de dispersión más intuitiva y la menos usada, y por qué.
Los cuatro gráficos que hay que mirar después de ajustar cualquier modelo, y qué patrón indica cada problema.
El gráfico que resume la distribución en cinco números y señala los atípicos: cómo se construye, cómo se lee y por qué es insuperable para comparar grupos.
El gráfico que hay que hacer siempre antes de calcular una correlación: qué mostrar, qué mirar y cómo evitar que la nube se convierta en una mancha.
Un gráfico que no pierde los datos originales: muestra la forma de la distribución y al mismo tiempo permite leer cada valor.
El diseño experimental más simple: todas las unidades al azar entre todos los tratamientos, cuándo alcanza y cuándo queda corto.
Agrupar unidades parecidas para sacar su variabilidad del error: el diseño que más potencia gana por menos costo.
Cuántos éxitos en n intentos independientes: la distribución discreta más usada, sus cuatro condiciones y cómo se calcula.
La distribución de las sumas de cuadrados: asimétrica, solo positiva, y la base de las pruebas sobre varianzas y sobre tablas de contingencia.
La distribución de un solo intento con dos resultados: el ladrillo con el que se construyen la binomial y casi toda la estadística de proporciones.
Qué es una distribución de frecuencias, para qué sirve y cómo se leen las frecuencias absolutas, relativas y porcentuales de una variable.
La distribución de los conteos raros: cuántos eventos ocurren en un intervalo de tiempo o espacio, con un solo parámetro.
El tiempo entre eventos: la contracara continua de la Poisson, con su cola larga y su falta de memoria.
El cociente de dos varianzas: la distribución con dos pares de grados de libertad que sostiene el ANOVA y la comparación de modelos.
Cuántos intentos hasta el primer éxito: la distribución de la espera en ensayos repetidos, y su propiedad de falta de memoria.
La binomial sin reposición: qué cambia cuando cada extracción modifica la población y cuándo la diferencia deja de importar.
La distribución de los valores que tomaría la media si repitiéramos el muestreo: el concepto que hace posible toda la inferencia estadística.
El mismo razonamiento de la media aplicado a porcentajes: cómo varía una proporción de muestra en muestra y cuándo se puede usar la normal.
La campana de Gauss: sus dos parámetros, la regla del 68-95-99,7, por qué aparece en todos lados y por qué casi ninguna variable real la sigue exactamente.
La normal con colas más pesadas: por qué hace falta cuando se estima el desvío, qué son los grados de libertad y cuándo deja de importar.
Cuando todos los valores son igualmente probables: la versión discreta, la continua, y su papel como base de toda simulación.
E
Cuánto se aparta el error real de un diseño complejo del que daría un muestreo aleatorio simple, y cómo se usa ese número para calcular el tamaño de muestra.
El documento que traduce cada columna de la base a su definición, sus categorías y su origen: lo primero que se arma y lo único que sobrevive al olvido.
Por qué duplicar la precisión cuesta cuatro veces más, dónde conviene invertir el presupuesto de un relevamiento y cuándo más muestra no sirve de nada.
Cómo se construye el índice de precios más usado del país, qué mide exactamente y por qué casi nunca coincide con la inflación que uno percibe.
De la recta descriptiva al modelo estadístico: qué agrega el término de error y qué se puede inferir a partir de él.
Qué mide exactamente el valor p, cómo se calcula y cómo se lo reporta, con la definición precisa que casi nadie enuncia bien.
Decidir qué se va a calcular antes de tener los datos: qué contiene el plan, por qué se escribe primero y qué protege exactamente.
Un árbol de decisión para elegir la distribución que corresponde a cada problema, con las preguntas que la determinan y los pares que más se confunden.
De qué depende el resultado de una estandarización: las opciones habituales, qué cambia con cada una y por qué hay que declararla siempre.
El diseño que sí permite afirmar causa: qué hace la asignación al azar, para qué sirve el enmascaramiento y por qué el análisis va por intención de tratar.
Cuánto varía un estimador de muestra en muestra: el número que convierte una estimación puntual en un resultado con incertidumbre declarada.
Dos números que se parecen en el nombre y miden cosas distintas: qué describe cada uno, cuándo va cada uno, y cómo detectar el error en un gráfico.
La diferencia entre equivocarse al azar y equivocarse siempre para el mismo lado, y por qué aumentar la muestra arregla una cosa y no la otra.
Las distorsiones que aparecen una y otra vez en gráficos publicados: cómo reconocerlas al leer y cómo no cometerlas al producir.
Las dos maneras de equivocarse al decidir, por qué reducir una aumenta la otra y cómo se elige cuál importa más.
Los problemas que aparecen una y otra vez en trabajos de grado y posgrado, ordenados por etapa, con lo que hay que hacer en su lugar.
Construir un mapa a partir de distancias: cuándo sirve, cómo se evalúa el ajuste y en qué se diferencia del PCA.
Cómo se construye una escala de acuerdo, qué se puede calcular con ella y la discusión de fondo: ¿se puede promediar una ordinal?
Los cuatro niveles de medición de Stevens, qué operaciones habilita cada uno y por qué el nivel decide qué estadísticos tienen sentido.
El conjunto de todo lo que puede pasar y los subconjuntos que interesan: la notación mínima para poder calcular probabilidades sin confundirse.
El indicador que resume toda la mortalidad de una población en un número, y por qué no predice cuánto va a vivir nadie.
El valor medio teórico de una variable aleatoria: qué es, por qué casi nunca se espera observarlo, y sus dos propiedades que se usan todo el tiempo.
La diferencia entre resumir lo que se observó y sacar conclusiones sobre lo que no se observó, y por qué importa saber en cuál de las dos se está.
Qué se puede hacer bien con una planilla, qué funciones usar, y dónde está el límite a partir del cual conviene pasar a R o Python.
Los dos programas de menús más usados en las universidades argentinas: dónde está cada análisis y cómo dejar registro de lo que se hizo.
Cómo comparar poblaciones con estructuras de edad distintas: el método paso a paso, con un ejemplo donde el ranking se da vuelta.
El método para cuando las tasas específicas no son confiables: se aplican las tasas de referencia a la población propia y se compara lo observado con lo esperado.
Por qué casi ningún método multivariado funciona sin estandarizar, qué transformación usar y cuándo no corresponde.
Usar un número de la muestra para representar un parámetro de la población: qué es un estimador, por qué nunca va solo y cómo se elige entre varios.
Partir del resultado y mirar hacia atrás: el diseño eficiente para estudiar eventos poco frecuentes, y por qué solo permite calcular odds ratio.
Seguir a un grupo expuesto y a uno no expuesto para ver quién desarrolla el resultado: el diseño observacional que mejor se acerca a la causalidad.
La foto y la película: qué puede responder cada uno, qué cuesta cada uno, y por qué el orden temporal es el problema central del transversal.
El tamaño del efecto del ANOVA: cuánto de la variabilidad explica el factor, y por qué omega cuadrado es preferible.
Las cinco etapas de un trabajo con datos, de la pregunta a la comunicación, y por qué el análisis se diseña antes de relevar y no después.
Los principios que rigen la investigación con personas, qué tiene que decir un consentimiento y cómo se protegen los datos que se relevan.
Qué significa que dos eventos no puedan ocurrir juntos, y por qué eso es lo contrario de ser independientes.
Qué tiene que cumplir una situación para que se le pueda aplicar la probabilidad, y por qué el azar no es lo mismo que el desorden.
F
Los siete errores de razonamiento probabilístico que más aparecen, por qué son tan persuasivos y cómo desarmarlos.
Modelar cuánto dura un componente: la función de riesgo, la curva de la bañera y por qué la exponencial suele quedar corta.
Que cualquiera —incluido vos dentro de un año— pueda rehacer el análisis y llegar al mismo resultado: qué hace falta y qué hay que dejar de hacer.
Las dos formas de organizar la misma información cuando hay mediciones repetidas, cuál pide cada análisis y cómo se pasa de una a la otra.
Qué responde cada tipo de frecuencia, cómo se acumulan y por qué la columna acumulada es la forma más rápida de ubicar la mediana y los cuartiles.
Las tres distribuciones que conviven en una tabla cruzada: la conjunta, las marginales y las condicionales, y qué pregunta responde cada una.
Si los datos los generaste vos o los tomaste de otro, y qué obligaciones distintas trae cada caso a la hora de analizarlos y de citarlos.
Por qué en una variable continua la probabilidad se lee como área y no como altura, y qué significa entonces el valor de la curva.
La función que responde '¿cuál es la probabilidad de no superar este valor?': la que devuelven todas las tablas y todo el software.
Cómo se reparte la probabilidad entre los valores de una variable discreta: la tabla que define su comportamiento y las dos condiciones que tiene que cumplir.
G
Qué son realmente: cuántos valores podrían haber sido cualquier cosa una vez fijado lo que ya se calculó, y por qué cambian en cada prueba.
El gráfico para variables categóricas: cómo se construye, cómo se ordenan las barras y por qué el eje siempre tiene que arrancar en cero.
Cuándo un gráfico de torta funciona, cuándo no, y por qué casi siempre conviene reemplazarlo por barras.
Las cartas que detectan cuándo un proceso se sale de control: cuál corresponde a cada tipo de dato y cómo se leen las señales.
Qué gráfico corresponde según el tipo de las dos variables: el catálogo completo con sus trampas.
H
Cuando la varianza del error no es constante: qué rompe exactamente, cómo se detecta y por qué los errores robustos son la respuesta moderna.
Dos cosas distintas que se llaman igual: la conjetura sustantiva del trabajo y el par de enunciados formales que se contrastan con una prueba.
Cómo se plantean las dos hipótesis, por qué la nula siempre lleva el signo igual y cómo traducir una pregunta de investigación a símbolos.
El gráfico de una variable continua: cómo se construye, qué revela sobre la forma de la distribución y en qué se diferencia de un gráfico de barras.
I
El intervalo que responde 'de cuánto es la diferencia': cómo se construye para dos grupos y por qué es más informativo que la prueba t.
Comparar dos porcentajes con su incertidumbre: la diferencia en puntos, por qué no se comparan los intervalos individuales y qué medidas la acompañan.
El intervalo más simple de todos, que casi nunca se puede usar en la práctica pero que hace falta entender para el que sí se usa.
El intervalo que se usa en la práctica: con el desvío estimado de la muestra y la distribución t, paso a paso y con sus supuestos.
El intervalo asimétrico que estima la dispersión poblacional: por qué usa chi-cuadrado y por qué es mucho más sensible a la normalidad que los demás.
El intervalo para un porcentaje: la fórmula clásica, cuándo falla y qué método usar en su lugar cuando la proporción es extrema.
Casos nuevos contra casos existentes: dos indicadores que se confunden y que responden preguntas opuestas.
Cuándo saber que ocurrió un evento no cambia nada sobre otro, cómo se verifica y por qué es el supuesto más frágil de la estadística aplicada.
Cuánto se ajusta un proceso a lo que el cliente pide: Cp, Cpk y por qué el primero solo no alcanza.
Las tres fórmulas clásicas de índices ponderados: qué cantidades usa cada una, por qué una sobreestima y la otra subestima, y cuál se usa en la práctica.
Cómo se separa el aumento del gasto entre lo que subieron los precios y lo que creció el volumen: la descomposición básica de cualquier análisis económico.
De un solo producto a una canasta: por qué el promedio simple de índices casi nunca sirve y qué lo reemplaza.
Qué hace bueno a un estimador: las tres propiedades que permiten elegir entre varias formas de estimar el mismo parámetro.
Cuando el efecto de un factor depende del nivel de otro: cómo se lee en un gráfico, por qué depende de la escala y qué no se puede concluir sin ella.
Cuando el efecto de una variable depende de otra: cómo se especifica, cómo cambia la lectura de los demás coeficientes y por qué centrar ayuda.
Dos intervalos que se confunden todo el tiempo: uno para la media condicional y otro para un individuo, con anchos muy distintos.
Cómo se agrupa una variable continua en intervalos: cuántas clases conviene usar, qué amplitud darles y dónde poner los límites sin generar ambigüedad.
El marco que unifica la regresión lineal, la logística y la de Poisson: tres piezas y una tabla que ordena todo el módulo.
L
Por qué se supone lo contrario de lo que se quiere probar, y qué significa realmente rechazar o no rechazar una hipótesis.
El primer paso de todo análisis multivariado: cómo se lee, cómo se grafica y qué indica sobre si vale la pena seguir.
La tabla donde cada fila es un caso y cada columna una variable: el formato en el que todo software espera recibir los datos, y por qué conviene respetarlo.
La tabla que conecta objetivos, variables, indicadores y análisis en una sola página: el documento que evita descubrir al final que falta una pregunta.
Cuando la relación que se ve en el total desaparece o se invierte al mirar por subgrupos: el caso extremo de la confusión.
De dónde sale todo lo demás: cómo se formula una pregunta que se pueda responder con datos, y cómo se reconoce una que no.
Cómo se ajusta la recta que mejor resume una nube de puntos, qué significan su pendiente y su ordenada, y hasta dónde se la puede usar.
Por qué la media muestral se acerca a la poblacional cuando crece n, en qué se diferencia del teorema central del límite y qué falacia populariza su nombre.
La etapa más larga de cualquier trabajo con datos: qué se revisa, en qué orden, y por qué toda corrección tiene que quedar registrada.
Las seis interpretaciones erróneas más difundidas, por qué cada una es falsa y qué habría que decir en su lugar.
El procedimiento completo en siete pasos, con el ejemplo resuelto de punta a punta y la redacción final del resultado.
M
ANOVA con varias variables de respuesta a la vez: qué gana respecto de hacer varios ANOVA y cuándo realmente corresponde.
La lista desde la cual se sortea la muestra: por qué casi nunca coincide con la población y qué sesgos introduce esa diferencia.
La mitad del ancho de un intervalo de confianza: el número que se informa en las encuestas y las tres cosas que no incluye.
El promedio: qué propiedades tiene, por qué es tan usado y en qué situaciones deja de representar al conjunto que pretende resumir.
Las otras dos medias: la geométrica para tasas de crecimiento y la armónica para razones, con el criterio para saber cuál corresponde.
El promedio en el que cada valor pesa distinto: cómo se calcula, cuándo es obligatoria y por qué el promedio de promedios casi siempre está mal.
El criterio para elegir entre las tres medidas de posición central según la escala de la variable y la forma de la distribución.
El valor que parte al conjunto ordenado en dos mitades iguales, por qué no se deja arrastrar por los valores extremos y cuándo conviene usarla.
El suavizado más simple y más usado: cómo se elige la ventana, por qué se centra y qué pasa en los extremos de la serie.
Cómo se mide cuán parecidos son dos casos: las distancias más usadas, cuándo cada una y por qué la elección cambia los resultados.
De dónde salen las fórmulas de los estimadores: los dos procedimientos generales que las producen, sin demostraciones.
Qué hacer cuando las observaciones están agrupadas: efectos aleatorios, correlación intraclase y por qué ignorar la estructura produce falsos positivos.
El valor que más se repite: la única medida de posición que sirve para variables nominales, y la que revela distribuciones con más de un pico.
El diseño de referencia: todas las muestras posibles tienen la misma probabilidad. Cómo se hace, cuándo conviene y por qué casi nunca se usa en encuestas grandes.
Decidir si un lote se acepta o se rechaza inspeccionando una muestra: los planes, sus riesgos y por qué la industria moderna lo abandonó.
Dividir la población en grupos homogéneos y sortear dentro de cada uno: el diseño que gana precisión y garantiza representación de los grupos chicos.
Combinar varios diseños en etapas sucesivas: cómo funciona el esquema que usan todas las encuestas nacionales y qué implica para el análisis.
Sortear grupos enteros en lugar de individuos: el diseño que hace viables las encuestas de campo, y el precio que se paga en precisión.
La división que decide si se puede generalizar: qué significa que cada unidad tenga probabilidad conocida de ser elegida, y qué se pierde cuando no la tiene.
Un arranque al azar y después cada k-ésima unidad: el diseño más práctico en campo, y el único riesgo real que tiene.
Cuando las predictoras se solapan entre sí: qué rompe, cómo se mide con el VIF y por qué muchas veces no hay que hacer nada.
N
Los indicadores que describen la dinámica de una población: qué mide cada uno, cómo se combinan y cuál es su límite.
Qué se elige cuando se elige 95 %, qué se paga por subirlo y por qué ese número es una convención y no una propiedad de los datos.
Qué es alfa, de dónde salió el 0,05, por qué es una convención y no una ley, y cuándo conviene apartarse de él.
Quiénes no contestan y por qué eso importa más que cuántos: los dos tipos de no respuesta y cómo se corrigen.
Cómo se convierte cualquier normal en la de media 0 y desvío 1, y cómo se usa esa única tabla para calcular cualquier probabilidad.
Cómo se leen los símbolos que aparecen en todas las fórmulas de la materia, empezando por la sumatoria, y la convención de notación de este sitio.
O
Tres conceptos que se confunden —atípico, leverage e influencia— y qué hacer con el caso que mueve el modelo entero.
El gráfico de la frecuencia acumulada: cómo se construye y cómo se leen en él la mediana, los cuartiles y cualquier percentil.
El paso de un concepto abstracto a algo que se puede medir: cómo se define, qué decisiones hay que tomar y por qué todas se declaran.
P
La distinción entre el valor verdadero de la población y el que se calcula con la muestra, y la notación griega y latina que los separa.
Contar arreglos donde el orden importa: todos los elementos o algunos, con repetición o sin ella.
El gráfico que resume la estructura por edad y sexo: cómo se construye, qué formas existen y qué se lee en sus irregularidades.
Qué es la población de un estudio, qué es una muestra, y por qué definir mal la población arruina todo lo que venga después.
La línea que une las marcas de clase de un histograma, para qué sirve realmente y cuándo conviene usarla en lugar de las barras.
Por qué cada caso de una encuesta representa a una cantidad distinta de personas, cómo se usa ese número y qué pasa si se lo ignora.
La elección del multiplicador no es cosmética: define cuántos decimales hacen falta y cuán comparable es el indicador.
La corrección de Bessel explicada sin demostración: por qué dividir por n subestima la varianza poblacional y cuándo corresponde cada denominador.
Las razones para observar una parte en vez del todo, y por qué una muestra bien elegida puede ser más precisa que un censo mal hecho.
La decisión que más errores produce al presentar una tabla cruzada, con la regla que la resuelve en un paso.
La probabilidad de detectar un efecto que existe: de qué depende, cómo se calcula el n necesario y por qué la mayoría de los estudios no la declara.
Declarar públicamente el plan antes de mirar los datos: qué problema resuelve, qué se registra y por qué está cambiando la práctica científica.
Lo mínimo de pandas para importar, explorar y describir una base, y cuándo conviene Python en vez de R.
Lo mínimo para dejar de depender de la planilla: importar una base, mirarla, calcular descriptivos y graficar, sin aprender a programar antes.
La regla de conteo de la que salen todas las demás: si una tarea tiene etapas, las posibilidades se multiplican.
Tres maneras de asignar probabilidades, cuándo sirve cada una y por qué la discusión entre ellas reaparece en la inferencia.
Cómo cambia la probabilidad de un evento cuando ya se sabe que ocurrió otro: la idea que está detrás de casi toda la estadística aplicada.
Cómo se estima la población futura con el método de los componentes, qué tan confiables son y por qué toda tasa depende de ellas.
La no paramétrica para tres o más medidas repetidas: rangos dentro de cada sujeto, que es lo que la hace potente.
La prueba basada en la máxima distancia entre distribuciones acumuladas: para contrastar contra una teórica o entre dos muestras.
La alternativa no paramétrica al ANOVA de un factor: rangos sobre tres o más grupos, con sus post hoc y su tamaño del efecto.
La prueba más simple de todas: contar cuántas diferencias son positivas y compararlo con una binomial.
La prueba de aleatoriedad: si una secuencia tiene demasiadas o muy pocas rachas para haber salido al azar.
La alternativa no paramétrica a la t pareada: rangos con signo sobre las diferencias, y la confusión de nombres que conviene aclarar de entrada.
La alternativa al chi-cuadrado cuando los conteos son chicos: probabilidad exacta por la hipergeométrica, sin aproximaciones.
Comparar la dispersión de dos grupos: el cociente de varianzas, su extrema sensibilidad a la normalidad y por qué conviene Levene.
Comparar el porcentaje de dos grupos: la proporción combinada, por qué el error estándar cambia respecto del intervalo y su equivalencia con el chi-cuadrado.
Contrastar una proporción contra un valor de referencia: la prueba z, la exacta binomial y cuándo cada una.
Comparar las medias de dos grupos: la versión de Welch, la clásica, cuál usar y qué significa el resultado.
Cuando cada dato tiene su par: antes y después, o casos emparejados. Por qué trabajar con las diferencias multiplica la potencia.
La prueba que efectivamente se usa para contrastar una media: cuándo aplicarla, qué supone y cómo se lee su salida.
La alternativa no paramétrica a la prueba t para dos grupos: qué compara realmente y el supuesto que casi nadie declara.
La prueba más simple sobre una media, cuándo es aplicable —casi nunca— y por qué se enseña igual.
Cómo se contrasta la normalidad, por qué con muestras grandes rechazan siempre y por qué el gráfico Q-Q es mejor que cualquier valor p.
Construir la distribución nula barajando las etiquetas: la prueba más directa que existe, y la que mejor muestra qué significa un valor p.
Cómo se decide si una variable aporta al modelo: la prueba t de cada coeficiente, el F global y sus intervalos de confianza.
Cuándo la prueba mira una sola dirección, cómo cambia el valor crítico y por qué elegir unilateral después de ver los datos es hacer trampa.
Medir lo que no se ve directamente: de la teoría clásica de los tests a la TRI, y por qué el puntaje total no alcanza.
Cuántos desvíos estándar separan a un valor de la media: la transformación que vuelve comparables variables de escalas distintas.
La confusión más frecuente al informar cambios de un indicador que ya es un porcentaje, con la regla que la evita.
Q
Cuándo hacen falta técnicas para muchas variables a la vez, cómo se ordenan las que existen y qué pregunta responde cada familia.
La disciplina que se ocupa de obtener, organizar y analizar datos para describir la realidad y decidir con información incompleta.
El rango de valores compatibles con los datos: cómo se construye, de qué depende su ancho y por qué es más informativo que cualquier p-valor.
La herramienta para comparar magnitudes a lo largo del tiempo: qué significa la base, cómo se lee y por qué no se promedian ni se restan.
Datos ordenados en el tiempo: qué los distingue de cualquier otro conjunto y por qué casi ninguna técnica del curso se les aplica directamente.
La característica que se mide en cada unidad de análisis y que toma valores distintos según el caso: el ladrillo con el que se construye todo lo demás.
El criterio para elegir la representación correcta según cuántas variables hay, de qué tipo son y qué se quiere mostrar.
El árbol de decisión completo: las cuatro preguntas que determinan la prueba, la tabla de equivalencias paramétricas y no paramétricas, y los casos límite.
El malentendido más extendido de la estadística aplicada, desarmado con una simulación: la confianza es una propiedad del método, no del intervalo que te tocó.
R
Por qué el R² no sirve para comparar modelos y qué usar en su lugar, con la demostración empírica de agregar ruido puro.
La dispersión del 50 % central de los datos: la medida robusta que acompaña a la mediana y la que define qué valores se consideran atípicos.
La medida de dispersión más simple: la distancia entre el máximo y el mínimo, lo que informa y por qué casi nunca alcanza.
Tres palabras que se usan como sinónimos y no lo son: qué va en el denominador de cada una y por qué eso cambia la interpretación.
Cuántos decimales corresponde informar, cuándo redondear y por qué arrastrar quince decimales no es más riguroso sino menos honesto.
Dónde está la frontera entre rechazar y no rechazar, cómo se la ubica en la distribución y por qué hoy conviene el valor p.
Cómo se calcula la probabilidad de que ocurra uno u otro evento, por qué hay que restar la intersección y cuándo no hace falta.
Cómo se calcula la probabilidad de que ocurran dos eventos a la vez, con y sin independencia, y cómo encadenarla para varios pasos.
Qué proporción de los datos cae dentro de uno, dos o tres desvíos de la media: la regla del 68-95-99,7 y la cota que vale para cualquier distribución.
Por qué los valores extremos tienden a moderarse en una segunda medición, y cuántas conclusiones falsas produce ignorarlo.
El modelo para conteos: coeficientes multiplicativos, el término de exposición y la sobredispersión que casi siempre aparece.
Varias predictoras a la vez: qué significa 'controlar por', cuánto aporta cada variable y los problemas que aparecen al agregarlas.
El modelo para variables de respuesta binaria: por qué no sirve la regresión lineal, qué es el logit y cómo se evalúa el ajuste.
La división que ordena toda la escritura de una tesis: los hechos en una sección, su interpretación en la otra, y qué pasa cuando se mezclan.
Investigar sobre lo ya investigado con método explícito: cómo se hace una revisión sistemática y qué agrega combinar los resultados estadísticamente.
Las dos medidas que comparan el riesgo entre grupos, en qué se diferencian, cuándo corresponde cada una y por qué el OR exagera.
Por qué la solución factorial inicial casi nunca se puede interpretar y cómo la rotación la vuelve legible sin cambiar el ajuste.
S
Cómo se decide qué entra en el modelo, por qué los métodos automáticos tienen mala prensa y qué hacer en su lugar.
Las cuatro medidas de una prueba diagnóstica, cuál mira el clínico y cuál el laboratorio, y por qué solo dos dependen de la prevalencia.
Por qué los precios no se analizan como cualquier serie: rendimientos, colas pesadas y agrupamiento de la volatilidad.
Las tres familias de errores sistemáticos que distorsionan un estudio, cómo se reconocen y en qué etapa se puede hacer algo con cada una.
Por qué un resultado significativo puede no importar y uno no significativo puede importar mucho: las cuatro combinaciones posibles.
Cuando el modelo aprende el ruido de la muestra: cómo se detecta, cómo se mide la capacidad predictiva real y por qué el R² no alcanza.
Qué significa que los grupos tengan la misma dispersión, cómo se verifica y por qué la recomendación actual es no usar esa verificación para elegir la prueba.
Los tres supuestos, cuánto importa cada uno, cómo se verifican y qué hacer cuando no se cumplen.
Los cinco supuestos, cuánto importa cada uno, en qué orden verificarlos y qué hacer cuando fallan.
T
Cómo se arma y se lee una tabla de doble entrada: la herramienta básica para cruzar dos variables categóricas.
Cómo se numeran, titulan y citan las tablas y los gráficos de un trabajo académico, y cuándo conviene cada uno.
Cuando la población es chica hacen falta muchos menos casos de los que sugiere la fórmula estándar: el ajuste y cuánto cambia.
Despejar n a partir de la precisión buscada: la fórmula, de dónde sale la estimación previa del desvío y qué hacer si no se tiene.
El cálculo más usado de todos: cuántos casos hacen falta para un margen de error dado, y por qué se usa 0,5 cuando no se sabe nada.
La medida que dice cuán grande es lo que se encontró, independiente del tamaño de la muestra: cuál corresponde a cada prueba y cómo se interpreta.
Cómo se resume el crecimiento de varios períodos en un número: la tasa media geométrica, y por qué el promedio simple da mal.
El indicador más usado para comparar condiciones de vida: cómo se calcula, en qué se descompone y por qué su denominador no es la población.
La tasa general esconde lo que pasa en cada grupo: por qué la bruta puede engañar y qué aportan las específicas.
La correlación ordinal basada en contar pares concordantes y discordantes: más interpretable que Spearman y mejor con empates.
Las cuatro partes en que se descompone una serie de tiempo, cómo se combinan y qué se hace con cada una.
Por qué la distribución de la media se vuelve normal aunque la población no lo sea: el resultado que sostiene casi toda la estadística aplicada.
Cómo invertir una probabilidad condicional, por qué el resultado suele desafiar la intuición y qué papel juega la prevalencia.
Cómo se calcula la probabilidad de un evento sumando lo que aporta cada subgrupo, y por qué es el paso previo indispensable para Bayes.
El mapa de los diseños de investigación y, sobre todo, qué puede afirmar cada uno: por qué solo algunos permiten hablar de causa.
La primera clasificación de toda variable: cualitativa o cuantitativa, y dentro de las cuantitativas, discreta o continua. De acá sale qué análisis corresponde.
La tercera vía entre la prueba paramétrica y la no paramétrica: qué transformación corresponde a cada problema y qué cambia en la interpretación.
U
Qué es exactamente lo que se cuenta y se mide en un estudio, por qué hay que decidirlo antes de empezar, y qué pasa cuando se mezcla.
Cómo se leen las tablas de z, t, chi-cuadrado y F sin equivocarse de cola, y qué función del software reemplaza a cada una.
V
Las medidas que convierten el chi-cuadrado en un número entre 0 y 1, comparable entre tablas y entre estudios.
Si el instrumento mide lo que dice medir: los tipos de validez, cómo se argumenta cada uno y por qué es distinta de la confiabilidad.
Cómo se identifica un valor extremo, por qué 'atípico' no significa 'erróneo' y cuál es el único criterio legítimo para descartar un dato.
La función que traduce los resultados de un experimento a números: el puente entre la probabilidad y todo lo que se puede calcular con ella.
Dos variables a la vez: distribución conjunta, marginales, condicionales, covarianza y qué significa exactamente que sean independientes.
La tercera variable que produce asociaciones espurias: cómo se la reconoce, cómo se la controla y por qué no toda variable intermedia debe controlarse.
Cómo entran las variables categóricas en un modelo: la categoría de referencia, la trampa de las dummy y cómo se leen los coeficientes.
Tres números distintos sobre el mismo dato: qué compara cada uno, cuál usar y por qué las mensuales no se suman.
La cuenta más usada de todas y la que más se hace mal: qué va en el denominador, por qué no es simétrica y cómo se encadenan varias.
La dispersión teórica alrededor de la esperanza: la fórmula práctica para calcularla y la propiedad de la suma que exige independencia.
Las dos medidas de dispersión más usadas: cómo se calculan, qué significan y por qué una se informa y la otra casi nunca.
¿Preferís recorrerlo por tema? Está la enciclopedia por módulos y los itinerarios por carrera. Y si no sabés cómo se llama lo que buscás, el buscador mira dentro del texto.