Cargando aplicación...
Preparando tu experiencia meskeIA
De contar ganado para calcular impuestos a predecir qué película verás esta noche: 5.000 años de la ciencia de los datos
Haz clic en un período para ver sus detalles. La línea abarca de 3000 a.C. a Presente.
De contar ganado para calcular impuestos a predecir qué película verás esta noche: 5.000 años de la ciencia de los datos
Del censo babilónico que contaba cabezas de ganado para calcular impuestos (~3000 a.C.) al algoritmo de machine learning que predice qué película verás esta noche: la estadística es la ciencia de extraer información de datos inciertos. En 5.000 años ha pasado de herramienta del Estado a fundamento de la medicina, la economía y la inteligencia artificial. Hoy, cada vacuna aprobada, cada encuesta electoral y cada recomendación de Netflix son estadística aplicada. Entender sus conceptos básicos —y sus limitaciones— es una competencia ciudadana esencial.
| Período | Fecha | Categoría | Figura clave | Aportación principal |
|---|---|---|---|---|
| Media y varianza | 1809 (Gauss) | Estadística descriptiva | Carl Friedrich Gauss | Descripción numérica de una distribución de datos |
| Correlación de Pearson | 1895 (Pearson) | Estadística descriptiva | Karl Pearson | Mide la relación lineal entre dos variables (-1 a +1) |
| P-valor | 1925 (Fisher) | Inferencia estadística | Ronald Fisher | Probabilidad de obtener el resultado observado si la hipótesis nula es cierta |
| Intervalo de confianza | 1937 (Neyman) | Inferencia estadística | Jerzy Neyman | Rango de valores plausibles para el parámetro estimado |
| Regresión lineal | 1886 (Galton) | Modelización | Francis Galton | Predice el valor de una variable a partir de otra u otras |
| Teorema de Bayes | 1763 (Bayes/Laplace) | Probabilidad bayesiana | Thomas Bayes / Pierre-Simon Laplace | Actualiza probabilidades a medida que llega nueva información |
Durante la Guerra de Crimea, Florence Nightingale recogió datos sistemáticos sobre las causas de muerte de los soldados en el hospital de Scutari. Descubrió que el 87% de las muertes se debían a enfermedades infecciosas prevenibles (cólera, tifus, disentería), no a heridas de combate. Para comunicarlo al Parlamento Británico, diseñó los diagramas de área polar (coxcombs): infografías estadísticas que mostraban en colores las causas de muerte mes a mes. Su presentación convenció al Parlamento de invertir en saneamiento y mejorar las condiciones hospitalarias. La tasa de mortalidad en el hospital cayó del 42% al 2% en seis meses tras las reformas. Nightingale demostró que la visualización estadística puede salvar vidas al hacer comprensibles los datos para quienes toman decisiones.
Francis Galton usó los mismos conceptos estadísticos (correlación, regresión a la media) para dos fines completamente distintos: describir la herencia de la inteligencia (científicamente válido) y proponer la eugenesia —la mejora de la raza humana mediante control de la reproducción (éticamente execrable). La eugenesia fue adoptada como política pública en EEUU (más de 60.000 esterilizaciones forzadas documentadas entre 1907 y 1981) y en la Alemania nazi (base pseudo-científica del Holocausto). Este caso muestra que la validez matemática de una herramienta estadística no garantiza la validez ética de sus aplicaciones. La misma correlación que hoy usamos para análisis de mercado, genómica o psicología fue usada para justificar crímenes contra la humanidad. La historia de la estadística no puede contarse sin este episodio.
Publicar en una revista científica de prestigio no garantiza que un resultado sea real. La crisis de replicación reveló que muchos estudios publicados en las mejores revistas de psicología, medicina y economía no podían ser reproducidos por otros investigadores. Las causas son estadísticas: muestras pequeñas (poca potencia estadística), p-hacking (buscar análisis que den p<0,05), sesgo de publicación (las revistas solo publican resultados positivos) y falta de pre-registración de hipótesis. El resultado es que el 61% de los estudios de psicología social no se replicaron. La solución es también estadística: pre-registración de hipótesis, datos abiertos, aumento de tamaños muestrales y transparencia en el análisis. La crisis de replicación es una lección sobre los límites y el uso correcto de la estadística.
El machine learning no es una disciplina separada de la estadística: es estadística aplicada a escala computacional masiva. La regresión logística (estadística clásica) clasifica imágenes de spam. Los árboles de decisión (técnica estadística de los años 1980) se usan para diagnóstico médico. Los random forests (ensemble de árboles) predicen precios de viviendas. Las redes neuronales son regresiones no lineales con millones de parámetros. Los LLMs como GPT o Claude aprenden distribuciones de probabilidad condicional sobre texto y generan el token más probable dado el contexto. Toda la revolución de la IA moderna está construida sobre fundamentos estadísticos: probabilidad, optimización, estimación de distribuciones. Entender estadística es entender IA.
El p-valor es la probabilidad de obtener un resultado al menos tan extremo como el observado, asumiendo que no hay ningún efecto real (hipótesis nula). Si p=0,03, significa que si no hubiera ningún efecto, obtendríamos este resultado (o uno más extremo) solo el 3% de las veces. Lo que NO significa: que el resultado sea verdadero con un 97% de probabilidad, que el efecto sea grande o importante, ni que sea reproducible. Se abusa del p-valor porque publicar resultados con p<0,05 es más fácil en las revistas científicas, lo que incentiva el p-hacking y el sesgo de publicación. La American Statistical Association recomendó en 2016 no usar el p-valor como único criterio de validez científica.
Un p<0,05 con una muestra de 10 personas es mucho menos convincente que un p<0,05 con una muestra de 10.000 personas.La correlación mide si dos variables tienden a variar juntas (cuando una sube, la otra también, o cuando una baja, la otra sube). La causalidad implica que una variable produce el cambio en la otra. Una correlación puede existir sin causalidad por tres razones: causalidad inversa (A parece causar B, pero B causa A), variable confusora (una tercera variable C causa tanto A como B), o pura coincidencia. Ejemplo clásico: los países con más televisores por habitante tienen mayor esperanza de vida. Los televisores no causan longevidad: ambas variables están causadas por el nivel de desarrollo económico. Establecer causalidad requiere experimentos aleatorizados o métodos cuasi-experimentales (diferencias en diferencias, regresión discontinua, variables instrumentales).
El sitio Spurious Correlations (tylervigen.com) muestra correlaciones absurdas como la entre los ahogados en piscinas y las películas de Nicolas Cage.El sesgo de confirmación es la tendencia a buscar, interpretar y recordar datos que confirman creencias previas, ignorando los que las contradicen. En análisis de datos, se manifiesta como: elegir el período de análisis que muestra el resultado deseado, comparar con el grupo de referencia conveniente, ignorar variables confusoras, o detener el análisis cuando el resultado es positivo (sin esperar la muestra completa). La solución estadística es la pre-registración: declarar antes de ver los datos qué hipótesis se va a probar, con qué método y con qué muestra. Esto hace que el análisis sea verificable y reduce el sesgo de confirmación.
Una encuesta representativa requiere: (1) Marco muestral claro: definir exactamente la población que se quiere estudiar. (2) Muestreo aleatorio: cada individuo de la población debe tener la misma probabilidad de ser seleccionado (o una probabilidad conocida, en muestreo estratificado). (3) Tamaño muestral suficiente: para una precisión de ±3% con 95% de confianza, se necesitan ~1.067 personas independientemente del tamaño total de la población. (4) Control del sesgo de respuesta: los que responden pueden ser sistemáticamente diferentes de los que no responden. El error de las encuestas electorales recientes (Brexit, EEUU 2016/2020) se debió principalmente a sesgos de muestreo no cubiertos (votantes rurales, baja participación de ciertos grupos) y a errores en las ponderaciones estadísticas posteriores.
El tamaño de muestra para una encuesta nacional es similar al de una encuesta local: lo que importa no es el tamaño relativo de la muestra sino el absoluto.El teorema de Bayes (Thomas Bayes, 1763) describe cómo actualizar la probabilidad de una hipótesis cuando llega nueva evidencia. La fórmula: P(H|E) = P(E|H) × P(H) / P(E). En palabras: la probabilidad posterior de que H sea cierta dado que observamos E es proporcional a la probabilidad de observar E si H fuera cierta, multiplicada por la probabilidad previa de H. Ejemplo: si un test de enfermedad tiene un 99% de sensibilidad y la prevalencia de la enfermedad es del 1%, un resultado positivo solo implica ~50% de probabilidad real de tener la enfermedad. Importa porque: es la base de los filtros de spam, del diagnóstico médico bayesiano, del machine learning probabilístico, de los LLMs y de la epidemiología moderna.
El teorema de Bayes fue publicado en 1763 por Richard Price tras la muerte de Bayes; Laplace lo desarrolló independientemente y le dio la forma moderna.El primer paso de un estudio estadístico riguroso es declarar, antes de ver ningún dato, qué se va a probar: la hipótesis nula (no hay efecto), la hipótesis alternativa (hay efecto), el método estadístico que se va a usar, el tamaño muestral objetivo y el criterio de decisión. Esta pre-registración puede hacerse en plataformas como OSF (Open Science Framework) o AsPredicted.org. La razón es sencilla: si se decide qué probar después de ver los datos, se puede elegir la hipótesis que los datos ya confirman, generando un falso positivo. La pre-registración hace el análisis verificable y limita el p-hacking.
Antes de recoger datos, se debe calcular cuántas observaciones se necesitan para tener una probabilidad razonable (típicamente 80%) de detectar el efecto de interés si existe. Este cálculo depende de tres parámetros: el tamaño del efecto esperado (¿cuánto cambia la variable de resultado?), el nivel de significación elegido (0,05) y la potencia deseada (1 menos la probabilidad de falso negativo). Estudios con muestras demasiado pequeñas tienen baja potencia: pueden no detectar efectos reales (falsos negativos) o, si detectan algo, el efecto es probablemente una sobreestimación (winner's curse). Hay calculadoras de potencia gratuitas: G*Power, pwr en R.
La aleatorización —asignar participantes al grupo de tratamiento o al grupo control mediante un proceso aleatorio— es el elemento clave que distingue un experimento de una observación. La aleatorización garantiza que, en promedio, los dos grupos son iguales en todas las variables (observadas y no observadas) antes del tratamiento, lo que permite atribuir cualquier diferencia posterior al tratamiento y no a diferencias previas entre los grupos. Sin aleatorización, las diferencias observadas pueden deberse a variables confusoras (selection bias). Los ensayos clínicos aleatorizados (RCT) son el estándar de oro en medicina; cuando la aleatorización no es posible (ética, práctica), se usan métodos cuasi-experimentales.
Una vez recogidos los datos, el análisis debe seguir el plan pre-especificado. Si se descubren datos atípicos (outliers), su tratamiento debe justificarse explícitamente y, si se eliminan, el análisis debe hacerse también con ellos incluidos. Si hay datos faltantes (missing data), el método de imputación debe estar justificado. El análisis exploratorio (buscar patrones no anticipados en los datos) es valioso y legítimo, pero debe presentarse como hipótesis generadoras para estudios futuros, no como confirmaciones del estudio actual. Mezclar análisis confirmatorio y exploratorio sin distinguirlos es una de las causas del p-hacking.
El último paso de un estudio estadístico riguroso es la publicación transparente: compartir los datos crudos (Open Data) en un repositorio público (OSF, Zenodo, figshare), publicar el código de análisis (Open Code, en R, Python o Stata), y publicar los resultados independientemente de si son positivos o negativos. Los resultados nulos (no encontré el efecto que buscaba) son científicamente valiosos y combaten el sesgo de publicación. La pre-impresión (preprint en arXiv, medRxiv, bioRxiv) permite la revisión científica pública antes de la revisión formal por pares. Estas prácticas son el núcleo de la "Open Science" o Ciencia Abierta, que se está convirtiendo en estándar en muchas áreas científicas.
Cómo interpretar un intervalo de confianza del 95%: NO significa que hay un 95% de probabilidad de que el parámetro esté en ese rango. Significa que si repitieras el experimento muchas veces, el 95% de los intervalos calculados contendrían el verdadero parámetro. En la práctica: un IC 95% que no incluye el cero indica un efecto estadísticamente significativo al nivel 0,05.
Diferencia entre riesgo relativo y riesgo absoluto en noticias de salud: "Un medicamento reduce el riesgo de infarto en un 50%" suena impresionante. Pero si el riesgo basal es del 2% y pasa al 1%, la reducción absoluta es solo del 1%. El riesgo relativo (50%) es siempre más llamativo que el absoluto (1%). Para evaluar la utilidad real de una intervención, pide siempre el riesgo absoluto o el NNT (Number Needed to Treat: cuántos pacientes hay que tratar para evitar un evento).
Recursos gratuitos para aprender estadística: Seeing Theory (seeing-theory.brown.edu) visualiza interactivamente los conceptos de probabilidad. StatQuest with Josh Starmer (YouTube) explica estadística y machine learning con animaciones y humor. Khan Academy tiene un curso completo gratuito de estadística en español. R para principiantes: el paquete tidyverse y ggplot2 son el estándar para análisis y visualización de datos.
Cómo detectar gráficos estadísticos manipulados: (1) Eje Y truncado: si el eje Y no empieza en 0, las diferencias parecen mucho mayores de lo que son. (2) Escala no lineal sin indicar: logarítmica vs. lineal cambia completamente la percepción del crecimiento. (3) Muestra selectiva: mostrar solo el período en que el indicador es favorable. (4) Comparación con el grupo equivocado: "somos mejores que nuestra media de hace 10 años" vs. "somos peores que la media del sector". La regla de oro: pedir siempre el gráfico con el eje Y empezando en 0 y el período completo de datos.