• Saltar al contenido principal
  • Skip to secondary menu
  • Saltar a la barra lateral principal
  • Saltar al pie de página
  • Inicio
  • Secciones
    • Ciencia de datos
    • Criptografía
    • Herramientas
    • Machine Learning
    • Noticias
    • Opinión
    • Productividad
    • Programación
      • JavaScript
      • Julia
      • Matlab
      • Python
      • R
  • Programación
    • JavaScript
    • Julia
    • Matlab
    • Python
    • R
  • Laboratorio
    • Estadística
      • Calculadora del Tamaño Muestral en Encuestas
      • Calculadora de estadísticos descriptivos
      • Test de normalidad
      • Calculadora de contrastes de hipotesis
      • Calculadora de tamano del efecto
      • Simulador de Regresión Lineal con Ruido
      • Visualizador de PCA
      • Visualizador de Series Temporales
      • Simulador de Regresión Logística
      • Simulador de K-Means
      • Simulador de DBSCAN
      • Detector de la Ley de Benford
      • Ajuste de Curvas
      • Calculadora de Matrices
    • Probabilidad
      • Calculadora de Probabilidad de Distribuciones
      • Calculadora de Probabilidades de Lotería
      • Simulador del Problema de Monty Hall
      • Simulador de la Estrategia Martingala
    • Finanzas
      • Calculadora de Préstamos e Hipotecas
      • Conversor TIN ↔ TAE
      • Calculadora DCA con ajuste por inflación
      • Calculadora XIRR con Flujos Irregulares
      • Simulador FIRE (Financial Independence, Retire Early)
    • Negocios
      • CLV
      • Scoring
    • Herramientas
      • Formateador / Minificador de JSON
      • Conversor CSV ↔ JSON
      • Comparador y Formateador de Texto y JSON
      • Formateador y Tester de Expresiones Regulares
      • Inspector de JWT
      • Generador y verificador de hashes
      • Codificador / Decodificador Base64 y URL
      • Conversor de bases numericas
      • Conversor de Timestamp Unix
      • Conversor de colores
      • Generador de UUIDs
    • Juegos
      • Tres en Raya
      • Nim con Q-Learning
    • Más
      • Método D’Hondt
      • Generador de Contraseñas Seguras
  • Noticias
  • Boletín
  • Contacto
  • Tienda
    • Libros
    • Equipamiento de oficina
    • Equipamiento en movilidad

Analytics Lane

Ciencia e ingeniería de datos aplicada

  • Ciencia de datos
  • Machine Learning
  • IA Generativa
  • Python
  • Pandas
  • NumPy
  • R
  • Excel

Errores comunes al interpretar resultados estadísticos

Estadística

septiembre 10, 2026 Por Daniel Rodríguez Deja un comentario
Tiempo de lectura: 6 minutos

La estadística no suele fallar en los cálculos: falla en la interpretación. El test está bien hecho, el número es correcto… y aun así la conclusión que se saca de él es errónea. Estos malentendidos no son anécdotas de principiante; aparecen en artículos científicos, informes de empresa y, especialmente, titulares de prensa todos los días.

En esta entrada reunimos los errores de interpretación más habituales, agrupados por el tipo de confusión que los origina. No es una lista para memorizar, sino un conjunto de reflejos que conviene tener entrenados cada vez que alguien te enseña un resultado.

Tabla de contenidos

  • 1. Grupo 1: El p-valor y la significación
    • 1.1. Invertir el condicional: creer que el p-valor es la probabilidad de que H₀ sea cierta
    • 1.2. Confundir significación con importancia
    • 1.3. Leer “no significativo” como “no hay efecto”
    • 1.4. Comparar “significativo” con “no significativo” como si fuera una diferencia real
  • 2. Grupo 2: Causalidad y variables ocultas
    • 2.1. Confundir correlación con causalidad
    • 2.2. La paradoja de Simpson
    • 2.3. Confundir regresión a la media con un efecto real
  • 3. Grupo 3: De dónde vienen los datos
    • 3.1. Ignorar el sesgo de selección y de supervivencia
    • 3.2. No mirar más allá de los resúmenes numéricos
  • 4. Grupo 4: Buscar hasta encontrar
    • 4.1. Las comparaciones múltiples y el p-hacking
  • 5. Un extra que casi todo el mundo lee mal: el intervalo de confianza
  • 6. Conclusiones

Grupo 1: El p-valor y la significación

Invertir el condicional: creer que el p-valor es la probabilidad de que H₀ sea cierta

Este es, posiblemente, el error más habitual, del que se derivan muchos otros. El p-valor es P(\text{datos} \mid H_0): la probabilidad de observar datos al menos tan extremos suponiendo que la hipótesis nula es cierta. No es P(H_0 \mid \text{datos}), la probabilidad de que la hipótesis nula sea cierta dados los datos. Son dos cosas distintas, y confundirlas es como confundir “la probabilidad de tener fiebre si tienes gripe” con “la probabilidad de tener gripe si tienes fiebre”.

Un p-valor de 0,03 no significa “hay un 3 % de probabilidad de que el resultado sea casualidad” ni “un 97 % de que el efecto sea real”. Significa, exclusivamente, que datos así serían poco frecuentes en un mundo sin efecto. Para pasar de ahí a la probabilidad de la hipótesis hace falta información adicional (en términos bayesianos, una probabilidad previa).

Desbalanceo de Clases en Credit Scoring: Por Qué Usamos Ponderación en lugar de Undersampling
En Analytics Lane
Desbalanceo de Clases en Credit Scoring: Por Qué Usamos Ponderación en lugar de Undersampling

Publicidad


Confundir significación con importancia

Un resultado “estadísticamente significativo” solo dice que probablemente no es casualidad; no dice que sea grande ni que importe. Con una muestra suficientemente grande, hasta un efecto trivial alcanza significación. Para saber si algo importa hay que mirar el tamaño del efecto y su intervalo de confianza, no el p-valor. (Es un error tan frecuente que merece su propia entrada.)

Leer “no significativo” como “no hay efecto”

La cara complementaria: no rechazar la hipótesis nula no prueba que el efecto sea nulo. Puede que simplemente la muestra fuera pequeña o ruidosa y no tuviera potencia para detectarlo. La ausencia de evidencia no es evidencia de ausencia. Si de verdad quieres demostrar que no hay diferencia, necesitas un contraste de equivalencia, no un test clásico que sale no significativo.

Comparar “significativo” con “no significativo” como si fuera una diferencia real

Un error sutil y muy extendido: un estudio encuentra un efecto significativo, otro no, y se concluye que “los resultados se contradicen” o que “el efecto desapareció en el segundo grupo”. Pero la diferencia entre significativo y no significativo no es, en sí misma, estadísticamente significativa. Que un resultado cruce el umbral de 0,05 y otro no puede deberse a una diferencia mínima de muestra o de ruido. Para comparar dos efectos hay que contrastarlos directamente, no comparar sus etiquetas.

Publicidad


Grupo 2: Causalidad y variables ocultas

Confundir correlación con causalidad

El clásico de los clásicos. Que dos cosas varíen juntas no significa que una cause la otra. Puede haber causalidad inversa (B causa A, no A a B) o, mucho más a menudo, una variable de confusión que mueve a ambas: el consumo de helado y los ahogamientos suben a la vez, pero el culpable es el verano, no el helado. Antes de afirmar una causa, hay que preguntarse qué tercer factor podría estar detrás de ambas variables.

La paradoja de Simpson

Una relación que aparece en los datos agregados puede invertirse al separar por subgrupos. El caso famoso es el de unas admisiones universitarias que, en conjunto, parecían favorecer a un género, mientras que departamento por departamento la tendencia era la contraria: la diferencia se explicaba por a qué departamentos (más o menos selectivos) se presentaba cada grupo. Moraleja: una tendencia global puede ser un espejismo creado por cómo se mezclan subgrupos de distinto tamaño. Siempre conviene preguntarse si hay una variable por la que deberíamos estratificar.

Publicidad


Confundir regresión a la media con un efecto real

Las mediciones extremas tienden, por puro azar, a ir seguidas de mediciones menos extremas. Si seleccionas a los pacientes con la presión más alta, a los alumnos con la peor nota o a los comerciales con el peor trimestre, y luego les aplicas cualquier intervención, casi todos “mejorarán” en la siguiente medición… aunque la intervención no haya hecho nada. Esa mejora es en buena parte regresión a la media, y atribuirla al tratamiento es uno de los espejismos más persistentes que existen. Sin grupo de control, es casi imposible distinguir el efecto real de este artefacto.

Grupo 3: De dónde vienen los datos

Ignorar el sesgo de selección y de supervivencia

Una conclusión solo es tan buena como la muestra de la que sale. El sesgo de supervivencia es el ejemplo más elegante: durante la Segunda Guerra Mundial se quiso reforzar los aviones por donde más impactos mostraban los que volvían… hasta que se cayó en la cuenta de que había que reforzar justo donde no tenían impactos, porque los aviones tocados ahí no regresaban para ser contados. Generalizamos constantemente a partir de los supervivientes (fondos de inversión que siguen abiertos, empresas que no quebraron, usuarios que no se dieron de baja) y olvidamos a los ausentes, que son precisamente los que más nos dirían.

Publicidad


No mirar más allá de los resúmenes numéricos

Media, desviación típica y correlación comprimen los datos, pero también pueden esconderlos. El cuarteto de Anscombe es la demostración perfecta: cuatro conjuntos de datos con prácticamente la misma media, varianza, correlación y recta de regresión, pero con formas radicalmente distintas (uno lineal, otro curvo, otro arruinado por un único valor atípico). Quien solo mire los números los creería idénticos; quien los dibuje vería cuatro historias diferentes. La lección es vieja pero eterna: grafica tus datos antes de fiarte de sus resúmenes.

Grupo 4: Buscar hasta encontrar

Las comparaciones múltiples y el p-hacking

Si haces 20 contrastes a un nivel de 0,05, esperas un falso positivo de media aunque no haya absolutamente nada real. Por eso, probar muchas hipótesis y quedarse con la que “salió significativa” es una receta para descubrir efectos inexistentes. Esto incluye sus formas más sutiles: probar muchas variables, muchos subgrupos o muchas formas de procesar los datos hasta que algo cruza el umbral (el llamado “jardín de senderos que se bifurcan”). Cuando se hacen comparaciones múltiples hay que corregirlo (Bonferroni, control de la tasa de falsos descubrimientos) y, sobre todo, desconfiar de los resultados que aparecen tras una búsqueda exhaustiva en lugar de una hipótesis planteada de antemano.

Publicidad


Un extra que casi todo el mundo lee mal: el intervalo de confianza

Un intervalo de confianza del 95 % no significa “hay un 95 % de probabilidad de que el valor verdadero esté en este intervalo concreto”. En el marco frecuentista, el valor verdadero es fijo y el intervalo es lo aleatorio: lo correcto es decir que, si repitiéramos el estudio muchas veces, el 95 % de los intervalos así construidos contendrían el valor verdadero. Es una distinción sutil, pero importa: el 95 % es una propiedad del procedimiento, no una probabilidad sobre el intervalo que tienes delante. Aun así, el intervalo de confianza sigue siendo una de las herramientas más informativas que existen, porque te muestra a la vez la magnitud y la incertidumbre.

Conclusiones

El denominador común de casi todos estos errores es el mismo: tomar un número correcto y colgarle una interpretación que no le corresponde. La buena noticia es que la defensa también es siempre la misma, una pregunta escéptica más antes de dar por buena la conclusión: ¿qué es exactamente lo que este resultado puede, y no puede, sostener?

En resumen:

  • El p-valor es P(\text{datos} \mid H_0), no P(H_0 \mid \text{datos}). No lo inviertas.
  • Significativo ≠ importante; no significativo ≠ inexistente. Mira siempre el tamaño del efecto.
  • No compares etiquetas (“significativo” vs “no”) como si fueran una diferencia real; contrasta directamente.
  • Correlación no es causalidad: busca confusores y causalidad inversa antes de afirmar una causa.
  • Desconfía de los agregados (Simpson) y de las mejoras tras seleccionar extremos (regresión a la media).
  • Pregunta de dónde salió la muestra (sesgo de selección y supervivencia) y dibuja los datos antes de creer en sus resúmenes.
  • Cuidado con buscar hasta encontrar: las comparaciones múltiples fabrican falsos positivos.
  • El intervalo de confianza habla del procedimiento, no de tu intervalo concreto.

Imagen de Saul en Pixabay

¿Te ha parecido de utilidad el contenido?

¡Puntúalo entre una y cinco estrellas!

Puntuación promedio 0 / 5. Votos emitidos: 0

Ya que has encontrado útil este contenido...

¡Síguenos en redes sociales!

¡Siento que este contenido no te haya sido útil!

¡Déjame mejorar este contenido!

Dime, ¿cómo puedo mejorar este contenido?

Publicaciones relacionadas

  • Desbalanceo de Clases en Credit Scoring: Por Qué Usamos Ponderación en lugar de Undersampling
  • Por Qué las Contraseñas Largas son más Seguras que las Complejas
  • Gini, KS y AUC: Cómo Medir la Calidad de un Modelo de Credit Scoring
  • BG/NBD + Gamma/Gamma: el modelo probabilístico para CLV en compras continuas
  • Curiosidad: De dónde vienen foo, bar y foobar
  • Curiosidad: El “bug”, la polilla y la leyenda de Grace Hopper
  • Curiosidad: Por qué la criptografía habla siempre de Alice y Bob
  • BG/BB: el modelo de CLV para compras en períodos discretos
  • Dashboard CLV: cuatro modelos, un mismo dataset, conclusiones muy distintas

Publicado en: Ciencia de datos Etiquetado como: Estadística

Interacciones con los lectores

Deja una respuesta Cancelar la respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

I accept the Terms and Conditions and the Privacy Policy

Este sitio usa Akismet para reducir el spam. Aprende cómo se procesan los datos de tus comentarios.

Barra lateral principal

Suscríbete a nuestro boletín

Suscríbete al boletín semanal para estar al día de todas las publicaciones.

Política de Privacidad

Analytics Lane en redes sociales

  • Amazon
  • Bluesky
  • Facebook
  • GitHub
  • Instagram
  • Mastodon
  • Pinterest
  • RSS
  • Telegram
  • Tumblr
  • Twitter
  • YouTube

Publicidad

Entradas recientes

Errores comunes al interpretar resultados estadísticos

septiembre 10, 2026 Por Daniel Rodríguez

Dashboard CLV: cuatro modelos, un mismo dataset, conclusiones muy distintas

septiembre 8, 2026 Por Daniel Rodríguez

Curiosidad: Por qué la criptografía habla siempre de Alice y Bob

septiembre 3, 2026 Por Daniel Rodríguez

Publicidad

Es tendencia

  • Qué es la variabilidad estadística y cómo evitar errores al analizar datos publicado el febrero 12, 2026 | en Opinión
  • Gráficos de barras en Matplotlib publicado el julio 5, 2022 | en Python
  • La similitud de Jaro–Winkler publicado el junio 24, 2020 | en Ciencia de datos, R
  • El método de la bisección e implementación en Python publicado el marzo 11, 2022 | en Ciencia de datos
  • Trabajar con archivos Excel en Matlab publicado el marzo 20, 2019 | en Matlab

Publicidad

Lo mejor valorado

4.9 (24)

Seleccionar filas y columnas en Pandas con iloc y loc

4.6 (16)

Archivos JSON con Python: lectura y escritura

4.4 (14)

Ordenación de diccionarios en Python mediante clave o valor

4.7 (13)

Operaciones de filtrado de DataFrame con Pandas en base a los valores de las columnas

4.1 (11)

Aplicar el método D’Hondt en Excel

Comentarios recientes

  • Daniel Rodríguez en Los récords con asterisco, o la épica del titular sin contexto – El bestiario de los indicadores económicos absurdos (parte 8 y final)
  • Juan en Los récords con asterisco, o la épica del titular sin contexto – El bestiario de los indicadores económicos absurdos (parte 8 y final)
  • bif en JSON en bases de datos: cuándo es buena idea y cuándo no
  • bif en Cómo desinstalar Oracle Database 19c en Windows
  • M. Pilar en Cómo eliminar las noticias en Windows 11 y recuperar tu concentración

Publicidad


Footer

Analytics Lane

  • Acerca de Analytics Lane
  • Boletín de noticias
  • Contacto
  • Libros
  • Lo más popular
  • Noticias
  • Tienda
  • Tiendas afiliadas

Secciones

  • Ciencia de datos
  • Criptografía
  • Herramientas
  • Machine Learning
  • Opinión
  • Productividad
  • Programación
  • Reseñas

Sobre de Analytics Lane

En Analytics Lane tratamos de explicar los principales conceptos de la ciencia e ingeniería de datos con un enfoque práctico. Los principales temas tratados son ciencia de datos, ingeniería de datos, inteligencia artificial, machine learning, deep learning y criptografía. Además, también se habla de los principales lenguajes de programación y herramientas utilizadas por los científicos e ingenieros de datos.

Copyright © 2018-2026 Analytics Lane ·Términos y condiciones ·Política de Cookies ·Política de Privacidad ·Herramientas de privacidad ·Contacto