1Hipótesis nula y alternativa
Toda prueba de hipótesis estadística parte de dos afirmaciones mutuamente excluyentes sobre la población: la hipótesis nula (H₀), que postula que no existe diferencia o efecto real (el estado de partida conservador, análogo a la presunción de inocencia), y la hipótesis alternativa (H₁), que postula que sí existe una diferencia o efecto real —lo que el investigador habitualmente busca demostrar—. La lógica del procedimiento es indirecta: se asume que H₀ es verdadera, y se evalúa qué tan compatibles son los datos observados con esa suposición; si son muy poco compatibles, se rechaza H₀ en favor de H₁.
2El valor p
El valor p es la probabilidad de observar un resultado tan extremo o más extremo que el efectivamente obtenido, asumiendo que la hipótesis nula es verdadera. Un valor p pequeño indica que el resultado observado sería muy poco probable si realmente no existiera diferencia alguna, lo cual constituye evidencia en contra de H₀. El umbral convencional de significación estadística (α, habitualmente 0,05) es un punto de corte arbitrario pero ampliamente aceptado: si p < α, se rechaza H₀ y el resultado se considera "estadísticamente significativo".
¿Por qué el valor p NO es "la probabilidad de que la hipótesis nula sea verdadera", ni tampoco "la probabilidad de que el resultado se deba al azar"? Esta es, con diferencia, la mala interpretación más extendida en la literatura médica —incluso entre profesionales con formación estadística formal—. El valor p se calcula bajo el supuesto de que H₀ ya es verdadera; es una probabilidad condicional del tipo P(datos observados o más extremos | H₀ verdadera), no P(H₀ verdadera | datos observados). Confundir ambas cantidades es la misma falacia de "probabilidad transpuesta" discutida en el capítulo II.2 a propósito del Teorema de Bayes: son cantidades matemáticamente distintas que no pueden intercambiarse. Un valor p pequeño no dice "hay solo un 3% de probabilidad de que la hipótesis nula sea cierta" —dice que, si la hipótesis nula fuera cierta, sería muy poco probable observar un resultado tan extremo como el que efectivamente se observó—. La distinción parece sutil, pero cambia completamente cómo debe leerse un resultado estadístico: el valor p cuantifica la sorpresa de los datos bajo un supuesto, no la probabilidad de ese supuesto en sí mismo.
3Errores tipo I y tipo II
Toda decisión estadística basada en una muestra —nunca en la población completa— conlleva un riesgo inherente de equivocarse en alguna de dos direcciones posibles:
| Error | Descripción | Probabilidad de cometerlo |
|---|---|---|
| Tipo I (falso positivo) | Rechazar H₀ cuando en realidad es verdadera — concluir que hay un efecto que en realidad no existe | α (el nivel de significación elegido, habitualmente 0,05) |
| Tipo II (falso negativo) | No rechazar H₀ cuando en realidad es falsa — no detectar un efecto que sí existe | β (depende del tamaño del efecto real, la variabilidad de los datos, y el tamaño muestral) |
El complemento de β es el poder estadístico (1−β): la probabilidad de detectar correctamente un efecto real, cuando ese efecto realmente existe — un concepto central para el diseño de estudios, desarrollado en el capítulo V.4.
4Por qué "no significativo" no equivale a "no hay efecto"
No rechazar H₀ (obtener un valor p ≥ α) no demuestra que H₀ sea verdadera ni que no exista ningún efecto real: solo significa que, con los datos disponibles en esa muestra particular, no hubo suficiente evidencia para rechazarla. Esto puede deberse a que efectivamente no hay efecto, pero también puede deberse a un tamaño muestral insuficiente (bajo poder estadístico) para detectar un efecto real que sí existe pero es de magnitud modesta. La ausencia de significación estadística no es, en sí misma, evidencia de ausencia de efecto — una distinción fundamental que suele resumirse con la frase "ausencia de evidencia no es evidencia de ausencia".
5Trampas de examen
| Trampa | Por qué confunde | Aclaración |
|---|---|---|
| Interpretar el valor p como "probabilidad de que la hipótesis nula sea verdadera" | Es la interpretación más intuitiva del lenguaje "p pequeño = poco probable que H₀ sea cierta" | El valor p es P(datos | H₀ verdadera), no P(H₀ verdadera | datos) — la misma falacia de probabilidad transpuesta del Teorema de Bayes |
| Concluir que "no hay diferencia" o "no hay efecto" a partir de un resultado no significativo | "No significativo" suena a "confirmación de que no hay diferencia" | Puede simplemente reflejar poder estadístico insuficiente (muestra pequeña) para detectar un efecto real — no equivale a demostrar la ausencia de efecto |
6Puntos clave
- H₀ (sin efecto/diferencia, se asume de partida) vs. H₁ (sí hay efecto/diferencia) — se rechaza H₀ si la evidencia es suficientemente incompatible con ella.
- Valor p: probabilidad de los datos observados (o más extremos) asumiendo H₀ verdadera — no es la probabilidad de que H₀ sea verdadera.
- Error tipo I (falso positivo, probabilidad α) vs. error tipo II (falso negativo, probabilidad β); poder estadístico = 1−β.
- "No significativo" no equivale a "no hay efecto" — puede reflejar poder estadístico insuficiente, no ausencia real de efecto.