III. Inferencia Estadística · Capítulo III.4

Comparación de Medias: Pruebas t

Comparar la presión arterial antes y después de un fármaco no es matemáticamente lo mismo que comparar la presión arterial entre dos grupos distintos de pacientes — y usar la prueba t equivocada invalida la conclusión, aunque los números parezcan "andar".

~20 min de lectura

1La lógica del estadístico t

La prueba t de Student evalúa si la diferencia observada entre una o más medias es lo suficientemente grande, en relación con la variabilidad esperada por azar, como para considerarse estadísticamente significativa. El estadístico t se construye, en esencia, como una razón: (diferencia observada entre medias) / (error estándar de esa diferencia). Cuanto mayor es la diferencia observada en relación con la variabilidad esperable, mayor es el valor de t, y menor el valor p resultante. La distribución t (similar a la normal, pero con colas más pesadas) se usa en lugar de la normal estándar precisamente porque, con muestras pequeñas, el desvío estándar poblacional real es desconocido y debe estimarse a partir de la propia muestra, lo que introduce una incertidumbre adicional que la distribución t incorpora correctamente.

2Los tres tipos de prueba t

TipoComparaEjemplo médico
T de una muestraLa media de una muestra contra un valor de referencia conocido o hipotético¿La glucemia media de un grupo de pacientes difiere significativamente del valor de referencia poblacional de 100 mg/dL?
T de muestras independientesLas medias de dos grupos distintos, no relacionados entre sí¿Difiere la presión arterial media entre un grupo tratado con fármaco A y un grupo distinto tratado con fármaco B?
T pareada (para datos apareados)Las medias de dos mediciones repetidas sobre los mismos individuos (o sujetos apareados por alguna característica)¿Difiere la presión arterial de los mismos pacientes antes y después de recibir un tratamiento?

¿Por qué usar una t de muestras independientes en lugar de una t pareada para datos de "antes y después" en los mismos pacientes produce una conclusión potencialmente errónea? La t pareada trabaja directamente sobre la diferencia individual de cada paciente (valor después menos valor antes), aprovechando que cada persona actúa como su propio control — esto elimina automáticamente la variabilidad debida a diferencias basales entre individuos (un paciente que parte de una presión arterial más alta y otro que parte de una más baja), concentrando el análisis exclusivamente en el cambio que interesa medir. La t de muestras independientes, en cambio, ignora esa relación entre las mediciones "antes" y "después" del mismo paciente, tratándolas como si vinieran de dos grupos de personas completamente distintas y no relacionadas. Esto tiene una consecuencia estadística concreta: al no aprovechar la reducción de variabilidad que aporta el diseño pareado, la t de muestras independientes aplicada erróneamente a datos pareados produce una estimación de la variabilidad más grande de la necesaria, lo que reduce el poder estadístico de la prueba —aumentando el riesgo de un error tipo II, no detectar un efecto real que sí existe— y puede incluso arrojar un resultado "no significativo" para un efecto que la prueba pareada correcta sí hubiera detectado con la misma cantidad de datos.

3Supuestos de la prueba t

SupuestoQué exige
NormalidadLa variable analizada debe distribuirse aproximadamente normal en cada grupo (o, con muestras grandes, el Teorema Central del Límite —capítulo III.1— relaja esta exigencia)
Homogeneidad de varianzas (solo para muestras independientes)Los dos grupos comparados deben tener varianzas similares entre sí — existen variantes de la prueba (ej. corrección de Welch) para cuando esto no se cumple
Independencia de las observacionesLas mediciones de un individuo no deben influir en las de otro (salvo en el diseño pareado, donde la relación entre el "antes" y "después" del mismo individuo es precisamente lo que la prueba pareada modela correctamente)

Cuando estos supuestos —particularmente el de normalidad— no se cumplen razonablemente, corresponde recurrir a las alternativas no paramétricas desarrolladas en el capítulo III.5.

4Trampas de examen

TrampaPor qué confundeAclaración
Usar una t de muestras independientes para comparar mediciones repetidas en los mismos sujetosAmbas comparan "dos grupos de números"Los datos pareados (mismo sujeto, dos momentos) requieren la t pareada, que aprovecha la correlación entre las mediciones — usar la versión independiente reduce el poder estadístico innecesariamente
Aplicar una prueba t a comparaciones de más de dos grupos, repitiendo t de a paresParece una extensión lógica y sencilla de la prueba de dos gruposComparar múltiples pares de grupos con pruebas t repetidas infla el riesgo de error tipo I acumulado (más comparaciones, más oportunidades de un falso positivo); para tres o más grupos corresponde un análisis de varianza (ANOVA), que controla ese riesgo de forma conjunta

5Puntos clave

  • El estadístico t es la razón entre la diferencia observada de medias y el error estándar de esa diferencia.
  • Tres tipos: t de una muestra (vs. valor de referencia), t de independientes (dos grupos distintos), t pareada (mismos sujetos, dos momentos).
  • Usar t independiente para datos pareados reduce el poder estadístico innecesariamente, al no aprovechar la correlación entre mediciones del mismo sujeto.
  • Supuestos: normalidad, homogeneidad de varianzas (independientes), independencia de observaciones — si no se cumplen, corresponden pruebas no paramétricas (capítulo III.5).