1El coeficiente de correlación de Pearson
El coeficiente de correlación de Pearson (r) cuantifica la fuerza y dirección de la asociación lineal entre dos variables cuantitativas continuas. Toma valores entre −1 y +1:
| Valor de r | Interpretación |
|---|---|
| +1 | Correlación lineal positiva perfecta — a mayor una variable, mayor la otra, siguiendo exactamente una línea recta |
| 0 | Sin correlación lineal — no hay una tendencia lineal entre ambas variables (aunque podría existir una relación no lineal, ver más abajo) |
| −1 | Correlación lineal negativa perfecta — a mayor una variable, menor la otra, siguiendo exactamente una línea recta |
Rangos de referencia habituales (orientativos, no absolutos): |r| < 0,3 se considera correlación débil; 0,3-0,7 moderada; >0,7 fuerte. Estos umbrales son convenciones prácticas, no puntos de corte matemáticamente definidos, y su relevancia clínica siempre debe evaluarse en el contexto específico de la pregunta biomédica.
2Correlación de Spearman
Cuando las variables son ordinales, o la relación entre ellas es monótona pero no estrictamente lineal (por ejemplo, siempre creciente pero con una forma curva), o cuando hay valores atípicos que distorsionarían a Pearson, se utiliza la correlación de Spearman (ρ) — el equivalente no paramétrico (capítulo III.5), que calcula la correlación de Pearson sobre los rangos de los datos en lugar de sus valores originales, siguiendo la misma lógica de robustez frente a atípicos y ausencia de supuestos de normalidad ya vista para las pruebas no paramétricas.
3Correlación no implica causalidad
Esta es, probablemente, la advertencia estadística más repetida —y con razón— en toda la literatura biomédica: encontrar una correlación significativa entre dos variables A y B es compatible con al menos cuatro escenarios causales distintos, y el coeficiente de correlación por sí solo no permite distinguir entre ellos:
| Escenario | Descripción |
|---|---|
| A causa B | La relación causal directa que suele asumirse implícitamente |
| B causa A | Causalidad inversa a la asumida |
| C (variable de confusión) causa tanto A como B | A y B están correlacionadas sin que ninguna cause a la otra directamente, porque ambas responden a una tercera causa común |
| Correlación espuria / azar | Coincidencia estadística sin ningún vínculo causal real, especialmente frecuente al analizar muchas variables simultáneamente sin hipótesis previa |
¿Por qué una variable de confusión puede generar una correlación estadísticamente perfecta entre dos variables sin ninguna relación causal directa entre ellas? El ejemplo clásico: el número de heladerías abiertas y el número de ahogamientos en una ciudad están correlacionados positivamente a lo largo del año, pero ninguna causa a la otra. Ambas son consecuencia de una tercera variable —la temperatura o la estación del año—: en verano hay más heladerías abiertas y, simultáneamente, más gente nadando y por lo tanto más ahogamientos. Si un investigador solo mide heladerías y ahogamientos, sin considerar la temperatura, encontrará una correlación robusta y "estadísticamente significativa" entre dos variables sin ninguna conexión causal directa. Este mismo mecanismo opera en investigación biomédica real de forma mucho menos obvia: una correlación entre un hábito de vida y una enfermedad puede estar mediada por el nivel socioeconómico, la edad, u otro factor no medido que causa ambas cosas. Por eso establecer causalidad exige diseños de estudio específicos (idealmente ensayos aleatorizados, que distribuyen al azar los posibles factores de confusión entre los grupos comparados) y no puede inferirse de la sola presencia de una correlación, sin importar cuán fuerte o "significativa" sea esa correlación.
4Trampas de examen
| Trampa | Por qué confunde | Aclaración |
|---|---|---|
| Pensar que r=0 significa "no hay ninguna relación" entre dos variables | r=0 se interpreta como "ausencia total de asociación" | r=0 indica ausencia de relación lineal — puede existir una relación no lineal fuerte (ej. en forma de U) con un coeficiente de Pearson cercano a cero, precisamente porque Pearson solo detecta el componente lineal de la asociación |
| Usar el valor de r para afirmar causalidad | Un r alto y un valor p significativo parecen evidencia contundente | La correlación, sin importar su magnitud o significación estadística, no distingue entre causalidad directa, inversa, variable de confusión o coincidencia — establecer causalidad requiere diseño de estudio adicional |
5Puntos clave
- El coeficiente de Pearson (r, entre −1 y +1) cuantifica la fuerza y dirección de la asociación lineal entre dos variables cuantitativas.
- Spearman (ρ) es el equivalente no paramétrico, para datos ordinales, relaciones monótonas no lineales, o con atípicos.
- Correlación no implica causalidad: los escenarios posibles incluyen causalidad directa, inversa, variable de confusión, o azar.
- r=0 indica ausencia de correlación lineal específicamente, no ausencia de cualquier tipo de relación entre las variables.