IV. Correlación y Regresión · Capítulo IV.2

Regresión Lineal Simple

Ir más allá de decir "estas dos variables se relacionan" para poder afirmar "por cada unidad que aumenta una, la otra aumenta (en promedio) esta cantidad específica" — y predecir un valor a partir del otro.

~19 min de lectura

1La ecuación de la recta de regresión

La regresión lineal simple modela la relación entre una variable independiente o predictora (X) y una variable dependiente o de resultado (Y) mediante la ecuación de una recta: Y = a + bX, donde a es la ordenada al origen (el valor esperado de Y cuando X=0) y b es la pendiente (cuánto cambia Y, en promedio, por cada unidad que aumenta X). A diferencia de la correlación (capítulo IV.1), que trata a ambas variables de forma simétrica, la regresión asigna explícitamente un rol direccional: una variable predice a la otra, no al revés.

2El método de mínimos cuadrados

La recta de regresión se calcula mediante el método de mínimos cuadrados: entre todas las rectas posibles que podrían trazarse sobre una nube de puntos, elige aquella que minimiza la suma de los cuadrados de las distancias verticales entre cada punto observado y la recta (estos residuos, elevados al cuadrado antes de sumarlos, evitan que los residuos positivos y negativos se cancelen entre sí, y penalizan más los errores de predicción más grandes).

3El coeficiente de determinación (R²)

El coeficiente de determinación (R²) —el cuadrado del coeficiente de correlación de Pearson en el caso de regresión simple con una sola variable predictora— indica qué proporción de la variabilidad total de Y es explicada por su relación lineal con X. Un R² de 0,64, por ejemplo, significa que el 64% de la variabilidad observada en Y puede atribuirse a su asociación lineal con X, mientras que el 36% restante se debe a otros factores no incluidos en el modelo (u otras fuentes de variabilidad no explicada, incluido el azar).

¿Por qué un R² alto no garantiza que el modelo de regresión sea clínicamente útil, y un R² modesto no significa que el modelo sea inútil? El R² cuantifica exclusivamente qué proporción de la variabilidad estadística es explicada por el modelo, pero no dice nada, por sí solo, sobre si esa relación tiene sentido causal, sobre la magnitud clínica real del efecto (la pendiente b), ni sobre si el modelo cumple sus supuestos. Un R² relativamente modesto (por ejemplo, 0,25) en un fenómeno biológico genuinamente complejo y multicausal —donde muchos factores no medidos contribuyen a la variabilidad de Y— puede representar, aun así, un hallazgo clínicamente relevante si la pendiente asociada a X tiene una magnitud importante y biológicamente plausible. Inversamente, un R² muy alto puede obtenerse de forma artificial (por ejemplo, ajustando un modelo a muy pocos puntos de datos, o incluyendo variables que están mecánicamente relacionadas entre sí sin aportar información clínica nueva) sin que eso implique ningún hallazgo de utilidad práctica. El R² es una medida de ajuste estadístico del modelo a los datos disponibles, no una medida directa de relevancia clínica ni de validez causal —ambas preguntas requieren evaluación adicional, más allá del valor numérico de R².

4Supuestos de la regresión lineal

SupuestoQué exige
LinealidadLa relación real entre X e Y debe ser aproximadamente lineal — si la relación real es curva, un modelo lineal producirá predicciones sistemáticamente erróneas en ciertos rangos
HomocedasticidadLa dispersión de los residuos (la distancia entre puntos observados y la recta) debe ser aproximadamente constante a lo largo de todo el rango de X, no aumentar o disminuir sistemáticamente
Independencia de los residuosLos errores de predicción de una observación no deben estar relacionados con los de otra
Normalidad de los residuosLos residuos deben distribuirse aproximadamente normal — necesario particularmente para la validez de las pruebas de significación e intervalos de confianza sobre los coeficientes del modelo

Extrapolar el modelo más allá del rango de valores de X observados en los datos originales es, además, una práctica de riesgo: la relación lineal ajustada dentro del rango estudiado no garantiza que la misma relación se mantenga fuera de ese rango.

5Trampas de examen

TrampaPor qué confundeAclaración
Pensar que un R² alto valida automáticamente que el modelo tiene sentido causal o clínicoUn número alto "suena" a modelo confiable y relevanteEl R² mide solo el ajuste estadístico a los datos disponibles, no la validez causal ni la relevancia clínica de la relación encontrada
Usar el modelo para predecir valores de X fuera del rango observado en los datos originalesLa ecuación matemática se puede calcular para cualquier valor de X sin restricción aparenteLa relación lineal ajustada es válida solo dentro (o cerca) del rango de datos observado — extrapolar fuera de ese rango asume, sin evidencia, que la misma relación lineal continúa, lo cual puede ser falso

6Puntos clave

  • Regresión lineal: Y = a + bX, con roles direccionales explícitos (predictora vs. dependiente), a diferencia de la correlación simétrica.
  • Mínimos cuadrados: la recta que minimiza la suma de los residuos al cuadrado.
  • R² indica qué proporción de la variabilidad de Y es explicada por X — no es medida directa de relevancia clínica ni de causalidad.
  • Supuestos: linealidad, homocedasticidad, independencia y normalidad de los residuos; evitar extrapolar fuera del rango de datos observado.