IV. Correlación y Regresión · Capítulo IV.3

Análisis de Concordancia

Dos médicos que evalúan la misma radiografía, o dos aparatos que miden la misma presión arterial, no necesitan estar "correlacionados": necesitan coincidir. Medir acuerdo es una pregunta estadística distinta de medir correlación.

~18 min de lectura

1El índice Kappa de Cohen

El índice Kappa (κ) mide el acuerdo entre dos observadores (o dos mediciones) sobre una variable categórica, corrigiendo por el acuerdo que se esperaría simplemente por azar. Esta corrección es su rasgo distintivo frente a un simple "porcentaje de acuerdo": dos observadores que clasifican al azar una condición con solo dos categorías posibles ya coincidirían, en promedio, en el 50% de los casos por puro azar — el porcentaje de acuerdo crudo no distingue ese acuerdo casual de un acuerdo genuino basado en criterio clínico compartido.

Valor de KappaInterpretación habitual
< 0Acuerdo peor que el esperado por azar
0,01 - 0,20Acuerdo leve
0,21 - 0,40Acuerdo aceptable/discreto
0,41 - 0,60Acuerdo moderado
0,61 - 0,80Acuerdo sustancial
0,81 - 1,00Acuerdo casi perfecto

Un uso típico del índice Kappa: evaluar cuánto coinciden dos radiólogos al clasificar una misma serie de imágenes como "presencia" o "ausencia" de un hallazgo, o cuánto coincide un nuevo criterio diagnóstico con el criterio de referencia establecido previamente.

2El método de Bland-Altman

Cuando lo que se compara son dos métodos de medición cuantitativa continua —por ejemplo, un tensiómetro digital nuevo frente al método de referencia auscultatorio, o dos técnicas de laboratorio para medir la misma sustancia—, el método de Bland-Altman es la herramienta apropiada. Grafica, para cada par de mediciones del mismo sujeto, la diferencia entre ambos métodos (eje Y) contra el promedio de ambas mediciones (eje X), y calcula los límites de concordancia (habitualmente la diferencia media ± 1,96 desvíos estándar de las diferencias) dentro de los cuales se espera que caiga el 95% de las diferencias entre ambos métodos.

¿Por qué usar el coeficiente de correlación de Pearson para comparar dos métodos de medición (en lugar de Bland-Altman) es un error metodológico frecuente y potencialmente engañoso? El coeficiente de Pearson mide si dos variables se mueven juntas de forma lineal, no si sus valores absolutos coinciden entre sí. Dos métodos de medición pueden tener una correlación de Pearson casi perfecta (r=0,98) y, sin embargo, tener un desacuerdo sistemático constante —por ejemplo, si un tensiómetro nuevo mide sistemáticamente 15 mmHg más alto que el de referencia en todo el rango de presiones—: la correlación seguirá siendo altísima porque ambos instrumentos suben y bajan juntos de forma proporcional, aunque no coincidan en el valor absoluto. Un investigador que solo reporta "r=0,98, excelente correlación" para justificar que un nuevo método puede reemplazar al de referencia está respondiendo la pregunta equivocada: la pregunta clínicamente relevante no es "¿se mueven juntos estos dos métodos?" sino "¿producen, para el mismo paciente, valores lo suficientemente similares como para intercambiarlos en la práctica clínica?" — y esa es exactamente la pregunta que Bland-Altman responde, al graficar y cuantificar directamente la magnitud de la diferencia entre ambos métodos, no su correlación.

3Trampas de examen

TrampaPor qué confundeAclaración
Usar el porcentaje de acuerdo crudo en lugar de Kappa para evaluar concordancia entre observadoresEl porcentaje de acuerdo parece un indicador directo e intuitivoEl porcentaje crudo no descuenta el acuerdo esperable por azar — Kappa corrige específicamente por ese componente, dando una medida más fiel del acuerdo genuino
Usar el coeficiente de correlación de Pearson para validar si dos métodos de medición son intercambiablesUn r alto parece demostrar "buena concordancia"Pearson mide asociación lineal, no coincidencia de valores absolutos — dos métodos con desacuerdo sistemático constante pueden tener una correlación casi perfecta; Bland-Altman es la herramienta correcta para esta pregunta

4Puntos clave

  • El índice Kappa mide acuerdo entre observadores en variables categóricas, corrigiendo por el acuerdo esperable por azar.
  • Bland-Altman compara dos métodos de medición cuantitativa continua, graficando diferencia vs. promedio y calculando límites de concordancia.
  • Pearson mide asociación lineal, no coincidencia de valores — no es la herramienta correcta para validar intercambiabilidad entre métodos de medición.