VI. Cierre y Repaso · Capítulo VI.1

Casos Prácticos Integrados

Un resultado de laboratorio, un estudio publicado, un ensayo clínico: seis situaciones de lectura crítica que combinan estadística descriptiva, probabilidad bayesiana, inferencia y medidas diagnósticas desarrolladas en todo el manual.

~22 min de lectura

Caso 1 · Un promedio que no representa a nadie

Un estudio reporta que el costo promedio de internación por una complicación quirúrgica fue de $850.000, con un desvío estándar de $920.000. Al revisar los datos individuales, la mayoría de los pacientes (38 de 45) tuvo costos entre $150.000 y $400.000, mientras que 7 pacientes con complicaciones graves tuvieron costos superiores a $3.000.000.

¿Por qué la media y el desvío estándar reportados son poco informativos en este caso, y qué debería haberse reportado en su lugar?

Ver resolución

Los datos descriptos tienen una distribución marcadamente asimétrica a la derecha (capítulo I.2): la mayoría de los casos se concentra en un rango bajo, mientras una minoría de casos extremos "arrastra" la media hacia arriba —el mismo fenómeno del ejemplo de días de internación visto en el capítulo I.3—. Reportar "media $850.000 ± DE $920.000" sugiere, engañosamente, que el paciente "típico" tiene un costo cercano a esa cifra, cuando en realidad la mayoría de los pacientes tuvo costos bastante menores. En esta situación corresponde reportar la mediana y el rango intercuartílico (capítulo I.4), medidas robustas frente a los valores atípicos, que representarían mucho mejor la experiencia típica de costo para la mayoría de los pacientes, sin ocultar por eso la existencia de los casos extremos (que podrían reportarse aparte, describiendo específicamente esa subpoblación de alto costo).

Caso 2 · Un tamizaje poblacional con resultado positivo

Una prueba de tamizaje tiene sensibilidad del 95% y especificidad del 90%. Se aplica como parte de un programa de tamizaje poblacional en una enfermedad con prevalencia del 1% en la población general (sin sospecha clínica previa en ninguno de los testeados). Un paciente asintomático da positivo.

¿Qué probabilidad tiene ese paciente de estar realmente enfermo, y por qué el resultado sorprende a quien solo mira la sensibilidad y especificidad?

Ver resolución

Aplicando el Teorema de Bayes (capítulo II.2) sobre una población hipotética de 10.000 personas con prevalencia 1% (100 enfermos, 9.900 sanos): de los 100 enfermos, la sensibilidad del 95% detecta a 95 (verdaderos positivos); de los 9.900 sanos, la especificidad del 90% da negativo correctamente a 8.910, pero produce 990 falsos positivos (10% de 9.900). El VPP (capítulo V.2) resulta VPP = 95 / (95+990) ≈ 8,8% — es decir, de cada 100 personas asintomáticas con resultado positivo en este tamizaje, apenas 9 están realmente enfermas, y 91 son falsos positivos. La sorpresa surge precisamente de la trampa discutida en el capítulo II.2 y V.2: sensibilidad y especificidad son propiedades fijas de la prueba, pero el valor predictivo positivo depende críticamente de la prevalencia — en un tamizaje de baja prevalencia sin sospecha clínica previa, incluso una prueba "buena" (95%/90%) genera, en términos absolutos, muchos más falsos positivos que verdaderos positivos.

Caso 3 · Un ensayo clínico "no significativo" que se interpreta como negativo

Un ensayo clínico con 40 participantes por grupo comparó un nuevo antihipertensivo contra placebo, obteniendo una reducción promedio de 6 mmHg en la presión sistólica a favor del fármaco, con p=0,09 (no significativo al umbral convencional de 0,05). Los autores concluyen que "el fármaco no es efectivo".

¿Es correcta esa conclusión, dado el diseño del estudio?

Ver resolución

No necesariamente. Como se desarrolla en el capítulo III.3, "no significativo" no equivale a "no hay efecto" — solo indica que, con los datos disponibles en esa muestra particular, no hubo evidencia suficiente para rechazar la hipótesis nula al umbral elegido. Con apenas 40 participantes por grupo, el estudio podría tener poder estadístico insuficiente (capítulo V.4) para detectar de forma confiable una diferencia de 6 mmHg si esa es, efectivamente, la magnitud real del efecto del fármaco —un tamaño de efecto modesto que exigiría una muestra bastante mayor para alcanzar significación estadística con confianza—. La conclusión correcta y más cautelosa sería: "el estudio no encontró evidencia estadísticamente significativa del efecto, pero el tamaño muestral limitado no permite descartar un efecto clínicamente relevante" — y lo apropiado sería calcular el poder estadístico post-hoc de este diseño, o directamente diseñar un estudio nuevo con el tamaño muestral adecuado calculado de antemano para el efecto que se busca detectar.

Caso 4 · Dos variables correlacionadas, sin relación causal directa

Un estudio observacional encuentra una correlación positiva fuerte (r=0,78, p<0,001) entre el consumo de café y la incidencia de cáncer de pulmón en una cohorte de adultos. Los autores sugieren que el café podría ser un factor de riesgo para esta enfermedad.

¿Qué explicación alternativa, no considerada por los autores, podría dar cuenta de esta correlación sin que el café tenga ningún efecto causal directo?

Ver resolución

Tal como se discute en el capítulo IV.1, una correlación —sin importar cuán fuerte o estadísticamente significativa sea— es compatible con una variable de confusión que cause tanto la exposición estudiada como el desenlace. En este caso concreto, el tabaquismo es un candidato evidente: las personas que fuman tienden también, en muchas poblaciones, a consumir más café (hábitos que suelen coexistir socialmente), y el tabaquismo es una causa establecida de cáncer de pulmón. Si el estudio no midió ni ajustó estadísticamente por el hábito tabáquico de los participantes, la asociación observada entre café y cáncer de pulmón podría deberse enteramente a que ambas variables comparten al tabaquismo como causa común, sin que el café tenga ningún rol causal directo. Un diseño más riguroso debería medir y ajustar estadísticamente por esta variable de confusión conocida antes de sugerir cualquier relación causal entre café y cáncer de pulmón.

Caso 5 · Comparar dos tensiómetros con el coeficiente equivocado

Un fabricante de tensiómetros digitales publica un estudio de validación reportando un coeficiente de correlación de Pearson r=0,96 entre su nuevo dispositivo y el método auscultatorio de referencia, concluyendo que ambos métodos "son equivalentes y pueden usarse indistintamente".

¿Por qué esta conclusión no está necesariamente respaldada por el análisis reportado?

Ver resolución

Como se explica en el capítulo IV.3, el coeficiente de Pearson mide asociación lineal —si ambos instrumentos suben y bajan juntos de forma proporcional— pero no mide si sus valores absolutos coinciden entre sí. Es perfectamente posible que el nuevo tensiómetro digital mida sistemáticamente, por ejemplo, 12 mmHg más alto que el método de referencia en todo el rango de presiones, y aun así obtener r=0,96, porque ambos instrumentos seguirían moviéndose juntos de forma casi perfectamente proporcional. Un análisis de intercambiabilidad clínicamente válido requeriría el método de Bland-Altman, que grafica directamente la magnitud de la diferencia entre ambos instrumentos frente a su promedio, y calcula los límites de concordancia esperables — la pregunta correcta ("¿estos dos métodos producen valores lo suficientemente similares para el mismo paciente?") es distinta de la que Pearson responde ("¿se mueven juntos estos dos métodos?"), y el estudio del fabricante, tal como se describe, no responde la primera.

Caso 6 · Un titular que exagera un riesgo relativo

Un artículo periodístico titula: "Un nuevo estudio muestra que consumir cierto suplemento duplica el riesgo de una rara complicación cardiovascular (RR=2,1)". Al revisar el estudio original, el riesgo de esa complicación en el grupo que no consumía el suplemento fue del 0,05%, y en el grupo que sí lo consumía fue del 0,105%.

¿El titular es matemáticamente correcto? ¿Qué información adicional debería acompañarlo para no inducir una alarma desproporcionada?

Ver resolución

El titular es matemáticamente correcto en cuanto al valor del riesgo relativo (0,105% / 0,05% ≈ 2,1), pero omite información crítica sobre la magnitud absoluta del riesgo (capítulo V.3). La reducción —o en este caso, el aumento— absoluto del riesgo es de apenas 0,055 puntos porcentuales: el número necesario para dañar (el equivalente conceptual del NNT para un efecto adverso) sería aproximadamente 1/0,00055 ≈ 1818 — es decir, aproximadamente 1818 personas deberían consumir el suplemento, en promedio, para que se produzca un caso adicional de esta complicación, comparado con no consumirlo. Comunicar únicamente "duplica el riesgo" sin el riesgo basal correspondiente exagera la percepción de peligro real: un RR=2,1 sobre un riesgo basal extremadamente bajo (0,05%) representa un riesgo absoluto adicional mínimo, mientras que el mismo RR=2,1 sobre un riesgo basal del 20% representaría un aumento absoluto mucho más relevante clínicamente. Cualquier comunicación responsable de un riesgo relativo debería acompañarse siempre del riesgo basal absoluto correspondiente.