VI. Cierre y Repaso · Capítulo VI.2

Repaso Final: Perlas, Trampas y Preguntas de Examen

Un repaso condensado de las seis partes del manual, pensado para las últimas semanas antes del parcial y para el examen final.

~25 min de lectura

1Perlas rápidas de todo el programa

TemaIdea clave
Tipos de variablesCualitativa (nominal/ordinal) vs. cuantitativa (discreta/continua); escalas nominal, ordinal, de intervalo, de razón determinan qué operaciones son válidas.
Representación gráficaBarras/sectores para categóricas; histograma/polígono/boxplot para continuas — barras contiguas vs. separadas codifican continuidad vs. discreción.
Media, mediana, modaMedia sensible a atípicos; mediana robusta; moda única válida para nominales — orden entre ellas revela sesgo de la distribución.
DispersiónDE recupera unidad original; CV compara dispersión relativa entre escalas distintas; RIC es robusto, análogo a la mediana.
Reglas de probabilidadSuma general resta la intersección si no son excluyentes; producto solo para independientes; excluyentes e independientes son incompatibles entre sí (salvo prob. cero).
Teorema de BayesInvierte P(B|A) conocida (sensibilidad) en P(A|B) buscada (VPP) — la probabilidad previa (prevalencia) modifica sustancialmente el resultado.
Binomialn fijo, dos resultados, p constante, independencia; media=np, varianza=np(1−p).
NormalSimétrica, media=mediana=moda; regla 68-95-99,7; puntaje Z estandariza; "atípico" ≠ "patológico".
MuestreoProbabilístico permite generalizar con error cuantificable; error muestral (aleatorio, se reduce con n) ≠ sesgo (sistemático, no se corrige con n).
TCL y error estándarLa media muestral tiende a la normalidad con n grande, sea cual sea la distribución original; EE=σ/√n, distinto del DE de datos individuales.
Intervalos de confianzaIC 95% describe confiabilidad del procedimiento a largo plazo, no la probabilidad de ese intervalo específico; mayor confianza y variabilidad amplían el IC, mayor n lo estrecha.
Prueba de hipótesisValor p = P(datos|H₀ verdadera), no P(H₀|datos); error tipo I (α, falso positivo) vs. tipo II (β, falso negativo); "no significativo" ≠ "no hay efecto".
Pruebas tUna muestra (vs. referencia), independientes (dos grupos distintos), pareada (mismo sujeto) — usar independiente en datos pareados reduce poder innecesariamente.
Chi-cuadrado y no paramétricasChi² compara categóricas independientes (Fisher si frecuencias esperadas <5); no paramétricas (Mann-Whitney, Wilcoxon, Kruskal-Wallis) usan rangos, robustas pero algo menos potentes.
CorrelaciónPearson mide asociación lineal (−1 a +1); Spearman para ordinales/no lineal monótono; correlación no implica causalidad (confusión, causalidad inversa, azar).
Regresión linealY=a+bX, mínimos cuadrados; R² = variabilidad explicada, no mide relevancia clínica ni causalidad; no extrapolar fuera del rango de datos.
ConcordanciaKappa corrige acuerdo por azar (categóricas); Bland-Altman compara métodos cuantitativos por diferencia vs. promedio — Pearson no sirve para esto.
Sensibilidad/especificidadPropiedades intrínsecas de la prueba, no dependen de prevalencia; SnNOut (sensible+negativo descarta), SpPIn (específico+positivo confirma).
VPP/VPN y ROCDependen de la prevalencia (a diferencia de Sn/Sp); LR no dependen de prevalencia; curva ROC grafica Sn vs. 1−Sp en todos los puntos de corte; AUC resume rendimiento global.
RR, OR, NNTRR nativo de cohortes/ensayos; OR nativo de casos y controles (aproxima a RR solo si enfermedad rara); NNT=1/RAR incorpora riesgo basal.
Diseño de estudiosJerarquía: serie de casos → transversal → casos-controles → cohorte → ensayo aleatorizado → metaanálisis; tamaño muestral se calcula según α, poder, efecto y variabilidad.

2Errores conceptuales frecuentes

ErrorCorrección
"Toda variable numérica es cuantitativa"Un estadio codificado I-IV con números sigue siendo ordinal — el número es solo una etiqueta ordenada.
"La media siempre representa mejor a los datos que la mediana"Con atípicos o distribuciones sesgadas, la mediana es más representativa del "dato típico".
"Mutuamente excluyentes e independientes son parecidos"Son, de hecho, prácticamente incompatibles entre sí (salvo el caso trivial de probabilidad cero).
"El valor p es la probabilidad de que H₀ sea verdadera"Es P(datos observados o más extremos | H₀ verdadera) — la misma falacia de probabilidad transpuesta que aplica también a Bayes.
"No significativo = no hay efecto"Puede reflejar poder estadístico insuficiente, no ausencia real de efecto.
"IC 95% = 95% de probabilidad de que el valor real esté en este intervalo"Describe la confiabilidad del procedimiento a largo plazo, no la probabilidad de ese intervalo puntual.
"Usar t independiente para datos de antes/después en los mismos sujetos"Corresponde la t pareada, que aprovecha la correlación entre mediciones del mismo sujeto.
"r=0 significa que no hay ninguna relación"Solo indica ausencia de relación lineal — puede haber una relación no lineal fuerte.
"Correlación fuerte implica causalidad"Compatible con causalidad directa, inversa, variable de confusión o azar — se requiere diseño adicional para inferir causalidad.
"Sensibilidad y especificidad cambian con la prevalencia"Son propiedades intrínsecas de la prueba; lo que cambia con la prevalencia son los valores predictivos.
"Un OR se puede interpretar siempre igual que un RR"Solo se aproximan bien bajo la asunción de enfermedad rara (prevalencia <10%); con enfermedades frecuentes, el OR sobreestima al RR.
"Un riesgo relativo alto siempre implica gran impacto clínico"Depende del riesgo basal absoluto — el NNT (o la RAR) es necesario para juzgar la magnitud clínica real.
"Correlación de Pearson alta valida que dos instrumentos son intercambiables"Pearson mide asociación lineal, no coincidencia de valores absolutos — Bland-Altman es la herramienta correcta.
"Duplicar la muestra duplica la capacidad de detectar la mitad del efecto"La relación no es lineal (vía 1/√n) — reducir a la mitad el efecto detectable exige, aproximadamente, cuadruplicar la muestra.

3Autoevaluación

Intentá responder cada pregunta antes de abrirla. Cubren las seis partes del manual, en orden.

¿Por qué calcular la media de una variable ordinal (ej. estadio tumoral I-IV) produce un número sin sentido interpretable?

Las escalas ordinales no garantizan distancias iguales entre categorías consecutivas — la mediana es la medida de tendencia central apropiada para este tipo de dato.

¿Por qué un histograma usa barras contiguas mientras un gráfico de barras las separa?

Codifica una propiedad matemática real: el continuo de valores posibles en una variable continua (histograma) vs. la discreción de categorías nominales sin valores intermedios (barras).

¿Por qué la mediana es preferible a la media cuando hay valores atípicos extremos?

La media usa la magnitud exacta de cada valor (sensible a extremos); la mediana solo usa la posición relativa ordenada, siendo robusta frente a esos valores.

¿Por qué el coeficiente de variación permite comparar dispersión entre variables de escalas distintas y el desvío estándar no?

El CV es adimensional (DE/media ×100), mientras que el DE conserva la unidad original de cada variable, que no es comparable directamente entre escalas distintas.

¿Por qué dos sucesos mutuamente excluyentes no pueden ser, a la vez, independientes?

Si A ocurre, B queda automáticamente excluido (P(B|A)=0), lo cual, salvo que P(B) ya fuera cero, viola la definición de independencia P(B|A)=P(B).

¿Por qué la misma prueba diagnóstica puede rendir de forma muy distinta según el contexto clínico en que se aplica?

El valor predictivo posterior depende tanto de la calidad de la prueba (sensibilidad/especificidad) como de la probabilidad previa (prevalencia o sospecha clínica) — el mismo principio bayesiano.

¿Por qué la condición de independencia entre ensayos es tan estricta en el modelo binomial?

Datos correlacionados (ej. mismo centro/equipo médico) violan el supuesto y subestiman la variabilidad real, generando intervalos de confianza artificialmente estrechos.

¿Por qué "estadísticamente atípico" (fuera de μ±2DE) no equivale a "patológico"?

Aproximadamente el 5% de cualquier población sana cae fuera de ese rango por variabilidad biológica natural — los puntos de corte diagnósticos reales requieren validación adicional contra desenlaces clínicos.

¿Por qué un tamaño muestral grande reduce el error muestral pero no corrige el sesgo?

El error muestral es fluctuación aleatoria que se compensa con más observaciones; el sesgo es un desplazamiento sistemático producido por cómo se construyó la muestra, no por su tamaño.

¿Por qué el Teorema Central del Límite permite aplicar métodos basados en la normal a variables que no son normales en la población?

La distribución de las medias muestrales (no de los datos individuales) tiende a la normalidad con n suficientemente grande, sea cual sea la forma de la distribución original.

¿Cuál es la interpretación frecuentista correcta de un "IC 95%"?

Si se repitiera el procedimiento de muestreo muchas veces, el 95% de los intervalos así construidos contendrían el valor poblacional real — no una probabilidad sobre el intervalo específico calculado.

¿Por qué el valor p no es "la probabilidad de que H₀ sea verdadera"?

El valor p se calcula asumiendo que H₀ ya es verdadera — es P(datos|H₀), no P(H₀|datos), la misma falacia de probabilidad transpuesta del Teorema de Bayes.

¿Por qué usar t de muestras independientes para datos de "antes y después" en los mismos sujetos reduce el poder estadístico?

Ignora la correlación entre mediciones del mismo sujeto que la t pareada aprovecha para reducir la variabilidad relevante del análisis.

¿Por qué chi-cuadrado exige frecuencias esperadas de al menos 5 por celda?

Con frecuencias esperadas muy bajas, la aproximación del estadístico χ² a su distribución teórica de referencia deja de ser confiable — corresponde la prueba exacta de Fisher.

¿Por qué las pruebas no paramétricas trabajan con rangos en lugar de valores originales?

El rango de un valor atípico sigue siendo simplemente "el más alto/bajo" sin distorsionar el cálculo — las hace robustas frente a no normalidad y atípicos, a costa de algo de poder estadístico.

¿Por qué r=0 no significa "no hay ninguna relación" entre dos variables?

r=0 indica ausencia de relación lineal específicamente — puede existir una relación no lineal fuerte (ej. en forma de U) con Pearson cercano a cero.

¿Cómo puede una variable de confusión generar una correlación fuerte entre dos variables sin relación causal directa entre ellas?

Si una tercera variable causa a ambas (ej. temperatura causando tanto ventas de helado como ahogamientos), estas aparecerán correlacionadas entre sí sin que ninguna cause a la otra.

¿Por qué un R² alto no garantiza que un modelo de regresión sea clínicamente relevante?

R² mide solo el ajuste estadístico a los datos disponibles, no la magnitud clínica del efecto (pendiente) ni la validez causal de la relación.

¿Por qué Bland-Altman es más apropiado que Pearson para validar si dos instrumentos de medición son intercambiables?

Pearson mide asociación lineal (si se mueven juntos); Bland-Altman mide directamente la magnitud de la diferencia entre ambos métodos, que es la pregunta clínicamente relevante.

¿Por qué una prueba de tamizaje prioriza sensibilidad y una prueba confirmatoria prioriza especificidad?

El costo relativo de cada error cambia según la etapa: en tamizaje, el costo de un falso negativo (no detectar) suele ser mayor; en confirmación, el costo de un falso positivo (tratar innecesariamente) es el que se busca minimizar.

¿Por qué no se puede calcular directamente un riesgo relativo en un estudio de casos y controles?

La proporción de casos y controles en la muestra es definida por el diseño, no refleja la incidencia poblacional real — el odds ratio es la medida de asociación válida para este diseño.

¿Por qué el NNT complementa mejor la información clínica que el riesgo relativo solo?

Incorpora el riesgo basal absoluto de la población: un mismo RR puede representar un beneficio absoluto grande o insignificante según ese riesgo basal.

¿Por qué detectar un efecto clínico pequeño exige una muestra desproporcionadamente mayor que detectar uno grande?

El error estándar es proporcional a 1/√n — reducir a la mitad el efecto detectable exige, aproximadamente, cuadruplicar el tamaño muestral, no solo duplicarlo.