1Tipos de muestreo
El muestreo probabilístico —donde cada individuo de la población tiene una probabilidad conocida y distinta de cero de ser seleccionado— es el único tipo de muestreo que permite generalizar estadísticamente los resultados hacia la población de origen con un margen de error cuantificable.
| Tipo | Descripción |
|---|---|
| Aleatorio simple | Cada individuo tiene la misma probabilidad de ser seleccionado, típicamente mediante un sorteo o generador de números aleatorios |
| Estratificado | La población se divide primero en subgrupos (estratos) homogéneos internamente (ej. por edad o sexo), y se muestrea aleatoriamente dentro de cada estrato — asegura representación proporcional de subgrupos importantes |
| Por conglomerados (clusters) | Se seleccionan aleatoriamente grupos naturales completos (ej. centros de salud, barrios) en lugar de individuos sueltos — más práctico y económico cuando la población está dispersa geográficamente |
| Sistemático | Se selecciona cada k-ésimo individuo de una lista ordenada, a partir de un punto de inicio aleatorio |
El muestreo no probabilístico (por conveniencia, por cuota, "bola de nieve") no garantiza que cada individuo de la población tenga una probabilidad conocida de selección, y por lo tanto no permite calcular formalmente un margen de error muestral — cualquier generalización desde ese tipo de muestra hacia una población más amplia queda expuesta a sesgos de selección no cuantificables.
2Error muestral vs. sesgo
El error muestral es la variabilidad esperable, puramente por azar, entre el valor calculado en una muestra y el valor real de la población —existe incluso con el mejor diseño de muestreo posible, y disminuye a medida que aumenta el tamaño de la muestra—. El sesgo, en cambio, es un error sistemático que no se corrige aumentando el tamaño muestral, porque proviene de un problema en cómo se seleccionó o midió a la muestra (por ejemplo, reclutar pacientes solo entre quienes concurren voluntariamente a un centro de salud, sesgando la muestra hacia personas con mayor acceso o preocupación por su salud).
¿Por qué aumentar el tamaño de una muestra reduce el error muestral pero no corrige el sesgo? El error muestral es, por definición, la fluctuación aleatoria alrededor del valor poblacional real que ocurre simplemente porque se observó una parte y no el todo — al aumentar el número de observaciones, esas fluctuaciones aleatorias tienden a compensarse entre sí (algunas por exceso, otras por defecto), y el promedio de la muestra se acerca cada vez más al valor poblacional verdadero. El sesgo, en cambio, no es una fluctuación aleatoria: es un desplazamiento sistemático en una dirección consistente, producido por cómo se construyó la muestra. Si un estudio reclutó exclusivamente pacientes con acceso a un hospital privado para estimar la prevalencia de una enfermedad en la población general, aumentar el número de pacientes reclutados en ese mismo hospital privado no acerca la estimación a la prevalencia poblacional real —simplemente produce una estimación sesgada calculada con mayor precisión aparente, pero igual de equivocada—. Esta distinción es la razón por la cual "n grande" no es sinónimo de "estudio confiable": un estudio con muestra enorme pero mal diseñada puede ser menos útil que uno con muestra pequeña pero verdaderamente representativa.
3El Teorema Central del Límite
El Teorema Central del Límite (TCL) establece que, si se toman repetidamente muestras de tamaño suficientemente grande de cualquier población (independientemente de la forma de la distribución original de esa población), la distribución de las medias muestrales resultantes se aproxima a una distribución normal, centrada en la media poblacional real. Esta propiedad es lo que permite aplicar los métodos basados en la distribución normal (capítulo II.4) —intervalos de confianza, pruebas de hipótesis— a la media de casi cualquier variable, incluso cuando la variable original no se distribuye normalmente en la población, siempre que el tamaño muestral sea razonablemente grande (una regla práctica habitual sugiere n≥30).
4Error estándar de la media
El error estándar de la media (EE) es el desvío estándar de la distribución muestral de las medias —es decir, cuánto varían entre sí las medias que se obtendrían si se repitiera el muestreo muchas veces—, y se calcula como EE = σ / √n (el desvío estándar poblacional dividido por la raíz cuadrada del tamaño muestral). No debe confundirse con el desvío estándar de los datos individuales (capítulo I.4): el desvío estándar describe la dispersión entre individuos dentro de una muestra; el error estándar describe la dispersión de las medias muestrales entre sí, y disminuye a medida que aumenta n —una muestra más grande produce una estimación de la media poblacional más precisa (menor error estándar), aunque la dispersión de los datos individuales (desvío estándar) permanezca igual.
5Trampas de examen
| Trampa | Por qué confunde | Aclaración |
|---|---|---|
| Confundir desvío estándar con error estándar | Ambos se calculan con fórmulas similares y se abrevian de forma parecida (DE / EE) | El DE describe la variabilidad entre individuos; el EE describe la variabilidad de las medias muestrales, y disminuye al aumentar n — el DE de los datos individuales no disminuye al aumentar la muestra |
| Pensar que un tamaño muestral grande corrige cualquier problema metodológico | "Más datos" suena intuitivamente a "más confiable" | Un n grande reduce el error muestral (aleatorio), pero no corrige el sesgo (sistemático) — un muestreo no probabilístico o mal diseñado sigue siendo problemático sin importar cuántos participantes tenga |
6Puntos clave
- Muestreo probabilístico (aleatorio simple, estratificado, por conglomerados, sistemático) permite generalizar con margen de error cuantificable; el no probabilístico no.
- Error muestral (aleatorio, se reduce con mayor n) es distinto de sesgo (sistemático, no se corrige con más datos).
- El Teorema Central del Límite: la distribución de medias muestrales tiende a la normalidad con n suficientemente grande, sea cual sea la distribución original.
- Error estándar (EE = σ/√n) describe la dispersión de las medias muestrales, distinto del desvío estándar de los datos individuales.