La distribución hipergeométrica cuenta cuántos éxitos aparecen al seleccionar una muestra sin reemplazo de una población finita. Como cada extracción modifica la composición restante, los ensayos son dependientes.
Imaginemos una población de N elementos, de los cuales K son éxitos y N−K son fracasos. Elegimos n elementos sin devolverlos a la población y definimos X como la cantidad de éxitos seleccionados.
En la distribución binomial los ensayos suelen considerarse independientes y la probabilidad p permanece constante. En el muestreo sin reemplazo, cada extracción cambia las cantidades restantes:
Por eso la probabilidad de éxito no es constante y las extracciones no son independientes. La hipergeométrica incorpora esa dependencia directamente.
La probabilidad de obtener exactamente x éxitos es:
El numerador cuenta las muestras que eligen x éxitos y n−x fracasos. El denominador cuenta todas las muestras posibles de tamaño n tomadas de la población.
No todos los valores entre 0 y n son necesariamente posibles. El rango válido es:
Por ejemplo, si solo hay dos éxitos en toda la población, no podemos obtener cinco éxitos en una muestra aunque n sea mayor que cinco.
Una urna contiene N=10 bolas, K=4 rojas y 6 azules. Se extraen n=3 sin reemplazo. La probabilidad de obtener exactamente x=2 rojas es:
La fórmula cuenta las formas de elegir dos bolas rojas y una azul, divididas por todas las formas de elegir tres bolas entre diez.
La esperanza de una variable hipergeométrica es:
Es igual al tamaño de la muestra multiplicado por la proporción de éxitos de la población. Aunque la dependencia cambia la varianza, el promedio esperado conserva esta interpretación proporcional.
La varianza incluye un factor de corrección por población finita:
El factor (N−n)/(N−1) se denomina corrección por población finita. Si n es pequeño frente a N, se acerca a 1 y la hipergeométrica puede aproximarse a una binomial con p=K/N.
Modifica la población, la cantidad de éxitos y el tamaño de la muestra. El gráfico muestra qué cantidades de éxitos son posibles y sus probabilidades exactas.
La fórmula se puede implementar con coeficientes combinatorios:
function combinaciones(n, k) {
if (k < 0 || k > n) return 0;
let resultado = 1;
for (let i = 1; i <= k; i++) {
resultado *= (n - i + 1) / i;
}
return resultado;
}
function hipergeometrica(N, K, n, x) {
return combinaciones(K, x) * combinaciones(N - K, n - x)
/ combinaciones(N, n);
}
console.log(hipergeometrica(10, 4, 3, 2)); // 0.3Pulsa Ejecutar para comprobar el ejemplo de la urna.
La simulación construye una población finita, mezcla sus elementos y toma una muestra sin devolverlos. Luego cuenta los éxitos observados.
Si después de cada extracción devolvemos el elemento, la composición de la población vuelve a ser la misma y los ensayos pueden modelarse como independientes. En ese caso, el conteo de éxitos se aproxima a una binomial con p=K/N.
Sin reemplazo, la variabilidad suele ser menor que en la binomial equivalente porque conocer un resultado aporta información sobre los restantes.
La hipergeométrica puede aproximarse por una binomial cuando la muestra representa una fracción pequeña de la población. Como regla práctica, la aproximación suele ser razonable cuando n/N es pequeño, aunque la calidad depende del contexto y de los parámetros.
Se utiliza en control de calidad de lotes finitos, auditorías, selección de cartas, muestreo de inventarios, inspección de piezas, detección de elementos defectuosos y estudios donde extraer un elemento modifica la población restante.
La distribución hipergeométrica cuenta éxitos en una muestra sin reemplazo de una población finita.
La distribución hipergeométrica modela correctamente la dependencia que aparece cuando cada extracción modifica la población. Compararla con la binomial ayuda a elegir el modelo adecuado según exista o no reemplazo y según el tamaño relativo de la muestra.