La distribución F de Fisher-Snedecor aparece al comparar dos variancias. Es una distribución continua, no negativa y con dos grados de libertad: uno para el numerador y otro para el denominador.
Sean U y V variables chi-cuadrado independientes, con ν1 y ν2 grados de libertad. Entonces el cociente de sus versiones normalizadas sigue una distribución F:
Cada chi-cuadrado se divide por sus grados de libertad para convertirlo en una estimación de variabilidad promedio. La distribución F compara esas dos cantidades.
Para x>0, su densidad puede escribirse usando la función beta:
La función beta normaliza el área total para que sea 1. En la práctica, las calculadoras y bibliotecas estadísticas suelen trabajar con la densidad acumulada o con cuantiles.
La forma de F depende de dos grados de libertad. El primer parámetro controla la variabilidad del numerador y el segundo la del denominador. Al aumentar ambos, la distribución se concentra alrededor de 1 y la cola derecha pierde peso.
La distribución no es simétrica: una variación grande del denominador puede hacer que el cociente sea muy pequeño, mientras que un denominador cercano a cero puede producir valores enormes.
Si F∼F(ν1,ν2), la media existe cuando ν2>2:
La varianza requiere ν2>4 y vale:
Por eso la media no siempre es exactamente 1, aunque el cociente compare dos cantidades normalizadas con valor esperado cercano a 1.
La distribución F se construye con dos chi-cuadrado independientes, mientras que la t usa una normal y una chi-cuadrado:
Esta identidad conecta las pruebas t de dos colas con pruebas F cuyo numerador tiene un grado de libertad.
Si dos muestras normales independientes tienen varianzas poblacionales σ1² y σ2², entonces:
Cuando la hipótesis plantea σ1²=σ2², el cociente S1²/S2² se contrasta contra una distribución F. Conviene colocar la mayor varianza en el numerador cuando se busca una prueba de una cola superior.
En ANOVA se compara la variabilidad entre grupos con la variabilidad dentro de los grupos:
Un valor F grande indica que las medias de los grupos están separadas en relación con el ruido interno. La prueba no demuestra por sí sola qué pares de medias son diferentes; para eso se requieren comparaciones posteriores.
Modifica los grados de libertad y observa cómo cambia la densidad. La línea vertical muestra F=1, el punto natural de referencia cuando las dos varianzas comparadas son similares.
Para generar una observación F se generan dos chi-cuadrado independientes, se normalizan por sus grados de libertad y se calcula el cociente:
function normalEstandar() {
return Math.sqrt(-2 * Math.log(Math.random()))
* Math.cos(2 * Math.PI * Math.random());
}
function chiCuadrado(grados) {
let suma = 0;
for (let i = 0; i < grados; i++) {
const z = normalEstandar();
suma += z * z;
}
return suma;
}
function fisher(numerador, denominador) {
return (chiCuadrado(numerador) / numerador)
/ (chiCuadrado(denominador) / denominador);
}
console.log(fisher(5, 10));Pulsa Ejecutar para generar un valor aleatorio de F(5,10).
La simulación permite comparar la media observada con la media teórica cuando existe y contar qué proporción de valores queda por debajo del límite elegido.
Como F es no negativa, una prueba de una cola superior examina si el cociente es demasiado grande. Para una prueba bilateral de varianzas también importa un cociente demasiado pequeño; puede invertirse el orden de las varianzas o calcularse cada cola con cuidado.
La decisión se basa en un valor crítico o en un valor p, siempre especificando los grados de libertad de ambos parámetros.
La falta de normalidad o la presencia de valores extremos puede alterar notablemente un cociente de varianzas.
La distribución F se utiliza en comparación de varianzas, ANOVA, regresión lineal, pruebas de significación conjunta y construcción de intervalos para cocientes de varianzas. En regresión, una estadística F puede evaluar si un conjunto de variables explica una cantidad significativa de variación.
F es un cociente de variabilidades normalizadas. Sus dos grados de libertad son esenciales para interpretar la forma y los valores críticos.
La distribución F transforma la comparación de dos fuentes de variabilidad en un modelo probabilístico. Comprender su construcción desde chi-cuadrado permite interpretar pruebas de varianzas, ANOVA y muchos contrastes de regresión.