La distribución t de Student se utiliza para trabajar con medias cuando la muestra es pequeña y la desviación estándar poblacional es desconocida. Tiene colas más pesadas que la normal y depende de los grados de libertad.
Si conociéramos la desviación estándar verdadera σ de una población normal, podríamos estandarizar una media con la normal estándar. En la práctica σ suele ser desconocida y la reemplazamos por la desviación estándar muestral s.
Ese reemplazo introduce variabilidad adicional. La distribución t representa esa incertidumbre y produce colas más pesadas que la normal.
Para una muestra de tamaño n, cuando se contrasta una media μ0, el estadístico es:
Si los datos provienen de una población normal y la hipótesis nula es correcta, este estadístico sigue una distribución t con:
La densidad t con ν grados de libertad es:
La expresión utiliza la función gamma. No es necesario calcularla manualmente para usar la distribución, pero muestra cómo ν controla el peso de las colas.
Los grados de libertad indican cuánta información independiente queda disponible después de estimar parámetros. Al estimar la media con x̄, una de las desviaciones queda determinada por las demás y se utiliza n−1.
Con pocos grados de libertad, la t es más ancha y tiene colas más pesadas. Cuando ν crece, la distribución t se aproxima a la normal estándar.
La distribución t es simétrica alrededor de 0, como la normal estándar, pero asigna más probabilidad a valores alejados del centro. Por eso los valores críticos t suelen ser mayores que los valores críticos normales para el mismo nivel de confianza cuando la muestra es pequeña.
Para una t con ν grados de libertad:
Cuando ν≤1 la media no existe; cuando ν≤2 la varianza es infinita. Esto refleja que las colas son especialmente pesadas con muy pocos grados de libertad.
Un intervalo de confianza para la media de una población normal con σ desconocida tiene la forma:
El valor crítico se obtiene de la distribución t con ν=n−1 grados de libertad. Para muestras grandes, el valor crítico se acerca al de la normal.
Compara la distribución t con distintos grados de libertad. La línea normal estándar sirve como referencia y la región sombreada muestra un intervalo central aproximado.
Una t de Student puede generarse usando una normal estándar Z y una variable chi-cuadrado V:
function normalEstandar() {
return Math.sqrt(-2 * Math.log(Math.random()))
* Math.cos(2 * Math.PI * Math.random());
}
function tStudent(grados) {
let chi = 0;
for (let i = 0; i < grados; i++) {
const z = normalEstandar();
chi += z * z;
}
return normalEstandar() / Math.sqrt(chi / grados);
}
console.log(tStudent(5));Pulsa Ejecutar para generar una observación t con cinco grados de libertad.
La simulación permite comparar la proporción de valores dentro de un intervalo con la probabilidad teórica aproximada. Las colas pesadas hacen que aparezcan valores extremos con más frecuencia que en la normal cuando ν es pequeño.
Si Z∼Normal(0,1) y V∼χ²(ν) son independientes, entonces:
El denominador aleatorio puede ser menor o mayor que 1. Esa variación adicional produce colas más pesadas que las de Z.
La distribución t aparece en pruebas de una media, pruebas pareadas y comparación de medias bajo supuestos de normalidad. El estadístico se compara con valores críticos t para decidir si una diferencia es compatible con la hipótesis nula.
La elección de una prueba concreta depende del diseño, la independencia, la escala de medición y la calidad de los datos.
Se usa en análisis de muestras pequeñas, intervalos de confianza, pruebas de medias, regresión lineal y estimación de parámetros cuando la variabilidad poblacional debe estimarse con los datos.
La distribución t es simétrica, tiene colas más pesadas que la normal y se acerca a ella cuando aumentan los grados de libertad.
La distribución t incorpora la incertidumbre de estimar la desviación estándar a partir de una muestra. Sus grados de libertad controlan cuánto se diferencia de la normal y la convierten en una herramienta esencial para inferencia con muestras pequeñas.