Probabilidad y Estadística · Tema 28

Muestras

Fragmentos representativos para inferir el todo: población vs muestra, muestreo que sí representa y cómo el tamaño manda el error.

01 · Punto de partida

No medís todo: medís bien una parte

La población es todo lo que te interesa (todas las atenciones del mes); la muestra es la parte que medís (300 atenciones). Si es aleatoria y con n suficiente, su media estima μ con error σ/√n. Si es cómoda o chica, estima con sesgo o ruido.

En simulación, cada conjunto de réplicas es una muestra del modelo: el mismo marco decide cuántas corridas pedir (tema 41).

  • ¿Cuál es la población exacta (qué, dónde, cuándo)?
  • ¿Cada elemento tuvo igual chance de salir?
  • ¿n alcanza para el error que necesito?
  • ¿La muestra cubre estratos (pico/valle, sucursales)?

02 · Definición

Población, muestra y marco

Ω

Población

Conjunto completo con μ y σ (casi siempre desconocidos). Se define por alcance temporal y espacial.

n

Muestra aleatoria

n sorteos independientes de la población. Cada uno con igual chance: sin a dedo ni por comodidad.

x̄ s

Estadísticos

Media y desvío muestrales estiman μ y σ. Con n grande y aleatoriedad, se pegan (temas 15 y 32).

Población N(50, 10): SE por n.
n925100400
σ/√n3,33210,5

03 · Métodos

Cómo muestrear sin sesgar

Que sí representan

Aleatorio y estratificado

Simple: sorteo puro. Estratificado: sorteo dentro de cada tramo (pico/valle) con su peso. El segundo rinde más con picos.

Que sesgan

Conveniencia y juicio

Lo accesible, lo voluntario, «clientes típicos» a ojo. Rápidos y baratos… y sesgados (tema 27).

Aleatorio simple
Cada elemento igual chance. Base teórica; exige marco completo.
Estratificado
Se parte en estratos y se sortea en cada uno proporcional. Ideal con picos.
Sistemático
Cada k-ésimo (cada 10.º cliente). Vale si no hay periodicidad escondida.
Tamaño
n se calcula del margen deseado (tema 42), no del presupuesto de tiempo.

04 · Ejemplos

Muestras que calibran

Población→n sorteos→x̄ ± E
  1. 1
    Atención.

    300 tiempos sorteados del mes → μ y σ del servicio.

  2. 2
    Llegadas.

    60 horas estratificadas pico/valle → λ por tramo.

  3. 3
    Conversión.

    2000 visitas → p con ±2 puntos (tema 33).

  4. 4
    Réplicas.

    500 corridas del simulador → media del escenario.

  5. 5
    Calidad.

    50 piezas por lote → tasa de falla del lote.

05 · Representación en Python

Sortear y estimar

Python en tu navegador. Compará n = 9 contra 400.

import random, statistics
random.seed(281)
pob = [random.gauss(50, 10) for _ in range(20000)]

for n in [9, 100]:
    m = random.sample(pob, n)
    print(n, "x̄:", round(statistics.mean(m), 2), "| s:", round(statistics.stdev(m), 2))

Consejo: random.sample es sin reposición (muestra real); choices es con reposición (réplicas del modelo).

Estratificar picos

import random
random.seed(6)
# 75% valle lam=6, 25% pico lam=14 → ponderar, no promediar simple
valle = [6]*75
pico = [14]*25
print("media ponderada:", sum(valle+pico)/len(valle+pico))

06 · Exploración

Laboratorio: medias que se angostan con n

Población N(50, 10). Tomamos 500 muestras de tamaño n y graficamos sus medias: histograma vs campana teórica N(50, 10/√n). Subí n y mirá cómo se angosta.

EXPERIMENTO 28

Distribución de x̄

x̄ ~ N(μ, σ/√n)

Los resultados numéricos aparecen debajo.
Media de medias0,00
SE sim (teo σ/√n)0,00
% en μ ± 2SE0,0 %
n25

Con n = 25, SE = 2: el 95 % de las medias cae en 50 ± 4.

Eje x 38 a 62. La curva blanca es la teórica; las barras/puntos, las 500 medias simuladas.

Preguntas para explorar

  1. Con n = 4, ¿qué ancho tiene el histograma? ¿Y con n = 100?
  2. ¿La media de medias se acerca a 50 en ambos? ¿Qué cambia: centro o ancho?
  3. ¿Qué n pedirías para SE = 0,5? Verificá en el laboratorio.
Ver respuestas sugeridas
  1. SE 5 vs 1: el segundo es 5× más angosto. n manda el ancho, no el centro.
  2. Ambas centran en 50 (insesgado); cambia el ancho. Aleatoriedad centra, n afina.
  3. n = 400 (10/√n = 0,5). Cuesta 16× pasar de n = 25 a 400 para 4× precisión.

07 · Comprensión

Confusiones frecuentes

«n grande arregla muestra cómoda»

No: centra mejor el sesgo. 10000 cómodos estiman el sesgo con precisión quirúrgica.

«La media muestral es μ»

La estima con error σ/√n. Informar x̄ sin n ni s esconde la precisión.

«Estratificar complica»

Simplifica el error: con picos, estratificar rinde más que agrandar n a ciegas.

«Réplicas y muestras son distintas»

Mismo marco: R réplicas son muestra de tamaño R del modelo. Todo lo de aquí aplica (tema 41).

08 · Práctica guiada

Ejercicios con Python

Ejercicio 1: SE a mano

Con σ = 10, calculá SE para n = 25 y 100. Verificá con 500 medias simuladas.

import random, statistics
random.seed(281)
for n in [25, 100]:
    medias = [statistics.mean(random.gauss(50,10) for _ in range(n)) for _ in range(500)]
    print(n, "SE sim:", round(statistics.stdev(medias), 2), "| teo:", round(10/n**0.5, 2))
Ver solución razonada

2 y 1: la sim calca σ/√n. Así se valida el N antes de medir en serio.

Ejercicio 2: n para margen

¿n para estimar μ ± 1 con 95 % (z ≈ 2) si σ = 10? Fórmula n = (2·10/1)².

print("n:", (2*10/1)**2)
Ver solución

n = 400. Precisión de 1 punto en escala σ = 10 cuesta cientos: planificar evita medir de menos.

Ejercicio 3: estratificar

Día 75 % valle (μ = 6) y 25 % pico (μ = 14). ¿Media ponderada? ¿Y el error de promediar simple 50/50?

Ver una posible respuesta
print("ponderada:", 0.75*6+0.25*14, "| simple:", (6+14)/2)

8 vs 10: el simple sesga +2. Estratificar con pesos reales corrige.

09 · Síntesis

Ideas para recordar

  • Población (μ, σ) vs muestra (x̄, s, n).
  • Aleatoria + estratificada por picos; conveniencia sesga.
  • SE = σ/√n: n manda el ancho, aleatoriedad el centro.
  • En Python: sample sin reposición, choices con reposición.
  • R réplicas = muestra del modelo: mismo cálculo de N.

En el próximo tema graficaremos la muestra: histogramas.