Probabilidad y Estadística · Tema 27

Obtención de datos experimentales

Medir la realidad para alimentar el modelo: qué registrar, cómo evitar sesgos y cómo dejar datos auditables.

01 · Punto de partida

Sin datos, los parámetros son deseos

Todo λ, p, μ y σ del modelo debería venir de mediciones o declararse supuesto. Medir es diseñar: qué variable, con qué instrumento, en qué ventana, con qué formato. Un dato mal medido calibra mal aunque la familia sea correcta.

El enemigo es el sesgo: medir solo en hora pico, redondear tiempos, perder los ceros. Este tema deja el protocolo mínimo para que tus datos sostengan el ajuste (tema 34).

  • ¿Qué variable exacta alimenta cada parámetro?
  • ¿En qué ventana y con qué instrumento se mide?
  • ¿La muestra cubre valles y picos o solo lo visible?
  • ¿El registro guarda crudos con fecha o solo promedios?

02 · Definición

Protocolo mínimo de medición

◉

Variable e instrumento

Definir «llegada = persona que cruza la puerta» y con qué se cuenta (sensor, ticket, manual). Sin definición no hay réplica.

◷

Ventana y cobertura

Días, horas y zonas que cubre. Pico y valle incluidos en su proporción real, no en la cómoda.

≣

Registro crudo

Cada evento con timestamp, sin agregar. Del crudo salen tasas, histogramas y ajustes; del promedio no sale nada más.

Ficha mínima por variable.
CampoEjemplo
VariableLlegadas por hora, por puerta
InstrumentoSensor + conteo manual de control
Ventana7 días, 8 a 20 h, picos incluidos
Formatotimestamp por llegada, CSV
n1420 llegadas en 84 horas

03 · Sesgos que rompen modelos

Los 4 clásicos

Cobertura

Pico y conveniencia

Medir solo en pico infla λ; medir lo accesible ignora lo crítico. La muestra debe pesar cada tramo como pesa en la realidad.

Instrumento

Redondeo y pérdida

Redondear a 5 min aplasta varianza; perder ceros («horas sin nada no se anotan») infla la tasa.

Selección
Quién/qué entra en la muestra. Horarios cómodos ≠ día completo.
Medición
Cómo se registra: redondeo, umbral, sensor que satura en picos.
Supervivencia
Solo éxitos visibles («clientes atendidos», sin abandonos): la cola real es peor.
Agregación
Guardar promedios destruye forma y colas. Guardar crudos preserva todo.

04 · Ejemplos

Mediciones que alimentan parámetros

Protocolo→Crudos→λ, p, μ, σ
  1. 1
    Llegadas.

    Timestamp por puerta 7 días → λ/hora global y por hora (picos).

  2. 2
    Atención.

    Inicio–fin por cliente, sin redondear → μ, σ del servicio.

  3. 3
    Conversión.

    Visita sí/no con n → p con intervalo (temas 32–33).

  4. 4
    Fallas.

    Fecha–hora de cada falla + horas operadas → λ/día.

  5. 5
    Demanda.

    Ventas + faltantes (demanda insatisfecha): vender 10 con quiebre no es demandar 10.

05 · Representación en Python

Registrar crudos, no promedios

Python en tu navegador. El CSV crudo habilita todo el análisis posterior.

# Registro crudo: timestamp (min) de cada llegada
llegadas = [3, 9, 12, 21, 27, 33, 41, 48, 55, 59]
ventana_h = 1.0
lam = len(llegadas) / ventana_h
print("n:", len(llegadas), "| lam/hora:", lam)
# Entre-llegadas para chequear exponencial
entre = [b-a for a, b in zip([0]+llegadas, llegadas)]
print("entre:", entre)

Consejo: del timestamp salen conteos (Poisson) y entre-llegadas (exponencial): dos chequeos con un registro.

Sesgo de cobertura en código

# Día: 18h valle lam=6 + 6h pico lam=14. Verdadero = 8/h
# Muestrear solo pico estima 14: sesgo +75%
verdadero = (18*6 + 6*14) / 24
solo_pico = 14
print("verdadero:", verdadero, "| solo pico:", solo_pico)

06 · Exploración

Laboratorio: medir solo el pico miente

Día real: 18 h valle Poisson(6) + 6 h pico Poisson(14), media verdadera 8/hora. El deslizador q es la fracción de horas medidas en pico. Con q = 25 % (proporción real) estima 8; con q = 100 % estima 14. El ruido depende de N horas medidas.

EXPERIMENTO 27

Sesgo de cobertura

λ̂ = q·14 + (1−q)·6 · verdadero 8

Los resultados numéricos aparecen debajo.
λ̂ promedio0,00
Sesgo (λ̂−8)0,00
Rango réplicas0,00
Verdadero8,00

Con q = 0,25 el estimador centra en 8; con q = 1 centra en 14.

Cada curva es λ̂ acumulado de una réplica. La recta blanca es 8; la naranja, 14 (solo pico). El sesgo no se achica con N: solo se estabiliza en el número equivocado.

Preguntas para explorar

  1. Con q = 1 y N = 240, ¿λ̂ se acerca a 8? ¿Por qué más datos no arreglan?
  2. Con q = 0,25 y N = 6 vs 240, ¿qué cambia: sesgo o ruido?
  3. ¿Cómo diseñarías la muestra de 48 horas para estimar sin sesgo?
Ver respuestas sugeridas
  1. No: converge a 14. El sesgo es sistemático; N solo reduce ruido alrededor del blanco equivocado.
  2. El sesgo (~0) no cambia; el rango se achica de ±2 a ±0,5. N quita ruido, el diseño quita sesgo.
  3. 12 en pico/no… no: 36 valle + 12 pico (25 % pico, como el día). Estratificar por tramo con su peso real.

07 · Comprensión

Confusiones frecuentes

«Más datos arreglan mala muestra»

No: achican ruido, no sesgo. 1000 horas solo-pico estiman 14 con total confianza… y totalmente mal.

«Promedio guardado alcanza»

No: sin crudos no hay histograma, colas ni re-análisis por ventana. Guardar crudos es barato.

«Ventas iguales a demanda»

Con quiebre, ventas subestiman demanda. Hay que sumar faltantes o el stock se calibra a la baja.

«Redondear no cambia nada»

Aplasta varianza y fabrica picos falsos en el histograma. Medir con resolución real.

08 · Práctica guiada

Ejercicios con Python

Ejercicio 1: λ ponderado

Calculá el λ verdadero del día (18×6 + 6×14)/24 y el sesgo de medir 50 % en pico.

verd = (18*6 + 6*14)/24
est = 0.5*14 + 0.5*6
print("verd:", verd, "| est:", est, "| sesgo:", est-verd)
Ver solución razonada

Verdadero 8, estimado 10, sesgo +2 (+25 %). Medir mitad pico duplica su peso real (25 %). Estratificar corrige.

Ejercicio 2: de timestamps a λ

Con 37 llegadas en 4,5 horas, estimá λ/hora y entre-llegada media. ¿Coherentes?

n, h = 37, 4.5
print("lam:", round(n/h, 2), "| entre min:", round(60/(n/h), 1))
Ver solución

λ ≈ 8,22/hora, entre ≈ 7,3 min. Dualidad Poisson/Exp: un registro, dos lecturas que deben cerrar.

Ejercicio 3: ficha de medición

Escribí la ficha de «tiempo de atención» con 5 campos y n objetivo. ¿Qué sesgo evitás con cada campo?

Ver una posible respuesta
ficha = {
 "variable": "inicio-fin por cliente, sin redondeo",
 "ventana": "lun-dom 8-20h, pico y valle proporcionales",
 "instrumento": "ticket + control manual 10%",
 "formato": "timestamp inicio,fin, cajero",
 "n": ">= 300 atenciones",
}
print(ficha)

Definición evita ambigüedad; ventana evita pico-sesgo; instrumento evita redondeo; crudos evitan agregación; n da precisión.

09 · Síntesis

Ideas para recordar

  • Medir es diseñar: variable, instrumento, ventana, crudos.
  • Cobertura proporcional: cada tramo pesa lo que pesa en la realidad.
  • N quita ruido; solo el diseño quita sesgo.
  • Guardar timestamps: habilita tasas, entre-tiempos e histogramas.
  • Ventas con quiebre ≠ demanda; ceros y abandonos se anotan.

En el próximo tema formalizaremos la muestra: muestras.