Probabilidad y Estadística · Tema 43

Comparación estadística de escenarios

Decidir si A es mejor que B: diferencia con intervalo, muestras comunes y significancia práctica vs estadística.

01 · Punto de partida

Comparar es restar con error

A = 121, B = 124 no dice nada sin R y s. Comparar es estimar D = B − A con su intervalo: si el 0 queda fuera, hay ganador estadístico; si queda dentro, empate técnico aunque el punto difiera.

Con muestras comunes (mismas semillas) la diferencia se afina sin más R: el ruido compartido se cancela.

  • ¿D = B − A con qué intervalo 95 %?
  • ¿El 0 está dentro o fuera?
  • ¿Usé mismas semillas para afinar?
  • ¿La diferencia es relevante en plata/tiempo, no solo significativa?

02 · Definición

Diferencia con intervalo

D±

Independientes

SE(D) = √(sA²/RA + sB²/RB). R iguales y s parecidas: SE ≈ s·√(2/R).

↔

Apareadas

Mismas semillas: Dᵢ = Bᵢ − Aᵢ por réplica, SE = sD/√R. Suele pedir mitad de R.

≠0

Veredicto

0 fuera → significativo. 0 dentro → empate. Relevante = supera umbral práctico (plata, minutos).

s = 8, R = 100 por brazo: SE(D) ≈ 1,13.
D310,5
Intervalo[0,8–5,2] gana[−1,2–3,2] empateempate

03 · Diseño que afina

Mismas semillas, mitad de R

Independiente

Semillas distintas

Simple pero ruidoso: el azar distinto en A y B infla SE(D). Pide más R.

Apareado

Mismas semillas

Mismas demandas en A y B: lo común se cancela y D muestra el efecto puro del escenario.

Práctica vs estadística
D = 0,3 significativo con R enorme puede ser irrelevante en plata. Umbral práctico primero.
Solape
Intervalos A/B solapados no deciden: el de D sí. Comparar D, no ojos.
Múltiple
Comparar 5 escenarios infla falsos ganadores: ajustar (Bonferroni) o pre-registrar duelos.
Proporciones
D = p̂B − p̂A con SE = √(pA(1−pA)/RA + pB(1−pB)/RB). Tasas se comparan igual.

04 · Ejemplos

Duelos que se fallan con D

A, B con R→D ± E→Gana / empate
  1. 1
    Stock.

    115 vs 125: D = +8 ± 6 gana 125. Con ±10 empatan: más R.

  2. 2
    Cajeros.

    2 vs 3: D espera = −2,5 ± 0,5 gana 3. Relevante en SLA.

  3. 3
    Promo.

    0,12 vs 0,15 ± 0,02: B gana y es plata (tema 33).

  4. 4
    Precio.

    D = +1 ± 3: empate estadístico aunque el punto gane.

  5. 5
    Juego.

    Balance A/B con 20000 peleas: D = 1 % ± 0,3 % gana sin discusión.

05 · Representación en Python

Diferencia apareada en 6 líneas

Python en tu navegador. Mismas Ds: el ruido se cancela.

import random, statistics, math
random.seed(431)
Ds = [random.uniform(80,140) for _ in range(300)]
A = [10*min(115,d)-6*115 for d in Ds]
B = [10*min(125,d)-6*125 for d in Ds]
D = [b-a for a,b in zip(A,B)]
m = statistics.mean(D); se = statistics.stdev(D)/math.sqrt(len(D))
print(round(m,1), "±", round(1.96*se,1))

Consejo: con semillas distintas el ± duplica: probá generar Ds separadas para A y B.

Proporciones A/B

import math
pA, pB, n = 0.12, 0.15, 2000
se = math.sqrt(pA*(1-pA)/n + pB*(1-pB)/n)
print(round(pB-pA,3), "±", round(1.96*se,3))

06 · Exploración

Laboratorio: duelo A(120) vs B(120+δ)

A ~ N(120, 8), B ~ N(120+δ, 8), R por brazo. Barras = medias ± 95 %; abajo D con su intervalo vs 0. Mové δ y R: con δ = 1 y R = 30 empatan; con R = 400 ganan.

EXPERIMENTO 43

D = B − A ± 1,96·SE

0 fuera = gana · dentro = empate

Los resultados numéricos aparecen debajo.
D (B−A)0,00
IC 95 % de D—
Veredicto—
R100

Con δ = 3 y R = 100, D ≈ 3 ± 2,2: gana B.

Arriba medias con intervalos; abajo diferencia con cero. Apareado angosta el intervalo ~40 %.

Preguntas para explorar

  1. Con δ = 1 y R = 30, ¿gana alguien? ¿Y con R = 500?
  2. Con δ = 0, ¿cuántas veces «gana» uno de 20 repeticiones? ¿Por qué 5 %?
  3. ¿Qué cambia a apareado con δ = 1 y R = 100?
Ver respuestas sugeridas
  1. No (intervalo ±4 tapa); sí con 500 (±1): la misma D pasa de ruido a señal con R.
  2. ~1 de 20: el 5 % de falsos del 95 %. Significancia no es certeza.
  3. El intervalo se angosta ~40 % y puede decidir sin más R: muestras comunes afinan gratis.

07 · Comprensión

Confusiones frecuentes

«Medias distintas ya ganan»

No sin intervalo: 124 vs 121 con ±4 empatan. El punto no decide, D ± E sí.

«Solape leve es empate seguro»

El test de D es más fino que ojos en solape: D puede excluir 0 con solape parcial.

«Significativo es importante»

Con R enorme todo es significativo. Relevancia = supera umbral práctico (plata, minutos).

«5 duelos al 95 % dan 95 % conjunto»

No: 1−0,95⁵ ≈ 23 % de algún falso. Ajustar o pre-registrar el duelo principal.

08 · Práctica guiada

Ejercicios con Python

Ejercicio 1: D con R = 100

A N(120,8), B N(123,8), R = 100. ¿D ± E? ¿Gana B?

import random, statistics, math
random.seed(431)
A = [random.gauss(120,8) for _ in range(100)]
B = [random.gauss(123,8) for _ in range(100)]
D = statistics.mean(B)-statistics.mean(A)
se = math.sqrt(statistics.variance(A)/100+statistics.variance(B)/100)
print(round(D,2), "±", round(1.96*se,2))
Ver solución razonada

D ≈ 3 ± 2,2: el 0 queda fuera → gana B al 95 %. Con R = 30 daría ±4 y empataría.

Ejercicio 2: apareado afina

Con las Ds comunes del bloque Python (stock 115/125), ¿E apareado vs independiente?

import statistics, math
# D ya calculada arriba como apareada; comparar con SE independiente aproximado
print("apareado usa s(D)/√R: menor que √(sA²+sB²)/√R")
Ver solución

Apareado ~40 % más angosto aquí: las mismas demandas cancelan el azar común y dejan el efecto puro del stock.

Ejercicio 3: relevancia

D = +0,4 ± 0,2 con umbral práctico 1. ¿Gana? ¿Y con D = +2 ± 0,5?

Ver una posible respuesta
print("D=0.4: significativo pero irrelevante (<1)")
print("D=2: significativo y relevante")

Significancia sin relevancia no compra nada. El umbral práctico va antes del test.

09 · Síntesis

Ideas para recordar

  • Comparar = D ± 1,96·SE(D). 0 fuera gana; dentro empata.
  • Apareado (mismas semillas) afina sin más R.
  • Solape de A/B no decide; intervalo de D sí.
  • Relevancia práctica antes que significancia.
  • Informar D + rango + método + R.

En el próximo tema cerraremos con casos reales: aplicaciones prácticas en simulación.