2. Historia y aplicaciones de la estadística

La estadística evolucionó desde el registro de poblaciones y recursos hasta convertirse en una herramienta esencial para la ciencia, la programación y las decisiones basadas en datos.

2.1 Introducción

La necesidad de contar personas, tierras, cosechas e impuestos existe desde las primeras civilizaciones. Sin embargo, registrar cantidades no era todavía hacer estadística en el sentido actual: faltaban métodos para analizar los datos, comparar grupos y obtener conclusiones.

La estadística moderna se formó mediante la unión de tres elementos: la recolección sistemática de datos, el desarrollo de la teoría de la probabilidad y la creación de métodos matemáticos para estudiar la variación.

Con las computadoras, estos métodos pudieron aplicarse a volúmenes de datos cada vez mayores. Hoy forman parte del desarrollo de software, la ciencia de datos, la inteligencia artificial y muchas otras disciplinas.

2.2 Los primeros registros

En la Antigüedad, distintos gobiernos realizaban recuentos de población y bienes. Estos registros se utilizaban para organizar impuestos, distribuir tierras, planificar obras y conocer la cantidad de personas disponibles para los ejércitos.

Los censos y registros administrativos tenían una finalidad principalmente práctica. Su importancia histórica reside en haber establecido la idea de que una sociedad podía describirse mediante datos organizados.

Registro de datos → Organización de recursos → Decisiones de gobierno

La palabra estadística se relaciona precisamente con el estudio de asuntos del Estado. Con el tiempo, su significado se amplió mucho más allá de la administración pública.

2.3 El nacimiento de la estadística demográfica

En el siglo XVII comenzaron a analizarse registros de nacimientos y defunciones de manera sistemática. En 1662, el comerciante inglés John Graunt publicó un estudio de los registros de mortalidad de Londres.

Graunt agrupó datos, comparó cantidades e identificó regularidades. Entre otras cosas, analizó causas de muerte y diferencias entre nacimientos de varones y mujeres. Su trabajo es considerado un antecedente fundamental de la demografía y la estadística aplicada.

El cambio fue importante: los registros dejaron de ser simples listas y comenzaron a utilizarse para descubrir patrones en una población.

2.4 La probabilidad y la incertidumbre

También durante el siglo XVII, los estudios sobre juegos de azar impulsaron el desarrollo de la teoría de la probabilidad. Los trabajos de Blaise Pascal, Pierre de Fermat, Christiaan Huygens y Jacob Bernoulli proporcionaron herramientas para cuantificar la incertidumbre.

La relación entre probabilidad y estadística puede resumirse así:

Probabilidad: parte de un modelo y estudia qué datos podrían observarse.
Estadística: parte de datos observados e intenta conocer el proceso que los generó.

Esta conexión permitió no solo describir datos, sino también estimar valores desconocidos y evaluar la confiabilidad de las conclusiones.

2.5 Medición, errores y distribución normal

Durante los siglos XVIII y XIX, la astronomía y la geodesia necesitaban combinar mediciones que nunca coincidían exactamente. Esto llevó al desarrollo de métodos para estudiar los errores de observación.

Adrien-Marie Legendre publicó el método de mínimos cuadrados en 1805. Carl Friedrich Gauss también desarrolló y justificó este método, además de relacionar los errores de medición con la distribución normal.

El método de mínimos cuadrados permite encontrar una línea o modelo que se ajuste a los datos minimizando la suma de los errores al cuadrado. Esta idea continúa siendo fundamental en la regresión y el aprendizaje automático.

2.6 Del individuo a los fenómenos sociales

En el siglo XIX, Adolphe Quetelet aplicó métodos estadísticos al estudio de poblaciones y fenómenos sociales. Buscó describir características humanas mediante promedios y regularidades observadas en grandes grupos.

Este enfoque ayudó a consolidar la idea de que la variación entre individuos podía estudiarse matemáticamente. También mostró una precaución que sigue vigente: un promedio resume un grupo, pero no describe necesariamente a cada uno de sus integrantes.

2.7 Correlación, regresión e inferencia

A fines del siglo XIX y comienzos del XX se desarrollaron muchas herramientas de la estadística moderna:

  • Francis Galton estudió la regresión y la relación entre características.
  • Karl Pearson formalizó métodos de correlación y desarrolló la prueba chi-cuadrado.
  • William Sealy Gosset, bajo el seudónimo “Student”, desarrolló métodos adecuados para muestras pequeñas.
  • Ronald Fisher realizó aportes decisivos al diseño de experimentos, el análisis de varianza y la estimación.
  • Jerzy Neyman y Egon Pearson desarrollaron un marco formal para las pruebas de hipótesis.

Estos avances permitieron diseñar mejores experimentos y distinguir entre una diferencia que podría deberse al azar y otra respaldada por evidencia suficiente.

2.8 La revolución informática

Muchos cálculos estadísticos eran lentos cuando debían realizarse manualmente. Las computadoras cambiaron esta situación: hicieron posible procesar grandes conjuntos de datos, repetir cálculos, crear simulaciones y aplicar modelos complejos.

La disponibilidad de bases de datos, sensores, dispositivos conectados e Internet multiplicó la cantidad de información registrada. La estadística pasó a integrarse directamente con la programación.

Datos digitales + Estadística + Programación = Análisis automatizado y escalable

Actualmente, un mismo programa puede recolectar datos, validarlos, calcular indicadores, generar gráficos y producir alertas en tiempo real.

2.9 Línea de tiempo resumida

Período Desarrollo Aporte principal
Antigüedad Censos y registros Recuento de población, tierras y recursos.
1662 John Graunt Análisis sistemático de datos de mortalidad.
Siglos XVII y XVIII Teoría de la probabilidad Fundamentos para estudiar la incertidumbre.
Siglo XIX Legendre, Gauss y Quetelet Medición de errores, ajuste de modelos y estadística social.
Finales del siglo XIX Galton y Pearson Regresión, correlación y nuevas pruebas estadísticas.
Siglo XX Gosset, Fisher, Neyman y Pearson Inferencia, experimentación y pruebas de hipótesis.
Actualidad Computación y datos masivos Análisis automatizado, ciencia de datos y aprendizaje automático.

2.10 Aplicaciones actuales de la estadística

La estadística se aplica en casi todas las actividades que producen datos:

Área Aplicación Ejemplo
Salud Evaluación de tratamientos y factores de riesgo. Comparar la recuperación de distintos grupos de pacientes.
Industria Control de calidad y mejora de procesos. Medir la proporción de productos defectuosos.
Economía Análisis de precios, empleo y producción. Estudiar la evolución mensual de la inflación.
Marketing Segmentación y evaluación de campañas. Comparar la conversión de dos anuncios.
Medio ambiente Análisis de mediciones y tendencias. Estudiar cambios en temperatura o contaminación.
Software Rendimiento, confiabilidad y comportamiento de usuarios. Detectar un aumento anormal en los tiempos de respuesta.

2.11 Aplicaciones en programación

Un programador utiliza estadística cada vez que resume mediciones, compara comportamientos o construye una regla basada en datos. Algunos casos habituales son:

  • calcular el tiempo medio y los percentiles de respuesta de una API;
  • medir la frecuencia y distribución de errores;
  • comparar el rendimiento de dos algoritmos;
  • analizar pruebas A/B de una interfaz;
  • detectar operaciones inusuales en un sistema;
  • evaluar la precisión de un modelo predictivo.

Este ejemplo calcula la tasa de errores de un servicio:

const solicitudes = 2500;
const solicitudesConError = 35;

const tasaDeError = solicitudesConError / solicitudes;
const porcentajeDeError = tasaDeError * 100;

console.log(`Tasa de error: ${porcentajeDeError.toFixed(2)}%`);

El resultado es 1.40%. Esta medida resume lo ocurrido, pero para interpretarla necesitamos contexto: el período analizado, los tipos de error incluidos y el nivel de error considerado aceptable.

2.12 Estadística, ciencia de datos y aprendizaje automático

La ciencia de datos combina estadística, programación y conocimiento del área estudiada. La estadística ayuda a formular preguntas, explorar datos, seleccionar métodos y comunicar la incertidumbre de los resultados.

En aprendizaje automático, los modelos identifican patrones a partir de ejemplos. Los conceptos estadísticos permiten:

  • comprender la distribución y calidad de los datos;
  • separar datos de entrenamiento y evaluación;
  • medir el error de las predicciones;
  • detectar sobreajuste;
  • comparar modelos de manera objetiva;
  • interpretar resultados con sus limitaciones.

La capacidad de ejecutar un algoritmo no garantiza un análisis correcto. Es necesario comprender qué representan los datos y qué supuestos utiliza el método.

2.13 Qué debes recordar de este tema

  • La estadística comenzó con la necesidad de registrar poblaciones y recursos.
  • John Graunt convirtió registros de mortalidad en un análisis sistemático de datos.
  • La teoría de la probabilidad permitió estudiar la incertidumbre de forma matemática.
  • Los métodos de regresión, correlación e inferencia se consolidaron entre los siglos XIX y XX.
  • Las computadoras hicieron posible automatizar cálculos y analizar grandes volúmenes de datos.
  • La estadística es fundamental en programación, ciencia de datos y aprendizaje automático.

2.14 Conclusión

La estadística evolucionó en respuesta a problemas concretos: administrar recursos, estudiar poblaciones, reducir errores de medición y evaluar experimentos. Hoy esos mismos principios ayudan a comprender el funcionamiento de aplicaciones, usuarios, algoritmos y modelos predictivos.

En el próximo tema estudiaremos los tipos de datos y las escalas de medición, conceptos esenciales para elegir correctamente cada técnica estadística.