Reconocer qué representa cada dato permite almacenarlo correctamente y elegir operaciones, gráficos y métodos estadísticos adecuados.
No todos los datos expresan lo mismo. El color de un producto, una calificación de “malo” a “excelente”, la cantidad de errores y el tiempo de respuesta describen características diferentes.
El tipo de dato estadístico indica la naturaleza de la información. La escala de medición indica qué relaciones y operaciones tienen sentido entre sus valores.
Clasificar correctamente una variable es esencial: determina cómo validarla, resumirla, representarla y analizarla.
Antes de clasificar los datos conviene distinguir tres conceptos:
Una tabla de datos suele representar las observaciones en filas y las variables en columnas.
Los datos cualitativos, también llamados categóricos, representan cualidades, clases o etiquetas. Sus valores indican a qué categoría pertenece cada observación.
Se dividen en dos tipos:
Una variable con solo dos categorías, como “activo/inactivo”, se denomina binaria o dicotómica.
Los datos cuantitativos representan cantidades obtenidas mediante un conteo o una medición. Sus valores son numéricos y permiten realizar operaciones aritméticas acordes con su escala.
Se dividen en:
Un dato continuo puede almacenarse con pocos decimales, pero sigue siendo continuo si conceptualmente procede de una medición.
| Tipo | Qué representa | Ejemplo en programación |
|---|---|---|
| Cualitativo nominal | Categorías sin orden. | Sistema operativo: Windows, Linux, macOS. |
| Cualitativo ordinal | Categorías ordenadas. | Severidad: baja, media, alta, crítica. |
| Cuantitativo discreto | Cantidades contables. | Número de intentos de inicio de sesión. |
| Cuantitativo continuo | Cantidades medidas. | Tiempo de respuesta en milisegundos. |
Una escala de medición describe la información contenida en los valores y las comparaciones que podemos realizar con ellos. Las cuatro escalas principales son:
Cada nivel conserva las propiedades del anterior y agrega una nueva. Elegir una escala incorrecta puede producir operaciones sin significado.
La escala nominal identifica categorías sin establecer un orden. Podemos comprobar si dos valores son iguales o diferentes, contar casos y calcular proporciones.
Aunque asignemos códigos numéricos —por ejemplo, móvil = 1, tableta = 2 y escritorio = 3—, esos números funcionan como etiquetas. No tiene sentido afirmar que “escritorio es tres veces móvil” ni calcular el promedio de los códigos.
La escala ordinal clasifica y ordena. Permite determinar si una categoría se encuentra antes, después, por encima o por debajo de otra.
No conocemos la distancia exacta entre categorías. El paso de prioridad baja a media no tiene por qué ser equivalente al paso de alta a crítica. Por ello, los códigos 1, 2, 3 y 4 expresan orden, pero no garantizan intervalos iguales.
La escala de intervalo posee orden y distancias iguales entre valores. Las diferencias son interpretables, pero el cero es un punto de referencia y no representa ausencia absoluta de la característica.
La temperatura en grados Celsius es el ejemplo clásico. La diferencia entre 10 °C y 20 °C es igual a la diferencia entre 20 °C y 30 °C. Sin embargo, 20 °C no significa “el doble de calor” que 10 °C, porque 0 °C no representa ausencia de temperatura.
Las fechas de calendario también se interpretan como una escala de intervalo: podemos calcular cuántos días separan dos fechas, pero una fecha no es una proporción significativa de otra.
La escala de razón posee orden, intervalos iguales y un cero que representa ausencia real de la cantidad medida. Esto permite interpretar tanto diferencias como proporciones.
Son variables de razón la duración, la distancia, el peso, la cantidad de registros y el consumo de memoria. La temperatura expresada en kelvin también tiene un cero absoluto y pertenece a esta escala.
| Escala | Orden | Diferencias comparables | Cero absoluto | Ejemplo |
|---|---|---|---|---|
| Nominal | No | No | No corresponde | Tipo de navegador. |
| Ordinal | Sí | No | No corresponde | Nivel de satisfacción. |
| Intervalo | Sí | Sí | No | Temperatura en °C. |
| Razón | Sí | Sí | Sí | Tiempo de ejecución. |
El tipo utilizado por un lenguaje de programación no determina por sí solo el significado estadístico del dato. El contexto es indispensable.
| Variable | Valor almacenado | Tipo en JavaScript | Interpretación estadística |
|---|---|---|---|
| Código postal | 5000 |
number |
Cualitativo nominal: es un identificador. |
| Prioridad | "alta" |
string |
Cualitativo ordinal. |
| Cantidad de errores | 8 |
number |
Cuantitativo discreto, escala de razón. |
| Duración | 1.75 |
number |
Cuantitativo continuo, escala de razón. |
Sumar códigos postales es posible para el lenguaje, pero el resultado carece de significado estadístico.
Podemos organizar la descripción de las variables junto con los datos. Esto ayuda a validarlos antes del análisis:
const variables = {
navegador: {
tipo: "cualitativo nominal",
valoresPermitidos: ["Chrome", "Firefox", "Safari"]
},
prioridad: {
tipo: "cualitativo ordinal",
orden: ["baja", "media", "alta", "crítica"]
},
tiempoRespuesta: {
tipo: "cuantitativo continuo",
escala: "razón",
unidad: "ms"
}
};
const prioridad = "alta";
const posicion = variables.prioridad.orden.indexOf(prioridad);
console.log(posicion); // 2
El arreglo orden permite comparar categorías ordinales sin suponer que la distancia entre ellas sea numéricamente uniforme.
Un valor faltante no es lo mismo que cero. El cero puede ser una medición válida; un dato faltante indica que no se dispone de la observación.
En programación, los valores faltantes pueden aparecer como null, undefined, una celda vacía o un código especial. Deben tratarse explícitamente. Reemplazarlos automáticamente por cero puede alterar promedios, proporciones y conclusiones.
Estas preguntas ofrecen una guía práctica:
La clasificación depende del significado y del uso de la variable, no únicamente de su apariencia.
Identificar la naturaleza y la escala de cada variable evita cálculos sin significado y permite seleccionar resúmenes, gráficos y técnicas adecuados. Esta clasificación debe realizarse antes de comenzar cualquier análisis.
En el próximo tema estudiaremos la diferencia entre población y muestra, y por qué normalmente analizamos una parte de los datos para aprender sobre un conjunto mayor.