Un análisis confiable comienza antes de calcular: requiere una pregunta precisa, datos obtenidos de forma adecuada y una estructura consistente, documentada y verificable.
Las técnicas estadísticas no pueden corregir por sí solas una recolección deficiente. Si los datos no corresponden a la pregunta, contienen mediciones inconsistentes o excluyen casos importantes, las conclusiones serán poco confiables.
La recolección de datos es el proceso de obtener y registrar observaciones. La organización de datos consiste en estructurarlas, documentarlas y prepararlas para su análisis.
Ambas tareas forman parte de un mismo flujo y deben planificarse antes de comenzar a registrar valores.
La pregunta determina qué datos hacen falta. “Analizar la aplicación” es demasiado amplio; una pregunta útil especifica una característica, una población y un período.
La segunda pregunta permite definir la unidad de análisis, la variable, el umbral y el intervalo temporal.
Un plan de recolección debe responder, como mínimo, las siguientes preguntas:
Documentar estas decisiones evita cambiar criterios durante el proceso sin dejar constancia.
Los datos pueden clasificarse según su origen:
| Fuente | Definición | Ejemplo |
|---|---|---|
| Primaria | Los datos se recolectan específicamente para el estudio actual. | Realizar una encuesta a los usuarios de una nueva función. |
| Secundaria | Los datos ya existían y fueron creados con otro propósito. | Analizar registros históricos del servidor. |
Las fuentes secundarias suelen ahorrar tiempo, pero es necesario conocer cómo, cuándo y para qué se generaron.
| Método | Qué obtiene | Precaución principal |
|---|---|---|
| Encuesta | Respuestas declaradas por personas. | Preguntas ambiguas o muestra sesgada. |
| Observación | Comportamientos o fenómenos registrados. | Criterios de observación inconsistentes. |
| Experimento | Resultados bajo condiciones controladas. | Grupos no comparables o variables sin controlar. |
| Sensores | Mediciones automáticas y periódicas. | Descalibración, fallos o unidades incorrectas. |
| Registros de software | Eventos producidos por aplicaciones y servidores. | Eventos duplicados, faltantes o mal definidos. |
| API o base de datos | Datos almacenados por otros sistemas. | Cambios de esquema, cobertura o significado. |
Una variable debe medirse del mismo modo en todas las observaciones. Para ello se necesita una definición operacional: una regla concreta que indique cómo se obtiene el valor.
Sin esta definición, dos sistemas podrían llamar “tiempo de respuesta” a mediciones distintas y producir valores no comparables.
Una forma habitual de organizar datos es utilizar una tabla donde:
| id | fecha_hora | ruta | estado_http | duracion_ms |
|---|---|---|---|---|
| R001 | 2026-08-02T10:15:03Z | /productos | 200 | 184,2 |
| R002 | 2026-08-02T10:15:05Z | /pedidos | 500 | 622,8 |
El estado HTTP es una categoría codificada, mientras que la duración es una variable cuantitativa.
Un identificador permite distinguir observaciones y detectar duplicados. Debe ser único, estable y no depender de una característica que pueda cambiar.
Un identificador no es una medida. Aunque sea numérico, no corresponde calcular su media ni utilizarlo como cantidad. Cuando contiene información personal, debe evitarse exponerlo o reemplazarse por un código controlado.
El diccionario de datos documenta el significado de cada variable. Como mínimo, debería incluir:
| Campo | Descripción | Tipo | Unidad o valores permitidos |
|---|---|---|---|
id |
Identificador único de la solicitud. | Cualitativa nominal | Texto no vacío y único. |
estado_http |
Código devuelto por el servidor. | Cualitativa nominal | Código HTTP de tres dígitos. |
duracion_ms |
Tiempo total de respuesta. | Cuantitativa continua | Milisegundos, valor mayor o igual que cero. |
El diccionario evita que una misma columna sea interpretada de formas diferentes por distintas personas o programas.
El formato debe elegirse según la estructura y el uso de los datos:
El formato no reemplaza la documentación. También deben registrarse codificación de texto, separador decimal, zona horaria, formato de fechas y representación de valores faltantes.
La validación comprueba si cada valor respeta las reglas definidas. Algunas verificaciones frecuentes son:
Conviene validar durante la entrada de datos y repetir los controles antes del análisis.
Un dato puede faltar porque no se registró, no correspondía, se perdió o fue rechazado por una validación. Estas causas no son equivalentes.
No se deben reemplazar todos los faltantes por cero. Primero hay que medir cuántos faltan, estudiar por qué faltan y decidir un tratamiento que no distorsione el análisis.
La limpieza corrige o señala problemas detectados sin alterar silenciosamente la información original. Puede incluir:
Es recomendable conservar los datos originales sin modificar y generar una versión limpia mediante un proceso reproducible.
El siguiente ejemplo normaliza registros y separa aquellos que no cumplen las reglas:
const datosCrudos = [
{ id: " R001 ", estado: "ÉXITO", duracion: "184.2" },
{ id: "R002", estado: "error", duracion: "622.8" },
{ id: "R003", estado: "éxito", duracion: "-5" }
];
function normalizar(registro) {
return {
id: registro.id.trim(),
estado: registro.estado.trim().toLowerCase(),
duracion: Number(registro.duracion)
};
}
function esValido(registro) {
const estados = ["éxito", "error"];
return registro.id !== "" &&
estados.includes(registro.estado) &&
Number.isFinite(registro.duracion) &&
registro.duracion >= 0;
}
const normalizados = datosCrudos.map(normalizar);
const validos = normalizados.filter(esValido);
const rechazados = normalizados.filter(registro => !esValido(registro));
console.log(validos);
console.log(rechazados);
El registro con duración -5 queda separado para revisión. El programa no inventa un reemplazo ni lo elimina sin dejar evidencia.
Un informe de calidad ayuda a decidir si los datos están listos para analizarse. Puede incluir:
Los problemas no siempre obligan a descartar el conjunto completo, pero deben conocerse y comunicarse junto con los resultados.
Recolectar un dato porque es técnicamente posible no significa que sea necesario ni apropiado. Deben considerarse la finalidad, el consentimiento, la seguridad y la normativa aplicable.
La privacidad debe incorporarse al diseño del proceso, no agregarse únicamente al final.
Un análisis es reproducible cuando otra persona puede comprender de dónde provienen los datos y repetir las transformaciones.
Para lograrlo, conviene conservar versiones, registrar fechas, documentar reglas y automatizar transformaciones mediante código. Modificar manualmente celdas sin dejar registro dificulta comprobar el resultado.
Recolectar y organizar datos exige decisiones metodológicas y técnicas. Una estructura consistente y documentada reduce errores, facilita la programación y permite que los resultados estadísticos sean interpretables y verificables.
En el próximo tema aprenderemos a resumir las observaciones mediante tablas de frecuencia.