6. Recolección y organización de datos

Un análisis confiable comienza antes de calcular: requiere una pregunta precisa, datos obtenidos de forma adecuada y una estructura consistente, documentada y verificable.

6.1 Introducción

Las técnicas estadísticas no pueden corregir por sí solas una recolección deficiente. Si los datos no corresponden a la pregunta, contienen mediciones inconsistentes o excluyen casos importantes, las conclusiones serán poco confiables.

La recolección de datos es el proceso de obtener y registrar observaciones. La organización de datos consiste en estructurarlas, documentarlas y prepararlas para su análisis.

Ambas tareas forman parte de un mismo flujo y deben planificarse antes de comenzar a registrar valores.

6.2 Comenzar con una pregunta clara

La pregunta determina qué datos hacen falta. “Analizar la aplicación” es demasiado amplio; una pregunta útil especifica una característica, una población y un período.

Pregunta imprecisa:
¿La aplicación funciona bien?

Pregunta precisa:
¿Qué porcentaje de solicitudes superó los 500 ms
durante la última semana?

La segunda pregunta permite definir la unidad de análisis, la variable, el umbral y el intervalo temporal.

6.3 Plan de recolección

Un plan de recolección debe responder, como mínimo, las siguientes preguntas:

  1. ¿Cuál es el objetivo del análisis?
  2. ¿Cuál es la población y cuál es la unidad de observación?
  3. ¿Qué variables se registrarán?
  4. ¿Cómo se medirá cada variable y con qué unidad?
  5. ¿De qué fuente se obtendrán los datos?
  6. ¿Durante qué período y con qué frecuencia se recolectarán?
  7. ¿Cómo se controlará su calidad?
  8. ¿Cómo se protegerán los datos sensibles?

Documentar estas decisiones evita cambiar criterios durante el proceso sin dejar constancia.

6.4 Fuentes primarias y secundarias

Los datos pueden clasificarse según su origen:

Fuente Definición Ejemplo
Primaria Los datos se recolectan específicamente para el estudio actual. Realizar una encuesta a los usuarios de una nueva función.
Secundaria Los datos ya existían y fueron creados con otro propósito. Analizar registros históricos del servidor.

Las fuentes secundarias suelen ahorrar tiempo, pero es necesario conocer cómo, cuándo y para qué se generaron.

6.5 Métodos de recolección

Método Qué obtiene Precaución principal
Encuesta Respuestas declaradas por personas. Preguntas ambiguas o muestra sesgada.
Observación Comportamientos o fenómenos registrados. Criterios de observación inconsistentes.
Experimento Resultados bajo condiciones controladas. Grupos no comparables o variables sin controlar.
Sensores Mediciones automáticas y periódicas. Descalibración, fallos o unidades incorrectas.
Registros de software Eventos producidos por aplicaciones y servidores. Eventos duplicados, faltantes o mal definidos.
API o base de datos Datos almacenados por otros sistemas. Cambios de esquema, cobertura o significado.

6.6 Medición consistente

Una variable debe medirse del mismo modo en todas las observaciones. Para ello se necesita una definición operacional: una regla concreta que indique cómo se obtiene el valor.

Variable: tiempo de respuesta
Inicio: momento en que el servidor recibe la solicitud.
Fin: momento en que envía el último byte de la respuesta.
Unidad: milisegundos.
Precisión: un decimal.

Sin esta definición, dos sistemas podrían llamar “tiempo de respuesta” a mediciones distintas y producir valores no comparables.

6.7 Estructura tabular

Una forma habitual de organizar datos es utilizar una tabla donde:

  • cada fila representa una observación;
  • cada columna representa una variable;
  • cada celda contiene un valor;
  • cada columna conserva un significado y una unidad consistentes.
id fecha_hora ruta estado_http duracion_ms
R001 2026-08-02T10:15:03Z /productos 200 184,2
R002 2026-08-02T10:15:05Z /pedidos 500 622,8

El estado HTTP es una categoría codificada, mientras que la duración es una variable cuantitativa.

6.8 Identificadores

Un identificador permite distinguir observaciones y detectar duplicados. Debe ser único, estable y no depender de una característica que pueda cambiar.

Un identificador no es una medida. Aunque sea numérico, no corresponde calcular su media ni utilizarlo como cantidad. Cuando contiene información personal, debe evitarse exponerlo o reemplazarse por un código controlado.

6.9 Diccionario de datos

El diccionario de datos documenta el significado de cada variable. Como mínimo, debería incluir:

Campo Descripción Tipo Unidad o valores permitidos
id Identificador único de la solicitud. Cualitativa nominal Texto no vacío y único.
estado_http Código devuelto por el servidor. Cualitativa nominal Código HTTP de tres dígitos.
duracion_ms Tiempo total de respuesta. Cuantitativa continua Milisegundos, valor mayor o igual que cero.

El diccionario evita que una misma columna sea interpretada de formas diferentes por distintas personas o programas.

6.10 Formatos de almacenamiento

El formato debe elegirse según la estructura y el uso de los datos:

  • CSV: adecuado para tablas simples e intercambio entre herramientas.
  • JSON: útil para datos jerárquicos y comunicación entre aplicaciones.
  • Base de datos: apropiada para consultas, relaciones, actualizaciones y grandes volúmenes.
  • Hoja de cálculo: práctica para revisión manual de conjuntos pequeños, con controles para evitar cambios accidentales.

El formato no reemplaza la documentación. También deben registrarse codificación de texto, separador decimal, zona horaria, formato de fechas y representación de valores faltantes.

6.11 Validación de datos

La validación comprueba si cada valor respeta las reglas definidas. Algunas verificaciones frecuentes son:

  • tipo: el valor tiene el formato esperado;
  • rango: está dentro de límites posibles;
  • categoría: pertenece a la lista permitida;
  • unicidad: el identificador no está repetido;
  • obligatoriedad: los campos esenciales no están vacíos;
  • coherencia: las relaciones entre campos son válidas.

Conviene validar durante la entrada de datos y repetir los controles antes del análisis.

6.12 Datos faltantes

Un dato puede faltar porque no se registró, no correspondía, se perdió o fue rechazado por una validación. Estas causas no son equivalentes.

0 ms → valor registrado; requiere revisión porque puede ser imposible.
null → valor ausente según la convención definida.
"" → texto vacío; debe normalizarse si representa ausencia.

No se deben reemplazar todos los faltantes por cero. Primero hay que medir cuántos faltan, estudiar por qué faltan y decidir un tratamiento que no distorsione el análisis.

6.13 Limpieza de datos

La limpieza corrige o señala problemas detectados sin alterar silenciosamente la información original. Puede incluir:

  • eliminar duplicados confirmados;
  • normalizar mayúsculas, tildes y espacios;
  • convertir unidades a una referencia común;
  • unificar formatos de fecha y zona horaria;
  • marcar valores imposibles;
  • registrar cada transformación aplicada.

Es recomendable conservar los datos originales sin modificar y generar una versión limpia mediante un proceso reproducible.

6.14 Ejemplo de limpieza con JavaScript

El siguiente ejemplo normaliza registros y separa aquellos que no cumplen las reglas:

const datosCrudos = [
  { id: " R001 ", estado: "ÉXITO", duracion: "184.2" },
  { id: "R002", estado: "error", duracion: "622.8" },
  { id: "R003", estado: "éxito", duracion: "-5" }
];

function normalizar(registro) {
  return {
    id: registro.id.trim(),
    estado: registro.estado.trim().toLowerCase(),
    duracion: Number(registro.duracion)
  };
}

function esValido(registro) {
  const estados = ["éxito", "error"];
  return registro.id !== "" &&
    estados.includes(registro.estado) &&
    Number.isFinite(registro.duracion) &&
    registro.duracion >= 0;
}

const normalizados = datosCrudos.map(normalizar);
const validos = normalizados.filter(esValido);
const rechazados = normalizados.filter(registro => !esValido(registro));

console.log(validos);
console.log(rechazados);

El registro con duración -5 queda separado para revisión. El programa no inventa un reemplazo ni lo elimina sin dejar evidencia.

6.15 Control de calidad

Un informe de calidad ayuda a decidir si los datos están listos para analizarse. Puede incluir:

  • cantidad total de registros;
  • cantidad y porcentaje de valores faltantes por variable;
  • identificadores duplicados;
  • valores fuera de rango;
  • categorías desconocidas;
  • período realmente cubierto;
  • transformaciones realizadas.

Los problemas no siempre obligan a descartar el conjunto completo, pero deben conocerse y comunicarse junto con los resultados.

6.16 Privacidad y ética

Recolectar un dato porque es técnicamente posible no significa que sea necesario ni apropiado. Deben considerarse la finalidad, el consentimiento, la seguridad y la normativa aplicable.

  • Recolectar solo los datos necesarios para el objetivo declarado.
  • Evitar almacenar contraseñas, secretos o información sensible en registros.
  • Limitar el acceso según las responsabilidades.
  • Definir períodos de conservación y eliminación.
  • Anonimizar o seudonimizar cuando corresponda.
  • Evaluar si la recolección puede perjudicar o excluir a determinados grupos.

La privacidad debe incorporarse al diseño del proceso, no agregarse únicamente al final.

6.17 Trazabilidad y reproducibilidad

Un análisis es reproducible cuando otra persona puede comprender de dónde provienen los datos y repetir las transformaciones.

Datos originales → Validación → Limpieza → Datos preparados → Análisis

Para lograrlo, conviene conservar versiones, registrar fechas, documentar reglas y automatizar transformaciones mediante código. Modificar manualmente celdas sin dejar registro dificulta comprobar el resultado.

6.18 Flujo de trabajo recomendado

  1. Definir la pregunta y la población.
  2. Especificar variables, unidades y reglas.
  3. Elegir fuentes y métodos de recolección.
  4. Realizar una prueba pequeña del proceso.
  5. Recolectar y conservar los datos originales.
  6. Validar, normalizar y documentar problemas.
  7. Generar una versión limpia y reproducible.
  8. Revisar la calidad antes del análisis.

6.19 Qué debes recordar de este tema

  • La recolección debe partir de una pregunta y una población bien definidas.
  • Cada variable necesita una definición operacional, unidad y regla de validación.
  • Una tabla ordenada representa observaciones en filas y variables en columnas.
  • El diccionario de datos documenta el significado y los valores permitidos.
  • Los datos faltantes, duplicados e inválidos deben identificarse explícitamente.
  • Los datos originales deben conservarse y la limpieza debe ser reproducible.
  • La privacidad, la seguridad y la ética forman parte del diseño de recolección.

6.20 Conclusión

Recolectar y organizar datos exige decisiones metodológicas y técnicas. Una estructura consistente y documentada reduce errores, facilita la programación y permite que los resultados estadísticos sean interpretables y verificables.

En el próximo tema aprenderemos a resumir las observaciones mediante tablas de frecuencia.