Recursos / Guía

Calidad de Datos: Guía con Dataset Real y Checklist de Validación

Un dataset de 1,000 registros con los defectos de siempre, corregido fila por fila, más un checklist de validación por dimensión y los KPIs con fórmulas para medir la calidad de tus propios datos.

Actualizado: 20 de septiembre de 2026

Las tablas de esta guía usan datos sintéticos de demostración y las reglas y umbrales son un punto de partida verificado en septiembre de 2026, no una receta universal: los valores correctos dependen de la decisión que alimentan tus datos. Para un diagnóstico de tu caso, solicita una cotización de consultoría de datos.
01

La respuesta corta

La calidad de datos es el grado en que tus datos cumplen los requisitos de la decisión que alimentan: completos, consistentes, únicos, vigentes y dentro de rangos válidos. Esta guía está escrita para responsables de operaciones, finanzas o sistemas que sospechan que sus catálogos y reportes traen defectos, pero no saben cuántos ni cómo medirlos. Te llevas tres cosas listas para copiar a Excel o Google Sheets: un dataset de 1,000 registros con los problemas que aparecen en todo proyecto real, un checklist de validación por dimensión y el mismo dataset corregido, con las métricas de mejora. Empieza por la tabla del dataset y baja al checklist.

02

¿Qué es la calidad de datos?

La calidad de datos mide qué tan bien un conjunto de datos sirve para su uso previsto. No es una sensación de que la información se ve bien: es un conjunto de reglas que cada campo pasa o rompe. El DAMA-DMBOK, el marco de referencia global de gestión de datos (consultado en septiembre de 2026), la define como un área completa de la disciplina, con dimensiones y procesos propios.

Las seis dimensiones clave que usamos en esta guía:

  • Exactitud: los valores reflejan la realidad.
  • Integridad: no hay campos requeridos vacíos.
  • Consistencia: el mismo valor se escribe igual en todos lados.
  • Unicidad: cada entidad existe una sola vez.
  • Actualidad: los datos siguen vigentes hoy.
  • Validez: los valores caen dentro del rango o formato permitido.

El impacto de ignorarlas es concreto: decisiones erróneas tomadas sobre reportes corruptos, horas de limpieza manual repetidas cada cierre y problemas de compliance cuando los registros fiscales o de clientes no cuadran. Si tus datos terminan en tableros, estos defectos llegan directo a la dirección; nuestra consultoría de business intelligence siempre empieza por revisar la calidad de las fuentes antes de graficar nada.

03

Dataset de ejemplo (antes de limpiar)

Este es un extracto de un CSV con 1,000 registros de clientes y ventas, antes de cualquier limpieza. Son datos sintéticos de demostración, pero cada defecto viene de proyectos reales. Copia la tabla a Excel o Google Sheets y úsala para practicar las validaciones del checklist:

IDNombreEmailTeléfonoFechaValor
1Juan Pérezjuan@gmail555-12342024-01-15100
2María Lópezmaria@(555) 567815/01/2024200
3NULLcarlos@yahoo.com555-99992024-13-45-50
1Juan Pérezjuan@gmail555-12342024-01-15100

Los problemas incluidos en los 1,000 registros:

  • Emails inválidos o incompletos, como juan@gmail y maria@.
  • Fechas en formatos mixtos (2024-01-15 contra 15/01/2024) y fechas imposibles (2024-13-45, un mes 13 que no existe).
  • Valores negativos donde no corresponden, como -50 en ventas.
  • NULLs en campos requeridos, como el nombre del registro 3.
  • Duplicados exactos: la fila 4 repite el ID 1 con los mismos datos.

Cómo usar cada columna: ID es la llave única esperada; Nombre y Email son campos requeridos; Teléfono debe seguir un solo formato; Fecha debe ser ISO válida; Valor debe ser un número positivo. En los proyectos que revisamos, los formatos mixtos de fecha y teléfono casi siempre delatan dos sistemas que exportan distinto: un ERP con formato ISO y una hoja de captura manual con formato local.

04

Checklist de validación de calidad

Este checklist convierte las seis dimensiones en pruebas ejecutables. Cópialo a tu hoja de cálculo y recórrelo contra tu propia tabla: cada fila te dice qué preguntar, cómo probarlo y qué hacer con lo que falle.

DimensiónPreguntaTestAcción
Exactitud¿Los valores reflejan la realidad?Muestreo manual vs. fuenteCorregir en origen
Integridad¿Hay NULLs en campos requeridos?COUNT(NULL) > 0Imponer NOT NULL
Consistencia¿Formatos uniformes?Regex para email, teléfonoEstandarizar
Unicidad¿Hay duplicados?COUNT(ID) != COUNT(DISTINCT ID)Deduplicar
Actualidad¿Datos vigentes?Fecha última actualización > 90 díasRefrescar
Validez¿Valores dentro de rango?MIN/MAX fuera de esperadoValidar en entrada

Aplícalo en orden de costo: primero los tests que se programan solos (integridad, unicidad, validez) y al final el muestreo manual de exactitud, que es el único que requiere comparar contra la fuente humana. La dimensión de actualidad es la que más se degrada sola, y es crítica cuando los datos alimentan series de tiempo: un pronóstico de demanda construido sobre historiales con huecos o datos vencidos hereda el defecto completo.

05

Ejemplo de limpieza (antes y después)

Así se ven los mismos registros después de aplicar el checklist. La columna final documenta la regla que produjo cada corrección, porque una limpieza sin reglas escritas no se puede repetir:

ProblemaAntesDespuésRegla aplicada
Email inválidojuan@gmailjuan@gmail.comRegex: ^[\w.-]+@[\w.-]+\.[a-zA-Z]{2,}$
Fecha mixta15/01/20242024-01-15ISO 8601: YYYY-MM-DD
Valor negativo-50NULLValidación: valor >= 0
NULL en nombreNULLRegistro eliminadoNOT NULL en campo requerido
DuplicadoID 1 y 1ID 1 conservadoEliminar por fecha más reciente

Dos decisiones de criterio detrás de la tabla. El valor negativo se convierte en NULL y no en cero, porque inventar un número contamina los promedios; un NULL explícito se cuenta y se investiga. Y el duplicado se resuelve conservando el registro con fecha más reciente, nunca borrando a ciegas.

Métricas de mejora del dataset completo, medidas con las fórmulas de la sección de KPIs:

  • Integridad: 85% → 98%
  • Consistencia: 72% → 99%
  • Unicidad: 94% → 100%
06

Herramientas de validación

No necesitas una plataforma costosa para correr el checklist. Estas son las opciones según dónde viven tus datos:

  • Excel: fórmulas COUNTIF para contar duplicados y vacíos, y conditional formatting para marcar formatos inválidos. Suficiente para catálogos de hasta unos miles de filas.
  • Python: pandas para perfilar y limpiar, great_expectations para expresar cada regla como una prueba ejecutable, pandas-profiling para un diagnóstico automático de la tabla completa.
  • SQL: constraints, triggers y stored procedures que rechazan el defecto en el momento de la carga, antes de que llegue a los reportes.
  • Herramientas de DQ: Talend, Informatica y Great Expectations para validación continua sobre muchas fuentes.

Cuando auditamos catálogos de clientes, el patrón que más vemos es el salto prematuro a la herramienta: compran una plataforma de DQ antes de tener escritas las reglas. Empieza con COUNTIF o con consultas SQL programadas; la documentación de Great Expectations (GX Core) (consultado en septiembre de 2026) muestra cómo convertir cada regla del checklist en una expectativa que corre sola dentro del pipeline, con licencia abierta Apache 2.0. Compra la plataforma cuando el proceso ya funciona, no para inventarlo.

07

Proceso de mejora continua

Limpiar una vez no funciona: si la captura sigue igual, los mismos defectos regresan en tres a seis meses. El proceso que sí sostiene la calidad tiene cinco pasos en ciclo:

  • 1. Evaluar: mide la calidad actual con el checklist de esta guía, dimensión por dimensión.
  • 2. Priorizar: ataca primero los defectos con mayor impacto en el negocio, no los más fáciles.
  • 3. Corregir: limpia el acumulado y agrega validación en el origen, para que el defecto no vuelva a nacer.
  • 4. Monitorear: publica un dashboard mensual con los KPIs de calidad, revisado con nombre y responsable.
  • 5. Automatizar: mueve los tests al CI/CD de datos, para que cada carga se valide sola antes de llegar a producción.

El paso 4 es donde la mayoría abandona. Un tablero de KPIs de calidad se construye con la misma infraestructura de cualquier reporte ejecutivo; si estás evaluando herramientas, nuestra guía de costo de Power BI desglosa licencias e implementación para ese tipo de tablero.

08

KPIs de calidad de datos

Cuatro KPIs cubren el estado de una tabla. Copia esta tabla a tu hoja de cálculo: la columna Fórmula va tal cual en Excel o en SQL, y la Meta es el umbral mínimo que recomendamos para datos que alimentan decisiones operativas:

KPIFórmulaMeta
% Integridad(Registros completos / Total) × 100> 95%
% Consistencia(Registros con formato válido / Total) × 100> 98%
% Unicidad(Registros únicos / Total) × 100100%
Tasa de error(Errores detectados / Total validaciones) × 100< 2%

Un registro completo es uno sin NULLs en campos requeridos; un registro único es uno sin llave repetida. Sobre el dataset de ejemplo, estos KPIs explican el salto de integridad de 85% a 98%: 150 registros traían al menos un campo requerido vacío y la limpieza resolvió 130; los 20 restantes quedaron como NULL explícito en investigación. Un KPI que no llega a la meta no es un fracaso: es la cola de trabajo priorizada para el siguiente ciclo.

09

Errores comunes

Cuando auditamos los procesos de datos de un cliente, los mismos cuatro errores explican casi todos los fracasos:

  • Limpiar datos sin atacar la causa raíz. El catálogo queda impecable unas semanas y los mismos defectos regresan, porque el formulario sigue aceptando texto libre y la integración sigue mandando fechas en otro formato. La limpieza es el diagnóstico; el tratamiento es la validación en el origen.
  • No validar en el punto de entrada. Cada defecto que entra cuesta entre 10 y 100 veces más corregirlo después, cuando ya contaminó reportes, inventarios y facturas.
  • Ignorar la calidad de datos de terceros. Las listas de proveedores, los catálogos de SAT y los feeds de socios llegan con sus propios defectos. Valida lo que recibes con las mismas reglas que aplicas a lo que capturas.
  • No documentar reglas de validación. Si la regla vive solo en la cabeza de quien limpió, muere cuando esa persona se va. Cada corrección debe terminar en una regla escrita, como en la tabla de antes y después.
10

Siguiente paso: cotiza tu consultoría de datos

Ya tienes el dataset, el checklist y los KPIs. El siguiente paso es correrlos contra tu tabla más crítica esta semana: exporta una muestra a Excel, aplica los seis tests del checklist y anota qué dimensión queda más lejos de la meta. Con ese número ya sabes dónde empezar.

Si prefieres que lo hagamos contigo, así planteamos la consultoría de datos: diagnóstico de tus catálogos con estos mismos KPIs, reglas de validación escritas como criterios de aceptación y tests corriendo en tu pipeline, con el código y los datos de tu propiedad. Para una cotización, envíanos los sistemas donde viven tus datos, la tabla que te preocupa, el volumen aproximado de registros y la decisión que alimenta. Solicitar una cotización de consultoría de datos.