
La limpieza de datos suele consumir más tiempo que entrenar un modelo. El artículo presenta cinco librerías Python que hacen este trabajo más claro y fiable. 🐍
pyjanitor añade operaciones encadenables a pandas para normalizar nombres, eliminar nulos y transformar columnas. Great Expectations permite declarar reglas sobre tipos, rangos, unicidad y valores ausentes, generando informes de calidad. ftfy repara texto corrupto, mojibake y problemas de Unicode.
Para explorar rápidamente un conjunto de datos, ydata-profiling crea un informe EDA con distribuciones, duplicados, correlaciones y valores atípicos. Finalmente, Cerberus valida diccionarios y JSON mediante esquemas, coerción de tipos y reglas anidadas. 🧹
💡 Explicación en pocas palabras#
Estas herramientas convierten tareas repetitivas en pasos declarativos: describimos cómo deberían verse los datos y la librería detecta o corrige los problemas. Así se encuentran errores antes de que lleguen a un modelo, dashboard o API.
No existe una librería universal: pyjanitor encaja con DataFrames, Great Expectations con controles de pipeline, ftfy con texto, y Cerberus con estructuras JSON.
Más información en el link 👇
