↓ Ir al contenido
  1. Posts/

Cinco Librerías Python Para Limpiar Datos

··181 palabras·1 min·

La limpieza de datos suele consumir más tiempo que entrenar un modelo. El artículo presenta cinco librerías Python que hacen este trabajo más claro y fiable. 🐍

pyjanitor añade operaciones encadenables a pandas para normalizar nombres, eliminar nulos y transformar columnas. Great Expectations permite declarar reglas sobre tipos, rangos, unicidad y valores ausentes, generando informes de calidad. ftfy repara texto corrupto, mojibake y problemas de Unicode.

Para explorar rápidamente un conjunto de datos, ydata-profiling crea un informe EDA con distribuciones, duplicados, correlaciones y valores atípicos. Finalmente, Cerberus valida diccionarios y JSON mediante esquemas, coerción de tipos y reglas anidadas. 🧹

💡 Explicación en pocas palabras
#

Estas herramientas convierten tareas repetitivas en pasos declarativos: describimos cómo deberían verse los datos y la librería detecta o corrige los problemas. Así se encuentran errores antes de que lleguen a un modelo, dashboard o API.

No existe una librería universal: pyjanitor encaja con DataFrames, Great Expectations con controles de pipeline, ftfy con texto, y Cerberus con estructuras JSON.

Más información en el link 👇

Más en la siguiente referencia externa.
También publicado en LinkedIn.

Juan Pedro Bretti Mandarano
Autor
Juan Pedro Bretti Mandarano