Ir al contenido
  1. Posts/

Automatiza Las Estadísticas Descriptivas Con Python

··260 palabras·2 mins·

Cada análisis de datos comienza con preguntas básicas: ¿cuántas filas hay?, ¿qué columnas son numéricas?, ¿faltan valores?, ¿cómo se distribuyen los datos? Resolverlas manualmente con fragmentos repetidos de código consume tiempo y dificulta crear informes consistentes.

El artículo presenta una escalera de herramientas Python para automatizar este trabajo usando el conjunto de datos de pingüinos de Palmer 🐧.

🔹 Pandas ofrece describe(), agg() y groupby() para obtener rápidamente medias, medianas, desviaciones, percentiles, asimetría y resúmenes por grupo.

🔹 skimpy genera en una llamada un resumen de la estructura del DataFrame, valores faltantes, estadísticas y pequeños histogramas en la consola.

🔹 fg-data-profiling crea un informe HTML interactivo con distribuciones, correlaciones, duplicados y alertas de calidad. En proyectos antiguos, su antecesor era ydata-profiling.

🔹 tableone produce la tabla “Table 1” usada en investigaciones: variables estratificadas, valores faltantes, valores p y diferencias estandarizadas.

🔹 Great Tables convierte cualquier resumen en una tabla pulida para informes, presentaciones o documentación.

El autor muestra cómo combinar estas herramientas en una función reutilizable, transformando un conjunto de fragmentos en un proceso repetible.

💡 Explicación en pocas palabras
#

Empieza con Pandas para una revisión rápida y elige herramientas más completas según la necesidad. Automatizar el resumen no reemplaza el criterio humano: todavía hay que decidir cómo tratar los valores faltantes y qué estadísticas tienen sentido.

Más información en el link 👇

También publicado en LinkedIn.

Juan Pedro Bretti Mandarano
Autor
Juan Pedro Bretti Mandarano