↓ Ir al contenido
  1. Posts/

DVC: Control De Versiones Para Datos Y Machine Learning

··210 palabras·1 min·

📦 DVC aplica las buenas prácticas de Git a los datos, modelos y experimentos de ciencia de datos. Su objetivo es hacer que los proyectos de Machine Learning sean reproducibles y fáciles de compartir.

🔗 Los archivos grandes no tienen que vivir dentro del repositorio Git. DVC conserva sus versiones y metadatos en el proyecto, mientras almacena los datos en una caché local o en remotos como S3, Azure, Google Cloud o servidores propios.

⚙️ También permite describir pipelines conectando código, datos, comandos y resultados. Cuando algo cambia, solo se ejecutan los pasos afectados. Además, los experimentos pueden correrse, compararse y compartir sus métricas sin necesidad de un servidor central.

El autor presenta una experiencia similar a combinar Git para datos, Makefiles para pipelines y un sistema local de seguimiento de experimentos. DVC funciona desde la línea de comandos y ofrece una extensión para VS Code.

💡 Explicación en pocas palabras
#

Git guarda muy bien el código, pero los datasets y modelos suelen ser demasiado grandes. DVC guarda una referencia ligera en Git y mantiene los archivos pesados fuera del repositorio, permitiendo volver a cualquier versión y reproducir cómo se obtuvo un resultado.

Más información en el link 👇

Más en la siguiente referencia externa.
También publicado en LinkedIn.

Juan Pedro Bretti Mandarano
Autor
Juan Pedro Bretti Mandarano