
El web scraping tradicional extrae HTML y texto, pero una aplicación de IA necesita algo más útil: contenido limpio y respuestas enfocadas. El autor construye un scraper en Python que descarga una página, elimina menús y elementos innecesarios, convierte el HTML a Markdown y pregunta a un modelo de lenguaje solo lo necesario. 🐍🤖
El flujo usa requests para obtener la página, BeautifulSoup para limpiarla, markdownify para transformarla y el SDK de OpenAI para responder consultas. También carga la clave desde variables de entorno y define tiempos de espera para evitar solicitudes interminables.
💡 Explicación en pocas palabras#
Es como darle a una IA un artículo después de quitar anuncios, botones y ruido. En vez de enviar una página completa, el sistema conserva el contenido importante y pide una respuesta concreta, por ejemplo, explicar una empresa o sus precios. Esto mejora la legibilidad y reduce el consumo de tokens.
La solución puede convertirse después en una API, chatbot o flujo de agentes. Aun así, hay que considerar costes de infraestructura, llamadas al modelo y mantenimiento frente a servicios listos como Firecrawl u Olostep.
Más información en el link 👇
