typestar

Web scraping

9 pasos en 3 series de Python.

Nueve pasos, dos bibliotecas, una advertencia honesta. requests para traer la página, con sesiones, headers, timeouts y el manejo de errores que la gente se salta. BeautifulSoup para sacarle cosas: selectores, recorrer el árbol, y el acceso a atributos que te da el href de un enlace.

El Bis scrapea algo de punta a punta. Tour corto, pero sus dos bibliotecas aparecen constantemente en scripts que se suponía que iban a correr una sola vez.

Empieza este tour

requests

BeautifulSoup

  • Parsear HTMLConvertir el markup en un árbol consultable con BeautifulSoup.
  • Selectores CSSEncontrar elementos con la sintaxis familiar de selectores CSS.
  • Recorrer el árbolCaminar etiquetas anidadas para extraer las filas de una tabla.

Bis

  • link_scraper.pyRaspar los enlaces de una página, separando internos de externos.

Los otros tours de Python