Web scraping
9 pasos en 3 series de Python.
Nueve pasos, dos bibliotecas, una advertencia honesta. requests para traer la página, con sesiones, headers, timeouts y el manejo de errores que la gente se salta. BeautifulSoup para sacarle cosas: selectores, recorrer el árbol, y el acceso a atributos que te da el href de un enlace.
El Bis scrapea algo de punta a punta. Tour corto, pero sus dos bibliotecas aparecen constantemente en scripts que se suponía que iban a correr una sola vez.
requests
- GET con requestsLa forma amigable de traer datos por HTTP.
- POST con requestsEnviar JSON y encabezados en una petición POST.
- Sesiones de requestsReusar conexiones, encabezados y cookies entre llamadas.
- Manejar errores de requestsAtrapar las formas específicas en que puede fallar una llamada HTTP.
- Descargas en streamingDescargar un archivo grande sin cargarlo entero en memoria.
BeautifulSoup
- Parsear HTMLConvertir el markup en un árbol consultable con BeautifulSoup.
- Selectores CSSEncontrar elementos con la sintaxis familiar de selectores CSS.
- Recorrer el árbolCaminar etiquetas anidadas para extraer las filas de una tabla.
Bis
- link_scraper.pyRaspar los enlaces de una página, separando internos de externos.