Parsear HTML en Python
Convertir el markup en un árbol consultable con BeautifulSoup.
from bs4 import BeautifulSoup
html = """
<html>
<body>
<h1 id="title">Tecleo para programadores</h1>
<p class="lead">Practica código real.</p>
<a href="/start">Comenzar</a>
</body>
</html>
"""
sopa = BeautifulSoup(html, "html.parser")
encabezado = sopa.find("h1").get_text()
entradilla = sopa.find("p", class_="lead").text
enlace = sopa.find("a")["href"]
id_titulo = sopa.find(id="title").get("id")
Cómo funciona
BeautifulSoup(html, 'html.parser')construye el árbol.findlocaliza la primera etiqueta que coincide.get_texty['href']leen contenido y atributos.
Palabras clave y builtins usados aquí
id
El intento, en números
- Líneas
- 17
- Caracteres a escribir
- 400
- Tokens
- 103
- Ritmo de tres estrellas
- 105 tpm
Al ritmo de tres estrellas de 105 tokens por minuto, este intento toma unos 59 segundos.
Paso 1 de 3 en BeautifulSoup; paso 6 de 9 en Web scraping.