typestar

Parsear HTML en Python

Convertir el markup en un árbol consultable con BeautifulSoup.

from bs4 import BeautifulSoup

html = """
<html>
  <body>
    <h1 id="title">Tecleo para programadores</h1>
    <p class="lead">Practica código real.</p>
    <a href="/start">Comenzar</a>
  </body>
</html>
"""

sopa = BeautifulSoup(html, "html.parser")
encabezado = sopa.find("h1").get_text()
entradilla = sopa.find("p", class_="lead").text
enlace = sopa.find("a")["href"]
id_titulo = sopa.find(id="title").get("id")

Cómo funciona

  1. BeautifulSoup(html, 'html.parser') construye el árbol.
  2. find localiza la primera etiqueta que coincide.
  3. get_text y ['href'] leen contenido y atributos.

Palabras clave y builtins usados aquí

El intento, en números

Líneas
17
Caracteres a escribir
400
Tokens
103
Ritmo de tres estrellas
105 tpm

Al ritmo de tres estrellas de 105 tokens por minuto, este intento toma unos 59 segundos.

Escribe este fragmento

Paso 1 de 3 en BeautifulSoup; paso 6 de 9 en Web scraping.

← Anterior Siguiente →