📘 Tag 22
March 28, 2026 · View on GitHub

📘 Tag 22
Python Web Scraping
Was ist Web Scraping?
Das Internet ist voll von riesigen Datenmengen, die für verschiedene Zwecke genutzt werden können. Um diese Daten automatisiert zu sammeln, nutzen wir Web Scraping. Web Scraping ist der Prozess, bei dem Daten von Webseiten extrahiert, gesammelt und auf dem lokalen Computer oder in einer Datenbank gespeichert werden.
Werkzeuge: BeautifulSoup und Requests
Um mit dem Scraping zu beginnen, benötigen wir zwei Pakete:
- Requests: Um die Webseite herunterzuladen.
- BeautifulSoup4: Um den HTML-Code der Seite zu analysieren und die gewünschten Informationen zu finden.
pip install requests
pip install beautifulsoup4
Um erfolgreich zu scrapen, ist ein Grundverständnis von HTML-Tags (wie <table>, <tr>, <td>, <a>) und CSS-Selektoren (Klassen und IDs) hilfreich.
Beispiel:
import requests
from bs4 import BeautifulSoup
url = 'https://archive.ics.uci.edu/ml/datasets.php'
response = requests.get(url)
content = response.content # HTML-Inhalt der Seite
soup = BeautifulSoup(content, 'html.parser')
print(soup.title.get_text()) # Gibt den Titel der Webseite aus
# Tabellen finden
tables = soup.find_all('table', {'cellpadding': '3'})
table = tables[0]
for tr in table.find_all('tr'):
tds = tr.find_all('td')
for td in tds:
print(td.text)
💻 Übungen - Tag 22
- Scrape die folgende Webseite und speichere die Daten als JSON-Datei:
http://www.bu.edu/president/boston-university-facts-stats/. - Extrahiere die Tabelle aus dieser URL:
https://archive.ics.uci.edu/ml/datasets.phpund wandle sie in eine JSON-Datei um. - Scrape die Tabelle der US-Präsidenten von Wikipedia und speichere sie als JSON:
https://en.wikipedia.org/wiki/List_of_presidents_of_the_United_States. (Hinweis: Dies ist eine fortgeschrittene Aufgabe, da Wikipedia-Tabellen oft komplex strukturiert sind).
🎉 HERZLICEN GLÜCKWUNSCH! 🎉