DSGVO-konformes Web Scraping in Deutschland: Was ist erlaubt?
Web Scraping ist für viele Unternehmen eine praktische Methode, um Geschäftsdaten zu sammeln. Aber sobald es um deutsche Firmeninformationen geht, stellt sich die zentrale Frage: Darf ich das überhaupt? Die Antwort ist differenzierter, als man denkt. Dieser Artikel zeigt, warum DSGVO-konformes Web Scraping möglich ist und wie du es rechtssicher umsetzt.
Die Unterscheidung: Öffentliche Daten vs. personenbezogene Daten
Das Missverständnis beginnt oft hier: Viele denken, dass DSGVO-konformes Web Scraping grundsätzlich verboten ist. Das stimmt nicht. Die DSGVO regelt nicht den Zugang zu öffentlichen Informationen – sie regelt den Umgang mit personenbezogenen Daten.
Ein Beispiel: Die Telefonnummer eines Unternehmens, die auf der Website veröffentlicht ist, ist eine geschäftliche Kontaktinformation. Die Privatnummer des Geschäftsführers ist personenbezogen. Der Unterschied bestimmt, ob Web Scraping erlaubt ist.
Firmeninformationen wie Name, Adresse, E-Mail und Telefon der Zentrale sind typischerweise geschäftliche Daten, keine persönlichen. Das macht DSGVO-konformes Web Scraping für diese Informationen rechtlich zulässig – unter bestimmten Bedingungen.
§5 TMG: Die Pflichtveröffentlichung macht es einfach
Das Telemediengesetz (§5 TMG) verpflichtet deutsche Websites zur Veröffentlichung eines Impressums. Dieses muss enthalten:
- Firmenname und Rechtsform
- Anschrift
- Kontaktdaten (E-Mail, Telefon)
- Geschäftsführer und Handelsregisternummer (bei Kapitalgesellschaften)
- Umsatzsteuer-Identifikationsnummer
Diese Informationen sind keine Geheimnisse – sie müssen öffentlich zugänglich sein. Das macht sie zu idealen Kandidaten für DSGVO-konformes Web Scraping. Der Gesetzgeber verlangt sogar, dass sie leicht auffindbar sind.
Wenn ein Unternehmen diese Daten selbst veröffentlicht, liegt bereits eine Einwilligung vor – zumindest für die Indexierung und Verarbeitung der Daten.
Artikel 6 DSGVO: Die rechtliche Grundlage
Auch wenn Daten öffentlich sind, braucht DSGVO-konformes Web Scraping eine Rechtsgrundlage. Diese findest du in Artikel 6 DSGVO:
Art. 6 Abs. 1 f) DSGVO – Berechtigtes Interesse: Die Verarbeitung ist zulässig, wenn sie zur Wahrung berechtigter Interessen erforderlich ist, sofern die Interessen oder Grundrechte der betroffenen Person nicht überwiegen.
Für Firmendaten funktioniert das so: Dein Interesse, Geschäftskontakte zu recherchieren oder deine Vertriebsdatenbank zu pflegen, ist legitim. Die Firma hat bereits entschieden, diese Daten zu veröffentlichen. Das Überwiegen von Unternehmensinteressen über dem Interesse der Firma, dass ihre öffentlichen Kontaktdaten nicht maschinell verarbeitet werden, ist schwer zu argumentieren.
Das macht DSGVO-konformes Web Scraping von Impressum-Daten in der Praxis für viele Geschäftsszenarien rechtlich haltbar.
Praktische Grenzen und Dinge zu vermeiden
Nur weil etwas öffentlich ist, heißt nicht, dass alles erlaubt ist. Hier sind die wichtigsten Grenzen:
- Private Daten nicht scrapen: Privatnummern, persönliche E-Mails von Mitarbeitern oder Privatadressen – Finger weg.
- Keine Roboter-Blockaden ignorieren: Wenn eine Website robots.txt nutzt, um Scraping zu verhindern, respektiere das. Das ist ein Signal, dass der Betreiber Web Scraping nicht duldet.
- Keine Server überlasten: Mass-Scraping mit tausenden Requests pro Minute kann zu Ausfällen führen. Das ist problematisch – technisch und rechtlich.
- Datenspeicherung begrenzen: Du darfst Firmendaten speichern, solltest sie aber nicht länger als nötig halten. Ein intelligentes Caching-System (wie 30 Tage) ist empfehlenswert.
- Transparenz: Wenn du Daten verarbeitest, sollte der Betroffene wissen, wie und warum. Das ist weniger relevant für reine Firmenkontakte, aber wichtig für dein Vertrauensverhältnis.
Datenquellen-Tabelle: Was ist rechtlich unbedenklich?
| Datentyp | Quelle | Web Scraping erlaubt? | Begründung |
|---|---|---|---|
| Firmenname, Adresse, Telefon | Impressum | Ja | §5 TMG Pflichtangaben, berechtigtes Interesse |
| Geschäftsführer-Name | Impressum | Ja | Öffentliche Pflichtangabe, geschäftlicher Kontext |
| E-Mail-Adresse (allgemein) | Impressum/Kontaktseite | Ja | Geschäftliche Kontaktinformation |
| Private Mobilnummer | Website | Nein | Personenbezogenes Datum, keine Geschäftsfunktion |
| Handelsregister-Info | Impressum | Ja | Öffentliches Register, Pflichtangabe |
| USt-IdNr. | Impressum | Ja | Geschäftsidentifikator, nicht personenbezogen |
Praktisches Beispiel: DSGVO-konformes Web Scraping mit API
Anstatt selbst zu scrapen, ist es oft besser, auf spezialisierte APIs zu setzen. Diese kümmern sich um Compliance, Caching und Datenqualität. Hier ein praktisches Beispiel mit der DACH Enrichment API:
curl -X POST https://api.dach-enrichment.de/api/enrich \
-H "Content-Type: application/json" \
-H "Authorization: Bearer YOUR_API_KEY" \
-d '{
"domain": "example-company.de"
}'
Die API extrahiert automatisch alle Impressum-Daten aus deutschen Websites und liefert sie strukturiert zurück:
{
"firmenname": "Example Company GmbH",
"adresse": "Musterstraße 123, 10115 Berlin",
"email": "kontakt@example-company.de",
"telefon": "+49 30 12345678",
"geschaeftsfuehrer": "Max Mustermann",
"handelsregister": "HR B 12345",
"ust_id": "DE123456789",
"rechtsform": "GmbH",
"cache_age_days": 15
}
Diese Lösung ist DSGVO-konform, weil:
- Server in der EU liegen
- Daten gecacht werden (30 Tage), um Overloading zu vermeiden
- Nur öffentliche, pflichtveröffentlichte Daten verarbeitet werden
- Transparente Dokumentation und Datenschutzerklärung vorhanden sind