Wer Webdaten für das Training generativer KI erhebt, trifft auf Informationspflichten, die sich kaum individuell erfüllen lassen. Dieser Beitrag zeigt, welche Anforderungen Art. 14 DSGVO beim Web Scraping stellt, wann die Ausnahme in Absatz 5 lit. b greift und welche Angaben die EDSA-Leitlinien 03/2026 verlangen.
Öffentlich zugänglich, aber nicht datenschutzfrei
Crawler erfassen Namen, Berufsangaben, Standorte, Meinungsäußerungen und ganze Diskussionsverläufe. Personenbezug ist dabei der Normalfall, besondere Kategorien nach Art. 9 DSGVO laufen unvermeidlich mit. Rechtsgrundlage ist in der Praxis regelmäßig das berechtigte Interesse gemäß Art. 6 Abs. 1 lit. f DSGVO. Die Vorschrift verlangt eine dreistufige Prüfung: Zunächst muss ein konkretes und legitimes Interesse des Verantwortlichen bestehen. Sodann ist die Verarbeitung nur zulässig, wenn sie hierfür erforderlich ist und das Ziel nicht mit einem datensparsameren Mittel erreicht werden kann. Schließlich sind die Interessen gegeneinander abzuwägen, wobei es maßgeblich darauf ankommt, ob die betroffenen Personen mit der Verarbeitung vernünftigerweise rechnen konnten und wie stark in ihre Rechte eingegriffen wird. Dass die Daten aus öffentlich zungänglichen Quellen stammen, ändert daran nichts und da die Daten nicht bei der betroffenen Person direkt erhoben werden, greift hinsichtlich der Informationspflichten Art. 14 DSGVO.
Welche Angaben verlangt Art. 14 DSGVO?
Der Pflichtkatalog nach Art. 14 Abs. 1 und 2 DSGVO ist umfangreicher als bei einer Direkterhebung. Erforderlich sind insbesondere:
- Identität und Kontaktdaten des Verantwortlichen sowie des Datenschutzbeauftragten
- Verarbeitungszwecke und Rechtsgrundlage
- Kategorien der verarbeiteten personenbezogenen Daten
- Empfänger oder Kategorien von Empfängern, einschließlich geplanter Drittlandübermittlungen
- Speicherdauer oder Kriterien für ihre Festlegung
- Betroffenenrechte, Widerspruchsrecht und Beschwerderecht
- die Quelle, aus der die Daten stammen
Entscheidend ist der Zeitpunkt. Nach Art. 14 Abs. 3 DSGVO muss die Information innerhalb eines Monats nach Erlangung der Daten erfolgen, bei einer Offenlegung an Dritte spätestens zum Zeitpunkt der Offenlegung.
Wann entfallen die Informationspflichten nach Art. 14 Abs. 5 lit. b DSGVO?
Die Pflicht entfällt, wenn die Information unmöglich ist oder einen unverhältnismäßigen Aufwand erfordern würde. In den „Guidelines 03/2026 on web scraping in the context of generative AI“ erkennt der EDSA an, dass eine Individualinformation beim Scraping großer Datenmengen oft schwierig, undurchführbar oder objektiv unmöglich ist. Eine pauschale Freistellung folgt daraus jedoch nicht.
Die ChatGPT Taskforce des EDSA formulierte 2024 bereits in ihrem „Report of the work undertaken by the ChatGPT Taskforce“ zurückhaltend, die Ausnahme aus Art. 14 Abs. 5 lit. b DSGVO könne anwendbar sein, solange alle Voraussetzungen der Vorschrift vollständig erfüllt seien. Konkrete Vorgaben blieben jedoch zunächst aus. In den Leitlinien 03/2026 wird der EDSA deutlicher und verweist ausdrücklich auf den Wortlaut der Norm, der Archivzwecke im öffentlichen Interesse sowie wissenschaftliche, historische und statistische Zwecke mit den Garantien des Art. 89 Abs. 1 DSGVO besonders hervorhebt und stellt klar:
„this exception should not be routinely relied upon by controllers who are not processing personal data for the purposes of archiving in the public interest, for scientific or historical research purposes or statistical purposes.“
> Verantwortliche, die personenbezogene Daten nicht zu Archivzwecken im öffentlichen Interesse, zu wissenschaftlichen oder historischen Forschungszwecken oder zu statistischen Zwecken verarbeiten, sollten sich demnach nicht routinemäßig auf diese Ausnahme berufen.
Vielmehr verlangt der EDSA eine dokumentierte Abwägung zwischen dem Aufwand des Verantwortlichen und den Auswirkungen auf die betroffenen Personen, bezogen auf den Datensatz als Ganzes und nicht auf jedes einzelne Datum. Einzubeziehen sind die Zahl der betroffenen Personen, das Alter der Daten und die getroffenen geeigneten Garantien. Gleichzeitig wird klargestellt, dass niemand Zusatzinformationen beschaffen muss, nur um eine Person identifizieren zu können. Umgekehrt gilt: Wer E-Mail-Adressen oder Profile mit Nachrichtenfunktion miterfasst, kann eine Individualinformation technisch leisten und muss den unverhältnismäßigen Aufwand deutlich sorgfältiger begründen.
Was müssen Verantwortliche veröffentlichen?
Greift die Ausnahme, verschiebt sich die Pflicht, sie entfällt nicht. Art. 14 Abs. 5 lit. b DSGVO verlangt geeignete Maßnahmen zum Schutz der Rechte und Freiheiten, einschließlich der Bereitstellung der Informationen für die Öffentlichkeit. Der EDSA benennt diese Veröffentlichung als Maßnahme, die stets zu ergreifen ist, etwa über eine Datenschutzerklärung oder einen gesonderten Hinweis auf der eigenen Website. Dorthin gehört nach Ansicht des EDSA der oben genannte Pflichtkatalog, ergänzt um zwei scraping-spezifische Angaben: die Eigenschaften des eingesetzten Crawlers und die Unterscheidung, ob die Daten aus öffentlich zugänglichen oder aus nicht öffentlich zugänglichen Quellen stammen.
Für die Quellenangabe enthalten die Leitlinien konkrete Vorgaben. Ist eine vollständige Liste nicht möglich, ist sie so weit wie möglich zu führen und um die Typen der nicht aufgeführten Quellen sowie die Gründe für deren Auslassung zu ergänzen. Als gute Praxis empfiehlt der EDSA, Domainnamen und URLs in durchsuchbarer Form anzugeben und den Erhebungszeitraum zu nennen. Wer bereits gescrapte Datensätze von Dritten bezieht, soll zusätzlich einen Kontaktweg zum ursprünglichen Verantwortlichen bereitstellen und die Bedingungen der Erhebung in klarer, einfacher Sprache erläutern. Die Angaben müssen leicht zu finden und verständlich sein.
Über den Pflichtinhalt hinaus nennt die EDSA-Stellungnahme 28/2024 zu gewissen Datenschutzaspekten der Verarbeitung personenbezogener Daten im Zusammenhang mit KI-Modellen Maßnahmen, die die Informationsasymmetrie verringern und als risikomindernd in die Abwägung einfließen können: öffentliche Mitteilungen mit zusätzlichen Angaben zu Erhebungskriterien und verwendeten Datensätzen, Informationskampagnen in Medien oder per E-Mail, grafische Visualisierungen, FAQ, Transparenzsiegel, Modellkarten und freiwillige jährliche Transparenzberichte.
Qualität der veröffentlichten Quellen ist entscheidend
Die Informationspflichten verlangen beim Web Scraping keine Individualinformation um jeden Preis, aber jedenfalls eine nachvollziehbare Begründung und eine belastbare öffentliche Alternative. Die Leitlinien 03/2026 setzen den Maßstab: Entscheidend ist nicht die Behauptung des unverhältnismäßigen Aufwands, sondern die dokumentierte Abwägung und die Qualität der veröffentlichten Angaben, insbesondere zu Quellen, Datenkategorien und Crawler. Wie Aufsichtsbehörden und Gerichte diese Linie konkretisieren, bleibt zu beobachten.
Die „Guidelines 03/2026 on web scraping in the context of generative AI“ liegen als Entwurf vor und befinden sich in der öffentlichen Konsultation. Stellungnahmen nimmt der EDSA bis zum 30. Oktober 2026 über das auf seiner Website bereitgestellte Formular an. Da sich der Text im weiteren Verfahren noch ändern kann, sollte die eigene Dokumentation so angelegt sein, dass sie bei veränderter Rechtsauffassung angepasst werden kann.


