EU AI Act

Wer darf mit Ihren Website-Inhalten KI-Systeme trainieren?

Person beugt sich beim Dehnen in einem weiten Sonnenblumenfeld nach vorn

Täglich durchsuchen automatisierte Crawler das Netz, um Datensätze für die nächste Generation von KI-Modellen aufzubauen. Wer eine öffentliche Website betreibt, liefert standardmäßig mit – Texte, Grafiken, Analysen. Ob das so bleibt, entscheiden Sie.

Das Wichtigste in Kürze
  • Standardmäßig erlaubt: In der EU dürfen KI-Unternehmen öffentlich zugängliche Website-Inhalte gesetzlich für Text und Data Mining nutzen – es sei denn, Sie erklären einen maschinenlesbaren Nutzungsvorbehalt.
  • Keine Auswirkung auf Google-Rankings: KI-Training und Suchmaschinen-Indexierung sind getrennt steuerbar. Wer Google-Extended blockiert, bleibt in der Google-Suche unverändert sichtbar.
  • Präferenz-Signale statt Katz und Maus: Statt veralteten Bot-Listen hinterherzulaufen, setzen Sie rechtlich wirksame Signale (AIPREF, TDMRep, Content Signals), die allen Crawlern Ihren Widerspruch maschinenlesbar erklären.

Ihre Website ist Trainingsmaterial – bis Sie widersprechen

Die Blocking-Welle hat 2026 ein Plateau erreicht: Über 79 % der weltweiten Top-Nachrichtenseiten blockieren mindestens einen KI-Bot, bei kleineren und mittleren Unternehmens-Websites herrscht dagegen oft Unklarheit. Der Grund ist meist derselbe – die Verwechslung von KI-Training und Suchmaschinen-Sichtbarkeit.

DeklarationswegAnteil
KI-Crawler per robots.txt ausgesperrt19,4 %
KI-Agenten namentlich gesperrt8,6 %
Content-Signal: Training untersagt0,5 %
tdmrep.json vorhanden0,5 %
ai.txt vorhanden0,2 %
Signal vom Hoster gesetzt (Cloudflare)0,2 %
TDM-Vorbehalt im Meta-Tag0,1 %
wirklich.ai

Deutsche Websites im Vergleich: 20 % setzen überhaupt ein Trainings-Signal, fast alle davon durch das Aussperren bekannter Crawler. Mehrfachnennung möglich. Quelle: wirklich.ai, Kennzeichnungs-Monitor 09/2026, 1.232 messbare Websites.

Zur Ausgabe im Kennzeichnungs-Monitor

Die Rechtsgrundlage: der maschinenlesbare Opt-out

Die juristische Basis im europäischen Urheberrecht (§ 44b UrhG, Art. 4 DSM-Richtlinie) ist klar formuliert: Text und Data Mining an öffentlich zugänglichen Werken ist zulässig – es sei denn, der Rechteinhaber hat sich die Nutzung vorbehalten. Ohne Vorbehalt greift die gesetzliche Schranke; mit Vorbehalt ist die Nutzung nur noch mit Ihrer Erlaubnis möglich. Der Opt-out ist also kein technisches Nice-to-have, sondern die entscheidende rechtliche Stellschraube.

Drei Punkte dazu:

  1. Der Verhaltenskodex greift. Anbieter von KI-Modellen mit allgemeinem Verwendungszweck sind unter der KI-Verordnung gehalten, TDM-Vorbehalte zu respektieren. Die Pflicht liegt beim KI-Unternehmen – die Bringschuld, den Vorbehalt auffindbar zu machen, beim Website-Betreiber.
  2. Die Rechtsprechung verlangt Maschinenlesbarkeit. Die Entscheidungen des LG und OLG Hamburg zu TDM und Webscraping zeigen: Gerichte setzen den maschinenlesbaren Vorbehalt als Maßstab an.
  3. Mehrere Dialekte gleichzeitig nutzen. Wie „maschinenlesbar” technisch exakt aussehen muss, ist im Detail noch juristische Debatte. In der Praxis empfiehlt es sich, alle etablierten Signale parallel zu setzen.

Die Bot-Landkarte: wen sperren Sie eigentlich aus?

Nicht jeder Crawler ist ein Trainings-Bot. Für eine strategische Entscheidung braucht es die Unterscheidung zwischen KI-Training, KI-Antworten und klassischer Suche:

KI-Training (sammelt auf Vorrat, Inhalte landen im Modell):

CrawlerAnbieterBei Blockade
GPTBotOpenAIkein Training für ChatGPT-Modelle
ClaudeBotAnthropickein Training für Claude-Modelle
Google-ExtendedGooglekein Training für Gemini, Google-Suche bleibt unberührt
Meta-ExternalAgentMetakein Training für Llama und Meta AI
Applebot-ExtendedApplekein Training für Apple Intelligence
CCBotCommon Crawlkein Eingang in freie Datensätze, auf denen viele Modelle aufbauen

KI-Suche (baut einen eigenen Index für KI-Antworten auf):

CrawlerAnbieterBei Blockade
OAI-SearchBotOpenAIkeine Verlinkung in der ChatGPT-Suche
Claude-SearchBotAnthropickeine Referenzen in der Claude-Suche
PerplexityBotPerplexitykeine Erwähnung in Perplexity

KI-Agenten (lesen Ihre Seite live, weil eine Person gerade fragt):

AgentAnbieterBei Blockade
ChatGPT-UserOpenAIChatGPT kann Ihre Seite nicht mehr live abrufen
Claude-UserAnthropicClaude kann Ihre Seite nicht mehr live abrufen
Perplexity-UserPerplexityPerplexity kann Ihre Seite nicht mehr live abrufen
MistralAI-UserMistralLe Chat kann Ihre Seite nicht mehr live abrufen
Meta-ExternalFetcherMetaMeta AI kann Ihre Seite nicht mehr live abrufen
DuckAssistBotDuckDuckGokeine Antworten aus Ihrer Seite in DuckAssist

Agenten sind die Kategorie, die am häufigsten übersehen wird. Ein Trainings-Crawler sammelt Inhalte lange bevor jemand danach fragt. Ein Agent ruft Ihre Seite erst ab, wenn eine Person ChatGPT oder Claude gerade nach Ihrem Thema fragt, und nutzt sie für genau diese eine Antwort. Daraus folgt die typische Verwechslung: Wer GPTBot sperrt, hat das Training untersagt, aber nicht den Live-Abruf durch ChatGPT-User.

Die wichtige Konsequenz: Wer pauschal jeden Bot aussperrt, verhindert zwar das Training, verschwindet aber auch aus den KI-Antworten von ChatGPT, Perplexity und Co. Das ist eine Sichtbarkeits-Entscheidung, keine reine Rechtsfrage.

Gut zu wissen: Google bestätigt in der eigenen Crawler-Dokumentation ausdrücklich, dass Google-Extended kein Ranking-Signal ist und keinen Einfluss auf die Aufnahme in die Google-Suche hat – das KI-Training lässt sich also ohne SEO-Risiko untersagen. Die Nuance dazu: AI Overviews und AI Mode gehören zur Suche und werden von Google-Extended nicht gesteuert; wer dort nicht erscheinen will, braucht andere Mittel (etwa nosnippet).

Zwei Wege: aussperren oder widersprechen

Weg A – User-Agent-Blocking (robots.txt): Sie sperren einzelne, bekannte Bots explizit aus. Nachteil: Bot-Listen veralten ständig, neue Crawler tauchen wöchentlich auf und fehlen in jeder statischen Liste.

Weg B – Präferenz-Signale (der zukunftssichere Weg): Sie erklären Ihren Nutzungsvorbehalt übergreifend über die Standard-Signale (IETF AIPREF, TDMRep, Cloudflare Content Signals). Sie müssen keinen Bot einzeln kennen – auch unbekannte und künftige Crawler sind von der Rechtserklärung erfasst.

Empfehlung: Signale als juristisches Fundament, optional ergänzt durch gezieltes Blocking einzelner Bots.

Hält sich überhaupt jemand daran?

Eine ehrliche Antwort: Der Opt-out ist kein technischer Panzerschrank, sondern ein Rechtsinstrument.

Was Cloudflare im September 2026 geändert hat

Cloudflare betreibt einen großen Teil der Infrastruktur vor deutschen Websites und hat am 15. September 2026 seine Einstellungen für KI-Crawler umgebaut. Aus dem einen Schalter „Block AI Bots” wurden drei getrennte Einstellungen, genau entlang der Kategorien oben: Suche, Training und Agenten. Die neue Empfehlung für Training lautet nicht mehr „sperren”, sondern „Training untersagen”: Suchmaschinen dürfen weiter indexieren, nur die Nutzung fürs Training wird ausgeschlossen.

Wer den alten Schalter aktiv hatte, wurde automatisch umgestellt auf Suche erlaubt, Training untersagt und Agenten auf Seiten mit Werbung gesperrt. Wer nie etwas eingestellt hatte, bleibt bei „erlaubt”.

Cloudflare schreibt dafür selbst Content-Signal-Zeilen in Ihre robots.txt. Rechtlich wirksam sind sie trotzdem, der mitgelieferte Text beruft sich ausdrücklich auf den Vorbehalt nach Art. 4 der DSM-Richtlinie. Es ist aber eine Erklärung, die Ihr Hoster für Sie abgegeben hat. Wollen Sie etwas anderes, etwa das Training ausdrücklich erlauben, müssen Sie es in Cloudflare umstellen. Sonst sagt Ihre Website das Gegenteil von dem, was Sie meinen.

Praxis: in drei Schritten sauber widersprechen

Schritt 1: Strategie festlegen. Nur das Training untersagen (häufigste Wahl) oder auch die Nutzung in KI-Antworten? Letzteres betrifft die KI-Suche und die Agenten aus der Übersicht oben und kostet Sichtbarkeit in ChatGPT, Claude und Perplexity. Die normale Suche bleibt fast immer erlaubt.

Schritt 2: Signale in allen Dialekten setzen. Der Vorbehalt gehört an drei Stellen, damit ihn jeder Crawler versteht:

In der robots.txt (beide Signal-Dialekte, optional plus gezieltes Blocking):

# Nutzungsvorbehalt nach § 44b UrhG / Art. 4 DSM-RL
User-agent: *
Content-Signal: search=yes, ai-input=no, ai-train=no
Content-Usage: train-ai=n

# Optional zusätzlich: einzelne Trainings-Bots aussperren
User-agent: GPTBot
Disallow: /

Die Zeile User-agent: * davor ist wichtig: Ein Signal gilt jeweils für die Gruppe, in der es steht. Ohne sie – etwa unten an die Datei gehängt – gehört der Vorbehalt zu keinem Bot.

Im HTML-Head (TDMRep-Meta-Tag):

<meta name="tdm-reservation" content="1">

Als Datei unter /.well-known/tdmrep.json (TDMRep-Standard des W3C). Für Bilder lässt sich der Vorbehalt zusätzlich in die Datei selbst einbetten (IPTC) – wie solche eingebetteten Signale funktionieren, zeigt das Kapitel Woran man Inhalte von Claude, Gemini und ChatGPT erkennt.

Schritt 3: Nachprüfen und datiert dokumentieren. Die Signale müssen fehlerfrei erreichbar sein, und der Aktivierungszeitpunkt gehört dokumentiert, damit der Nachweis im Zweifel gelingt. Liegt Ihre Website hinter Cloudflare, prüfen Sie dabei besonders, ob die robots.txt live wirklich Ihre Haltung zeigt und nicht die Voreinstellung Ihres Hosters. Der richtige Ort für die öffentliche Auskunft dazu ist Ihre KI-Transparenzseite.

In wenigen Minuten mit wirklich.ai: Ein Klick erzeugt Ihren Nutzungsvorbehalt in allen gängigen Dialekten – als fertige Bausteine für robots.txt, HTML-Head und /.well-known/. Einmal eingelegt, prüft der Abgleich laufend, dass die Signale wirklich live liegen, und der Vorbehalt steht datiert im manipulationssicheren Prüfprotokoll: „Maschinenlesbar erklärt seit …” ist damit belegbar, nicht nur behauptet. Kostenloses Konto erstellen →

Häufige Fragen

Reicht ein Satz im Impressum oder in den AGB aus, um KI-Training zu verbieten?

Nein. Das Gesetz verlangt einen maschinenlesbaren Nutzungsvorbehalt. Ein rein menschlich lesbarer Satz im Impressum erfüllt diesen Maßstab in der Regel nicht – automatisierte Crawler nehmen ihn schlicht nicht wahr. Setzen Sie stattdessen die etablierten Signale in robots.txt, Meta-Tag und TDMRep.

Verliere ich meine Google-Rankings, wenn ich das KI-Training verbiete?

Nein. Google trennt den normalen Suchmaschinen-Crawler (Googlebot) strikt vom KI-Trainings-Crawler (Google-Extended). Wer Google-Extended blockiert, verhindert das Gemini-Training – die Platzierungen in der normalen Google-Suche bleiben davon unberührt.

Gilt ein Opt-out rückwirkend für bereits gecrawlte Inhalte?

Nein. Der Nutzungsvorbehalt wirkt ab seiner Veröffentlichung. Bereits trainierte Modelle lassen sich nicht nachträglich „enttrainieren“. Umso wichtiger, den Vorbehalt früh zu setzen und das Startdatum nachweisbar zu dokumentieren.

Reicht es, GPTBot zu sperren, damit ChatGPT meine Seite nicht nutzt?

Nein. GPTBot ist nur der Trainings-Crawler. Wenn jemand ChatGPT gerade nach Ihrem Thema fragt, ruft ChatGPT Ihre Seite über einen eigenen Agenten namens ChatGPT-User ab. Den steuern Sie getrennt, über das Content-Signal ai-input oder indem Sie ChatGPT-User in der robots.txt namentlich sperren.

Cloudflare hat meine Einstellungen umgestellt. Muss ich etwas tun?

Prüfen, nicht zwingend handeln. Wer vorher „Block AI Bots“ aktiv hatte, steht seit September 2026 auf Suche erlaubt, Training untersagt und Agenten auf Seiten mit Werbung gesperrt. Das kann genau Ihre Haltung sein. Wenn nicht, stellen Sie es in Cloudflare um, sonst erklärt Ihre Website etwas anderes, als Sie meinen.

Wie schütze ich meine Bilder vor KI-Training?

Zusätzlich zu den Website-Signalen lässt sich der Opt-out direkt in die Metadaten der Bilddatei einbetten (IPTC-Standard). So reist der Vorbehalt mit, wenn das Bild außerhalb Ihrer Website geteilt oder gespeichert wird.

Quellen

Dieser Beitrag gibt den Verordnungstext und benannte Quellen wieder. Er ist keine Rechtsberatung und ersetzt im Einzelfall keine anwaltliche Prüfung.

Angaben zur Rechtslage, zu deren Auslegung sowie zu Funktionen, Oberflächen und Schnittstellen fremder Systeme geben den Stand zum oben genannten Datum wieder. Beides kann sich jederzeit und ohne Ankündigung ändern. Für Aktualität, Richtigkeit und Vollständigkeit übernehmen wir keine Gewähr; eine Haftung für Schäden aus der Nutzung dieser Inhalte, der beschriebenen Anleitungen oder der Code-Beispiele ist ausgeschlossen, soweit gesetzlich zulässig. Genannte Produkt- und Firmennamen gehören ihren jeweiligen Inhabern; eine Verbindung zu ihnen besteht nicht.

AI modified – EU-PiktogrammDieser Text wurde mit Unterstützung von KI erstellt und redaktionell geprüft.

Support kontaktieren

Ob Einbau, Einstufung oder Trainings-Signale: Schreiben Sie uns, wo es hakt. Wir sehen uns Ihre Website an und melden uns persönlich bei Ihnen.