Wer darf mit Ihren Website-Inhalten KI-Systeme trainieren?

Täglich durchsuchen automatisierte Crawler das Netz, um Datensätze für die nächste Generation von KI-Modellen aufzubauen. Wer eine öffentliche Website betreibt, liefert standardmäßig mit – Texte, Grafiken, Analysen. Ob das so bleibt, entscheiden Sie.
- Standardmäßig erlaubt: In der EU dürfen KI-Unternehmen öffentlich zugängliche Website-Inhalte gesetzlich für Text und Data Mining nutzen – es sei denn, Sie erklären einen maschinenlesbaren Nutzungsvorbehalt.
- Keine Auswirkung auf Google-Rankings: KI-Training und Suchmaschinen-Indexierung sind getrennt steuerbar. Wer Google-Extended blockiert, bleibt in der Google-Suche unverändert sichtbar.
- Präferenz-Signale statt Katz und Maus: Statt veralteten Bot-Listen hinterherzulaufen, setzen Sie rechtlich wirksame Signale (AIPREF, TDMRep, Content Signals), die allen Crawlern Ihren Widerspruch maschinenlesbar erklären.
Ihre Website ist Trainingsmaterial – bis Sie widersprechen
Die Blocking-Welle hat 2026 ein Plateau erreicht: Über 79 % der weltweiten Top-Nachrichtenseiten blockieren mindestens einen KI-Bot, bei kleineren und mittleren Unternehmens-Websites herrscht dagegen oft Unklarheit. Der Grund ist meist derselbe – die Verwechslung von KI-Training und Suchmaschinen-Sichtbarkeit.
| Deklarationsweg | Anteil | |
|---|---|---|
| KI-Crawler per robots.txt ausgesperrt | 19,4 % | |
| KI-Agenten namentlich gesperrt | 8,6 % | |
| Content-Signal: Training untersagt | 0,5 % | |
| tdmrep.json vorhanden | 0,5 % | |
| ai.txt vorhanden | 0,2 % | |
| Signal vom Hoster gesetzt (Cloudflare) | 0,2 % | |
| TDM-Vorbehalt im Meta-Tag | 0,1 % |
Deutsche Websites im Vergleich: 20 % setzen überhaupt ein Trainings-Signal, fast alle davon durch das Aussperren bekannter Crawler. Mehrfachnennung möglich. Quelle: wirklich.ai, Kennzeichnungs-Monitor 09/2026, 1.232 messbare Websites.
Die Rechtsgrundlage: der maschinenlesbare Opt-out
Die juristische Basis im europäischen Urheberrecht (§ 44b UrhG, Art. 4 DSM-Richtlinie) ist klar formuliert: Text und Data Mining an öffentlich zugänglichen Werken ist zulässig – es sei denn, der Rechteinhaber hat sich die Nutzung vorbehalten. Ohne Vorbehalt greift die gesetzliche Schranke; mit Vorbehalt ist die Nutzung nur noch mit Ihrer Erlaubnis möglich. Der Opt-out ist also kein technisches Nice-to-have, sondern die entscheidende rechtliche Stellschraube.
Drei Punkte dazu:
- Der Verhaltenskodex greift. Anbieter von KI-Modellen mit allgemeinem Verwendungszweck sind unter der KI-Verordnung gehalten, TDM-Vorbehalte zu respektieren. Die Pflicht liegt beim KI-Unternehmen – die Bringschuld, den Vorbehalt auffindbar zu machen, beim Website-Betreiber.
- Die Rechtsprechung verlangt Maschinenlesbarkeit. Die Entscheidungen des LG und OLG Hamburg zu TDM und Webscraping zeigen: Gerichte setzen den maschinenlesbaren Vorbehalt als Maßstab an.
- Mehrere Dialekte gleichzeitig nutzen. Wie „maschinenlesbar” technisch exakt aussehen muss, ist im Detail noch juristische Debatte. In der Praxis empfiehlt es sich, alle etablierten Signale parallel zu setzen.
Die Bot-Landkarte: wen sperren Sie eigentlich aus?
Nicht jeder Crawler ist ein Trainings-Bot. Für eine strategische Entscheidung braucht es die Unterscheidung zwischen KI-Training, KI-Antworten und klassischer Suche:
KI-Training (sammelt auf Vorrat, Inhalte landen im Modell):
| Crawler | Anbieter | Bei Blockade |
|---|---|---|
| GPTBot | OpenAI | kein Training für ChatGPT-Modelle |
| ClaudeBot | Anthropic | kein Training für Claude-Modelle |
| Google-Extended | kein Training für Gemini, Google-Suche bleibt unberührt | |
| Meta-ExternalAgent | Meta | kein Training für Llama und Meta AI |
| Applebot-Extended | Apple | kein Training für Apple Intelligence |
| CCBot | Common Crawl | kein Eingang in freie Datensätze, auf denen viele Modelle aufbauen |
KI-Suche (baut einen eigenen Index für KI-Antworten auf):
| Crawler | Anbieter | Bei Blockade |
|---|---|---|
| OAI-SearchBot | OpenAI | keine Verlinkung in der ChatGPT-Suche |
| Claude-SearchBot | Anthropic | keine Referenzen in der Claude-Suche |
| PerplexityBot | Perplexity | keine Erwähnung in Perplexity |
KI-Agenten (lesen Ihre Seite live, weil eine Person gerade fragt):
| Agent | Anbieter | Bei Blockade |
|---|---|---|
| ChatGPT-User | OpenAI | ChatGPT kann Ihre Seite nicht mehr live abrufen |
| Claude-User | Anthropic | Claude kann Ihre Seite nicht mehr live abrufen |
| Perplexity-User | Perplexity | Perplexity kann Ihre Seite nicht mehr live abrufen |
| MistralAI-User | Mistral | Le Chat kann Ihre Seite nicht mehr live abrufen |
| Meta-ExternalFetcher | Meta | Meta AI kann Ihre Seite nicht mehr live abrufen |
| DuckAssistBot | DuckDuckGo | keine Antworten aus Ihrer Seite in DuckAssist |
Agenten sind die Kategorie, die am häufigsten übersehen wird. Ein
Trainings-Crawler sammelt Inhalte lange bevor jemand danach fragt. Ein Agent
ruft Ihre Seite erst ab, wenn eine Person ChatGPT oder Claude gerade nach
Ihrem Thema fragt, und nutzt sie für genau diese eine Antwort. Daraus folgt
die typische Verwechslung: Wer GPTBot sperrt, hat das Training untersagt,
aber nicht den Live-Abruf durch ChatGPT-User.
Die wichtige Konsequenz: Wer pauschal jeden Bot aussperrt, verhindert zwar das Training, verschwindet aber auch aus den KI-Antworten von ChatGPT, Perplexity und Co. Das ist eine Sichtbarkeits-Entscheidung, keine reine Rechtsfrage.
Gut zu wissen: Google bestätigt in der eigenen Crawler-Dokumentation
ausdrücklich, dass Google-Extended kein Ranking-Signal ist und keinen
Einfluss auf die Aufnahme in die Google-Suche hat – das KI-Training lässt
sich also ohne SEO-Risiko untersagen. Die Nuance dazu: AI Overviews und
AI Mode gehören zur Suche und werden von Google-Extended nicht
gesteuert; wer dort nicht erscheinen will, braucht andere Mittel (etwa
nosnippet).
Zwei Wege: aussperren oder widersprechen
Weg A – User-Agent-Blocking (robots.txt): Sie sperren einzelne, bekannte Bots explizit aus. Nachteil: Bot-Listen veralten ständig, neue Crawler tauchen wöchentlich auf und fehlen in jeder statischen Liste.
Weg B – Präferenz-Signale (der zukunftssichere Weg): Sie erklären Ihren Nutzungsvorbehalt übergreifend über die Standard-Signale (IETF AIPREF, TDMRep, Cloudflare Content Signals). Sie müssen keinen Bot einzeln kennen – auch unbekannte und künftige Crawler sind von der Rechtserklärung erfasst.
Empfehlung: Signale als juristisches Fundament, optional ergänzt durch gezieltes Blocking einzelner Bots.
Hält sich überhaupt jemand daran?
Eine ehrliche Antwort: Der Opt-out ist kein technischer Panzerschrank, sondern ein Rechtsinstrument.
- Seriöse Akteure halten sich daran. OpenAI, Anthropic und Google respektieren korrekt konfigurierte robots.txt-Vorgaben und Signale für ihre Trainings- und Such-Crawler.
- Bei Agenten gilt das nur eingeschränkt. Abrufe, die eine Person auslöst, werten einige Anbieter nicht als Crawling und beachten die robots.txt dafür nicht in jedem Fall. Für Agenten ist die robots.txt deshalb vor allem eine Erklärung Ihrer Haltung. Eine harte Sperre gibt es nur serverseitig, etwa über Regeln bei Ihrem Hoster.
- Kein Schutz vor schwarzen Schafen. Unseriöse Scraper ignorieren Header und Dateien; echtes technisches Blockieren findet auf Netzwerk-Ebene statt und ist ein anderes Werkzeug.
- Der wahre Wert ist juristisch: Die dokumentierte, datierte Erklärung entzieht KI-Anbietern die TDM-Schranke. Im Streitfall können Sie nachweisen, seit wann Ihr Vorbehalt maschinenlesbar aktiv war.
Was Cloudflare im September 2026 geändert hat
Cloudflare betreibt einen großen Teil der Infrastruktur vor deutschen Websites und hat am 15. September 2026 seine Einstellungen für KI-Crawler umgebaut. Aus dem einen Schalter „Block AI Bots” wurden drei getrennte Einstellungen, genau entlang der Kategorien oben: Suche, Training und Agenten. Die neue Empfehlung für Training lautet nicht mehr „sperren”, sondern „Training untersagen”: Suchmaschinen dürfen weiter indexieren, nur die Nutzung fürs Training wird ausgeschlossen.
Wer den alten Schalter aktiv hatte, wurde automatisch umgestellt auf Suche erlaubt, Training untersagt und Agenten auf Seiten mit Werbung gesperrt. Wer nie etwas eingestellt hatte, bleibt bei „erlaubt”.
Cloudflare schreibt dafür selbst Content-Signal-Zeilen in Ihre robots.txt.
Rechtlich wirksam sind sie trotzdem, der mitgelieferte Text beruft sich
ausdrücklich auf den Vorbehalt nach Art. 4 der DSM-Richtlinie. Es ist aber
eine Erklärung, die Ihr Hoster für Sie abgegeben hat. Wollen Sie etwas
anderes, etwa das Training ausdrücklich erlauben, müssen Sie es in Cloudflare
umstellen. Sonst sagt Ihre Website das Gegenteil von dem, was Sie meinen.
Praxis: in drei Schritten sauber widersprechen
Schritt 1: Strategie festlegen. Nur das Training untersagen (häufigste Wahl) oder auch die Nutzung in KI-Antworten? Letzteres betrifft die KI-Suche und die Agenten aus der Übersicht oben und kostet Sichtbarkeit in ChatGPT, Claude und Perplexity. Die normale Suche bleibt fast immer erlaubt.
Schritt 2: Signale in allen Dialekten setzen. Der Vorbehalt gehört an drei Stellen, damit ihn jeder Crawler versteht:
In der robots.txt (beide Signal-Dialekte, optional plus gezieltes Blocking):
# Nutzungsvorbehalt nach § 44b UrhG / Art. 4 DSM-RL
User-agent: *
Content-Signal: search=yes, ai-input=no, ai-train=no
Content-Usage: train-ai=n
# Optional zusätzlich: einzelne Trainings-Bots aussperren
User-agent: GPTBot
Disallow: /
Die Zeile User-agent: * davor ist wichtig: Ein Signal gilt jeweils für die
Gruppe, in der es steht. Ohne sie – etwa unten an die Datei gehängt – gehört
der Vorbehalt zu keinem Bot.
Im HTML-Head (TDMRep-Meta-Tag):
<meta name="tdm-reservation" content="1">
Als Datei unter /.well-known/tdmrep.json (TDMRep-Standard des W3C).
Für Bilder lässt sich der Vorbehalt zusätzlich in die Datei selbst einbetten
(IPTC) – wie solche eingebetteten Signale funktionieren, zeigt das Kapitel
Woran man Inhalte von Claude, Gemini und ChatGPT erkennt.
Schritt 3: Nachprüfen und datiert dokumentieren. Die Signale müssen
fehlerfrei erreichbar sein, und der Aktivierungszeitpunkt gehört
dokumentiert, damit der Nachweis im Zweifel gelingt. Liegt Ihre Website
hinter Cloudflare, prüfen Sie dabei besonders, ob die robots.txt live
wirklich Ihre Haltung zeigt und nicht die Voreinstellung Ihres Hosters. Der richtige Ort für
die öffentliche Auskunft dazu ist Ihre
KI-Transparenzseite.
In wenigen Minuten mit wirklich.ai: Ein Klick erzeugt Ihren
Nutzungsvorbehalt in allen gängigen Dialekten – als fertige Bausteine für
robots.txt, HTML-Head und /.well-known/. Einmal eingelegt,
prüft der Abgleich laufend, dass die Signale wirklich live liegen, und der
Vorbehalt steht datiert im manipulationssicheren Prüfprotokoll:
„Maschinenlesbar erklärt seit …” ist damit belegbar, nicht nur behauptet.
Kostenloses Konto
erstellen →
Häufige Fragen
Reicht ein Satz im Impressum oder in den AGB aus, um KI-Training zu verbieten?
Nein. Das Gesetz verlangt einen maschinenlesbaren Nutzungsvorbehalt. Ein rein menschlich lesbarer Satz im Impressum erfüllt diesen Maßstab in der Regel nicht – automatisierte Crawler nehmen ihn schlicht nicht wahr. Setzen Sie stattdessen die etablierten Signale in robots.txt, Meta-Tag und TDMRep.
Verliere ich meine Google-Rankings, wenn ich das KI-Training verbiete?
Nein. Google trennt den normalen Suchmaschinen-Crawler (Googlebot) strikt vom KI-Trainings-Crawler (Google-Extended). Wer Google-Extended blockiert, verhindert das Gemini-Training – die Platzierungen in der normalen Google-Suche bleiben davon unberührt.
Gilt ein Opt-out rückwirkend für bereits gecrawlte Inhalte?
Nein. Der Nutzungsvorbehalt wirkt ab seiner Veröffentlichung. Bereits trainierte Modelle lassen sich nicht nachträglich „enttrainieren“. Umso wichtiger, den Vorbehalt früh zu setzen und das Startdatum nachweisbar zu dokumentieren.
Reicht es, GPTBot zu sperren, damit ChatGPT meine Seite nicht nutzt?
Nein. GPTBot ist nur der Trainings-Crawler. Wenn jemand ChatGPT gerade nach Ihrem Thema fragt, ruft ChatGPT Ihre Seite über einen eigenen Agenten namens ChatGPT-User ab. Den steuern Sie getrennt, über das Content-Signal ai-input oder indem Sie ChatGPT-User in der robots.txt namentlich sperren.
Cloudflare hat meine Einstellungen umgestellt. Muss ich etwas tun?
Prüfen, nicht zwingend handeln. Wer vorher „Block AI Bots“ aktiv hatte, steht seit September 2026 auf Suche erlaubt, Training untersagt und Agenten auf Seiten mit Werbung gesperrt. Das kann genau Ihre Haltung sein. Wenn nicht, stellen Sie es in Cloudflare um, sonst erklärt Ihre Website etwas anderes, als Sie meinen.
Wie schütze ich meine Bilder vor KI-Training?
Zusätzlich zu den Website-Signalen lässt sich der Opt-out direkt in die Metadaten der Bilddatei einbetten (IPTC-Standard). So reist der Vorbehalt mit, wenn das Bild außerhalb Ihrer Website geteilt oder gespeichert wird.
Quellen
- Der TDM-Vorbehalt: Technische Umsetzung der Maschinenlesbarkeit, LAUSEN Rechtsanwälte
- KI und Urheberrecht: Urteil des LG Hamburg zu TDM, Legal Tribune Online
- Text und Data Mining nach dem neuen Urheberrecht (§ 44b UrhG), CMS
- KI-Crawler-Übersicht: Alle AI-Bots und User-Agents, llmshub.de
- AI Crawler & Bot Traffic Statistics 2026, Digital Applied
- A Vocabulary For Expressing AI Usage Preferences (AIPREF), IETF
- Search generative AI control (Google-Extended), Google Search Console-Hilfe
- Content Signals: Definitionen von search, ai-input und ai-train
- Übersicht der Crawler und Abrufer, OpenAI
Dieser Beitrag gibt den Verordnungstext und benannte Quellen wieder. Er ist keine Rechtsberatung und ersetzt im Einzelfall keine anwaltliche Prüfung.
Angaben zur Rechtslage, zu deren Auslegung sowie zu Funktionen, Oberflächen und Schnittstellen fremder Systeme geben den Stand zum oben genannten Datum wieder. Beides kann sich jederzeit und ohne Ankündigung ändern. Für Aktualität, Richtigkeit und Vollständigkeit übernehmen wir keine Gewähr; eine Haftung für Schäden aus der Nutzung dieser Inhalte, der beschriebenen Anleitungen oder der Code-Beispiele ist ausgeschlossen, soweit gesetzlich zulässig. Genannte Produkt- und Firmennamen gehören ihren jeweiligen Inhabern; eine Verbindung zu ihnen besteht nicht.