// HEISE ONLINE — INTELLIGENZA ARTIFICIALE
Google-Suche ja, Modelltraining nein: Neue Cloudflare-Regeln
KI-Crawler blockieren, aber in der Suche bleiben: Cloudflare entschärft den Konflikt bei Mehrzweck-Crawlern.
This article is also available in
English.
It was translated with technical assistance and editorially reviewed before publication.
Cloudflare erweitert seine Steuerung für KI-Crawler: Websitebetreiber können künftig festlegen, dass ihre Inhalte nicht zum Training von KI-Modellen verwendet werden dürfen, während Suchmaschinen sie weiter indexieren. Die neue Option „Disallow AI Training“ zielt auf Crawler, die ein Anbieter zugleich für Suche und KI-Training einsetzt.
Das betrifft laut Cloudflare insbesondere Applebot, Googlebot und Bingbot. Bisher schränkte das Blockieren solcher Mehrzweck-Crawler im Zweifel auch die Auffindbarkeit in der jeweiligen Suche ein. Cloudflare veröffentlicht die Präferenz gegen KI-Training in der robots.txt und klassifiziert zugleich die zugreifenden Crawler. Reine Trainingsbots blockiert der Anbieter technisch in seiner vorgeschalteten Infrastruktur. Mehrzweck-Crawler wie Googlebot dürfen für die Suche weiter zugreifen; ihre Betreiber sollen die Trainingssperre beachten. Details beschreibt Cloudflare in seinem Blogbeitrag.
Cloudflare unterscheidet Bots nach drei Verwendungszwecken: Search steht für den Aufbau eines Suchindex, Training für das Trainieren oder Feintunen von Modellen und Agent für Abrufe im Auftrag eines Nutzers, etwa durch Browser- oder Chat-Agenten. Ein Mehrzweck-Crawler kombiniert mindestens Suche und Training unter derselben Bot-Kennung.
Die neue Option ergänzt die bisherigen Optionen „Allow“, „Block on pages with ads“ und „Block“. Bei „Disallow AI Training“ trägt Cloudflares Bot Preference Sync die passenden Anweisungen in die robots.txt ein. Reine Trainingscrawler, etwa von Amazon, Anthropic, Meta oder OpenAI, blockiert Cloudflare bereits in seiner vorgeschalteten Infrastruktur. Bei Mehrzweck-Crawlern bleibt der Zugriff für die Suche dagegen möglich, sofern der Betreiber die Trainingssperre respektiert.
Cloudflare hatte die Steuerung erst im Juli in die drei Kategorien Suche, Training und Agenten aufgeteilt. Diese Logik war restriktiver: Wenn ein Bot mehrere Rollen übernahm, griffen alle zutreffenden Regeln. Wer das Training blockierte, sperrte damit auch einen Crawler, der zugleich für die Suche zuständig war. Die neue Einstellung entschärft genau diesen Zielkonflikt für die von Cloudflare als „Accountable“ eingestuften Betreiber.
Mit der neuen Ausnahme ändert Cloudflare zugleich die Bedeutung der vorhandenen Blockieroptionen. „Block“ und „Block on pages with ads“ greifen nun auch für Mehrzweck-Crawler. Wer einen solchen Bot vollständig aussperrt, verhindert damit also sowohl KI-Training als auch Suchindexierung – also auch Applebot, Bingbot und Googlebot.
Die Option „Block on pages with ads“ soll Crawler nur auf Seiten stoppen, auf denen Cloudflare Werbung erkennt. Eine vergleichbare Regel als robots.txt-Anweisung gebe es nicht, erklärt das Unternehmen: Die Liste der betroffenen URLs sei zu dynamisch und zu umfangreich. Eine Einstellung, die KI-Training nur auf Seiten mit Werbung untersagt, bietet Cloudflare nicht an. Für Agenten führt Cloudflare ebenfalls keine entsprechende Opt-out-Option ein. Dafür fehle bislang eine etablierte Direktive; das Unternehmen verweist auf noch entstehende Standards wie ai-prefs.
Die Änderungen gelten laut Cloudflare seit dem 15. September für Bot Management und AI Crawl Control. Die bisherige Pauschaloption „Block AI Bots“ wird durch die feineren Kategorien ersetzt, die verwaltete robots.txt durch Bot Preference Sync. Bestehende Konfigurationen will Cloudflare automatisch übertragen. Die Funktionen sollen in allen Tarifen verfügbar sein.