Blokkeer je AI-crawlers of laat je ze binnen?
Alle AI-crawlers blokkeren is meestal te grof. GPTBot, ClaudeBot, PerplexityBot, Google-Extended en CCBot hebben elk een andere functie — hoe je robots.txt gericht instelt op training versus zichtbaarheid.
Voor een bedrijf dat via ChatGPT, Perplexity, Gemini en andere AI-systemen gevonden wil worden, is alle AI-crawlers blokkeren meestal te grof. Een betere aanpak is selectief: laat crawlers toe die je content nodig hebben voor zoeken, actuele antwoorden en bronverwijzingen, en bepaal afzonderlijk of je crawlers wilt toestaan die content verzamelen voor modeltraining of brede datasets.
Dat onderscheid is belangrijk, omdat één AI-bedrijf verschillende bots kan gebruiken voor verschillende doelen. OpenAI gebruikt bijvoorbeeld GPTBot voor content die mogelijk voor modeltraining wordt gebruikt en OAI-SearchBot voor ChatGPT Search. Anthropic maakt vergelijkbaar onderscheid tussen ClaudeBot, Claude-SearchBot en Claude-User. Wie alleen naar de bedrijfsnaam kijkt en alles blokkeert, kan daardoor onbedoeld ook zijn AI-zichtbaarheid beperken.
Niet iedere AI-crawler doet hetzelfde
Traditioneel was de afweging rond robots.txt relatief overzichtelijk: wil je
dat een zoekmachine een pagina crawlt of niet? Bij generatieve AI zijn er minstens drie
verschillende functies.
Een trainingcrawler verzamelt webcontent die mogelijk wordt gebruikt om toekomstige modellen te ontwikkelen. Een searchcrawler bouwt of ondersteunt een zoekindex waarmee actuele bronnen gevonden kunnen worden. Daarnaast bestaan user-triggered fetchers die pas een pagina ophalen nadat een gebruiker daarom heeft gevraagd.
Dat verschil bepaalt de praktische afweging. Een bedrijf kan bezwaar hebben tegen opname van zijn artikelen in trainingsdata, maar tegelijkertijd graag geciteerd worden wanneer iemand in ChatGPT of Claude naar zijn expertise zoekt. Die twee doelen hoeven technisch niet altijd met elkaar in conflict te zijn.
GPTBot blokkeren betekent niet automatisch verdwijnen uit ChatGPT
OpenAI is een duidelijk voorbeeld van die scheiding. GPTBot crawlt content
die mogelijk kan bijdragen aan de training van generatieve foundation models.
OAI-SearchBot is bedoeld om websites vindbaar en citeerbaar te maken in
ChatGPT Search. OpenAI geeft expliciet aan dat een site OAI-SearchBot moet toelaten om
content goed te kunnen laten opnemen in samenvattingen en snippets van zoekresultaten.
Wie training wil uitsluiten maar ChatGPT-zichtbaarheid wil behouden, kan daarom bijvoorbeeld dit gebruiken:
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Allow: /
Daarnaast bestaat ChatGPT-User. Die wordt gebruikt voor bepaalde handelingen
die door een gebruiker worden gestart, bijvoorbeeld wanneer ChatGPT een webpagina bezoekt
naar aanleiding van een concrete vraag. Omdat zo'n request user-triggered is, kunnen
gewone robots.txt-regels niet in alle situaties op dezelfde manier van
toepassing zijn.
De praktische conclusie is dus: GPTBot blokkeren is een andere beslissing dan ChatGPT Search blokkeren.
ClaudeBot, Claude-SearchBot en Claude-User
Anthropic hanteert inmiddels eveneens aparte bots. ClaudeBot verzamelt
publieke webcontent die mogelijk aan modeltraining kan bijdragen.
Claude-SearchBot crawlt voor de kwaliteit van Claude's zoekfunctionaliteit,
terwijl Claude-User wordt gebruikt wanneer Claude op verzoek van een
gebruiker webcontent ophaalt. Anthropic waarschuwt dat het blokkeren van
Claude-SearchBot de zichtbaarheid en nauwkeurigheid van je site in zoekresultaten binnen
Claude kan verminderen.
Een organisatie die training wil beperken maar search wil behouden, kan dus kiezen voor:
User-agent: ClaudeBot
Disallow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Claude-User
Allow: /
De naam anthropic-ai komt nog regelmatig voor in lijsten met AI-crawlers en
oude robots.txt-voorbeelden. Anthropic noemt deze token echter niet meer in
zijn actuele officiële overzicht; daar staan ClaudeBot, Claude-SearchBot en Claude-User.
Behandel anthropic-ai daarom hooguit als een legacy-regel en niet als
vervanging voor de huidige Anthropic-tokens.
PerplexityBot is vooral een zoekcrawler
Bij Perplexity ligt de afweging anders. PerplexityBot is bedoeld om pagina's
te indexeren en websites als bronnen in Perplexity-resultaten te kunnen tonen. Volgens
Perplexity wordt deze crawler niet gebruikt voor het pretrainen van foundation models.
Voor een bedrijf dat GEO- en AI-zichtbaarheid belangrijk vindt, is het blokkeren van PerplexityBot daarom een vrij directe afweging: je beschermt de pagina tegen deze indexeringscrawler, maar maakt het tegelijkertijd moeilijker voor Perplexity om de inhoud als actuele bron te verwerken.
Perplexity gebruikt daarnaast Perplexity-User voor verzoeken die door
gebruikers worden geïnitieerd. Volgens de documentatie negeert deze fetcher
robots.txt in het algemeen omdat de gebruiker zelf het ophalen van de
informatie heeft veroorzaakt.
Google-Extended is niet hetzelfde als Googlebot
Bij Google is het onderscheid extra belangrijk. Google-Extended is geen
normale crawler met een eigen HTTP-user-agent. Het is een
robots.txt-producttoken waarmee website-eigenaren kunnen aangeven of door
Google gecrawlde content mag worden gebruikt voor toekomstige Gemini-modellen en voor
bepaalde vormen van grounding in Gemini Apps en Vertex AI.
Je kunt dus bijvoorbeeld schrijven:
User-agent: Google-Extended
Disallow: / Daarmee blokkeer je niet automatisch Google Search. Google stelt expliciet dat Google-Extended geen invloed heeft op opname of ranking in Google Search. Voor AI Overviews en AI Mode binnen Google Search blijft Googlebot de relevante crawler.
Dit maakt Google-Extended interessant voor organisaties die normale SEO willen behouden, maar terughoudender zijn met Gemini-training of grounding buiten de reguliere Search-context.
En wat doe je met CCBot?
CCBot is de crawler van Common Crawl. Common Crawl bouwt een openbaar
webcorpus met ruwe pagina-inhoud, metadata en tekstextracten dat door onderzoekers,
bedrijven en andere partijen kan worden gebruikt. CCBot identificeert zich momenteel als
CCBot/2.0 en respecteert robots.txt.
Blokkeren gaat eenvoudig:
User-agent: CCBot
Disallow: / Hier is de afweging minder direct gekoppeld aan één zoekdienst. Toelaten vergroot de kans dat je openbare content terechtkomt in een breed herbruikbare dataset. Blokkeren geeft meer controle over toekomstige verzameling door Common Crawl, maar kan ook betekenen dat je content ontbreekt in datasets en systemen die deze bron later gebruiken.
Een robots.txt-wijziging haalt overigens geen materiaal terug dat al eerder
is gecrawld of elders is opgeslagen.
Robots.txt is een voorkeurssignaal, geen beveiligingslaag
Een volledige blokkade gebruikt doorgaans Disallow: /; met
Allow: / kan een crawler de hele site benaderen. Je kunt regels ook beperken
tot specifieke directories. Het Robots Exclusion Protocol bepaalt dat de meest specifieke
passende Allow- of Disallow-regel leidend is.
Maar robots.txt beschermt geen vertrouwelijke informatie. Het bestand is
publiek en een kwaadwillende scraper kan de instructies simpelweg negeren. Voor
daadwerkelijk afgeschermde content zijn authenticatie, autorisatie en eventueel WAF- of
serverregels nodig. Ook een user-agent-string alleen bewijst niet dat een request echt
van OpenAI, Google of een andere genoemde partij afkomstig is.
Een tweede belangrijk verschil: niet crawlen is niet altijd hetzelfde als niet
vindbaar zijn. Een URL kan via andere bronnen bekend zijn zonder dat de inhoud
gecrawld is. Wie content echt uit bepaalde zoekindexen wil houden, moet daarom ook de
relevante noindex- en platformcontroles beoordelen.
Kies per doel, niet per AI-bedrijf
Voor veel zakelijke websites is een selectieve configuratie de meest rationele standaard. Je kunt bijvoorbeeld searchcrawlers zoals OAI-SearchBot, Claude-SearchBot en PerplexityBot toelaten om de kans op actuele bronvermeldingen te behouden, terwijl je GPTBot, ClaudeBot of Google-Extended afzonderlijk beoordeelt vanuit je beleid rond training en hergebruik.
Dat beleid hoeft bovendien niet voor de hele website gelijk te zijn. Openbare kennisbankartikelen kunnen een andere waarde hebben dan premium onderzoekscontent, klantportalen of materiaal waarop een licentiemodel rust.
Controleer de configuratie periodiek. De markt verandert snel, crawlernamen en functies kunnen veranderen en nieuwe user-agents verschijnen. Baseer productieconfiguraties daarom op de actuele documentatie van de betreffende operator, niet uitsluitend op een jaren geleden gekopieerde lijst met AI-bots.
Samengevat
Blokkeer AI-crawlers niet automatisch als één groep: training, AI-search en
user-triggered fetching zijn verschillende functies. Voor AI-zichtbaarheid is het meestal
logisch om relevante searchcrawlers toegang te geven en trainingcrawlers afzonderlijk te
beoordelen. robots.txt geeft daarbij controle over compliant crawlers, maar
is geen beveiligingsmechanisme en werkt niet met terugwerkende kracht. De beste
configuratie volgt daarom uit je contentstrategie: wel gevonden worden waar dat
waarde heeft, en gericht beperken waar hergebruik niet gewenst is.