Terug naar kennisbank
GEO ·27 augustus 2026 ·7 min lezen

Blokkeer je AI-crawlers of laat je ze binnen?

Alle AI-crawlers blokkeren is meestal te grof. GPTBot, ClaudeBot, PerplexityBot, Google-Extended en CCBot hebben elk een andere functie — hoe je robots.txt gericht instelt op training versus zichtbaarheid.

Voor een bedrijf dat via ChatGPT, Perplexity, Gemini en andere AI-systemen gevonden wil worden, is alle AI-crawlers blokkeren meestal te grof. Een betere aanpak is selectief: laat crawlers toe die je content nodig hebben voor zoeken, actuele antwoorden en bronverwijzingen, en bepaal afzonderlijk of je crawlers wilt toestaan die content verzamelen voor modeltraining of brede datasets.

Dat onderscheid is belangrijk, omdat één AI-bedrijf verschillende bots kan gebruiken voor verschillende doelen. OpenAI gebruikt bijvoorbeeld GPTBot voor content die mogelijk voor modeltraining wordt gebruikt en OAI-SearchBot voor ChatGPT Search. Anthropic maakt vergelijkbaar onderscheid tussen ClaudeBot, Claude-SearchBot en Claude-User. Wie alleen naar de bedrijfsnaam kijkt en alles blokkeert, kan daardoor onbedoeld ook zijn AI-zichtbaarheid beperken.

Niet iedere AI-crawler doet hetzelfde

Traditioneel was de afweging rond robots.txt relatief overzichtelijk: wil je dat een zoekmachine een pagina crawlt of niet? Bij generatieve AI zijn er minstens drie verschillende functies.

Een trainingcrawler verzamelt webcontent die mogelijk wordt gebruikt om toekomstige modellen te ontwikkelen. Een searchcrawler bouwt of ondersteunt een zoekindex waarmee actuele bronnen gevonden kunnen worden. Daarnaast bestaan user-triggered fetchers die pas een pagina ophalen nadat een gebruiker daarom heeft gevraagd.

Dat verschil bepaalt de praktische afweging. Een bedrijf kan bezwaar hebben tegen opname van zijn artikelen in trainingsdata, maar tegelijkertijd graag geciteerd worden wanneer iemand in ChatGPT of Claude naar zijn expertise zoekt. Die twee doelen hoeven technisch niet altijd met elkaar in conflict te zijn.

GPTBot blokkeren betekent niet automatisch verdwijnen uit ChatGPT

OpenAI is een duidelijk voorbeeld van die scheiding. GPTBot crawlt content die mogelijk kan bijdragen aan de training van generatieve foundation models. OAI-SearchBot is bedoeld om websites vindbaar en citeerbaar te maken in ChatGPT Search. OpenAI geeft expliciet aan dat een site OAI-SearchBot moet toelaten om content goed te kunnen laten opnemen in samenvattingen en snippets van zoekresultaten.

Wie training wil uitsluiten maar ChatGPT-zichtbaarheid wil behouden, kan daarom bijvoorbeeld dit gebruiken:

User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Allow: /

Daarnaast bestaat ChatGPT-User. Die wordt gebruikt voor bepaalde handelingen die door een gebruiker worden gestart, bijvoorbeeld wanneer ChatGPT een webpagina bezoekt naar aanleiding van een concrete vraag. Omdat zo'n request user-triggered is, kunnen gewone robots.txt-regels niet in alle situaties op dezelfde manier van toepassing zijn.

De praktische conclusie is dus: GPTBot blokkeren is een andere beslissing dan ChatGPT Search blokkeren.

ClaudeBot, Claude-SearchBot en Claude-User

Anthropic hanteert inmiddels eveneens aparte bots. ClaudeBot verzamelt publieke webcontent die mogelijk aan modeltraining kan bijdragen. Claude-SearchBot crawlt voor de kwaliteit van Claude's zoekfunctionaliteit, terwijl Claude-User wordt gebruikt wanneer Claude op verzoek van een gebruiker webcontent ophaalt. Anthropic waarschuwt dat het blokkeren van Claude-SearchBot de zichtbaarheid en nauwkeurigheid van je site in zoekresultaten binnen Claude kan verminderen.

Een organisatie die training wil beperken maar search wil behouden, kan dus kiezen voor:

User-agent: ClaudeBot
Disallow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

De naam anthropic-ai komt nog regelmatig voor in lijsten met AI-crawlers en oude robots.txt-voorbeelden. Anthropic noemt deze token echter niet meer in zijn actuele officiële overzicht; daar staan ClaudeBot, Claude-SearchBot en Claude-User. Behandel anthropic-ai daarom hooguit als een legacy-regel en niet als vervanging voor de huidige Anthropic-tokens.

PerplexityBot is vooral een zoekcrawler

Bij Perplexity ligt de afweging anders. PerplexityBot is bedoeld om pagina's te indexeren en websites als bronnen in Perplexity-resultaten te kunnen tonen. Volgens Perplexity wordt deze crawler niet gebruikt voor het pretrainen van foundation models.

Voor een bedrijf dat GEO- en AI-zichtbaarheid belangrijk vindt, is het blokkeren van PerplexityBot daarom een vrij directe afweging: je beschermt de pagina tegen deze indexeringscrawler, maar maakt het tegelijkertijd moeilijker voor Perplexity om de inhoud als actuele bron te verwerken.

Perplexity gebruikt daarnaast Perplexity-User voor verzoeken die door gebruikers worden geïnitieerd. Volgens de documentatie negeert deze fetcher robots.txt in het algemeen omdat de gebruiker zelf het ophalen van de informatie heeft veroorzaakt.

Google-Extended is niet hetzelfde als Googlebot

Bij Google is het onderscheid extra belangrijk. Google-Extended is geen normale crawler met een eigen HTTP-user-agent. Het is een robots.txt-producttoken waarmee website-eigenaren kunnen aangeven of door Google gecrawlde content mag worden gebruikt voor toekomstige Gemini-modellen en voor bepaalde vormen van grounding in Gemini Apps en Vertex AI.

Je kunt dus bijvoorbeeld schrijven:

User-agent: Google-Extended
Disallow: /

Daarmee blokkeer je niet automatisch Google Search. Google stelt expliciet dat Google-Extended geen invloed heeft op opname of ranking in Google Search. Voor AI Overviews en AI Mode binnen Google Search blijft Googlebot de relevante crawler.

Dit maakt Google-Extended interessant voor organisaties die normale SEO willen behouden, maar terughoudender zijn met Gemini-training of grounding buiten de reguliere Search-context.

En wat doe je met CCBot?

CCBot is de crawler van Common Crawl. Common Crawl bouwt een openbaar webcorpus met ruwe pagina-inhoud, metadata en tekstextracten dat door onderzoekers, bedrijven en andere partijen kan worden gebruikt. CCBot identificeert zich momenteel als CCBot/2.0 en respecteert robots.txt.

Blokkeren gaat eenvoudig:

User-agent: CCBot
Disallow: /

Hier is de afweging minder direct gekoppeld aan één zoekdienst. Toelaten vergroot de kans dat je openbare content terechtkomt in een breed herbruikbare dataset. Blokkeren geeft meer controle over toekomstige verzameling door Common Crawl, maar kan ook betekenen dat je content ontbreekt in datasets en systemen die deze bron later gebruiken.

Een robots.txt-wijziging haalt overigens geen materiaal terug dat al eerder is gecrawld of elders is opgeslagen.

Robots.txt is een voorkeurssignaal, geen beveiligingslaag

Een volledige blokkade gebruikt doorgaans Disallow: /; met Allow: / kan een crawler de hele site benaderen. Je kunt regels ook beperken tot specifieke directories. Het Robots Exclusion Protocol bepaalt dat de meest specifieke passende Allow- of Disallow-regel leidend is.

Maar robots.txt beschermt geen vertrouwelijke informatie. Het bestand is publiek en een kwaadwillende scraper kan de instructies simpelweg negeren. Voor daadwerkelijk afgeschermde content zijn authenticatie, autorisatie en eventueel WAF- of serverregels nodig. Ook een user-agent-string alleen bewijst niet dat een request echt van OpenAI, Google of een andere genoemde partij afkomstig is.

Een tweede belangrijk verschil: niet crawlen is niet altijd hetzelfde als niet vindbaar zijn. Een URL kan via andere bronnen bekend zijn zonder dat de inhoud gecrawld is. Wie content echt uit bepaalde zoekindexen wil houden, moet daarom ook de relevante noindex- en platformcontroles beoordelen.

Kies per doel, niet per AI-bedrijf

Voor veel zakelijke websites is een selectieve configuratie de meest rationele standaard. Je kunt bijvoorbeeld searchcrawlers zoals OAI-SearchBot, Claude-SearchBot en PerplexityBot toelaten om de kans op actuele bronvermeldingen te behouden, terwijl je GPTBot, ClaudeBot of Google-Extended afzonderlijk beoordeelt vanuit je beleid rond training en hergebruik.

Dat beleid hoeft bovendien niet voor de hele website gelijk te zijn. Openbare kennisbankartikelen kunnen een andere waarde hebben dan premium onderzoekscontent, klantportalen of materiaal waarop een licentiemodel rust.

Controleer de configuratie periodiek. De markt verandert snel, crawlernamen en functies kunnen veranderen en nieuwe user-agents verschijnen. Baseer productieconfiguraties daarom op de actuele documentatie van de betreffende operator, niet uitsluitend op een jaren geleden gekopieerde lijst met AI-bots.

Samengevat

Blokkeer AI-crawlers niet automatisch als één groep: training, AI-search en user-triggered fetching zijn verschillende functies. Voor AI-zichtbaarheid is het meestal logisch om relevante searchcrawlers toegang te geven en trainingcrawlers afzonderlijk te beoordelen. robots.txt geeft daarbij controle over compliant crawlers, maar is geen beveiligingsmechanisme en werkt niet met terugwerkende kracht. De beste configuratie volgt daarom uit je contentstrategie: wel gevonden worden waar dat waarde heeft, en gericht beperken waar hergebruik niet gewenst is.

Robots.txt checken?

Weet je zeker dat je robots.txt het juiste doet?

Neuralex legt een site langs 15+ GEO-checks — van crawler-toegang tot citeerbaarheid van de tekst — en levert een score met concrete reparaties, inclusief een robots.txt die traint uitsluit zonder je AI-zichtbaarheid te kosten.