> Bron: https://neuralex.nl/blog/ai-crawlers-blokkeren-of-niet
> Alle AI-crawlers blokkeren is meestal te grof. GPTBot, ClaudeBot, PerplexityBot, Google-Extended en CCBot hebben elk een andere functie — hoe je robots.txt gericht instelt op training versus zichtbaarheid.

[Terug naar kennisbank](/blog)

GEO ·27 augustus 2026 ·7 min lezen

# Blokkeer je AI-crawlers of laat je ze binnen?

Alle AI-crawlers blokkeren is meestal te grof. GPTBot, ClaudeBot, PerplexityBot, Google-Extended en CCBot hebben elk een andere functie — hoe je robots.txt gericht instelt op training versus zichtbaarheid.

Voor een bedrijf dat via ChatGPT, Perplexity, Gemini en andere AI-systemen gevonden wil worden, is **alle AI-crawlers blokkeren meestal te grof**. Een betere aanpak is selectief: laat crawlers toe die je content nodig hebben voor zoeken, actuele antwoorden en bronverwijzingen, en bepaal afzonderlijk of je crawlers wilt toestaan die content verzamelen voor modeltraining of brede datasets.

Dat onderscheid is belangrijk, omdat één AI-bedrijf verschillende bots kan gebruiken voor verschillende doelen. OpenAI gebruikt bijvoorbeeld GPTBot voor content die mogelijk voor modeltraining wordt gebruikt en OAI-SearchBot voor ChatGPT Search. Anthropic maakt vergelijkbaar onderscheid tussen ClaudeBot, Claude-SearchBot en Claude-User. Wie alleen naar de bedrijfsnaam kijkt en alles blokkeert, kan daardoor onbedoeld ook zijn [AI-zichtbaarheid](/blog/geo-geciteerd-door-ai) beperken.

## Niet iedere AI-crawler doet hetzelfde

Traditioneel was de afweging rond `robots.txt` relatief overzichtelijk: wil je dat een zoekmachine een pagina crawlt of niet? Bij generatieve AI zijn er minstens drie verschillende functies.

Een **trainingcrawler** verzamelt webcontent die mogelijk wordt gebruikt om toekomstige modellen te ontwikkelen. Een **searchcrawler** bouwt of ondersteunt een zoekindex waarmee actuele bronnen gevonden kunnen worden. Daarnaast bestaan **user-triggered fetchers** die pas een pagina ophalen nadat een gebruiker daarom heeft gevraagd.

Dat verschil bepaalt de praktische afweging. Een bedrijf kan bezwaar hebben tegen opname van zijn artikelen in trainingsdata, maar tegelijkertijd graag geciteerd worden wanneer iemand in ChatGPT of Claude naar zijn expertise zoekt. Die twee doelen hoeven technisch niet altijd met elkaar in conflict te zijn.

## GPTBot blokkeren betekent niet automatisch verdwijnen uit ChatGPT

OpenAI is een duidelijk voorbeeld van die scheiding. `GPTBot` crawlt content die mogelijk kan bijdragen aan de training van generatieve foundation models. `OAI-SearchBot` is bedoeld om websites vindbaar en citeerbaar te maken in ChatGPT Search. OpenAI geeft expliciet aan dat een site OAI-SearchBot moet toelaten om content goed te kunnen laten opnemen in samenvattingen en snippets van zoekresultaten.

Wie training wil uitsluiten maar ChatGPT-zichtbaarheid wil behouden, kan daarom bijvoorbeeld dit gebruiken:

```
User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Allow: /
```

Daarnaast bestaat `ChatGPT-User`. Die wordt gebruikt voor bepaalde handelingen die door een gebruiker worden gestart, bijvoorbeeld wanneer ChatGPT een webpagina bezoekt naar aanleiding van een concrete vraag. Omdat zo'n request user-triggered is, kunnen gewone `robots.txt`\-regels niet in alle situaties op dezelfde manier van toepassing zijn.

De praktische conclusie is dus: **GPTBot blokkeren is een andere beslissing dan ChatGPT Search blokkeren.**

## ClaudeBot, Claude-SearchBot en Claude-User

Anthropic hanteert inmiddels eveneens aparte bots. `ClaudeBot` verzamelt publieke webcontent die mogelijk aan modeltraining kan bijdragen. `Claude-SearchBot` crawlt voor de kwaliteit van Claude's zoekfunctionaliteit, terwijl `Claude-User` wordt gebruikt wanneer Claude op verzoek van een gebruiker webcontent ophaalt. Anthropic waarschuwt dat het blokkeren van Claude-SearchBot de zichtbaarheid en nauwkeurigheid van je site in zoekresultaten binnen Claude kan verminderen.

Een organisatie die training wil beperken maar search wil behouden, kan dus kiezen voor:

```
User-agent: ClaudeBot
Disallow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /
```

De naam `anthropic-ai` komt nog regelmatig voor in lijsten met AI-crawlers en oude `robots.txt`\-voorbeelden. Anthropic noemt deze token echter niet meer in zijn actuele officiële overzicht; daar staan ClaudeBot, Claude-SearchBot en Claude-User. Behandel `anthropic-ai` daarom hooguit als een legacy-regel en niet als vervanging voor de huidige Anthropic-tokens.

## PerplexityBot is vooral een zoekcrawler

Bij Perplexity ligt de afweging anders. `PerplexityBot` is bedoeld om pagina's te indexeren en websites als bronnen in Perplexity-resultaten te kunnen tonen. Volgens Perplexity wordt deze crawler niet gebruikt voor het pretrainen van foundation models.

Voor een bedrijf dat GEO- en AI-zichtbaarheid belangrijk vindt, is het blokkeren van PerplexityBot daarom een vrij directe afweging: je beschermt de pagina tegen deze indexeringscrawler, maar maakt het tegelijkertijd moeilijker voor Perplexity om de inhoud als actuele bron te verwerken.

Perplexity gebruikt daarnaast `Perplexity-User` voor verzoeken die door gebruikers worden geïnitieerd. Volgens de documentatie negeert deze fetcher `robots.txt` in het algemeen omdat de gebruiker zelf het ophalen van de informatie heeft veroorzaakt.

## Google-Extended is niet hetzelfde als Googlebot

Bij Google is het onderscheid extra belangrijk. `Google-Extended` is geen normale crawler met een eigen HTTP-user-agent. Het is een `robots.txt`\-producttoken waarmee website-eigenaren kunnen aangeven of door Google gecrawlde content mag worden gebruikt voor toekomstige Gemini-modellen en voor bepaalde vormen van grounding in Gemini Apps en Vertex AI.

Je kunt dus bijvoorbeeld schrijven:

```
User-agent: Google-Extended
Disallow: /
```

Daarmee blokkeer je **niet automatisch Google Search**. Google stelt expliciet dat Google-Extended geen invloed heeft op opname of ranking in Google Search. Voor AI Overviews en AI Mode binnen Google Search blijft Googlebot de relevante crawler.

Dit maakt Google-Extended interessant voor organisaties die normale SEO willen behouden, maar terughoudender zijn met Gemini-training of grounding buiten de reguliere Search-context.

## En wat doe je met CCBot?

`CCBot` is de crawler van Common Crawl. Common Crawl bouwt een openbaar webcorpus met ruwe pagina-inhoud, metadata en tekstextracten dat door onderzoekers, bedrijven en andere partijen kan worden gebruikt. CCBot identificeert zich momenteel als `CCBot/2.0` en respecteert `robots.txt`.

Blokkeren gaat eenvoudig:

```
User-agent: CCBot
Disallow: /
```

Hier is de afweging minder direct gekoppeld aan één zoekdienst. Toelaten vergroot de kans dat je openbare content terechtkomt in een breed herbruikbare dataset. Blokkeren geeft meer controle over toekomstige verzameling door Common Crawl, maar kan ook betekenen dat je content ontbreekt in datasets en systemen die deze bron later gebruiken.

Een `robots.txt`\-wijziging haalt overigens geen materiaal terug dat al eerder is gecrawld of elders is opgeslagen.

## Robots.txt is een voorkeurssignaal, geen beveiligingslaag

Een volledige blokkade gebruikt doorgaans `Disallow: /`; met `Allow: /` kan een crawler de hele site benaderen. Je kunt regels ook beperken tot specifieke directories. Het Robots Exclusion Protocol bepaalt dat de meest specifieke passende `Allow`\- of `Disallow`\-regel leidend is.

Maar `robots.txt` beschermt geen vertrouwelijke informatie. Het bestand is publiek en een kwaadwillende scraper kan de instructies simpelweg negeren. Voor daadwerkelijk afgeschermde content zijn authenticatie, autorisatie en eventueel WAF- of serverregels nodig. Ook een user-agent-string alleen bewijst niet dat een request echt van OpenAI, Google of een andere genoemde partij afkomstig is.

Een tweede belangrijk verschil: **niet crawlen is niet altijd hetzelfde als niet vindbaar zijn**. Een URL kan via andere bronnen bekend zijn zonder dat de inhoud gecrawld is. Wie content echt uit bepaalde zoekindexen wil houden, moet daarom ook de relevante `noindex`\- en platformcontroles beoordelen.

## Kies per doel, niet per AI-bedrijf

Voor veel zakelijke websites is een selectieve configuratie de meest rationele standaard. Je kunt bijvoorbeeld searchcrawlers zoals OAI-SearchBot, Claude-SearchBot en PerplexityBot toelaten om de kans op actuele bronvermeldingen te behouden, terwijl je GPTBot, ClaudeBot of Google-Extended afzonderlijk beoordeelt vanuit je beleid rond training en hergebruik.

Dat beleid hoeft bovendien niet voor de hele website gelijk te zijn. Openbare [kennisbankartikelen](/blog/gevonden-worden-door-ai-assistenten) kunnen een andere waarde hebben dan premium onderzoekscontent, klantportalen of materiaal waarop een licentiemodel rust.

Controleer de configuratie periodiek. De markt verandert snel, crawlernamen en functies kunnen veranderen en nieuwe user-agents verschijnen. Baseer productieconfiguraties daarom op de actuele documentatie van de betreffende operator, niet uitsluitend op een jaren geleden gekopieerde lijst met AI-bots.

## Samengevat

Blokkeer AI-crawlers niet automatisch als één groep: training, AI-search en user-triggered fetching zijn verschillende functies. Voor AI-zichtbaarheid is het meestal logisch om relevante searchcrawlers toegang te geven en trainingcrawlers afzonderlijk te beoordelen. `robots.txt` geeft daarbij controle over compliant crawlers, maar is geen beveiligingsmechanisme en werkt niet met terugwerkende kracht. De beste configuratie volgt daarom uit je contentstrategie: **wel gevonden worden waar dat waarde heeft, en gericht beperken waar hergebruik niet gewenst is.**

Robots.txt checken?

## Weet je zeker dat je robots.txt het juiste doet?

Neuralex legt een site langs 15+ GEO-checks — van crawler-toegang tot citeerbaarheid van de tekst — en levert een score met concrete reparaties, inclusief een robots.txt die traint uitsluit zonder je AI-zichtbaarheid te kosten.

[Bekijk de diensten](/diensten/) [Zie de agent-showcase](/showcase/agent/)

---
Volledige (opgemaakte) versie: https://neuralex.nl/blog/ai-crawlers-blokkeren-of-niet
