Overzicht van de Academy
Geciteerd worden door AI

Hoe AI-crawlers werken

In één zin

AI-crawlers halen je ruwe HTML op zonder JavaScript uit te voeren en met korte time-outs, dus wat niet meteen in de broncode staat, bestaat voor hen niet.

Een AI-crawler is een programma dat namens een taalmodel je pagina ophaalt, de ruwe HTML leest en die tekst doorgeeft aan een index of aan een antwoord. Hij voert geen JavaScript uit, hij wacht niet lang en hij komt alleen binnen als je robots.txt en je firewall hem doorlaten.

Dat maakt de eisen anders dan bij Google. Googlebot heeft een aparte renderfase waarin hij een pagina alsnog opbouwt zoals een browser dat doet. De AI-crawlers doen dat niet. Vercel analyseerde het crawlerverkeer op het eigen netwerk en stelde vast dat geen van de grote AI-crawlers JavaScript uitvoert. GPTBot alleen was daarin goed voor 569 miljoen verzoeken in één maand.

Welke bots er langskomen

Elk platform stuurt eigen bots en die doen verschillende dingen. Het verschil kennen is nuttig, want je kunt ze los van elkaar sturen.

Bot Van wie Wat hij doet Blokkeren betekent
OAI-SearchBot OpenAI crawlt voor de zoekfunctie van ChatGPT je verdwijnt uit de zoekantwoorden
OAI-AdsBot OpenAI controleert landingspagina’s van advertenties in ChatGPT je advertentie wordt afgekeurd
GPTBot OpenAI verzamelt trainingsdata je materiaal gaat niet mee in een volgende training
ChatGPT-User OpenAI haalt een pagina op als een gebruiker daarom vraagt die losse ophaalactie mislukt
PerplexityBot Perplexity crawlt voor de antwoorden van Perplexity geen vermelding in Perplexity
ClaudeBot Anthropic haalt pagina’s op voor Anthropic geen representatie in Claude
Googlebot Google crawlt voor Zoeken, AI Overviews en AI Mode je verdwijnt uit Google
Google-Extended Google regelt gebruik voor Gemini-grounding en training minder aanwezigheid in Gemini, je zoekpositie blijft gelijk
Meta-ExternalAgent Meta verzamelt data voor Meta-modellen geen aanwezigheid in Meta-producten

OAI-AdsBot is er sinds ChatGPT advertenties verkoopt en die verdient aparte aandacht. In de advertentierichtlijnen van OpenAI staat dat je landingspagina bereikbaar moet zijn en de gebruikersagenten OAI-AdsBot en OAI-SearchBot niet mag blokkeren. Doe je dat wel, dan wordt je advertentie afgekeurd. Het vervelende is dat dezelfde blokkade je ook organisch raakt, want OAI-SearchBot bepaalt of ChatGPT je überhaupt kan aanhalen. Eén regel in je robots.txt kost je dan allebei de kanalen. Wat er verder bij adverteren komt kijken staat op de pagina over het OpenAI Ads-platform.

De keuze is niet automatisch “alles toelaten”. Sommige crawlers halen veel op en sturen niets terug. Uit metingen van crawlerverkeer uit 2026 springt Mistral eruit met 3.389 opgehaalde pagina’s per doorverwijzing die het terugstuurt en Meta-ExternalAgent heeft überhaupt geen product dat verkeer terugstuurt. Die weren is een verdedigbare kostenkeuze. OAI-SearchBot weren is dat zelden.

Waar het in de praktijk misgaat

Drie dingen kom ik het vaakst tegen en alle drie zijn ze onbedoeld.

De eerste is een blokkade die niemand heeft aangezet. Een CDN of firewall die onbekende user agents weert, houdt ook de AI-crawlers tegen. Van de duizend grootste sites blokkeert 25,2 procent GPTBot volledig en ik durf te wedden dat een deel daarvan het niet weet.

De tweede is client-side rendering. Een site gebouwd in een JavaScript-framework waarbij de tekst pas na het laden verschijnt, scoort prima in Google en is leeg voor ChatGPT, Claude en Perplexity. Je merkt het niet, want je eigen browser laat gewoon een volle pagina zien.

De derde is traagheid. AI-crawlers hanteren korte time-outs, door meerdere toolmakers geschat op één tot vijf seconden per pagina. Een pagina die daar overheen gaat wordt niet opgehaald en kan dus niet geciteerd worden. Onderzoek naar crawlbudget laat zien dat een snelle server de dagelijkse crawlfrequentie tot vier keer kan verhogen.

Zelf controleren, in twee minuten

Je hebt hier geen tool voor nodig. Vraag je pagina op zoals de bot dat doet:

curl -A "GPTBot" https://jouwdomein.nl/jouw-pagina/

Staan je kernfeiten in wat er terugkomt, dan kan de crawler ze lezen. Zie je vooral een skelet met scriptverwijzingen, dan hangt je content aan JavaScript en moet je die serverzijdig laten opbouwen.

Controleer daarnaast twee dingen. Kijk in je robots.txt of de bots die je wilt toelaten een expliciete regel hebben. En kijk in je serverlogs of ze daadwerkelijk binnenkomen, want een regel in robots.txt zegt niets over wat je firewall doet.

In die logs let je op drie dingen: welke user agents er langskomen, welke statuscode ze terugkrijgen en welke pagina’s ze ophalen. Een reeks 403-antwoorden aan OAI-SearchBot betekent dat je ergens een blokkade hebt staan die je robots.txt niet laat zien. Een crawler die alleen je homepage ophaalt en verder niets, komt je interne links waarschijnlijk niet door.

Een ding om niet uit het oog te verliezen: gecrawld worden en geciteerd worden zijn twee verschillende dingen. Een crawler die netjes binnenkomt bewijst alleen dat de deur openstaat. Wat er daarna gebeurt hangt af van je autoriteit en van de opbouw van je teksten. Daar gaat de rest van dit hoofdstuk over.

De rest van de toegangslaag

Nog twee dingen die tot dezelfde categorie horen.

Dode links kosten je citaties. ChatGPT stuit aantoonbaar vaker op verdwenen URL’s dan Google: 2,38 procent van de crawlpogingen tegenover 0,15 tot 0,84 procent bij Google. Verhuis je een pagina zonder een correcte 301-redirect, dan is een bestaande citatie in één klap waardeloos.

En indexatie in Bing is voor ChatGPT bijna een voorwaarde. De citaties van ChatGPT overlappen voor ruim 87 procent met de Bing-index. Bing Webmaster Tools aanzetten en IndexNow inschakelen, waarmee je nieuwe URL’s binnen seconden meldt, is een half uur werk met een direct effect op de snelheid waarmee je opgenomen wordt.

Dit alles is de toegangslaag: het bepaalt of je geciteerd kunt worden. Het bepaalt niet hoe vaak. Daarvoor heb je de dingen nodig die in waarom AI sommige sites citeert staan. De bredere technische inrichting komt aan bod in technische SEO voor AI. Het bestand waarmee je de crawlers stuurt staat in wat is robots.txt.

Wil je in één keer zien of de crawlers bij jou binnenkomen, dan kijkt de gratis AI-zichtbaarheidscheck daar als eerste naar.

Wil je dit laten uitvoeren in plaats van het zelf te doen, dan is dat het werk dat wij GEO-optimalisatie noemen.

Veelgestelde vragen

Voeren AI-crawlers JavaScript uit?

Nee. Vercel analyseerde het crawlerverkeer op het eigen netwerk en stelde vast dat geen van de grote AI-crawlers JavaScript uitvoert. GPTBot alleen was daarin goed voor 569 miljoen verzoeken in één maand. Googlebot is met zijn aparte renderfase de uitzondering. Content die pas in de browser wordt opgebouwd, is voor ChatGPT, Claude en Perplexity niet zichtbaar.

Welke crawler moet ik zeker toelaten?

OAI-SearchBot, als je in ChatGPT genoemd wilt worden. OpenAI stelt in de eigen documentatie dat wie deze bot blokkeert uit de zoekantwoorden verdwijnt. GPTBot verzamelt trainingsdata en die blokkeren kost je geen zoekzichtbaarheid, dus je kunt die keuze los maken.

Hoe controleer ik of een AI-crawler mijn pagina goed leest?

Met een curl-verzoek onder de user agent van de bot, bijvoorbeeld curl -A "GPTBot" gevolgd door je URL. Staan je kernfeiten in de teruggegeven HTML, dan kan de crawler ze lezen. Zie je vooral een leeg skelet met scripts, dan is je content afhankelijk van JavaScript en onzichtbaar voor deze bots.

Aan de slag

Weten hoe zichtbaar jij bent in AI?

Doe de gratis AI-zichtbaarheidscheck, of bekijk hoe we AI-vindbaarheid voor je aanpakken.