AI-crawlers komen, maar de waarde blijft vaag

AI-bots bezoeken steeds meer sites, maar of ze iets opleveren is een eerlijke vraag. Referral traffic vanuit LLMs is laag, je IP wordt gegraasd zonder compensatie, en toch volledig blokkeren voelt als jezelf onzichtbaar maken voor de toekomst. Helen Pollitt, Head of SEO bij Getty Images, legt uit hoe je hier verstandig mee omgaat.

Drie soorten AI-crawlers, drie verschillende afwegingen

Niet alle AI-bots zijn hetzelfde, en dat is precies waarom een one-size-fits-all beslissing hier niet werkt.

AI training bots zoals GPTBot halen content op om modellen mee te trainen. Ze sturen geen traffic terug. Je content verdwijnt in een kennisbank en de gebruiker bezoekt jouw site nooit. Vooral voor publishers en sites met unieke data is dit een reëel risico.

Search indexing bots zoals OAI-SearchBot doen iets wat dichter bij traditionele zoekmachines ligt: ze indexeren pagina’s om ze te kunnen citeren in AI-antwoorden. Als je in AI Overviews of LLM-antwoorden geciteerd wilt worden, heb je deze bots nodig.

User-triggered fetches zoals ChatGPT-User worden geactiveerd als een gebruiker expliciet naar jouw site vraagt. Dat is een sterk signaal: iemand kent je merk al en wil meer weten. Dat is waardevolle funnel-informatie.

robots.txt werkt niet meer voor alle bots

Hier wordt het technisch relevant. OpenAI heeft zijn documentatie aangepast: ChatGPT-User respecteert robots.txt niet langer. Perplexity-User doet hetzelfde. Dat betekent dat je voor user-triggered bots niet meer kunt vertrouwen op de klassieke robots.txt-aanpak.

Wil je die bots echt buiten de deur houden, dan moet je op WAF-niveau blokkeren, via Cloudflare of AWS bijvoorbeeld, of via directe serverregels. Dat is een gesprek met je infrastructuurteam, maar als SEO kun je alvast uitzoeken welke opties jouw tech stack biedt.

Blokkeren of niet: mijn mening

Ik zie dit vaak misgaan bij klanten: ze blokkeren alles uit voorzorg, zonder te meten wat ze opgeven. Dat is te kort door de bocht. Botverkeer overtreft inmiddels menselijk webverkeer, dus dit speelt bij iedereen.

Mijn advies: begin met meten. Check in je server logs welke AI-bots langskomen, hoeveel crawl budget ze verbruiken, en of er referral traffic of citaties uit voortkomen. Koppel dat aan je Analytics en kijk of je LLM-gedreven bezoeken kunt isoleren.

Daarna kun je een gedifferentieerde keuze maken: training bots van partijen die geen traffic sturen blokkeer je misschien via WAF, search indexing bots laat je door, en user-triggered fetches ook, want die vertegenwoordigen echte gebruikersinteresse.

Volledig blokkeren is nu misschien veilig, maar als LLMs de primaire discovery-methode worden, sta je met lege handen. En als jij niet geciteerd wordt, is een concurrent dat wel.

Bron: Search Engine Journal