ChatGPT-fetchbot bereikt pagina’s die hem verboden zijn

Data uit het TollBit State of the Bots-rapport over de eerste helft van 2026 laat zien dat ChatGPT-User de bot is die op de meeste sites disallowed pagina’s heeft bereikt. Tegelijkertijd is het de bot die door meer sites geblokkeerd wordt dan welke andere AI-fetchbot ook. Dat klinkt tegenstrijdig, en dat is het ook.

Wat er precies aan de hand is

Onder de Europese sites in het rapport bereikte ongeveer 15% van de geïdentificeerde AI-fetchbots URL’s die als disallowed waren gemarkeerd. ChatGPT-User, Bytespider en Youbot bereikten elk disallowed pagina’s op bijna de helft van de Europese sites die hen expliciet hadden geblokkeerd. ChatGPT-User sprong er daarin het meest uit.

De verklaring staat in OpenAI’s eigen crawlerdocumentatie: ChatGPT-User bezoekt een pagina wanneer een gebruiker er expliciet om vraagt. Omdat die actie door een mens wordt geïnitieerd, stelt OpenAI dat robots.txt-regels mogelijk niet van toepassing zijn. Perplexity hanteert hetzelfde argument voor Perplexity-User. Anthropic neemt een ander standpunt in en zegt dat al zijn bots het bestand respecteren.

Hier zit een subtiliteit die ik vaak mis zie gaan: de bot die bepaalt of jouw site in ChatGPT-zoekresultaten verschijnt, heet OAI-SearchBot, niet ChatGPT-User. Als je beide blokkeert om AI-verkeer te weren, geef je je zichtbaarheid op maar houd je een fetch-blokkade over die OpenAI zelf als niet-bindend beschouwt. Je betaalt twee keer, zonder garantie.

Dit is ook relevant in de bredere context van botverkeer dat voor het eerst menselijk webverkeer overtreft: de druk op je server logs en je contentafschermingsstrategie neemt alleen maar toe.

Wat dit voor jou betekent

Robots.txt was altijd al een afspraak, geen slot op de deur. Maar dit is de eerste keer dat een grote speler dat zo expliciet in eigen documentatie opschrijft en het koppelt aan een redenering over gebruikersintentie. Het “user-initiated loophole” waar het artikel over spreekt, is nu het standaardmodel voor alle grote AI-assistenten, want ze halen allemaal pagina’s op bij vragen van gebruikers.

Mijn advies: kijk in je server logs of CDN-records wat er daadwerkelijk binnenkomt. Robots.txt toont wat je gevraagd hebt, de logs tonen wat er echt is gebeurd. Check dit gewoon even, dan zie je het zelf.

Cloudflare speelt hier op in: vanaf 15 september worden op nieuwe domeinen training- en agentcrawlers standaard geblokkeerd op pagina’s met advertenties, maar zoekcrawlers blijven toegestaan. Dat is handhaving op netwerkniveau, wat betekent dat compliance niet langer afhankelijk is van de crawler zelf.

Als je content serieus wilt afschermen van AI-fetchbots, is robots.txt onvoldoende. Authenticatiewalls, IP-blokkades of Cloudflare-instellingen zijn je echte opties. En als je juist zichtbaar wilt zijn in AI-antwoorden, lees dan ook wat er bekend is over hoe llms.txt-bestanden in de praktijk worden gelezen, want ook die verwachtingen zijn bijstelling waard.

Bron: Search Engine Journal