ChatGPT heeft een intern systeem voor bronkeuze dat je in de antwoorden nooit ziet

Suganthan Mohanadasan, co-founder van Snippet Digital, deed iets wat de meeste ‘AI SEO’-studies niet doen: hij keek niet naar de output van ChatGPT, maar las het ruwe JSON-verkeer dat de browser ontvangt. Wat hij vond, verandert hoe je naar GEO moet kijken.

Het veld dat alles bepaalt: result_source

Elk webresultaat dat ChatGPT ophaalt, krijgt een intern label via het veld result_source. Dat label heeft vier mogelijke waarden, en die vertellen je precies via welke pipeline een bron binnenkomt:

  • serp: open web, vooral nieuwssites
  • labrador: een allowlist van gevestigde uitgevers. Reuters, The Guardian, WSJ, Wikipedia, arXiv. Snippets lopen op tot circa 1.080 tekens, wat neerkomt op bijna complete artikelextracten. Dit lijkt een gelicentieerde tier, want meerdere van deze uitgevers hebben content deals met OpenAI afgesloten.
  • bright: Bright Data, een commerciële web scraper. Dominant bij shopping, finance en lokale zoekopdrachten. Reddit, Forbes en vergelijkingssites zoals rtings vallen hieronder.
  • oxylabs: Oxylabs, een concurrent van Bright Data. Regionaal en lokaal nieuws, zoals Khaleej Times en Gulf News.

Dit zijn structurele bevindingen, rechtstreeks van het netwerk afgelezen. Of percentages kloppen is een ander verhaal: Suganthan werkte met een paar dozijn zoekopdrachten op zijn eigen Pro-account, gericht op SaaS en tech. Richtinggevend, geen bevolkingsstudie.

Eén mechanisch patroon dat hij ook vaststelde: puur tekst-queries triggeren helemaal geen webcrawl. En de ‘Thinking’-modus vuurt tientallen sub-queries af, inclusief site:-checks en prijsverificatie.

Wat dit betekent voor Nederlandse marketeers

Ik zie dit soort onderzoek zelden gedaan worden op dit niveau van technische precisie, en het legt een pijnlijk punt bloot. De meeste GEO-adviezen die rondgaan, zijn gebouwd op output-analyse: iemand kijkt welke merken ChatGPT noemt en trekt daar conclusies uit. Maar de machine heeft een eigen laag die die output aanstuurt, en die was tot nu toe goeddeels onzichtbaar.

Praktisch gezien: als je niet Reuters of The Guardian bent, zit je in de bright of oxylabs pipeline. Dat betekent dat je afhankelijk bent van wat commerciële scrapers oppikken. Structured data, crawlbaarheid en duidelijke attribuutinformatie worden dan extra relevant, want de scraper beslist wat er meekomt.

Reddit blijft opduiken als zwaargewicht, en dat is geen toeval. Reddit pakt na de mei core update in elke niche meer top 3-posities af, en het onderzoek van Suganthan geeft daar een technische verklaring bij: Reddit levert tekst, YouTube niet. Video-metadata wordt simpelweg niet geciteerd.

Check ook of je site technisch schoon is voor geautomatiseerde fetches. Als Cloudflare of een andere bot-bescherming geautomatiseerde browsers blokkeert, is de kans aanwezig dat scrapers je content mislopen. Dat is niet iets wat je in Search Console ziet, maar het raakt wel je GEO-zichtbaarheid direct.

Bron: Search Engine Journal