Je AI-visibility dashboard liegt niet, maar het overdrijft wel

Nieuw onderzoek van IQRush, gepubliceerd op 11 april, laat zien dat de cijfers op je AI-visibility dashboard in de meeste gevallen statistisch ruis zijn. Een tweede studie van onderzoekers aan de Universiteit van St. Gallen bevestigt hetzelfde onafhankelijk: één meting is onbetrouwbaar, je moet een engine herhaaldelijk bevragen voordat de uitkomst iets zegt.

Wat er precies aan de hand is

SearchGPT, Gemini en Perplexity bouwen bewust willekeur in hun antwoorden. Dezelfde vraag levert elke keer andere bronnen op. Die 8,4% citatieshare op je scherm is dus geen feit, het is één trekking uit een continue kansverdeling. Het concrete voorbeeld uit het onderzoek maakt het helder: Tom’s Guide scoorde 9,5% op running gear bij SearchGPT, Runner’s World 6,0%. Op het dashboard lijkt Tom’s Guide te winnen. Maar de marges overlappen, dus het verschil is statistisch niet verdedigbaar.

Voor een ranking betrouwbaar wordt, moeten twee dingen tegelijk kloppen. De volgorde moet stoppen met veranderen naarmate je meer samples toevoegt, én de koplopers moeten ver genoeg uit elkaar liggen om het verschil groter dan de foutmarge te laten zijn. Uit 30 platform-topic tests bleek dat je daarvoor tussen de 33 en 94 antwoorden nodig hebt, alleen antwoorden mét citaties meegeteld. Drie van die dertig tests bereikten dit punt nooit, zelfs niet na 125 vragen. Allemaal op SearchGPT, waar de topsites te dicht op elkaar zaten.

Er is ook een platformverschil dat je niet verwacht. Gemini stapelt citaties op dezelfde paar sites binnen één antwoord, dus je leert per antwoord weinig nieuws. SearchGPT geeft minder citaties maar spreidt ze meer, waardoor elk antwoord meer onafhankelijke informatie oplevert. Hetzelfde aantal antwoorden op twee engines koopt je dus een heel andere zekerheid.

Wat dit voor jou betekent

Ik zie dit soort fouten regelmatig bij klanten: een content refresh, daarna een stijging van drie punten in citatieshare, en meteen de conclusie dat het werkt. Maar die drie punten kunnen gewoon de natuurlijke variatie zijn tussen twee losse metingen. Je hebt een meting vóór én na nodig, en beide meerdere keren.

Check bij je AI-visibility tool of die meer dan één run draait en een range rapporteert. Krijg je één schone getal, beschouw dat dan als een waarschuwing, niet als bevestiging. En voor Bing: daar kun je inmiddels Citation Share terugvinden in Webmaster Tools, maar ook die data heeft dit probleem als er maar één sample achter zit.

De eerlijke uitkomst is soms dat je het nog niet kunt zeggen. Een tracker die “onvoldoende data” kan rapporteren is meer waard dan één die altijd een zelfverzekerde ranking print. Behandel de top van de lijst als verdedigbaar, de staart als ruis, en publiceer nooit exacte posities ver buiten de kopgroep.

Bron: Search Engine Journal