Wat er aan de hand is

Google’s John Mueller en Martin Splitt hebben uitgelegd wat er gebeurt als spammers de zoekfunctie van een website misbruiken om op grote schaal spammy pagina’s te genereren. Het korte antwoord: Google kan die pagina’s als gehackt beschouwen en ze beïnvloeden je site quality. Check dit gewoon even in je Search Console, dan zie je het zelf.

Hoe dit precies werkt

Virtually elke website heeft een zoekbalk. Typ je daar iets in, dan genereert die zoekbalk een pagina met een eigen URL die die zoekterm bevat. Logisch, maar ook gevaarlijk: een spammer kan dit systematisch uitbuiten door duizenden zoekopdrachten te doen met spammy keywords, merknamen of telefoonnummers. Als die gegenereerde pagina’s indexeerbaar zijn, heb je een probleem.

Mueller zegt het zelf: je website wordt in dat geval “een vector voor andere mensen om te spammen”. De spammer hoeft niets te hacken, jouw eigen zoekfunctie doet het werk voor hem.

Nog een complicatie die Splitt noemt: sommige zoekimplementaties creëren een oneindige “crawl space”. De crawler bezoekt een zoekpagina, die triggert een “bedoelde je dit?”-link, die weer een nieuwe pagina genereert, enzovoort. Dat vreet je crawl budget op en gooit extra belasting op je server.

Mueller voegt daar aan toe dat Google algoritmisch wél een deel van deze pagina’s kan blokkeren, maar raadt af om daar op te vertrouwen. Jij moet dit zelf oplossen.

Wat je nu moet doen

Mueller en Splitt geven twee oplossingen, waarbij robots.txt hun duidelijke voorkeur heeft boven noindex:

  • Blokkeer crawling via robots.txt. Gebruik zo’n breed mogelijke regel die alle varianten van je zoek-URL’s afdekt. Dit lost tegelijk het crawl budget-probleem, de serverbelasting en het oneindige crawl space-probleem op.
  • Noindex als backup. Minder schoon dan robots.txt, maar beter dan niets.

Mijn advies: kijk nu even hoe jouw interne zoekfunctie URL’s opbouwt. Meest voorkomende patronen zijn ?s=, ?q= of /search?query=. Staan die URL’s niet geblokkeerd in je robots.txt en zijn ze indexeerbaar? Dan heb je een lek. Ik zie dit bij klanten vaker over het hoofd worden gezien, juist omdat het niet als een technisch SEO-probleem voelt. Het is er wel een.

Controleer daarna ook je Search Console op meldingen over gehackte content. Als spammers jouw zoekfunctie al hebben misbruikt, kan Google die pagina’s al hebben geflagd, precies zoals Mueller beschrijft.

Kort samengevat: interne zoekpagina’s horen nooit in de index thuis. Regel het met robots.txt, doe het breed, en doe het nu.

Bron: Search Engine Journal