August Vonk
Methode

Een AI-visibilityscore is geen ranking. Het is een kansverdeling.

August Vonk
Kort antwoordAI-antwoorden zijn probabilistisch: dezelfde vraag levert vaak andere bronnen op, tot 68% verandering tussen twee checks bij Google AI Mode. Een visibilityscore is daarmee een steekproef, geen positie. Meet daarom hoe vaak je verschijnt over veel prompts en herhalingen, in plaats van een gemiddelde rang, en wees expliciet over welk deel van de funnel je meet: retrieval, citation, mention of recommendation.
Drie panelen: dezelfde CRM-vraag levert bij ChatGPT, Claude en Gemini een andere bronmix op; een staafgrafiek toont hoeveel bronnen tussen twee checks veranderen, van 68% bij Google AI Mode tot 25% bij Perplexity; en een keten van retrieved via used en cited naar displayed.Drie panelen: dezelfde CRM-vraag levert bij ChatGPT, Claude en Gemini een andere bronmix op; een staafgrafiek toont hoeveel bronnen tussen twee checks veranderen, van 68% bij Google AI Mode tot 25% bij Perplexity; en een keten van retrieved via used en cited naar displayed.
Dezelfde vraag levert bij drie assistenten een andere bronmix op, en tussen twee metingen verandert een groot deel van de bronnen opnieuw.

SEO heeft ons slechte gewoontes aangeleerd. Niet omdat SEO slecht is, maar omdat rankings heerlijk deterministisch voelen.

Je opent een rank tracker. Keyword X: positie 3. Morgen: positie 4. Vervelend, maar begrijpelijk.

AI Search ziet er in een dashboard vaak hetzelfde uit. Prompt: “welke CRM’s zijn het beste voor Nederlandse scale-ups?”. Jouw visibility: positie 4. Mooi.

Alleen bestaat die positie misschien helemaal niet.

Stel exact dezelfde vraag nog een keer

En ineens verandert de bron. Of de volgorde. Of de merken. Of het complete antwoord.

Dat is geen bug. Generatieve systemen zijn probabilistisch. Daarnaast kunnen ze andere fan-out queries genereren, andere bronnen ophalen, een andere retrievalpipeline kiezen, andere passages selecteren, andere informatie synthetiseren en uiteindelijk andere citations tonen.

Een analyse van meer dan 20.000 herhaalde AI-antwoorden liet zien hoeveel cited sources tussen metingen konden veranderen.

Hoeveel van de geciteerde bronnen veranderen bij een volgende check?Zelfde vraag, opnieuw gesteld
  • Google AI Mode68%
  • Gemini48%
  • Claude45%
  • ChatGPT35%
  • Perplexity25%
Bron: SurfacedBy, juli 2026. Meer dan 20.000 antwoorden.Internationale studie. Perplexity was relatief stabiel, Google AI Mode bepaald niet.

Een visibility score is een sample, geen waarheid.

Retrieval is niet hetzelfde als citation

Hier gaat veel GEO-measurement mis. We behandelen een zichtbare bronlink alsof die het hele systeem beschrijft. Maar conceptueel moet je minstens vier dingen uit elkaar trekken: retrieved, used, cited en displayed.

Een pagina kan worden opgehaald maar niet gebruikt. Een pagina kan worden gebruikt om een antwoord te construeren maar niet als bron eindigen. Een citation kan intern gekoppeld zijn maar door de interface niet goed weergegeven worden.

En dat laatste zagen we letterlijk gebeuren op 2 en 3 september 2026. Google rolde Gemini 3.8 Flash uit naar AI Mode voor Pro- en Ultra-gebruikers. Kort daarna merkten SEO’s dat bepaalde AI Mode-antwoorden vrijwel geen links of citations meer lieten zien. Google bevestigde vervolgens dat dit niet de bedoeling was en kondigde een fix aan. De links verschenen kort daarna weer.

Dat is een fantastisch meetkundig voorbeeld. Als je GEO-dashboard die dag alleen zichtbare citations telde, kon je concluderen dat je visibility was ingestort. Terwijl het probleem deels simpelweg in de displaylaag zat.

Niet alles wat je meet is ranking. Soms meet je de UI.

AI Search gebruikt bovendien een ander internet

Een academische studie uit maart 2026 maakt dit nog duidelijker. Onderzoekers analyseerden 11.000 echte zoekopdrachten over SearchGPT, Google AI Overviews, traditionele Google Search en vanilla GPT, en vergeleken onder andere de 100 meest geciteerde domeinen.

Hoeveel van de top-100 domeinen delen deze systemen?Overlap in meest geciteerde domeinen, 11.000 zoekopdrachten
  • Google AI Overviews versus traditionele Google68%
  • SearchGPT versus traditionele Google25%
  • SearchGPT versus Google AI Overviews24%
Bron: Huang et al., Answer Bubbles: Information Exposure in AI-Mediated Search, 2026.Internationale studie.

Dat is gigantisch. We praten dus niet over Google rankings met een AI-laagje eroverheen. We praten over systemen die tot compleet verschillende source sets kunnen komen.

En zelfs AI-engines onderling zijn het nauwelijks eens

Writesonic analyseerde in 2026 ruim 161.000 prompts over ChatGPT, Gemini, Perplexity en AI Overviews. Slechts 3,8% van de bronnen verscheen bij alle vier engines. Ongeveer 72 tot 73% van alle cited domains verscheen maar bij één engine.

Dus een dashboard dat vier engines mengt tot “your AI visibility score: 47” maakt iets heel ingewikkelds heerlijk overzichtelijk. Misschien iets té overzichtelijk.

Een betere manier: behandel visibility als waarschijnlijkheid

Voor klassieke search kun je redelijk zinvol vragen: waar ranken we? Voor AI Search zou ik vaker vragen: hoe vaak verschijnen we?

Bijvoorbeeld een promptcluster “CRM software Nederland”, 50 prompts, 5 runs per prompt, 250 antwoorden. Dan kun je meten:

  • brand mention probability
  • citation probability
  • recommendation probability
  • share of voice
  • sentiment
  • source share
  • engine-specific visibility

Dan krijg je bijvoorbeeld “brand mentioned in 38% of answers, plus of min de variatie”. Dat vertelt mij veel meer dan “gemiddelde AI-rank: 3,7”.

Betekent dit dat iedere prompt tien keer moet worden gedraaid?

Niet noodzakelijk. Hier wordt het interessant. Als je maar vijf prompts meet, heb je veel herhaalde samples nodig. Als je honderden representatieve prompts meet, kan de portfolio zelf al veel volatiliteit gladstrijken.

Hetzelfde principe kennen we uit surveys. Je hoeft niet één persoon duizend keer dezelfde vraag te stellen. Je hebt liever een goede steekproef.

Kleine promptset

Herhaal prompts meerdere keren en op verschillende dagen.

Grote, representatieve promptportfolio

Eén of enkele dagelijkse runs kunnen al een stabieler merkbeeld geven.

Belangrijke high-value prompts

Meet ze apart én vaker. Denk aan “beste leverancier”, “X versus Y”, “welk bureau raden jullie aan” en “alternatieven voor X”. Daar zit commerciële waarde, dus daar wil ik de variantie begrijpen.

Het negenstappenmodel dat ik hiervoor nuttig vind

Ivana Drakulevska beschrijft AI visibility niet als één rankingprobleem, maar als een funnel. Ik vind dat een veel nuttiger model.

  1. Accessibility. Kan de crawler je überhaupt openen?
  2. Discovery. Weet het systeem dat je pagina of merk bestaat?
  3. Retrieval. Word je opgehaald voor relevante searches of fan-outs?
  4. Selection. Wordt jouw informatie gekozen uit alle retrieved candidates?
  5. Synthesis. Wordt je informatie daadwerkelijk verwerkt in het antwoord?
  6. Entity representation. Begrijpt het systeem wie jouw merk is en wat het doet?
  7. Citation. Wordt jouw bron zichtbaar gekoppeld?
  8. Recommendation. Wordt je merk daadwerkelijk aanbevolen?
  9. User action. Doet de gebruiker daarna iets? Klik, zoekopdracht, direct visit, lead, aankoop.

Dat zijn negen verschillende plekken waarop visibility verloren kan gaan. En toch is het standaard GEO-advies vaak “voeg meer FAQs toe”. Dat is ongeveer alsof een auto niet start en de garage adviseert de stoelen opnieuw te bekleden.

Zo diagnoseer ik het liever

Geen retrieval

Controleer crawlability, rendering, robots, indexatie, interne links, informatiearchitectuur en fan-out coverage. Niet je FAQ-schema.

Wel retrieval, geen citation

Kijk naar informatiedichtheid, primaire bronnen, originaliteit, betrouwbaarheid en hoe direct de passage het subprobleem beantwoordt.

Wel citation, geen brand mention

Dit is mogelijk een entity- en attributionprobleem. Koppel unieke data duidelijk aan je merk en zorg dat hetzelfde verhaal ook extern terugkomt.

Wel mention, geen recommendation

Nu praat je over reputatie, reviews, productkwaliteit, onafhankelijke aanbevelingen, category authority en positioning. Schema gaat je product hier niet beter maken.

Wel recommendation, geen action

Dan begint ouderwetse marketing weer. Positionering, propositie, prijs, UX, conversie. Gelukkig.

Stop met AI visibility behandelen als rank tracking 2.0

Rank tracking werkte omdat zoekresultaten relatief stabiele geordende lijsten waren. AI-antwoorden zijn gegenereerde outputs van systemen met meerdere retrieval-, selectie- en synthesestappen. Dat vraagt om andere statistiek, andere dashboards en vooral andere verwachtingen.

Mijn belangrijkste vraag bij iedere AI-visibilitytool is niet welke score we krijgen, maar hoeveel waarnemingen achter die score zitten, hoeveel het resultaat varieert en welk onderdeel van de funnel we eigenlijk meten.

Als het antwoord daarop niet duidelijk is, heb je misschien geen KPI. Je hebt een screenshot met decimalen.

Veelgestelde vragen

Waarom veranderen mijn AI-resultaten steeds?

Omdat generatieve systemen probabilistisch zijn en per run andere fan-out queries, bronnen en passages kunnen kiezen. In een analyse van meer dan 20.000 herhaalde antwoorden veranderde 68% van de bronnen bij Google AI Mode tussen twee checks, tegen 25% bij Perplexity.

Moet ik elke prompt tien keer draaien?

Niet per se. Bij een kleine promptset heb je herhaalde runs nodig; bij een grote, representatieve portfolio strijkt de steekproef zelf al veel volatiliteit glad. Belangrijke commerciële prompts meet je apart én vaker.

Is een citation hetzelfde als zichtbaarheid?

Nee. Retrieved, used, cited en displayed zijn vier verschillende dingen. In september 2026 verdwenen citations tijdelijk uit AI Mode door een displaybug, niet door een zichtbaarheidsdaling.

Bronnen

  1. Answer Bubbles: Information Exposure in AI-Mediated SearchHuang et al.
  2. 161.286-prompt citation overlap studyWritesonic
  3. Repeated citation study, 20.000+ antwoordenSurfacedBy
  4. Gemini 3.8 Flash citation bugGoogle / Search Engine Land
  5. AI visibility funnel frameworkIvana Drakulevska