Overzicht van de Academy
Meten en bewijzen

Bandbreedtes lezen in plaats van puntscores

In één zin

Een bandbreedte laat zien binnen welke marge je werkelijke zichtbaarheid ligt en twee metingen verschillen pas echt als hun bandbreedtes elkaar niet meer overlappen.

Een bandbreedte lees je als de reeks waarden waarbinnen je werkelijke AI-zichtbaarheid waarschijnlijk ligt, met het gemeten getal als de meest waarschijnlijke waarde daarbinnen.

Staat er “34 procent, bandbreedte 28 tot 41 procent”, dan is 34 je beste schatting en zegt de meting erbij dat de waarheid ergens tussen 28 en 41 ligt. Zou je de hele meting morgen opnieuw doen met een andere greep uit dezelfde soort vragen, dan kwam er waarschijnlijk een ander getal uit dat nog steeds in die marge past.

Waarom een score altijd een marge heeft

Je meet AI-zichtbaarheid met een steekproef. Een aantal vragen uit een veel grotere verzameling mogelijke vragen, elk een paar keer gesteld, over een aantal dagen. Uit die steekproef komt een percentage.

Dat percentage is een schatting van iets wat je niet direct kunt zien: de kans dat een model jouw merk noemt als iemand een vraag uit jouw categorie stelt. Elke schatting op basis van een steekproef heeft een marge en bij taalmodellen is die marge groter dan gebruikelijk, omdat de modellen zelf ook variëren. De kans dat twee identieke vragen dezelfde merkenlijst opleveren is kleiner dan 1 op 100 (SparkToro en Gumshoe.ai, 2.961 runs, november en december 2025).

Een arXiv-preprint over meetonzekerheid in AI-zichtbaarheid rekende dit door met bootstrap-analyse en kwam tot de conclusie dat veel schijnbare verschillen tussen domeinen binnen de ruis van het meetproces zelf vallen. Cijfers uit één run geven volgens dezelfde publicatie “a misleadingly precise picture”.

Hoe je twee metingen vergelijkt

De vraag die je bij elke rapportage stelt is of het verschil groter is dan de onzekerheid. Een voorbeeld, met cijfers die ik ter illustratie kies:

Meting Score Bandbreedte Wat je mag zeggen
Januari 31 procent 25 tot 38 Dit is je startpunt
Februari 34 procent 28 tot 41 De marges overlappen bijna volledig, dus nog niets
April 44 procent 38 tot 51 Geen overlap met januari, hier is beweging

De vuistregel is eenvoudig: overlappen twee bandbreedtes elkaar grotendeels, dan houd je je mond over vooruitgang. Raken ze elkaar net, dan spreek je van een aanwijzing. Liggen ze los van elkaar, dan is er iets veranderd.

Dat is ook de reden dat de eerste maand van een traject geen resultaat kan laten zien. In dertig dagen is elke verschuiving kleiner dan de marge, dus wie in die periode een verbetering claimt, laat je naar ruis kijken.

Waar die marge vandaan komt

Twee rekenstappen doen het werk.

Het Wilson-interval berekent de marge rond een percentage. Het houdt er netjes rekening mee dat percentages dicht bij 0 of 100 asymmetrisch liggen: bij een gemeten zichtbaarheid van 5 procent kan de werkelijkheid wel omhoog maar nauwelijks omlaag. Voor elk onderdeel van een score bereken je zo’n interval apart, want vermelding, aanbeveling en eigen bron zijn verschillende metingen met verschillende aantallen eronder.

De cluster-bootstrap doet iets anders. Die stelt de hele meting honderden keren opnieuw samen door willekeurig prompts terug te trekken en te vervangen en berekent elke keer de score opnieuw. Uit de spreiding van al die uitkomsten rolt de bandbreedte. Het woord cluster zit erin omdat je hele prompts trekt met al hun herhalingen eraan vast. Drie runs van dezelfde vraag lijken sterk op elkaar en tellen dus niet als drie losse waarnemingen. Wie dat verschil negeert, rapporteert een marge die te smal is.

Wij gebruiken beide: Wilson-intervallen per onderdeel en een cluster-bootstrap over de prompts. De rekenwijze staat uitgeschreven op de pagina over het Findori Visibility Framework, samen met de geldigheidsdrempel die bepaalt wanneer een meting te dun is om überhaupt een score te krijgen.

Waarom de puntscore zo aantrekkelijk blijft

Een getal zonder marge is makkelijker te presenteren. “Uw AI-zichtbaarheid is 34,7” past op één dia, roept geen vragen op en klinkt alsof er iets precies gemeten is. Ik snap de aantrekkingskracht en ik heb zelf ook wel eens gedacht dat een bandbreedte de klant onzeker zou maken.

In de praktijk gebeurt het omgekeerde. Zodra je uitlegt waarom er een marge omheen zit, snapt iemand meteen waarom hij zich niet druk hoeft te maken over een dip van twee punten. En hij weet dat als jij over drie maanden zegt dat er echt iets veranderd is, dat dan ook zo is.

De rekening voor de puntscore komt later. Een rapport dat elke maand met tienden schuift, dwingt je uiteindelijk om beweging te verklaren die er niet was.

Wat je aan een leverancier vraagt

Drie vragen die je bij elk zichtbaarheidsrapport kunt stellen:

  • Hoeveel waarnemingen zitten hieronder? Aantal vragen, aantal runs per vraag, aantal modellen, aantal meetdagen. Zonder die vier getallen is de score niet te beoordelen. De onderbouwing staat in de les over het aantal prompts.
  • Wat is de marge rond dit cijfer? Kan iemand die niet geven, dan is de marge nooit uitgerekend.
  • Wat gebeurt er bij te weinig data? Een meetmethode die altijd een score afgeeft, ook bij twintig bruikbare waarnemingen, geeft je op de dunne maanden een getal dat nergens op slaat.

En kijk of de promptlijst woordelijk is vastgelegd, want zonder die lijst is de meting van volgende maand een andere meting. Hoe je die reeks over de tijd volgt staat in de les over je AI-zichtbaarheid volgen.

Wij doen deze meting ook als losse opdracht. Wat je dan in handen krijgt staat bij de AI-zichtbaarheidsaudit.

Veelgestelde vragen

Waarom rapporteert een goede meting een bandbreedte?

Omdat een AI-zichtbaarheidsscore een schatting is op basis van een steekproef vragen en runs. De bandbreedte laat zien hoeveel die schatting kan afwijken. Een arXiv-preprint over meetonzekerheid concludeert met bootstrap-analyse dat veel schijnbare verschillen tussen domeinen binnen de ruis van het meetproces zelf vallen.

Wanneer is een stijging echt een stijging?

Als de bandbreedtes van de twee metingen elkaar niet of nauwelijks overlappen. Gaan ze van 31 procent (25 tot 38) naar 34 procent (28 tot 41), dan overlappen ze grotendeels en kun je nog niets zeggen. Gaan ze naar 44 procent (38 tot 51), dan is er een verschil dat de meting kan dragen.

Wat is een cluster-bootstrap?

Een cluster-bootstrap is een rekenmethode die de meting honderden keren opnieuw samenstelt door hele prompts terug te trekken en te vervangen en zo laat zien hoeveel de score varieert. De clustering is nodig omdat herhalingen van dezelfde vraag op elkaar lijken en dus niet als losse waarnemingen mogen tellen.

Aan de slag

Weten hoe zichtbaar jij bent in AI?

Doe de gratis AI-zichtbaarheidscheck, of bekijk hoe we AI-vindbaarheid voor je aanpakken.