Overzicht van de Academy
Meten en bewijzen

Hoeveel prompts heb je nodig

In één zin

Een verdedigbare meting begint bij vijftig prompts, met honderd tot tweehonderd als het punt waarop de bandbreedte rond je score echt smal wordt.

Voor een meting die je kunt verdedigen heb je minimaal vijftig prompts nodig, met honderd tot tweehonderd als het punt waarop de cijfers echt rustig worden.

Die getallen komen uit de meetliteratuur over AI-zichtbaarheid en ze hebben een simpele reden: je meet een percentage en de betrouwbaarheid van een percentage hangt af van het aantal waarnemingen eronder. Vijftig vragen is het punt waarop de foutmarge klein genoeg wordt om er een gesprek over te voeren. Tweehonderd is het punt waarop extra vragen nog maar weinig toevoegen.

Wat er met je marge gebeurt als de set groeit

Stel dat je merk in dertig procent van de antwoorden genoemd wordt. Dat is je meetwaarde. De vraag is hoe zeker je van die dertig procent bent en dat hangt af van hoeveel vragen je gesteld hebt.

Aantal prompts Gemeten zichtbaarheid Bandbreedte (95 procent)
10 30 procent 11 tot 60 procent
20 30 procent 15 tot 52 procent
50 30 procent 19 tot 44 procent
100 30 procent 22 tot 40 procent
200 30 procent 24 tot 37 procent

Dit zijn Wilson-intervallen van 95 procent, de standaardmanier om een marge rond een percentage te berekenen. Ik heb ze hier zelf uitgerekend, je kunt ze narekenen.

Kijk wat er gebeurt bij tien vragen. Je meet dertig procent en de werkelijkheid ligt ergens tussen elf en zestig. Daar kun je geen beslissing op nemen en al helemaal geen vooruitgang mee aantonen, want als je volgende maand veertig procent meet valt dat gewoon binnen dezelfde marge.

Bij vijftig vragen wordt het bruikbaar. Bij tweehonderd is de marge nog zo’n dertien procentpunten breed en dat is meteen een nuchtere waarschuwing: ook een grote meting geeft je geen cijfer achter de komma.

Eén nuance hoort erbij. Deze intervallen gaan uit van waarnemingen die los van elkaar staan. In de praktijk stel je dezelfde vraag meerdere keren en die herhalingen lijken op elkaar. Reken je dat mee, dan wordt de echte bandbreedte iets breder dan de tabel laat zien. Dat is de reden dat een meting met een clustercorrectie eerlijker is dan een gewone optelsom.

Meer runs is iets anders dan meer vragen

Deze twee worden vaak door elkaar gehaald en ze doen echt verschillend werk.

Meer vragen verbreedt de dekking van je categorie. Je vangt meer manieren waarop iemand een probleem formuleert en dat is nodig, want in de SparkToro-test lag de semantische overeenkomst tussen verschillende gebruikersformuleringen van dezelfde vraag op 0,081. Mensen die hetzelfde bedoelen typen iets heel anders.

Meer runs per vraag dempt het toeval binnen één vraag. SparkToro adviseert voor een echt betrouwbare baseline honderd runs per vraag, wat in de praktijk voor niemand haalbaar is. Drie tot vijf runs per vraag per week is het gangbare compromis en dan haal je je volume uit de herhaling over de weken.

Je hebt ze allebei nodig. Vijftig vragen die je één keer stelt geeft je een breed maar wankel beeld, tien vragen die je vijftig keer stelt geeft je een stabiel beeld van een heel klein hoekje.

Welke vragen erin horen

De samenstelling doet net zoveel als het aantal. Vier soorten, in deze verhouding ongeveer gelijk verdeeld:

  • Vragen met je merknaam erin. “Wat is de reputatie van X” of “is X een goede keuze voor Y”. Deze leveren het minste signaal, want een model dat naar jouw naam gevraagd wordt zal jouw naam noemen. Ze zijn wel nuttig om te zien hoe je beschreven wordt.
  • Categorievragen. “Welk bureau voor AI-vindbaarheid in Nederland” of “wie helpt met GEO”. Hier zit het echte signaal, want hier moet het model uit de hele markt kiezen.
  • Vergelijkingsvragen. “X of Y” en “alternatieven voor Z”. Deze laten zien tegen wie je in de overweging staat.
  • Probleemvragen. “Mijn bedrijf wordt niet genoemd door ChatGPT, wat nu”. Dit is hoe klanten echt praten en het is de categorie die de meeste bedrijven vergeten te meten.

Leg de woording van elke vraag woord voor woord vast. Een meting die je volgende maand niet exact kunt herhalen, blijft een momentopname.

Wat je meet zit dieper dan je denkt

Er is een reden dat dit werkt, ondanks alle variatie. Uit dezelfde SparkToro-studie blijkt dat de verzameling merken die een model überhaupt overweegt behoorlijk stabiel is: gevestigde merken als Bose en Sony verschenen in 55 tot 77 procent van 994 wisselend geformuleerde vragen, ook al verschilde elk individueel antwoord.

Die verzameling is wat je meet. Met vijftig tot tweehonderd vragen breng je in kaart hoe vaak jouw merk in de overweging zit en dat cijfer beweegt langzaam en betekenisvol. Het individuele antwoord blijft grillig, de kans over de hele set niet.

En als je zo veel niet kunt meten

Dan is dat een prima startpunt, zolang je de conclusie erbij aanpast. Twintig vragen die je netjes en herhaalbaar meet, vertellen je of je ergens in de buurt van nul zit of ergens in de buurt van gezien worden. Dat is waardevolle informatie en het is genoeg om een richting te kiezen.

Wat je met twintig vragen niet kunt, is een verbetering van een paar procentpunten aantonen. Wie dat wel doet, presenteert de eigen variatie van het model als resultaat.

Onze AI-zichtbaarheidsaudit draait tientallen prompts over meerdere modellen en meerdere meetdagen, met de promptmix hierboven en een vastgelegde woording, zodat je de meting over drie maanden nog een keer kunt doen en er dan iets mee kunt vergelijken.

Hoe je de uitkomst vervolgens leest staat in de les over bandbreedtes en waarom één antwoord het niet doet staat in de les over het bewijs van één AI-antwoord.

Veelgestelde vragen

Waarom is vijftig prompts het minimum?

Onder de vijftig wordt de foutmarge rond je score zo breed dat je er geen verandering in kunt aflezen. Bij twintig vragen en een gemeten zichtbaarheid van 30 procent loopt de bandbreedte van ongeveer 15 tot 52 procent, bij vijftig vragen van ongeveer 19 tot 44 procent. De onderzoeksconsensus legt de ondergrens daarom op vijftig, met honderd tot tweehonderd als werkbare bovenkant.

Is meer altijd beter?

Tot een punt. De winst per extra vraag neemt af: van vijftig naar honderd prompts scheelt nog merkbaar in de bandbreedte, van tweehonderd naar vierhonderd nauwelijks. Boven de tweehonderd zit de winst eerder in meer runs per vraag en meer meetdagen dan in een langere vragenlijst.

Tellen herhalingen van dezelfde vraag mee als extra prompts?

Nee, dat zijn twee verschillende dingen. Meer vragen verbreedt de dekking van je categorie, meer runs per vraag dempt het toeval binnen één vraag. Je hebt ze allebei nodig en runs van dezelfde vraag tellen statistisch minder zwaar dan waarnemingen uit verschillende vragen.

Aan de slag

Weten hoe zichtbaar jij bent in AI?

Doe de gratis AI-zichtbaarheidscheck, of bekijk hoe we AI-vindbaarheid voor je aanpakken.