Naar de inhoud

Kennisbank · Internet Marketing Begrippen

Wat is A/B-testen?

16 min leestijd

Bij een A/B-test laat je twee versies van dezelfde pagina zien aan willekeurig verdeelde bezoekers, in dezelfde periode, en kijk je welke versie meer oplevert. Versie A is wat er nu staat, versie B is je idee.

Het is de zuiverste manier om iets te weten in plaats van te vermoeden. Er hangt één voorwaarde aan die in bijna elk artikel over dit onderwerp ontbreekt: je hebt er veel bezoekers voor nodig. Hoeveel precies staat verderop, met de sommen erbij, en voor de meeste bedrijfssites in Nederland valt die uitkomst tegen.

Wat een A/B-test is

Twee dingen maken het een test en geen indruk. De verdeling is willekeurig, en beide versies draaien tegelijk.

Willekeurig verdelen zorgt ervoor dat de twee groepen bezoekers verder op elkaar lijken: dezelfde mix van telefoons en laptops, dezelfde mix van haastige kijkers en serieuze kopers. Alles wat je niet wilt meten valt daardoor tegen elkaar weg, ook de dingen waarvan je niet wist dat ze bestonden.

Tegelijk draaien doet hetzelfde voor de tijd. Een dinsdag in januari is een andere dinsdag dan een dinsdag in de week voor Kerst.

Wat overblijft is het ene verschil dat je zelf hebt aangebracht. Verander je twee dingen tegelijk en er komt winst uit, dan weet je niet welke ervoor zorgde. Dat is geen theoretisch bezwaar: ik heb tests gezien waarbij de nieuwe kop won en de nieuwe knop verloor, en het totaal bleef gelijk.

Waarom je niet met vorige maand vergelijkt

De verleiding is groot. Je past de pagina aan, je kijkt na een maand naar je aanvragen en je concludeert iets.

Daar zit alles doorheen wat er in die maand verder gebeurde. Een campagne die afliep, een concurrent die begon te adverteren, schoolvakantie, een artikel dat toevallig goed liep in Google. Je meet de maand, niet de aanpassing.

Zo'n vergelijking voor en na is niet waardeloos, maar hij is zwak bewijs. Behandel hem als een aanwijzing, niet als een uitslag.

Hoeveel bezoekers je echt nodig hebt

Hier gaat het meestal mis, en het is te berekenen. Vier dingen bepalen het aantal.

  • Je huidige conversiepercentage. Hoe lager dat is, hoe meer bezoekers je nodig hebt. Bij twee procent heb je ongeveer vijf keer zoveel bezoekers nodig als bij tien procent.
  • Het kleinste verschil dat je nog wilt kunnen zien. Vooraf vaststellen, niet achteraf. Dit is de knop waar het meeste aan hangt.
  • Hoe zeker je wilt zijn dat een gevonden verschil echt is. Gebruikelijk is 95 procent.
  • Hoe groot de kans moet zijn dat je een echt verschil ook daadwerkelijk vindt. Gebruikelijk is 80 procent. Dit heet onderscheidend vermogen en het wordt vrijwel altijd vergeten.

Met die gebruikelijke instellingen komen er de volgende aantallen uit, per variant, dus je hebt er twee keer zoveel nodig voor de hele test.

Sta je op twee procent conversie en wil je een verbetering naar 2,4 procent kunnen aantonen, een vijfde meer, dan heb je ruwweg 21.000 bezoekers per variant nodig. Dat komt neer op ongeveer 420 aanvragen of bestellingen per variant.

Sta je op vijf procent en wil je naar zes procent, ook een vijfde meer, dan zit je rond de 8.000 bezoekers per variant. Hoger conversiepercentage, minder bezoekers.

Wil je vanaf twee procent een verbetering naar 2,1 procent kunnen aantonen, dus vijf procent winst, dan heb je ruim 300.000 bezoekers per variant nodig. Diezelfde test, één cijfer anders.

Reken het na met een rekenmodel voor steekproefgrootte voordat je iets bouwt. Dat bepaalt of de rest van je werk zin heeft.

Waarom kleine verbeteringen onmeetbaar zijn

Het verschil tussen die 21.000 en die 300.000 zit in een eigenschap van de rekensom: het benodigde aantal loopt op met het kwadraat van het verschil dat je zoekt. Halveer het effect en je hebt vier keer zoveel bezoekers nodig. Deel het door vier en je hebt er zestien keer zoveel nodig.

Daarom kun je grote ingrepen wel testen en kleine niet. Een compleet ander aanbod op je pagina kan tientallen procenten schelen. Een knop van blauw naar groen scheelt dat vrijwel nooit. Het gevolg is ongemakkelijk: de wijzigingen waar mensen het liefst over discussiëren zijn precies de wijzigingen die je nooit kunt bewijzen.

Wat dat betekent voor de meeste sites in Nederland

Neem een gezonde site van een installatiebedrijf of een adviesbureau. Duizend bezoekers per maand, twee procent daarvan vraagt iets aan, dus twintig aanvragen.

Voor die 42.000 bezoekers uit het eerste voorbeeld ben je dan ruim drie jaar bezig. In die drie jaar verandert je aanbod, je prijzen, je Google-posities en waarschijnlijk je hele site. De test is dan allang zijn eigen voorwaarden kwijt.

Dit is geen tekortkoming van jouw bedrijf, het is rekenwerk. Ik zeg het liever hardop dan dat iemand een half jaar bezig is met een instrument dat op zijn schaal niets kan opleveren.

A/B-testen wordt interessant vanaf ongeveer tienduizend relevante bezoekers per maand op de pagina die je test, of bij een webshop met dagelijks bestellingen. Daaronder is het gereedschap te grof.

Wanneer je stopt, en wat te vroeg stoppen kost

Spreek vooraf af hoeveel bezoekers de test krijgt en wanneer hij dichtgaat. Daarna kijk je pas.

De reden is een verschijnsel dat in het Engels peeking heet, tussentijds gluren. De 95 procent zekerheid waar je mee rekent geldt voor één beoordeling aan het eind. Kijk je elke dag en stop je zodra er ergens 95 procent op het scherm staat, dan pak je precies de dagen waarop het toeval jouw kant op viel. De werkelijke kans dat je een verschil vindt dat niet bestaat, ligt dan veel hoger dan die vijf procent, en hij loopt op met elke keer dat je kijkt.

In de eerste dagen van een test loopt er bijna altijd één variant voor. Dat is normaal en het verdwijnt meestal weer. Wie steeds even kijkt en stopt zodra het goed uitkomt, verzamelt een map vol verbeteringen die in werkelijkheid niets deden.

Er is een uitweg. Sommige pakketten rekenen met methoden die wel tegen tussentijds kijken kunnen, met namen als sequentieel toetsen. Gebruik je zo'n pakket, lees dan na welke methode eronder zit. Rekent het met een vaste eindstreep, dan geldt de afspraak vooraf onverkort.

Hoe lang een test loopt

Minstens twee volle weken, ook als je eerder genoeg conversies hebt. Gedrag verschilt per weekdag: zaterdag ziet er anders uit dan dinsdag, en een test van vier dagen meet vooral welke dagen erin zaten.

Twee weken vangt ook het nieuwheidseffect af. Vaste bezoekers reageren op iets nieuws omdat het nieuw is. Die extra klikken verdwijnen na een paar weken en jij hebt ondertussen een winnaar aangewezen.

Kijk daarnaast naar je eigen ritme. Verkoop je vooral aan bedrijven, dan is een test die over een vakantieweek loopt vertekend. Draait je omzet rond de laatste week van de maand, laat dan een hele maand meelopen. Langer dan zes tot acht weken heeft weinig zin, want dan gaan andere dingen de uitslag beïnvloeden.

Hoe je de uitslag leest

Het getal dat je te zien krijgt is meestal een p-waarde of een betrouwbaarheidspercentage. Dat getal zegt niet hoe groot de kans is dat B beter is. Het zegt hoe waarschijnlijk het is dat je zo'n verschil ziet als er in werkelijkheid geen verschil bestaat.

Kijk daarom liever naar het betrouwbaarheidsinterval, het bereik waarbinnen het echte effect waarschijnlijk ligt. Staat er dat B tussen de 1 en 25 procent beter is, dan heb je nauwelijks iets geleerd, ook al is de uitslag significant. Staat er 8 tot 14 procent, dan weet je iets.

Houd er ook rekening mee dat een winnaar die net over de streep komt in de praktijk bijna altijd minder oplevert dan de test aangaf. Van alle tests die de drempel halen zijn de effecten die toevallig meezaten oververtegenwoordigd.

En vertaal de uitslag naar geld. Twee procent meer aanvragen op een pagina met drie aanvragen per maand is geen aanvraag. Statistisch verschil en zakelijk verschil zijn twee dingen. Welke getallen op je site er werkelijk toe doen staat bij de uitleg over KPI's.

Controles voordat je iets gelooft

Voer deze drie uit voordat je een uitslag doorvoert.

  • Klopt de verdeling. Zet je 50 om 50 en zie je na tienduizenden bezoekers 52 om 48, dan is er iets stuk in je meting of in de toewijzing. Dit heet een scheve verdeling en het maakt de hele uitslag onbruikbaar, ook als het verschil klein lijkt.
  • Meet je wat je denkt. Doe een testaanvraag op beide versies en controleer of hij in je statistieken landt. Ik heb tests gezien die twee weken liepen op een doel dat niet meer bestond.
  • Doe eens een A/A-test. Twee identieke versies tegen elkaar. Komt daar een winnaar uit, dan weet je dat je opstelling ruis produceert.

Splits daarna pas naar mobiel en desktop. Doe je dat vooraf, dan test je in feite twee dingen tegelijk en gelden je aantallen niet meer.

Wat je test, en in welke volgorde

Begin bij een vraag, niet bij een idee. "Haken mensen af omdat ze de prijs niet kunnen vinden" is een vraag. "Laten we de knop groen maken" is een idee zonder vraag erachter.

In volgorde van meeste naar minste opbrengst: het aanbod zelf, dus prijs, garantie en wat erin zit. Daarna de kop bovenaan, want die bepaalt of iemand blijft. Daarna het formulier, met het aantal velden voorop. Daarna de knop, eerst de tekst en dan pas de plek. Beeld staat daaronder.

Kleuren en lettertypes staan onderaan en krijgen in de praktijk de meeste aandacht. Wat er verder op een verkooppagina hoort te staan is uitgewerkt bij landingspagina's, en hoe je een knoptekst formuleert bij de call-to-action.

Test één ding per test. Wil je meerdere elementen tegelijk beoordelen, dan kom je bij multivariate testen uit, en dat kost een veelvoud aan bezoekers.

Aan de clientkant of op de server

De meeste testgereedschappen werken met een stukje JavaScript in je pagina. De pagina laadt, het script bepaalt in welke groep je zit en past de pagina daarna aan.

Dat geeft twee problemen. Je ziet soms even de oude versie voordat de nieuwe erover valt, het knippereffect. Dat is lelijk en het beïnvloedt je uitslag, want je meet dan mede de rommelige weergave. En het script kost laadtijd, wat direct meetelt in de snelheidscijfers waar Google naar kijkt. Zo kan een test op snelheid winnen wat hij op inhoud verliest.

De nettere weg is testen op de server: die kiest de variant voordat de pagina wordt opgebouwd, dus de bezoeker ziet nooit iets veranderen. Bij WordPress betekent dat wel dat je goed moet nadenken over je paginacache, want een gecachete pagina toont iedereen dezelfde variant.

Zet een test nooit aan zonder daarna te controleren wat er met je laadtijd gebeurt. Wat daarbij komt kijken staat bij optimaliseren voor mobiel.

De cookiebanner en Safari zitten in de weg

Dit wordt zelden genoemd en het raakt je uitslag hard.

Artikel 11.7a van de Telecommunicatiewet vraagt toestemming voordat je iets op het apparaat van een bezoeker plaatst of uitleest. Een testgereedschap bewaart welke variant iemand kreeg, en dat is precies zo'n opslag. Weigert een deel van je bezoekers, dan doen die mensen niet mee aan je test. Je meet dan de groep die op accepteren klikt, en dat is geen doorsnede van je bezoekers.

Daarbovenop komt Safari. Sinds 2019 wist Safari cookies die door JavaScript zijn gezet na zeven dagen. Iemand die na twee weken terugkomt is voor je testgereedschap een nieuwe bezoeker en kan in de andere variant belanden. Omdat er in Nederland veel via iPhones wordt gesurft, vervuilt dat een flink stuk van je meting. Wat er verder per browser verschilt staat bij cross-browser compatibiliteit.

Testen op de server met een korte, functionele markering in plaats van een marketingcookie lost een deel hiervan op. Leg wel vast wat je doet en waarom.

Waarmee je test nu Google Optimize weg is

Google Optimize en Optimize 360 zijn op 30 september 2023 gestopt. Dat was jarenlang het gereedschap waarmee kleine bedrijven konden testen zonder abonnement, en er is geen gratis vervanger van Google gekomen.

Over prijzen begin ik hier niet, want die veranderen te vaak. Wel over wat er ligt. Er zijn betaalde pakketten voor testen en personalisatie, zoals VWO, Optimizely, AB Tasty, Convert en Kameleoon. Er zijn open bronprojecten die je zelf kunt draaien, zoals GrowthBook en PostHog, waarbij de gegevens in eigen beheer blijven. Voor WordPress bestaan plug-ins die het testen binnen je site regelen. Google Analytics 4 zelf kan geen tests uitvoeren; het meet alleen de uitkomst.

Wat veel mensen missen: de advertentieplatforms kunnen dit ingebouwd. In Google Ads en in Meta zit een experimentfunctie waarmee je twee advertenties of twee bestemmingen tegen elkaar zet. Daar zit je verkeer al.

Kies je een pakket, kijk dan naar waar de gegevens staan, of het knippereffect wordt voorkomen en welke statistische methode eronder zit. Hoe je de uitkomst terugziet in je cijfers staat bij Google Analytics.

Wat je doet bij te weinig verkeer

Dit is voor de meeste lezers het echte antwoord.

Ga meekijken. Zet vijf mensen die je site niet kennen achter een scherm, geef ze een opdracht zoals uitzoeken wat dit kost, en laat ze hardop zeggen wat ze denken. Vijf mensen halen de meeste echte problemen eruit. Het is ongemakkelijk om aan te zien en dat is precies waarom het werkt.

Kijk daarna naar opnames en warmtekaarten om te zien waar mensen stoppen met scrollen en waar ze op iets tikken dat geen knop is. Hoe je dat opzet staat bij gebruikersgedragsanalyse.

Verschuif je test naar een kanaal met meer volume. Een onderwerpregel in je nieuwsbrief kun je met een paar duizend ontvangers al zinvol splitsen, omdat het percentage dat opent veel hoger ligt dan het percentage dat op je site converteert, en bij hogere percentages heb je minder waarnemingen nodig. Advertentieteksten zijn om dezelfde reden goed te testen.

En repareer gewoon wat aantoonbaar kapot is. Een formulier dat op een telefoon niet werkt hoef je niet te testen, dat los je op. Hetzelfde geldt voor een pagina die vier seconden laadt of een prijs die nergens staat. Wachten op statistisch bewijs dat je nooit gaat krijgen is geen zorgvuldigheid maar stilstand. De volgorde waarin je die dingen aanpakt staat bij conversie-optimalisatie.

Veelgestelde vragen over A/B-testen

Wat is A/B-testen?

A/B-testen is twee versies van dezelfde pagina tegelijk tonen aan willekeurig verdeelde bezoekers en meten welke versie meer oplevert. Versie A is de bestaande situatie, versie B bevat één wijziging.

Doordat de verdeling willekeurig is en beide versies in dezelfde periode draaien, valt alles wat je niet wilt meten tegen elkaar weg.

Hoeveel bezoekers heb ik nodig voor een A/B-test?

Dat hangt af van je huidige conversiepercentage en van het kleinste verschil dat je nog wilt kunnen zien. Bij twee procent conversie en een gewenste verbetering van een vijfde heb je ruwweg 21.000 bezoekers per variant nodig, dus zo'n 42.000 in totaal.

Reken het altijd vooraf uit met een rekenmodel voor steekproefgrootte. Komt eruit dat je test jaren zou lopen, doe hem dan niet.

Hoe lang moet een A/B-test lopen?

Minstens twee volle weken, zodat alle weekdagen erin zitten en het nieuwheidseffect is uitgewerkt. Langer dan zes tot acht weken heeft weinig zin, want dan veranderen er te veel andere dingen.

Het aantal bezoekers is leidend, niet de tijd. Heb je na twee weken nog niet genoeg, dan laat je hem doorlopen tot het afgesproken aantal binnen is.

Wat betekent statistisch significant?

Dat het gevonden verschil groot genoeg is om onwaarschijnlijk te zijn als er in werkelijkheid geen verschil was. Bij 95 procent betrouwbaarheid accepteer je een kans van vijf procent dat je iets vindt dat er niet is.

Het zegt niets over hoe groot het effect is en of het zakelijk iets voorstelt. Een significant verschil van twee procent op drie aanvragen per maand levert je nul extra klanten op.

Mag ik een test stoppen zodra er een winnaar in beeld is?

Nee, en dat is de meest gemaakte fout. De 95 procent waar je mee rekent geldt voor één beoordeling aan het eind. Kijk je elke dag en stop je op het gunstige moment, dan wordt je werkelijke foutkans veel groter dan vijf procent.

Spreek vooraf een aantal bezoekers of een einddatum af. Gebruikt je pakket een methode die tussentijds kijken toestaat, dan mag het wel, maar controleer dat eerst.

Kan ik A/B-testen met weinig bezoekers?

Uitvoeren kan altijd, er iets uit leren niet. Bij lage aantallen is de uitslag grotendeels toeval, en dan voer je net zo vaak een verslechtering door als een verbetering.

Onder ongeveer tienduizend relevante bezoekers per maand op de pagina die je wilt testen kun je beter meekijken met echte gebruikers en de duidelijke problemen oplossen.

Wat is het verschil tussen A/B-testen en multivariate testen?

Bij een A/B-test verander je één ding en vergelijk je twee versies. Bij een multivariate test verander je meerdere elementen tegelijk en test je alle combinaties, zodat je ook ziet hoe ze op elkaar inwerken.

Multivariate testen kost een veelvoud aan bezoekers, omdat je aantal in stukjes uiteenvalt over alle combinaties. Voor een gewone bedrijfssite is dat buiten bereik.

Waarmee kan ik A/B-testen nu Google Optimize is gestopt?

Google Optimize is op 30 september 2023 gestopt zonder gratis opvolger van Google. Er zijn betaalde pakketten zoals VWO, Optimizely, AB Tasty, Convert en Kameleoon, en open bronprojecten zoals GrowthBook en PostHog die je zelf kunt draaien.

Voor advertenties zit er een experimentfunctie in Google Ads en in Meta. Voor WordPress bestaan plug-ins die het binnen je site regelen.

Is A/B-testen slecht voor je SEO?

Nee, mits je het netjes doet. Google heeft altijd gezegd dat testen prima is zolang je zoekmachines niet iets anders voorschotelt dan bezoekers, je bij aparte adressen een canonieke verwijzing naar het origineel zet en je tijdelijke omleidingen gebruikt in plaats van permanente.

Ruim de test daarna op. Een testopstelling die maanden na afloop blijft draaien kost alleen nog laadtijd.

Heb ik toestemming nodig voor een A/B-test?

Als je gereedschap iets op het apparaat van de bezoeker opslaat, bijvoorbeeld welke variant hij kreeg, dan valt dat onder artikel 11.7a van de Telecommunicatiewet en heb je toestemming nodig.

Dat heeft een praktisch gevolg: bezoekers die weigeren doen niet mee. Je test dan op de groep die accepteert, en die groep is niet representatief voor al je bezoekers.

Wat is een A/A-test?

Bij een A/A-test zet je twee identieke versies tegen elkaar. Er hoort geen winnaar uit te komen, want er is geen verschil.

Komt er toch een duidelijke winnaar uit, dan zit er iets fout in je meting of in de verdeling van bezoekers. Het is een goedkope manier om je opstelling te controleren voordat je er beslissingen op baseert.

Waarom is de winst na de test kleiner dan de test aangaf?

Twee oorzaken. Van alle tests die net de drempel halen zijn de gevallen waarin het toeval meewerkte oververtegenwoordigd, dus het gemeten effect valt gemiddeld hoger uit dan het echte effect.

Daarnaast speelt het nieuwheidseffect. Vaste bezoekers reageren op iets nieuws omdat het nieuw is, en dat dooft uit. Reken in je begroting daarom met de onderkant van het betrouwbaarheidsinterval, niet met het gemeten getal.

Wat kan ik het beste als eerste testen?

Het aanbod zelf: prijs, garantie, wat er precies in zit. Daar zitten de grote verschillen, en alleen grote verschillen zijn met een normale hoeveelheid verkeer meetbaar.

Daarna de kop bovenaan de pagina en het aantal velden in je formulier. Kleuren en lettertypes leveren zelden een verschil op dat je kunt aantonen.

Wat is een minimaal detecteerbaar effect?

Het kleinste verschil dat je test nog betrouwbaar kan aantonen, en dat je vooraf zelf vaststelt. Het bepaalt hoeveel bezoekers je nodig hebt.

Het benodigde aantal loopt op met het kwadraat van dat effect. Wil je een half zo groot verschil kunnen zien, dan heb je vier keer zoveel bezoekers nodig.

Mijn test verdeelt niet netjes in tweeën, wat nu?

Een scheve verdeling wijst bijna altijd op een technisch probleem: een script dat op sommige pagina's niet laadt, een cache die één variant vasthoudt of bots die maar één kant meetellen. Stop de test, zoek de oorzaak en begin opnieuw.

Dit artikel hoort bij Internet Marketing Begrippen. Daar vind je meer uitleg over hetzelfde onderwerp.

Een vraag over dit onderwerp?

Vertel waar je tegenaan loopt.

Maurits denkt met je mee en geeft je een praktisch antwoord.

reactie dezelfde werkdag
Maurits van Platform Pro

Vertel kort waar je aan denkt

Nu bereikbaar, je krijgt Maurits zelf te spreken

Maurits leest je bericht en neemt persoonlijk contact met je op.

Dit veld is bedoeld voor validatiedoeleinden en moet niet worden gewijzigd.
Dit veld is verborgen bij het bekijken van het formulier