Sciencecheck · hoe werkt significantie

Doe het onderzoek
nog eens.

De bewering

"In dit onderzoek kwam de koolhydraatgroep 2,3 kg spiermassa aan, en de sojagroep maar 1,8 kg. De koolhydraatgroep deed het dus beter dan de sojagroep."

Twee getallen, de grootste wint. Zo klinkt het als een simpele optelsom.

Het onderzoek erachter liet mensen negen maanden lang begeleid krachttrainen. Er waren drie groepen, die elk dagelijks een ander drankje kregen: maltodextrine (een koolhydraat uit zetmeel) bij 22 deelnemers, soja-eiwit bij 22 deelnemers en whey-eiwit bij 19 deelnemers. Gemeten werd de vetvrije massa, op deze pagina kortweg spiermassa genoemd.

Het drankje is daarbij het middel, niet het onderwerp. Waar het om gaat is wat dat drankje veranderde. Alle drie de drankjes leverden evenveel calorieën, maar soja en whey bevatten elk ongeveer 20 gram eiwit per dag en maltodextrine vrijwel geen. Daardoor kwam de koolhydraatgroep uit op 1,1 gram eiwit per kilo lichaamsgewicht per dag, en kwamen de soja- en wheygroep op 1,4. Tussen koolhydraat en soja verschilt dus de hoeveelheid eiwit. Tussen soja en whey verschilt bij een vrijwel gelijke hoeveelheid de bron van dat eiwit.

Waarom vergelijk je groepen? De deelnemers werden per loting over de drie groepen verdeeld, en niemand wist wie wat kreeg. Zo leken de groepen aan het begin zo veel mogelijk op elkaar en verschilden ze daarna vooral in hun eiwitinname. Blijft er aan het eind een verschil over dat je niet met toeval kunt verklaren, dan wijst dat op een verband tussen die eiwitinname en de spiermassa. Blijft dat verschil uit, dan is zo'n verband niet aangetoond. Meer niet.

De bewering vergelijkt twee van die drie groepen: koolhydraat tegen soja. Alle getallen hieronder gaan dus over 44 mensen, 22 per groep. De wheygroep blijft tot het slot buiten beschouwing; daar is namelijk iets anders aan de hand.

De twee getallen kloppen. De conclusie die eruit getrokken wordt niet. Deze pagina laat in vier stappen zien waarom je uit dit verschil van een halve kilo niets kunt afleiden.

Stap 1

Achter elk gemiddelde zitten 22 mensen

Een gemiddelde is een samenvatting. Je perst 22 mensen samen tot één getal. Handig — maar er verdwijnt iets belangrijks: hoe ver die 22 mensen uit elkaar lagen.

En daar zit hier het probleem. Binnen één en dezelfde groep verschilden de deelnemers enorm. De grootste stijgers kwamen zo'n 5 kg aan. Onderaan zaten deelnemers die juist vetvrije massa verloren. Die spreiding staat in het onderzoek achter het gemiddelde, als het getal na het ±-teken.

Zet dat eens naast het verschil tussen de twee groepen:

Verschil tússen de groepen0,5 kg
Spreiding bínnen één groep1,6 à 1,7 kg

De mensen in dezelfde groep verschilden dus ruim drie keer zoveel van elkaar als de twee groepen van elkaar. Anders gezegd: pak twee willekeurige deelnemers uit dezelfde groep. Die schelen gemiddeld méér van elkaar dan de twee groepen van elkaar schelen.

Het verschil waar de bewering op leunt is dus kleiner dan de gewone variatie tussen twee willekeurige mensen.

Let wel op wat die spreiding doet en wat niet. Ze verdwijnt niet als je meer mensen meet, want mensen blijven onderling verschillen. Wat bij meer deelnemers kleiner wordt, is de onzekerheid over het gemiddelde. Dat is een ander getal, en daarover gaat stap 2.

Wat je zo gaat zien: de twee balken worden 44 losse deelnemers, 22 per groep. Let op hoeveel de wolken over elkaar heen liggen.

Verticale as: verandering in vetvrije massa in kg over negen maanden. De deelnemers zijn nagebootst, geloot uit het gemiddelde en de spreiding van de studie. Niet de echte meetpunten, die zijn niet gepubliceerd.

Even tussendoor: waarom is dat erg?

Bijna geen enkel onderzoek meet iedereen. Je meet een klein groepje en neemt aan dat wat je daar ziet, ook geldt voor de rest. Dat heet met een moeilijk woord inferentiële statistiek. Het betekent: van klein naar groot afleiden.

Maar zo'n groepje is een toevallige greep. Had je 44 andere mensen geloot, dan waren de getallen anders geweest. Soms flink anders. Mensen verschillen nu eenmaal — de een bouwt makkelijk spier op, de ander nauwelijks.

Dus als je twee getallen ziet die verschillen, zijn er altijd twee mogelijke verklaringen:

Verklaring 1 is de interessante: omdat de groepen door loting zijn samengesteld en verder hetzelfde deden, blijft het verschil in eiwitinname over als verklaring voor een echt verschil. Statistiek is het gereedschap om die twee uit elkaar te houden. Niet door te bewijzen welke waar is — dat kan niet. Wel door te kijken of toeval genoeg is om te verklaren wat je ziet.

Kan toeval het makkelijk verklaren, dan heb je geen bewijs voor een verschil.

Stap 2

Wat als je het nog eens zou doen?

Onderzoekers pakken dit op een slimme manier aan. Ze nemen eerst aan dat er helemaal geen verschil is. Daarna kijken ze hoe goed hun meting dan nog bij die aanname past.

Hieronder doen we dat letterlijk. We bouwen een wereld waarin er geen verschil tussen de groepen is: het extra eiwit uit soja maakt daar niets uit. Dat weten we daar zeker, want we hebben die wereld zelf zo gemaakt.

Dan loten we 44 nieuwe mensen en doen het onderzoek opnieuw. En nog eens. En nog eens.

Let op: ook zonder enig echt verschil komen er verschillen uit. Elke keer weer.

Verticale as: het gemiddelde van elke groep in kg, opnieuw berekend bij elke herhaling.

Koolhydraat won
Soja won
Gat van 0,5 kg of meer0%

En dat percentage is de p-waarde

Je hebt zojuist een p-waarde uitgerekend, zonder formule. Het derde vakje laat zien hoe vaak toeval alléén al een gat van 0,5 kg of groter opleverde, in welke richting dan ook. Dat getal is hem: ongeveer 32%.

Lees precies wat daar staat. Stel dat er in het echt geen verschil tussen de groepen is. Dan komt er nog steeds in ongeveer één op de drie herhalingen een verschil uit van deze grootte of groter — vanzelf. Het is dus niet opvallend. Het is wat je verwacht.

De bewering ziet dus iets bijzonders in een verschil dat vaak vanzelf ontstaat.

Echte onderzoekers herhalen hun studie natuurlijk niet duizend keer. Ze rekenen dit uit met een formule. Die heeft maar drie dingen nodig:

Hoe groot is het verschil?

Hier 0,5 kg. Groter verschil, sterker bewijs.

Hoe ver liggen mensen uit elkaar?

Hier 1,6 à 1,7 kg. Meer spreiding, zwakker bewijs.

Hoeveel mensen deden mee?

Hier 22 per groep. Meer mensen, sterker bewijs.

De uitkomst is dezelfde als wat je hierboven zag gebeuren. De formule is alleen sneller.

Onderzoekers spreken pas van een statistisch significant resultaat als die kans onder de 5% ligt. Dan is toeval geen goede verklaring meer. Bij 32% is dat bij lange na niet gehaald.

Let op twee dingen die de p-waarde niet zegt. Het is niet de kans dat het effect echt bestaat. En het is niet de kans dat een volgend onderzoek hetzelfde vindt. Het is alleen dit: hoe goed passen deze metingen bij "er is geen verschil tussen de groepen".

Stap 3

Hoe ziet een verschil eruit dat er wél toe doet?

Tot nu toe zag je alleen dat toeval verschillen maakt. Maar hoe herken je er dan wél een die echt is? Zonder dat antwoord lijkt het alsof je nooit iets kunt weten. Dat is niet zo.

Zet de wereld hieronder om. In de tweede stand is de ene groep écht beter af — met 1,5 kg. Dat is geen verzonnen getal: het is precies het verschil dat in ditzelfde onderzoek tussen soja en whey wél werd aangetoond.

Verder blijft alles gelijk. Dezelfde spreiding tussen mensen, dezelfde 22 per groep, dezelfde loting. We lenen alleen de omvang van dat verschil; we bouwen de whey-vergelijking niet na. Doe dan opnieuw twintig onderzoeken.

Kijk niet naar één uitkomst. Kijk naar het gedrag over alle herhalingen heen. Springt de winnaar heen en weer, of blijft het steeds dezelfde?

Horizontale as: het verschil tussen de twee groepsgemiddelden in kg. Nul betekent precies gelijk, rechts won koolhydraat, links won soja. Elke stip is één herhaling; de hoogte van een stip betekent niets en voorkomt alleen overlap.

Stap 4

Kon dit onderzoek het überhaupt vinden?

Nu een vraag die bijna nooit gesteld wordt. En dat is jammer, want hij is misschien wel de belangrijkste van allemaal. Dezelfde cijfers, een andere vraag: niet "kon dit toeval zijn?", maar "als het géén toeval was, had deze studie het dan kunnen zien?"

Tot nu toe keken we of het gevonden verschil echt kon zijn. Draai het nu eens om. Stel dat er wél een verschil van 0,5 kg bestaat — precies zo groot als het onderzoek mat. Zou dit onderzoek dat dan gezien hebben?

Hieronder bouwen we die wereld. Het verschil is er, en het is echt. Dan doen we honderd keer het onderzoek, met evenveel deelnemers als de echte studie had.

Elke plek in het raster is één onderzoek. Een volle stip betekent: het verschil gevonden. Een open ring betekent: gemist — terwijl het er wél was.

Verschil gevonden Gemist Nog niet gedaan
Verschil gevonden0
Gemist0

Niets vinden is iets anders dan aantonen dat er niets is

Dit verandert wat de uitkomst van het echte onderzoek betekent. Het vond geen verschil tussen koolhydraat en soja. Maar dat bewijst niet dat er geen verschil is.

Het onderzoek had te weinig deelnemers. Een verschil van deze grootte zou het meestal missen, ook als het er is. Bij 22 deelnemers per groep en deze spreiding is de kans dat het zo'n verschil wél vindt ongeveer 1 op 6.

Onderzoekers noemen dat de power van een studie: de kans dat je vindt wat je zoekt, áls het er is. In de praktijk mikken onderzoekers vrijwel altijd op 80%, oftewel 4 van de 5. Is de power laag, dan zegt "wij vonden niets" vooral iets over het onderzoek, en weinig over de wereld.

Waarom 171 — en waarom niet meer?

Je zag misschien al iets vreemds. Ook bij 171 deelnemers mist het onderzoek het verschil nog in ongeveer 1 op de 5 keer. Waarom heet dat dan genoeg?

Omdat 171 geen natuurwet is. Het is het aantal dat je nodig hebt om dit verschil in 4 van de 5 onderzoeken te vinden, oftewel bij een power van 80%. Dat doel spreken onderzoekers vooraf af, net zoals ze de 5%-grens afspreken.

Mikken op zekerheid kan wel, maar dat wordt snel duur:

Vinden in 4 van de 5 keer (80%)171
In 19 van de 20 keer (95%)283
In 99 van de 100 keer (99%)400

deelnemers per groep, bij een echt verschil van 0,5 kg. Voor het totaal vermenigvuldig je met het aantal groepen: bij twee groepen dus 342, 566 en 800 deelnemers, bij de drie groepen van deze studie nog de helft meer.

Om van 4-op-5 naar 99-op-100 te gaan moet je dus 800 deelnemers meten in plaats van 342. Allemaal negen maanden begeleid trainen. Ergens moet een grens liggen, en die ligt bij afspraak op 4 van de 5.

Ook dat getal is dus een keuze. Geen meting.

Wat blijft er van de bewering over?

De bewering leunt volledig op één ding: dat het verschil van 0,5 kg iets betekent. Stap 2 liet zien hoe vaak toeval zo'n verschil vanzelf maakt: ongeveer één op de drie keer. Ook als er tussen de groepen geen verschil bestaat.

Dat bedoelen onderzoekers met "niet statistisch significant". In gewone taal: dit verschil is te klein tegenover het toeval om er een uitspraak op te bouwen.

En stap 4 liet zien dat het daar niet ophoudt. Stel dat het verschil van 0,5 kg wél echt was geweest. Dan nog had dit onderzoek het maar in ongeveer één op de zes keer gezien.

Het oordeel

Op grond van dit onderzoek mag je niet zeggen dat de koolhydraatgroep het beter deed. Je mag net zo goed niet zeggen dat de sojagroep het beter deed. Beide richtingen blijven even goed mogelijk.

De eerlijke samenvatting is: tussen deze twee groepen is geen verschil aangetoond. Dat is iets anders dan "ze zijn even goed" — het onderzoek geeft geen antwoord op die vraag.

Een niet-significant verschil is dus geen zwak bewijs. Het is geen bewijs. Dat is een lastige boodschap, want het is geen antwoord. "Dit onderzoek weet het niet" haalt de krant niet. Maar het is wel wat er staat.

Wat dit onderzoek wél vond

Nu de derde groep uit de inleiding, die we tot hier buiten beschouwing lieten. Die kreeg whey-eiwit en kwam 3,3 kg aan — anderhalve kilo meer dan de sojagroep. Dát verschil hield wél stand bij de toets.

En dat is precies het getal dat je in stap 3 zag gedragen als een echt verschil. Geen toeval: het ís dat effect.

Whey deed het beter dan soja én beter dan koolhydraat. Soja en koolhydraat verschilden onderling niet. Bij een vrijwel gelijke hoeveelheid eiwit maakte de soort dus wel uit, en de extra hoeveelheid niet. Dat is ook wat de onderzoekers zelf concluderen.

De bewering doet precies het omgekeerde. Zij pakt de enige vergelijking waar niets uit kwam. De vergelijking die wél iets opleverde, laat zij liggen.

Vier vragen voor de volgende bewering

Zie je twee gemiddelden naast elkaar met een verschil ertussen? Stel dan deze vier vragen.

Zonder die vier is een verschil tussen twee gemiddelden niet meer dan een gerucht met een cijfer erbij.

Verdieping

De cijfers erachter

De hoofdlijn hierboven staat op zichzelf. Dit deel is voor wie wil weten waar die 5% en die 4-van-de-5 vandaan komen.

Twee getallen, twee verschillende fouten

Let op dat je de 5% en die 4-van-de-5 niet door elkaar haalt. Er zit geen rekensom tussen. Ze gaan over verschillende situaties.

Zet die twee naast elkaar en er zit een oordeel in. Vals alarm mag 5 keer op de 100. Iets missen mag 20 keer op de 100. Een onterechte claim geldt dus als vier keer zo erg als een gemiste ontdekking.

Dat is te verdedigen. Een onterechte claim komt in de wereld en wordt nagevolgd. Iets wat je mist, kan een volgend onderzoek alsnog vinden. Maar ook dat blijft een keuze.

Welke van de twee is "significant"?

Alleen de eerste. "Statistisch significant" betekent letterlijk: de kans lag onder de 5%. Dat is de regel waarmee je één onderzoek beoordeelt.

De 4-van-de-5 komt in dat oordeel niet voor. Je leest nooit "niet significant, en de kans om het te vinden was 80%". Toch is dat tweede getal precies wat je nodig hebt om een uitkomst zonder verschil te kunnen lezen.

Daar zit de scheefheid. De regel voor "significant" bewaakt alleen het vals alarm. Over de kans dat je iets mist, zegt hij niets.

En daarom is "wij vonden geen verschil" zo'n zwakke uitspraak. Het systeem is gebouwd om voorzichtig te zijn met claimen. Niet om voorzichtig te zijn met missen.

De onderzoekers hadden dit zelf uitgerekend

En hier wordt het pijnlijk. Deze som maakten de onderzoekers vooraf. In het artikel staat dat er 17 deelnemers nodig waren om een verschil van 0,5 kg vetvrije massa aan te tonen, bij 80% kans om het te vinden, de gangbare norm, en de 5%-grens. Of dat er 17 per groep waren of 17 in totaal, staat er niet bij.

Voor zo'n som moet je vooraf aannemen hoe ver mensen uit elkaar zullen liggen. Lees je die 17 als per groep, dan valt af te leiden dat ze rond de 0,5 kg zaten. Wat ze uiteindelijk maten was 1,6 à 1,7 kg. Meer dan drie keer zoveel. Lees je 17 als het totaal, dan is de misrekening nog groter.

Spreiding telt kwadratisch mee. Drie keer meer spreiding betekent dus ongeveer tien keer meer deelnemers. Reken hun eigen som opnieuw met wat ze werkelijk maten, en je komt uit op 171. Precies het getal hierboven.

Wat dit onderzoek niet uitsluit

De p-waarde geeft één antwoord op één vraag: past dit bij "geen verschil"? Ze zegt niets over hoe groot het verschil dan wél zou kunnen zijn. Daarvoor bestaat een ander getal, dat je in onderzoeksartikelen vaak naast de p-waarde ziet staan: het 95%-betrouwbaarheidsinterval.

Dat interval is de reeks verschillen die redelijk bij deze meting passen. Je meet 0,5 kg, maar dat is één trekking uit een wereld met spreiding en toeval. Het interval zegt: gegeven wat we gemeten hebben, liggen de waarden die daar goed bij passen hiertussen. Een smal interval betekent dat je het verschil nauwkeurig hebt vastgepind. Een breed interval betekent dat je het nauwelijks hebt ingeperkt.

Voor het verschil van 0,5 kg tussen koolhydraat en soja loopt het interval van ongeveer 0,5 kg in het voordeel van soja tot 1,5 kg in het voordeel van koolhydraat.

Lees wat daar staat. Nul zit erin, en dat is precies waarom dit verschil niet significant is: "geen verschil" past gewoon bij deze meting. Maar 1,5 kg zit er óók in, en dat is de omvang van het effect dat whey wél liet zien. Dit onderzoek kan dus niet uitsluiten dat soja een halve kilo beter is, en evenmin dat koolhydraat anderhalve kilo beter is. Alles daartussen blijft mogelijk.

Zo zie je stap 2 en stap 4 in één getal terug. Nul zit erin, dus je hebt geen bewijs voor een verschil. Het interval is bijna twee kilo breed, dus je hebt ook nauwelijks iets uitgesloten. Dat is de reden dat je hier niet mag concluderen "koolhydraat is beter" én niet "ze zijn even goed".

Vandaar de eerlijke samenvatting van deze pagina: wij weten het niet. Het interval is die zin in getallen.

Cijfers uit Volek e.a. (2013), Whey Protein Supplementation During Resistance Training Augments Lean Body Mass, J Am Coll Nutr 32(2):122–135. Gerandomiseerd, dubbelblind, negen maanden begeleide krachttraining (96 trainingen). Verandering vetvrije massa na 9 maanden: koolhydraat (maltodextrine) 2,3 ± 1,7 kg (n = 22), soja 1,8 ± 1,6 kg (n = 22), whey 3,3 ± 1,5 kg (n = 19). Whey verschilde significant van zowel koolhydraat als soja; tussen koolhydraat en soja was er geen significant verschil. Het artikel meldt voor de vergelijking van de drie groepen op 9 maanden p = 0,016 en geeft geen aparte p-waarde voor koolhydraat tegen soja. De 32%, het betrouwbaarheidsinterval en de aantallen 171, 283 en 400 staan niet in het artikel; die zijn berekend uit de gepubliceerde gemiddelden en standaarddeviaties. Van de 147 gelote deelnemers voltooiden er 63 de negen maanden; geanalyseerd zijn alleen deelnemers die het trainingsprogramma afmaakten en het supplement trouw gebruikten. De uitersten per deelnemer in stap 1 zijn afgelezen uit figuur 2 van het artikel, de enige plek waar individuele uitkomsten staan; dat is een schatting op ongeveer een halve kilo nauwkeurig. De deelnemers op deze pagina zijn nagebootst op basis van het gemiddelde en de spreiding uit dat onderzoek, niet overgenomen als individuele meetpunten. Gemeten is vetvrije massa (lean body mass); op deze pagina staat kortheidshalve „spiermassa” — vetvrije massa omvat naast spierweefsel ook bot en vocht. Onderzoek gefinancierd door het Dairy Research Institute.