Bjälkebring statistik
Kapitel 9 & 12 · Intervall

Konfidens eller trovärdighet?

Sanningen är ett fast värde: ett intervall innehåller den eller inte. Både konfidensintervall och kredibilitetsintervall säger ”95 %”, men de syftar på olika saker, och inget av dem ger en sannolikhet för sanningen som är fri från antaganden.

20 oberoende studier av samma sak. Standardavvikelsen är känd (1), så standardfelet blir 0,25. Studie 1 är ”din” studie.

Konfidensintervall

95 % KI för varje studie. Ingen prior.

Kredibilitetsintervall

95 % posteriorintervall för samma studier, med vald prior.

Din studie, i detalj

Samma data, men välj en annan prior och se posteriorn flytta sig.

Prior Likelihood (data) Posterior

Samma data, fyra intervall

Samma 20 studier analyseras på fyra sätt. Data är exakt desamma i alla fyra – det enda som skiljer är vad man lägger till: ett påstående om metoden eller en prior.

AnalysDin studieTräffade i våra 20Priorns vikt

Hur ofta träffar intervallen i längden?

Gissa först

Vad händer när 100 forskare utan förkunskap väljer en prior – och när de dessutom har bekräftelsebias? Se Att hitta sanningen tar tid.

Vad betyder 95 % egentligen?

Konfidensintervall: 95 % gäller metoden

Om vi upprepar studien många gånger täcker 95 % av intervallen sanningen, vilket värde sanningen än har (om modellen stämmer). Kolumnerna i tabellen visar det: 95 % i båda.

Men 95 % handlar om proceduren, inte om ditt intervall. När du väl har räknat ut det täcker det sanningen eller inte.

Fel: ”Det är 95 % sannolikt att sanningen ligger i [0,12; 1,10].”
Rätt: ”Intervallet är beräknat med en metod som täcker sanningen i 95 % av upprepade studier.”
Kredibilitetsintervall: 95 % gäller posteriorn

Intervallet innehåller verkligen 95 % av posteriorfördelningen. Den sannolikheten är dock villkorad på priorn och modellen. Byter du prior flyttar sig intervallet, fast data och sanning är desamma.

Tabellen visar också att kredibilitetsintervallet träffar 95 % i längden, men bara i genomsnitt över priorn, alltså om sanningen verkligen är ”dragen” ur den prior du valde. Är sanningen ett fast värde som priorn missbedömer kan täckningen bli mycket lägre.

Fel: ”Det är objektivt 95 % sannolikt att sanningen ligger här.”
Rätt: ”Givet vår prior och modell ligger 95 % av posteriorsannolikheten i intervallet.”
Så vilket ska man använda?

De besvarar olika frågor och ger olika garantier. Konfidensintervallet lovar något om metoden i längden. Kredibilitetsintervallet ger en sannolikhet givet det man antog innan. Ingen av dem ger en sannolikhet för sanningen utan antaganden, och båda blir vilseledande när villkoren försvinner bakom lugnande ord som ”konfidens” och ”trovärdighet”.

Rapportera därför alltid vad intervallet vilar på: modell, och för Bayes även vilken prior (se kapitel 31 om APA-rapportering).

Varför ser de ofta likadana ut?

Med en svag prior blir kredibilitetsintervallet nästan identiskt med konfidensintervallet, och med en helt platt prior blir det exakt identiskt. Därför läser många konfidensintervallet på bayesianskt sätt – med vaga priorer ger det sällan fel siffror, bara fel påstående. Men att bayesianens 95 % har ”rätt namn” gör den inte objektiv: den är fortfarande villkorad på priorn.

Hur hittar man då sanningen?

Inte i en enda studie, oavsett metod. Ditt intervall innehåller sanningen eller inte – sannolikheten är objektivt 0 eller 1, och forskaren vet inte vilken. Tre saker tar oss närmare:

1. Mer data. Priorns vikt krymper när data växer. Dra i Deltagare per studie: med 16 deltagare väger den skeptiska priorn 74 % mot data, med 256 deltagare 15 %. Till slut landar alla fyra intervallen på samma ställe, nära sanningen.

2. Replikation. Konfidensintervallets 95 % blir något verkligt först över många studier. Därför är en metaanalys (kapitel 25–26) starkare än en enskild studie.

3. Granskade antaganden. Alla fyra analyserna delar samma modell: normalfördelning, inget systematiskt fel, ingen publikationsbias. Är modellen fel är alla intervallen fel – och inget av dem kan upptäcka det. Det är ett argument för god design (kapitel 13) och för att pröva flera rimliga priorer och se om slutsatsen håller.

Men uppdaterar inte Bayes priorn över tid? Jo – dagens posterior kan bli morgondagens prior, och med tillräckligt mycket data slutar priorn spela roll. Det är precis vad reglaget Deltagare per studie visar: att uppdatera studie för studie ger samma resultat som att analysera all data på en gång. Frekventisten samlar evidens på ett annat sätt, genom att slå ihop studier i en metaanalys. Båda når till slut samma svar – och båda kan konvergera mot fel svar om alla studier delar samma systematiska fel. Mer om det i Att hitta sanningen tar tid.

Ett intervall är inte ett fönster mot sanningen utan ett villkorat påstående. Konfidensintervallet villkorar på metoden, kredibilitetsintervallet på priorn – och båda på modellen.