Konfidensintervall

Kurs: Basvetenskap 5 Moment 2

Vad är det?

  • Ett konfidensintervall (KI) är ett intervall av värden som med angiven konfidensgrad (nästan alltid 95 %) är förenliga med data.
  • Formellt: om man upprepade studien oändligt många gånger skulle 95 % av de beräknade intervallen innehålla det sanna populationsvärdet. Det är alltså proceduren, inte det enskilda intervallet, som har 95 %-egenskapen.
  • Bredden bestäms av standardfelet, som i sin tur beror på spridningen i data och — framför allt — på stickprovsstorleken. Fyrdubblad studiestorlek halverar intervallets bredd.

Varför är det viktigt / Mekanism

  • KI innehåller all information som ett p-värde ger, plus mer. Om ett 95 % KI för ett kvotmått (RR, OR, HR) inte innehåller 1, är p < 0,05. Om ett KI för en skillnad inte innehåller 0, är p < 0,05.
  • Men KI säger dessutom hur stor effekten rimligen kan vara, vilket p-värdet inte gör. Det är den avgörande fördelen:
    • RR 1,05 (95 % KI 0,60–1,80) → “vi vet inte” — studien är för liten för att utesluta något.
    • RR 1,02 (95 % KI 0,98–1,06) → “sannolikt ingen kliniskt relevant effekt” — studien är stor och precis.
    • Båda har p > 0,05 och båda är “icke-signifikanta”, men de betyder helt olika saker. Detta är det starkaste argumentet för att läsa KI i stället för att bara titta på Statistisk signifikans.
  • Man ska läsa båda ändpunkterna och fråga sig om den ena eller andra vore kliniskt betydelsefull. Ett intervall som sträcker sig från “helt oviktig nytta” till “stor nytta” motiverar en större studie, inte en slutsats.
  • KI för kvotmått är asymmetriskt på den vanliga skalan, eftersom beräkningen görs på logaritmerad skala och sedan transformeras tillbaka. Punktskattningen ligger därför inte i mitten.
  • Vid multipla jämförelser gäller samma Multiplicitetsproblem som för p-värden: många KI innebär att flera kommer att missa det sanna värdet.

Klinisk relevans & Diagnostik

  • I metaanalyser (forest plots) visas varje studies KI som en horisontell linje; den poolade skattningen är en romb. Bredden visar direkt vilken studie som bär tyngden.
  • Vid non-inferiority-studier vänds logiken: man förklarar en behandling likvärdig om hela KI ligger på “godtagbar” sida av en förutbestämd marginal. Ett icke-signifikant p-värde duger inte för att visa likvärdighet.
  • För diagnostiska mått (Sensitivitet, Specificitet) med små tal blir KI mycket brett. En sensitivitet på 100 % baserad på 8 fall har ett KI som kan gå ner mot 65 % — vilket praktiskt betyder att testet är oprövat.
  • Vid noll händelser används exakta metoder (t.ex. Clopper-Pearson) eftersom normalapproximationen då kollapsar.

Klinisk pärla

“Icke-signifikant” är inte samma sak som “ingen effekt”. Frågan är alltid om studien var stor nog att kunna se effekten. Ett brett konfidensintervall är ett svar om studien, inte om verkligheten.

Tenta-fokus

Kunna översätta mellan KI och p-värde (KI för kvot innehåller 1 ⇔ p > 0,05), och kunna förklara varför ett brett KI kring 1 och ett smalt KI kring 1 leder till helt olika slutsatser trots samma p-värde.

Kopplingar

Relaterat: Statistisk signifikans, Relativ risk, Odds ratio, Statistisk power, Studiedesign, Randomiserad kontrollerad studie, Multiplicitetsproblem, Sensitivitet, Specificitet