De siste rundene har jeg begynt å måle varslene på en ny måte. Det er ikke fordi den gamle var feil. Den svarer bare på et annet spørsmål. Dette innlegget forklarer den nye måten fra bunnen av.
Før
Rå skår
Varslet tas som det er. CRPS over 20 millimeter straffer både bom og falske alarmer. En modell som varsler kraftig regn for ofte, taper, selv om den egentlig skiller godt mellom kraftige og vanlige døgn.
Nå
Kalibrert sannsynlighet
Først rettes overmotet: hver sannsynlighet modellen gir, byttes med hvor ofte det faktisk regnet så mye. Så måles hvor godt den kalibrerte sannsynligheten treffer. Det som står igjen, er modellens evne til å skille.
I tillegg
En målestokk for tilfeldigheter
Kontrollarmen trent på nytt med et annet seed. Den viser hvor langt fra hverandre to like oppskrifter havner, så en forskjell kan leses mot den.
Steg 1: Et enkelt spørsmål
Alt starter med et ja-eller-nei-spørsmål: blir det mer enn 20 millimeter regn ved denne målestasjonen dette døgnet?
Bris lager fire ensemblemedlemmer. Sannsynligheten modellen gir, er andelen av dem som varsler over 20 millimeter. Med fire medlemmer finnes det bare fem mulige svar: 0, 25, 50, 75 eller 100 prosent.
Fasiten er like enkel. Enten målte stasjonen over 20 millimeter, eller så gjorde den ikke det.
Steg 2: Betyr 75 prosent virkelig 75 prosent?
Så samler jeg alle døgnene der modellen sa det samme, og ser hvor ofte det faktisk regnet over 20 millimeter. Det gir én prikk per mulig svar.
En modell som sier det den mener, ligger på diagonalen. Begge modellene ligger godt under. Når alle fire medlemmene i kontrollarmen sier kraftig regn, kommer det i 74 prosent av tilfellene. For variant C er det bare 64 prosent. Begge er overmodige, men C er mest overmodig, fordi den varsler kraftig regn oftere.
Det er derfor C taper på de rå skårene. Den roper ulv oftere.
Steg 3: Kalibrering er en oversettelsestabell
Kalibrering betyr å bytte hvert svar modellen gir med hvor ofte det faktisk skjer. Det er en oversettelsestabell med fem linjer:
| Modellen sa | Kontrollarm betyr egentlig | Variant C betyr egentlig |
|---|---|---|
| 0 % | 0,8 % | 0,5 % |
| 25 % | 14 % | 10 % |
| 50 % | 32 % | 22 % |
| 75 % | 41 % | 43 % |
| 100 % | 74 % | 64 % |
Etter oversettelsen sier begge modellene det de mener. Overmotet er borte. Det eneste som kan skille dem nå, er hvor godt de skiller døgn med kraftig regn fra døgn uten.
Tabellen må gå oppover: flere medlemmer som sier ja, kan aldri bety lavere sannsynlighet. Metoden heter isotonisk regresjon, og den passer på akkurat det.
Steg 4: Ingen får jukse
Hvis oversettelsestabellen lages av de samme døgnene som den testes på, blir resultatet for pent. Derfor lages tabellen uke for uke:
1
Hold av én uke
Én uke legges til side. Den er det som skal testes.
2
Lag tabellen av resten
Oversettelsestabellen lages av alle de andre ukene, uten å se på den som er holdt av.
3
Test og gjenta
Tabellen brukes på uka som ble holdt av. Så gjøres det samme for hver uke, til alle er kalibrert av data de ikke var med i.
Steg 5: Hvor godt treffer sannsynligheten?
Til slutt måles hvor godt sannsynligheten treffer, med Brier-skåren. For hvert stasjonsdøgn tas forskjellen mellom sannsynligheten og fasiten, 1 hvis det regnet over 20 millimeter og 0 hvis ikke, og den kvadreres. Snittet over alle døgnene er skåren. Lavere er bedre, og 0 er perfekt.
Rå er C dårligere enn kontrollarmen. Etter kalibrering er den 6 prosent bedre. Kalibreringen hjelper begge, men C har mye mer overmot å rette opp, og under overmotet ligger en bedre evne til å skille.
Hvorfor kan den dårligste bli best?
Brier-skåren kan deles i to deler som trekker hver sin vei:
- Pålitelighet: hvor langt det modellen sier, er fra det som skjer. Her taper C, fordi den er mest overmodig.
- Oppløsning: hvor forskjellig det går med døgnene modellen setter i ulike grupper. Her vinner C.
Kalibrering fjerner den første delen. Da står bare oppløsningen igjen, og den er bedre hos C.
Tabellen over viser hvorfor. Når C sier 0 prosent, kommer kraftig regn i 0,5 prosent av tilfellene. Når kontrollarmen sier 0 prosent, kommer det i 0,8 prosent. C gjemmer færre kraftige døgn blant dem den kaller umulige. Den skiller rett og slett bedre. Det samme viser ROC-arealet, et mål på hvor godt en modell skiller, som er 0,84 for C og 0,76 for kontrollarmen.
Steg 6: Leses mot målestokken
Til slutt sammenlignes forskjellen med F, kontrollarmen trent på nytt med et annet seed. På CRPS over 20 millimeter, målet runden ble rangert på, havnet F hele 5 prosent fra kontrollarmen, og spredningen flyttet seg like mye som den opprinnelige halearmens kollaps. Ingenting annet var endret. På den kalibrerte Brier-skåren havnet den under én prosent unna.
Det er den viktigste grunnen til at jeg stoler mer på den nye måten. CRPS over terskelen og spredningen flytter seg mye bare av tilfeldigheter i treningen. Den kalibrerte skåren gjør det ikke, og der er variantene med ekstra vekt på nedbør langt utenfor det tilfeldighetene forklarer.
Hva den nye måten ikke kan
- Den måler ett spørsmål om gangen, som «over 20 millimeter». Den sier ikke hvor mye det regner når det først regner mye.
- Kalibreringen trenger data. Den må lages av andre dager enn den testes på, og den kan bare rette nivået, ikke flytte regnet til riktig sted.
- Fire medlemmer er få. En våtere modell havner sjeldnere på 0 prosent, og det kan alene gi den litt bedre oppløsning. Neste sjekk, med 16 medlemmer, skal skille det fra en ekte forskjell.
- Alt dette er fra vår og sommer. Den avgjørende testen er hele teståret, med en plan som ble låst før varslene fantes.
De rå og de kalibrerte skårene motsier altså ikke hverandre. De rå sier at variantene er dårlige varsler slik de kommer ut av modellen. De kalibrerte sier at det ligger mer kunnskap i dem enn det ser ut som, og at den kan hentes fram etterpå.
