Spørsmålet
Skiller C bedre?
Variant C er finjustert med ekstra vekt på all nedbør. Rå varsler den for mye kraftig regn. Spørsmålet er om den likevel skiller kraftige regndøgn bedre fra andre døgn når overmotet er rettet.
Regelen
Låst på forhånd
Planen ble skrevet og låst før varslene for teståret fantes. Positivt bare hvis hele 95-prosentintervallet for forskjellen i Brier-skår over 20 millimeter ligger under null.
Svaret
Positivt
Kalibrert er C 7 prosent bedre enn kalibrert kontrollarm. Intervallet går fra 10 til 5 prosent bedre, og berører ikke null.
I de to forrige innleggene fant jeg et mønster: variantene med ekstra vekt på nedbør ser dårlige ut på de rå skårene, men blir bedre enn kontrollarmen når sannsynlighetene er kalibrert. Problemet var at jeg fant det etter å ha sett på dataene, i én årstid. Et funn man leter seg fram til, kan være flaks.
Derfor låste jeg en plan før neste test. Den sa nøyaktig hva som skulle måles, på hvilke døgn, og hva som skulle regnes som positivt. Så laget jeg varsler for et helt år som verken C eller kontrollarmen var scoret på før. Nå er teståret ferdig.
Teståret
- Perioden: 1. august 2025 til 6. september 2026, alle årstider.
- Varslene: ett varsel per døgn fra hver modell, fire ensemblemedlemmer, døgnnedbør 30 timer fram.
- Fasiten: 259 178 stasjonsdøgn fra målestasjoner i Norden, og 9 124 av dem hadde over 20 millimeter.
- Kalibreringen: hver måned kalibreres med en oversettelsestabell laget av de andre månedene, så ingen måned ser seg selv.
Fire døgn manglet inndata og falt bort for begge modellene, slik at sammenligningen gjelder nøyaktig de samme døgnene.
Resultatet
Det er det samme bildet som i valideringsperioden, bare tydeligere:
| Over 20 mm | Rå | Kalibrert | ROC-areal |
|---|---|---|---|
| Kontrollarm | 0,0225 | 0,0216 | 0,85 |
| Variant C | 0,0240 | 0,0201 | 0,91 |
| C mot kontrollarm | 6,5 % dårligere | 7 % bedre |
Rå er C dårligere. Kalibrert er den bedre, med en forskjell på −0,00154 og et intervall fra −0,00218 til −0,00100. Hele intervallet ligger under null, og etter planen er svaret positivt.
ROC-arealet, som måler hvor godt modellen skiller døgn med kraftig regn fra døgn uten, stiger fra 0,85 til 0,91. Det er en stor forskjell for et slikt mål, og den er ikke påvirket av kalibreringen i det hele tatt.
Hvorfor rå og kalibrert sier motsatt
Overmotet er det samme som i valideringsperioden. Når alle fire medlemmene i C sier kraftig regn, kommer det i 71 prosent av tilfellene. Når halvparten sier det, kommer det i 30 prosent.
Treff og bom viser det samme. Hvis «ja» betyr at minst halvparten av medlemmene sier over 20 millimeter:
Fanger
1 546 flere kraftige døgn
C treffer 72 prosent av døgnene med over 20 millimeter. Kontrollarmen treffer 55 prosent.
Koster
2 849 flere falske alarmer
49 prosent av C sine ja er feil. For kontrollarmen er det 41 prosent.
Netto
Mer informasjon
De falske alarmene er systematiske og kan oversettes bort. Det kraftige regnet C fanger, kan ikke kontrollarmen hente fram på samme måte.
Det er derfor kalibrering hjelper C så mye mer. Kontrollarmen blir 4 prosent bedre av den, C blir 16 prosent bedre.
Alle tre tersklene
Planen sa at 20 millimeter var hovedmålet, men at 10 og 50 millimeter også skulle rapporteres.
- Over 10 millimeter er C 3,7 prosent bedre, og intervallet ligger under null.
- Over 20 millimeter er C 7 prosent bedre. Det er hovedresultatet.
- Over 50 millimeter er C 2,5 prosent bedre, men det var bare 603 slike døgn, og intervallet berører null. Ved 50 millimeter kan jeg ikke si noe sikkert.
Kalibreringen holder over årstidene
Planen hadde også en strengere variant. I stedet for å kalibrere hver måned med de andre månedene i teståret, brukte jeg oversettelsestabellene fra valideringsperioden, vår og sommer 2025, uendret på hele teståret.
Da er C 9 prosent bedre ved 20 millimeter, med et intervall som heller ikke berører null. Tabellen fra kontrollarmen hjelper knapt på et nytt år, men tabellen fra C gjør det. Overmotet til C er altså stabilt nok til at det kan rettes med en tabell laget på forhånd. Det er det som skal til for at dette kan brukes i et ekte varsel.
Hva det betyr
Den første store kjøringen i oppgaven var en halearm med en hard terskel på 20 millimeter. Den gjorde ikke Bris bedre på kraftig regn, og etter kalibrering skilte den heller ikke bedre enn kontrollarmen.
Variant C dropper terskelen og gir ekstra vekt til all nedbør. Den gjør Bris bedre til å skille kraftige regndøgn fra andre, over et helt år og alle årstider, testet med en plan som ble låst før varslene fantes. Prisen er at modellen sier kraftig regn for ofte, og det må rettes etterpå med kalibrering.
Det er en annen historie enn den jeg begynte med. Ikke at et haleledd gjør Bris flinkere til ekstremvær rett ut av modellen, men at ekstra vekt på nedbør legger mer kunnskap om kraftig regn inn i modellen, kunnskap som overmotet skjuler og kalibreringen får fram.
Forbehold
- Én treningskjøring per arm. Målestokken F, kontrollarmen med et annet seed, flyttet den kalibrerte skåren under én prosent. C sine 7 prosent er langt utenfor det, men F er også bare én kjøring.
- Fire medlemmer. En våtere modell havner sjeldnere på 0 prosent, og det kan alene gi bedre oppløsning. Sjekken med 16 medlemmer står i kø og avgjør hvor mye av fordelen som er ekte.
- Steg 2 000. Begge armene er tatt ved samme steg i en kortere kjøring. Om fordelen holder i en full kjøring, med flere år med data, er neste test.
- Kalibrert, ikke rå. C er dårligere enn kontrollarmen slik den kommer ut av modellen. Funnet gjelder bare sammen med kalibrering.
