Oppgaven stiller ett spørsmål: blir Bris flinkere til å varsle kraftig nedbør hvis den finjusteres med et ekstra ledd i tapet som bare bryr seg om kraftig nedbør?
Nå har jeg svaret, og det er nei. Med den vekten jeg målte og brukte, gjorde haleleddet varslene av kraftig nedbør dårligere enn vanlig finjustering, ikke bedre.
Hva som ble sammenlignet
Tre modeller har varslet hver dag fra 1. august 2025 til 6. september 2026, klokka 00 UTC, 60 timer fram og med fire ensemblemedlemmer:
- Urørt Bris, METs publiserte modell.
- Kontrollarmen, finjustert på nordiske data med vanlig tap.
- Halearmen, finjustert på nøyaktig samme måte, men med et ekstra ledd som straffer feil over 20 millimeter.
Varslene er summert over døgn fra 06 til 06 og sammenlignet med 714 norske målestasjoner. Det ga 397 dager og 259 178 stasjonsdøgn, der 9 255 hadde over 20 millimeter og 609 over 50. Fire dager mangler for alle modellene, fordi inndataene har hull akkurat der.
Reglene ble låst først
Før noen varsler var rettet, ble hele evalueringen skrevet ned og låst: hvilket mål som avgjør, hvilket døgn det gjelder, hvordan usikkerheten regnes ut, og hva som skal til for å kalle resultatet positivt.
Hovedmålet er forskjellen mellom halearmen og kontrollarmen i terskelvektet CRPS over 20 millimeter, for døgnet som slutter 30 timer etter start. Terskelvektet CRPS er det samme målet haleleddet selv er bygget på: det straffer både bommer og falske varsler, men bare over terskelen. Lavere er bedre.
Resultatet skulle regnes som positivt bare hvis hele 95-prosentintervallet lå under null. Intervallet kommer fra en blokk-bootstrap som trekker hele uker om gangen, fordi målere under det samme værsystemet ikke er uavhengige av hverandre.
Hovedresultatet
| Døgnet 30 timer fram | CRPS over 20 mm |
|---|---|
| Kontrollarm | 0,2457 |
| Halearm | 0,2634 |
| Forskjell | +0,0178 |
| 95 % intervall | +0,004 til +0,033 |
Hele intervallet ligger over null. Halearmen er ikke bedre enn kontrollarmen. Den er dårligere, rundt 7 prosent, og forskjellen er større enn det tilfeldig variasjon kan forklare.
Det er et negativt resultat, og det står.
Resten av bildet
| Døgnet 30 timer fram | Urørt Bris | Kontrollarm | Halearm | MEPS |
|---|---|---|---|---|
| CRPS, alt regn | 1,349 | 1,281 | 1,352 | – |
| CRPS over 20 mm | 0,260 | 0,246 | 0,263 | – |
| CRPS over 50 mm | 0,025 | 0,025 | 0,026 | – |
| Snittnedbør (målt 3,30 mm) | 2,79 | 3,25 | 3,06 | 3,68 |
| Døgn over 20 mm funnet | 49 % | 57 % | 56 % | 61 % |
| Døgn over 50 mm funnet | 17 % | 24 % | 31 % | 38 % |
| Andel falske varsler over 50 mm | 48 % | 59 % | 62 % | 56 % |
Kontrollarmens forbedring forsvant. Vanlig finjustering rettet opp at urørt Bris er for tørr, og det gjorde varslene bedre. Halearmen er omtrent tilbake der urørt Bris startet, og klart dårligere enn kontrollarmen både over alt regn og over 20 millimeter. To døgn fram er bildet det samme for CRPS over alt regn, mens forskjellen over 20 millimeter ikke lenger er målbar.
Halearmen finner flere av de aller kraftigste døgnene. Den varslet 31 prosent av døgnene over 50 millimeter, mot kontrollarmens 24. Det er nærmest noen Bris-modell kommer MEPS. Men den varsler også flere slike døgn som ikke kommer, og det riktige målet for 50 millimeter, CRPS over terskelen, viser ingen forskjell. Andelen treff talt bare på døgn der det faktisk regnet kraftig, belønner den som varsler mye. Planen sier derfor at slike tall bare beskriver, de beviser ingenting.
Hvorfor, trolig
Én observasjon gjør bildet sammenhengende. Snittet av halearmens fire medlemmer bommer litt mindre enn kontrollarmens, 1,85 mot 1,87 millimeter. Likevel er CRPS klart dårligere.
CRPS vurderer hele ensemblet, ikke bare snittet. Den belønner at medlemmene sprer seg like mye som usikkerheten faktisk er. Når snittet er like godt eller bedre, men ensemblet skårer dårligere, er den mest sannsynlige forklaringen at medlemmene ligner for mye på hverandre. Ensemblet er blitt for sikkert på seg selv.
Det var akkurat det jeg så i valideringsperioden: halearmen hadde lavere feil per medlem, men dårligere CRPS. Haleleddet ser ut til å dra modellen mot sterkere nedbør der det regner mest, men med en vekt på 13 716 koster det mer i spredning og generell dyktighet enn det tjener.
Det var en tolkning i etterkant, så jeg sjekket den.
Sjekken: er ensemblet ærlig?
Et ærlig ensemble sprer medlemmene sine omtrent like mye som varselet faktisk bommer. Hvis de fire medlemmene er nesten like, men snittet deres ofte bommer kraftig, er ensemblet for sikkert på seg selv.
Jeg målte det med forholdet mellom spredningen og feilen, justert for at det bare er fire medlemmer. Et ærlig ensemble gir 1. Under 1 betyr for sikkert, over 1 for usikkert. Sjekken er gjort på nøyaktig de samme stasjonsdøgnene som evalueringen, men den ble bestemt etter at svaret var kjent. Den kan forklare resultatet, ikke endre det.
| Døgnet 30 timer fram | Spredning mellom medlemmene | Feil i snittet | Forhold |
|---|---|---|---|
| Urørt Bris | 2,04 mm | 4,03 mm | 0,57 |
| Kontrollarm | 2,70 mm | 4,02 mm | 0,75 |
| Halearm | 2,30 mm | 4,08 mm | 0,63 |
Forklaringen holder. De tre modellene bommer nesten nøyaktig like mye, mellom 4,02 og 4,08 millimeter. Forskjellen ligger i spredningen: halearmens medlemmer er 15 prosent mindre uenige enn kontrollarmens. Forskjellen i forholdet er −0,12, med et intervall fra −0,15 til −0,09, og to døgn fram er den nesten like stor.
Når feilen er den samme og spredningen mindre, blir CRPS dårligere. Det er den mest direkte forklaringen på hovedresultatet. Haleleddet dro spredningen tilbake mot der urørt Bris lå, og mistet det meste av det kontrollarmen hadde vunnet.
Det gjelder også der det betyr mest. Der modellene varsler 20 millimeter eller mer, er forholdet 0,80 for kontrollarmen, 0,68 for halearmen og 0,63 for urørt Bris. Her er dagene sortert etter hva modellen varslet, ikke hva som ble målt, så sjekken belønner ikke den som varsler mye.
To forbehold hører med.
Alle tre ser for sikre ut, men det er delvis målingen. En regnmåler er et punkt, mens modellen varsler et snitt over en rute på 2,5 ganger 2,5 kilometer. En lokal byge kan treffe måleren og ikke ruta, og det teller som feil ingen modell kan spre seg for. Derfor er forholdene lavest der modellene varsler tørt. Tallene overdriver altså problemet, men sammenligningen mellom modellene er rettferdig, fordi de er målt på nøyaktig de samme dagene.
Mer spredning er ikke automatisk bedre fysikk. Valideringen viste at en del av kontrollarmens spredning kom fra småskala støy. Mot målerne lønte det seg, men det er ikke det samme som en modell som forstår usikkerheten sin bedre.
Hvorfor haleleddet krymper spredningen, vet jeg ikke sikkert. En mulig forklaring er at leddet gjør om alt regn under 20 millimeter til 20 før det måler. Da ser det ingen forskjell mellom medlemmene under terskelen, mens den store vekten drar dem mot de samme verdiene over den. Det må testes for seg.
En hendelse underveis
Evalueringen gikk ikke helt etter planen. To av jobbene som skulle fullføre halearmens varsler, ble avbrutt av systemet på klyngen mens de sto i kø. Den første rettingen kjørte derfor med bare 303 av halearmens 398 dager, og manglet august og sensommeren.
Den kjøringen er ikke svaret, siden en tredjedel av dagene manglet av en driftsfeil. Jeg fullførte varslene og kjørte den samme låste planen på nytt, uendret. Den ufullstendige kjøringen er tatt vare på. Den pekte i samme retning, med en forskjell på +0,018, så resultatet henger ikke på hvilke dager som manglet.
Hva det betyr
Svaret på spørsmålet oppgaven stiller er nei: med denne oppskriften og denne vekten ga haleleddet ikke bedre varsler av kraftig nedbør i Norge. Det ga dårligere.
Et negativt resultat er fortsatt et resultat. Oppsettet er laget for at det skal være til å stole på: en kontrollarm som bare skiller seg på tapet, et helt år ingen modell har sett, 714 faktiske målere, og regler som var låst før svaret var kjent.
Det gir også noe å gå videre med. Tre ting peker seg ut, og ingen av dem er testet med egne treninger ennå:
- Vekten. 13 716 ble valgt for at haleleddet og det vanlige leddet skulle veie like mye på ekstreme dager. En lavere vekt kan gi noe av gevinsten på de kraftigste døgnene uten å koste så mye spredning.
- Spredningen. Sjekken viser at haleleddet gjorde ensemblet for sikkert. Et haleledd som ikke krymper spredningen, eller en justering av spredningen i etterkant, er det første som bør prøves.
- Oppskriften. Begge armene manglet METs spektralledd og trente bare seks timer fram. Begge deler påvirker hvor godt modellen holder seg over lengre ledetider.
