Spørsmålet oppgaven stiller er enkelt å si: blir Bris flinkere til å varsle kraftig nedbør hvis den finjusteres med et ekstra ledd i tapet som bare bryr seg om kraftig nedbør?
Å svare på det krever tre modeller, ikke to. Dette innlegget går gjennom hva de tre er, hva hver av dem er til for, og hvordan de sammenlignes.
De tre modellene
Modell 1 · grunnlinje
Urørt Bris
Sjekkpunktet MET publiserte, brukt akkurat som det er. Ingen ekstra trening. Den viser hvor modellen står før jeg har gjort noe med den.
Modell 2 · kontrollarm
Vanlig finjustert
Urørt Bris, trent videre i 3 000 steg på MEPS-data fra oktober 2023 til mars 2025, med Bris' vanlige skår som tap. Den viser hva finjusteringen gjør i seg selv.
Modell 3 · halearm
Finjustert med haleledd
Nøyaktig den samme treningen, men tapet har et ekstra ledd som gir nedbør over 20 millimeter i Norden ekstra vekt. Det er denne modellen oppgaven handler om.
Hvorfor det ikke holder med to
Det naturlige er å sammenligne halearmen med urørt Bris og se om den ble bedre. Problemet er at halearmen har fått to ting urørt Bris ikke har fått.
Den har fått haleleddet, som er det jeg vil teste. Men den har også fått tre tusen steg med nordiske data. Bris er trent på et bredt utvalg vær, og bare det å trene videre på MEPS-feltene kan flytte hvordan den varsler nedbør i Norge, i begge retninger.
Hvis halearmen slår urørt Bris, vet jeg ikke hvilken av de to tingene som gjorde det. Kontrollarmen løser det. Den har fått de tre tusen stegene, men ikke haleleddet. Forskjellen mellom halearmen og kontrollarmen kan da bare komme fra haleleddet.
Alt som er likt
En kontrollarm er bare en kontroll hvis den er lik på alt annet. Det er det meste av arbeidet med oppsettet: å sørge for at de to armene faktisk bare skiller seg på tapet.
| Kontrollarm | Halearm | |
|---|---|---|
| Startpunkt | METs sjekkpunkt | METs sjekkpunkt |
| Treningsdata | MEPS okt 2023 – mar 2025 | MEPS okt 2023 – mar 2025 |
| Valideringsperiode | apr – jul 2025 | apr – jul 2025 |
| Antall steg | 3 000 | 3 000 |
| Læringsrate | 3,75 · 10⁻⁶, 100 steg oppvarming | 3,75 · 10⁻⁶, 100 steg oppvarming |
| Ensemblemedlemmer | 3 | 3 |
| Tilfeldig startverdi | 20260909 | 20260909 |
| Maskin | ett H200-kort | ett H200-kort |
| Tap | vanlig skår | vanlig skår + haleledd × 13 716 |
Den siste raden er den eneste som skiller dem. Halearmens konfigurasjon arver kontrollarmens og overstyrer bare tapet. Før innsending sammenligner et skript de to ferdig sammensatte konfigurasjonene nøkkel for nøkkel, og melder fra hvis noe annet enn tapet er forskjellig.
Sammenligningene
Med tre modeller blir det tre sammenligninger, og hver av dem svarer på sitt eget spørsmål.
Kontroll mot urørt
Hva finjustering gjør
Effekten av å trene videre på nordiske data med vanlig tap. Den forteller om utgangspunktet for halearmen er bedre, verre eller likt urørt Bris.
Hale mot kontroll
Hva haleleddet gjør
Den eneste forskjellen mellom disse to er tapet. Dette er sammenligningen oppgaven står og faller på.
Hale mot urørt
Hva man ender opp med
Den samlede effekten av alt. Det er denne en bruker av modellen merker, men den kan ikke si hva som forårsaket den.
Ved siden av de tre står MEPS, METs egen fysikkbaserte modell på samme rutenett. Den er ikke en del av forsøket, men en målestokk. Et tall for Bris betyr lite alene, siden et gitterpunkt aldri blir helt likt en regnmåler. MEPS viser hva en god modell faktisk får til mot de samme målerne.
Hvordan de dømmes
Alle tre modellene, og MEPS, skal varsle den samme perioden: august 2025 til september 2026. Ingen av dem har sett den. Den ligger etter både treningsdataene og valideringsperioden.
Varslene sammenlignes med døgnnedbør fra 714 norske målestasjoner, summert fra 06 til 06 UTC. Verdier Frost selv merker som svært usikre eller feil er tatt ut, det samme er én måler som sto fast på samme verdi i seks døgn. Alle modellene scores av det samme skriptet mot den samme listen, så ingen forskjell kan komme fra at de ble målt ulikt.
To tall rapporteres alltid sammen:
- Dager med kraftig nedbør. Hvor stor andel av døgnene over 20 og 50 millimeter modellen fant, og hvor nær mengden den kom.
- Vanlige dager. Hvor mye modellen bommer når det ikke skjer noe spesielt.
Det andre tallet er like viktig som det første. En modell som varsler mye regn hele tiden, finner alle de kraftige dagene og er likevel ubrukelig. Haleleddet har bare lyktes hvis halearmen blir bedre på de kraftige dagene uten å bli merkbart verre på alle de andre.
For å gi tallene en skala: MEPS fant 58 prosent av døgnene over 20 millimeter i testperioden, og 37 prosent av døgnene over 50.
Hvor det står
Kontrollarmen er ferdig. Den trente i 29 timer og fullførte alle 3 000 stegene uten feil. Halearmen står klar i køen, men venter på at maskinen den skal kjøre på blir tilgjengelig igjen.
En første prøvekjøring av kontrollarmen mot urørt Bris, for kraftig nedbør 4. oktober 2025, med et sjekkpunkt fra steg 2 793, viste at en finjustert Bris laster og gir fysisk rimelige felt. Den viste også at kontrollarmen fant færre av de kraftigste døgnene enn urørt Bris. Det var én dato og ett ensemblemedlem per modell, og medlemmene spriker mye når det gjelder nedbør. Om forskjellen er ekte eller tilfeldig, sjekker jeg med flere medlemmer før jeg legger noe vekt på den.
Uansett utfall er det nettopp dette kontrollarmen er til for. Hvis vanlig finjustering gjør modellen dårligere på kraftig nedbør, er det kontrollarmen halearmen må vurderes mot, ikke urørt Bris.
