Variant D
Myk terskel
Haleleddet med terskel på 5 millimeter, men med en glatt overgang i stedet for en skarp kant. Skulle holde fokuset på kraftig nedbør uten å klemme ensemblet sammen.
Variant E
C med en tredel av dosen
Ekstra vekt på all nedbør, uten terskel, men svakere enn C. Skulle treffe midt mellom en kontrollarm som er for tørr og en C som er for våt.
Variant F
Kontrollarmen, én gang til
Ingen haleledd. Nøyaktig samme oppskrift som kontrollarmen, bare med et annet seed. Den rangeres aldri, men viser hvor langt fra hverandre to like oppskrifter havner.
Runde 3 er ferdig. Reglene ble låst før noe ble trent, og etter dem er svaret enkelt: verken D eller E består. Begge ble dårligere enn kontrollarmen på kraftig nedbør, og etter planen blir det ingen full kjøring av noen av dem.
Men den viktigste kjøringen i runden var ikke en variant. Det var F.
Dommen
| Mot kontrollarmen, 30 timer fram | Spredning delt på feil | CRPS over 20 mm | Vanlig CRPS | Dom |
|---|---|---|---|---|
| D: myk terskel | +0,06 | 15 % dårligere | 0,6 % bedre | ute |
| E: en tredel av dosen | −0,02 | 11 % dårligere | 1,7 % bedre | ute |
| F: nytt seed | −0,10 | 5 % dårligere | 2,1 % dårligere | målestokk |
Tallene gjelder de samme 61 valideringsdøgnene fra april til juli 2025, 40 182 stasjonsdøgn.
Hva F viser
F er kontrollarmen en gang til. Samme data, samme antall steg, samme tap, samme alt. Det eneste som skiller dem, er seedet: tallet som bestemmer rekkefølgen dataene trekkes i og støyen ensemblemedlemmene får under treningen.
Likevel havner de et godt stykke fra hverandre.
F er 5 prosent dårligere enn kontrollarmen på kraftig nedbør, uten at noe er endret. Forholdet mellom spredning og feil faller med 0,10, like mye som den opprinnelige halearmen falt ved steg 2 000. Og den vanlige skåren er 2 prosent dårligere.
Det betyr at tilfeldigheter i treningen alene kan flytte disse tallene omtrent like mye som det jeg har tolket som virkninger av haleleddet.
Hva det betyr for det jeg har funnet
Dette er ubehagelig, og det må sies rett ut.
Hovedresultatet var at halearmen ble 7 prosent dårligere enn kontrollarmen på kraftig nedbør. Intervallet var smalt, men det fanget bare variasjonen mellom dagene i testperioden, ikke variasjonen mellom treningskjøringer. Jeg har én kjøring av hver arm. F viser at to like oppskrifter kan skille seg med 5 prosent. Da kan jeg ikke si sikkert at hele forskjellen kommer av haleleddet.
Det samme gjelder forklaringen jeg har bygget på. Ensemblet som krympet, og terskelserien der kollapsen fulgte hvor hardt terskelen klippet, ligger innenfor det samme spennet som F viser. Mønsteret kan være ekte, men én kjøring per variant er ikke nok til å vise det.
Det er ikke noe nytt i faget. Wessel og medforfattere trente hver modell hundre ganger av akkurat denne grunnen, og fant at tilfeldigheter i treningen alene kunne gi store forskjeller i hvordan halen oppførte seg. Jeg har nå målt det samme på Bris.
Etter kalibrering ser det annerledes ut
Det er én måling som tåler F. I forrige innlegg så jeg at variantene med ekstra vekt på nedbør varsler for mange kraftige døgn, og at det er falske alarmer som koster dem. Kalibrering retter nettopp det. Hver sannsynlighet ensemblet gir, kobles til hvor ofte det faktisk regnet så mye. Koblingen for hver uke lages av de andre ukene, så ingen uke kalibreres med seg selv.
Her havner F nesten nøyaktig på kontrollarmen, med en forskjell på under én prosent. To like oppskrifter blir altså like gode når overmotet er tatt bort. Det er det som gjør målingen brukbar.
Og her er alle tre variantene med ekstra vekt på nedbør bedre: C med 6 prosent, D med 5,5 og E med 4. Det er ti ganger mer enn F flytter tallet. De skiller også bedre mellom døgn med og uten kraftig regn. ROC-arealet, som måler nettopp det, stiger fra 0,73 for kontrollarmen til mellom 0,79 og 0,84.
Funnet har dessuten holdt seg der det har blitt testet:
- Tre ulike varianter viser det samme mønsteret, ikke bare én.
- På 59 nye døgn, som ikke var med da jeg først så mønsteret, er C og E 6 til 7 prosent bedre etter kalibrering ved 20 millimeter, med intervaller som ikke berører null.
- F, målestokken for tilfeldigheter, flytter den kalibrerte skåren under én prosent.
Hva neste test avgjør
Det er fortsatt utforskende. Funnet ble oppdaget i data jeg allerede hadde sett, og det er bare én årstid. Derfor har jeg skrevet og låst en ny plan før de nye varslene finnes: kalibrert C mot kalibrert kontrollarm over hele teståret, 397 døgn og alle årstider. Hver måned kalibreres med en kobling laget av de andre månedene. Resultatet regnes som positivt bare hvis hele intervallet ligger under null.
Varslene for teståret starter i dag. Samtidig kjøres en sjekk med 16 ensemblemedlemmer i stedet for fire, for å se om fordelen bare kommer av at fire medlemmer gir for grove sannsynligheter.
Holder det, er historien i oppgaven en annen enn den jeg begynte med. Ikke at et haleledd gjør Bris flinkere til ekstremvær, men at ekstra vekt på nedbør gir modellen bedre evne til å skille kraftige regndøgn fra andre, en evne som skjules av overmot og som kalibrering etterpå får fram.
Forbehold
- F er én kjøring. Den viser omtrent hvor store forskjellene mellom seed kan være, ikke hele fordelingen.
- Kalibreringsfunnet er utforskende til teståret er scoret etter den låste planen.
- Det gjelder sannsynligheten for over 20 millimeter, ikke hele fordelingen. Ved 50 millimeter er det for få hendelser til å si noe.
