Variant C · forrige runde
Ekstra vekt på all nedbør
Haleleddet uten terskel, så det teller all nedbør, ikke bare den kraftige. Ensemblet ble bredere og det vanlige målet bedre, men den varslet kraftige regndøgn rundt 30 prosent for ofte.
Variant E · denne runden
C med en tredel av dosen
Det samme leddet, men med en tredel av vekten. Den skal treffe midt mellom kontrollarmen, som varsler for få kraftige døgn, og C, som varsler for mange. Det er den dette innlegget handler om.
Variant F · denne runden
Kontrollarmen, én gang til
Vanlig finjustering uten haleledd, trent på nytt med et annet seed. Den viser hvor store forskjeller to like oppskrifter gir av ren tilfeldighet. Den er ikke ferdig ennå.
I forrige runde var variant C den eneste som ikke klemte ensemblet sammen. Den ga haleleddet ekstra vekt på all nedbør, uten noen terskel. Ensemblet ble bredere, og det vanlige målet ble nesten to prosent bedre enn kontrollarmen. Men den gikk for langt: den varslet kraftige regndøgn rundt 30 prosent for ofte, og ble dårligere på nettopp kraftig nedbør.
Variant E er C med en tredel av dosen. Tanken var enkel: kontrollarmen varsler for få kraftige døgn, C for mange, og et sted mellom dem burde det stemme.
Varslene fra E ble ferdige i natt, to døgn før resten av runden. Dette er et første blikk på dem.
Et foreløpig blikk
Runden har tre kjøringer. D tester en myk terskel, E den lavere dosen, og F er kontrollarmen trent på nytt med et annet seed. F skal vise hvor store forskjeller to helt like oppskrifter gir av ren tilfeldighet. Uten F vet jeg ikke om en forskjell er et signal eller bare støy.
Reglene for runden ble låst før noe ble trent, og dommen kommer først når D og F også er ferdige. Det som står her, avgjør ingenting. Tallene for E blir de samme i den endelige rapporten, men tolkningen kan endre seg når F er på plass.
Riktig antall
På dette punktet gjorde E akkurat det den skulle. Kontrollarmen varsler døgn over 20 millimeter for sjelden, og C for ofte. E ligger nærmest riktig, med 0,92. Det samme gjelder ved 10 millimeter.
Ensemblet holdt seg også ærlig. Forholdet mellom spredning og feil er bare 0,016 lavere enn kontrollarmens, langt unna kollapsen i den opprinnelige halearmen. Og det vanlige målet ble 1,7 prosent bedre enn kontrollarmen, nesten like godt som C.
Men dårligere på kraftig nedbør
Her snur bildet. På CRPS over 20 millimeter, målet som teller i runden, er E 11 prosent dårligere enn kontrollarmen. Det er verre enn C, som hadde tre ganger så stor dose. Intervallet går fra omtrent null til klart dårligere, så forverringen er nesten større enn støyen. Det samme mønsteret viser seg ved 50 millimeter.
Etter reglene ville E dermed falt ut. Men det interessante er ikke dommen. Det er at riktig antall kraftige regndøgn ikke ga bedre varsler av kraftige regndøgn.
Hvorfor kan det bli slik?
CRPS over 20 millimeter straffer to slags feil. Den ene er å bomme på et døgn med kraftig regn. Den andre er å varsle kraftig regn som ikke kommer.
Kontrollarmen er forsiktig. Den varsler for få kraftige døgn, så den bommer på noen, men gir trolig færre falske alarmer. E varsler omtrent riktig antall, men det hjelper bare hvis den varsler dem på riktige steder og dager. Gjør den ikke det, bytter den bare noen bom mot flere falske alarmer, og falske alarmer over 20 millimeter koster.
Den mest sannsynlige forklaringen er derfor at ekstra vekt på nedbør endrer hvor mye kraftig regn modellen varsler, men ikke hvor godt den treffer med det. Den lærer at kraftig regn er vanligere, men ikke når og hvor det kommer.
Det er foreløpig en hypotese. Den kan testes direkte, ved å telle treff og falske alarmer for hver variant i stedet for å se på det samlede målet. Det gjør jeg når hele runden er ferdig.
Hva det kan bety
Hvis hypotesen holder, er det et viktig poeng for oppgaven. Å justere hvor mye en modell varsler av noe, er ikke det samme som å gjøre den flinkere til å varsle det. En vekt på nedbør i tapet kan flytte nivået, men ikke gi modellen ny informasjon om hvor regnet kommer.
Det passer med det etterbehandling gjør. Den kan rette nivået etterpå, og det er billig. Skal varslene faktisk treffe bedre på kraftig regn, trengs noe som gir modellen mer å lære av, ikke bare et sterkere ønske om å lære det.
Forbehold
- Foreløpig og utforskende. Dommen kommer med resten av runden, etter reglene som ble låst på forhånd.
- Én kjøring. Uten F vet jeg ikke hvor mye av forskjellen som er tilfeldig.
- 61 døgn fra vår og sommer. Intervallene er brede, og årstiden er dominert av byger, som er de vanskeligste å plassere.
D og F er ferdige i løpet av onsdagen. Da får runden sin dom, og E får sin målestokk.
