Halearmen ble ferdig i natt, etter 29 timer og 3 000 steg. Da har begge armene trent: kontrollarmen med Bris' vanlige skår, halearmen med den samme skåren pluss et ledd som gir nedbør over 20 millimeter ekstra vekt.
Alt i dette innlegget er sjekker på valideringsdata, ikke svaret oppgaven er ute etter. Det svaret krever varsler over testperioden sammenlignet med målere, og det står i kø for et grafikkort. Men sjekkene sier noe, og én av dem overrasket meg.
Det jeg ventet, og det som skjedde
Kontrollarmen hadde fått et problem av den vanlige finjusteringen: feltene ble for flekkete. Den lagde to til tre ganger for mye variasjon på skalaer under hundre kilometer, både i vind og nedbør.
Jeg ventet at halearmen ville gjøre det verre. Haleleddet belønner å treffe kraftig nedbør, og spredte småskala regnbyger passerer 20 millimeter lettere enn et jevnt felt. Det virket som en oppskrift på enda mer flekker.
Det motsatte skjedde. Tallene er hvor mye variasjon varselet har på hver skala, delt på hvor mye analysen har. 1,00 er riktig mengde detalj.
| Vind 10 m, 18 timer fram | 50–100 km | 20–50 km | 5–20 km |
|---|---|---|---|
| Urørt Bris | 1,22 | 1,13 | 1,12 |
| Kontrollarm | 2,24 | 2,49 | 2,69 |
| Halearm | 1,22 | 1,09 | 1,11 |
| Nedbør, 6 timer fram | 50–100 km | 20–50 km | 5–20 km |
|---|---|---|---|
| Urørt Bris | 0,90 | 2,27 | 2,86 |
| Kontrollarm | 2,09 | 6,15 | 9,00 |
| Halearm | 0,76 | 1,27 | 1,49 |
Halearmen er tilbake på nivå med urørt Bris i vinden, og for nedbør er den til og med jevnere. Vinden blir tilsvarende bedre enn kontrollarmen ved alle ledetider, mellom 4 og 14 prosent.
Jeg har ingen bekreftet forklaring. Den mest sannsynlige er at haleleddet sammenligner en terskelverdi av feltet, altså alt regn under 20 millimeter behandlet som 20, og at det å treffe en slik størrelse belønner sammenhengende nedbørsområder framfor spredte flekker. Men det er en hypotese.
Kraftigere der det faktisk regner
Halearmen varsler også mer nedbør der analysen har mest. For døgnet fram til 9. juli klokka 06, over hele det nordiske området:
| Snittvarsel der analysen hadde over 20 mm | Falske varsler over 20 mm | |
|---|---|---|
| Urørt Bris | 26,5 mm | 4 913–7 468 |
| Kontrollarm | 26,9 mm | 7 066–10 247 |
| Halearm | 28,6 mm | 7 771–9 679 |
Det er nettopp det haleleddet er bygget for: mer intensitet der det virkelig regner kraftig. Det er første tegn til at leddet gjør noe i riktig retning.
Prisen
Ingenting av dette er gratis.
Det vanlige tapet blir litt dårligere. Målt med kontrollarmens eget tap, uten haleledd, på de samme 23 valideringstilstandene:
| Modell | Tap i snitt |
|---|---|
| Urørt Bris | 2,177 |
| Kontrollarm | 2,130 |
| Halearm | 2,148 |
Halearmen er bedre enn urørt Bris på alle 23 tilstandene, men dårligere enn kontrollarmen på alle 23. Det er byttehandelen haleleddet er: litt generell dyktighet for mer oppmerksomhet på kraftig nedbør.
Lufttrykk og lange ledetider blir dårligere.
- Vind er bedre ved alle ledetider, mellom 4 og 14 prosent.
- Lufttrykk er dårligere overalt, og verst mot slutten: 42 prosent ved 30 timer.
- Nedbør er omtrent lik etter seks timer og klart dårligere fra 12 timer og utover.
- Temperatur er dårligere i midten og bedre helt mot slutten.
Nedbørsresultatet er verdt en presisering. Fram til 18 timer har halearmens medlemmer lavere gjennomsnittsfeil enn kontrollarmens, men likevel dårligere CRPS. CRPS måler hele ensemblet, så det betyr at medlemmene ligner for mye på hverandre. Ensemblet er blitt for sikkert på seg selv. Og ved 30 og 36 timer får den klart flere falske varsler over 10 millimeter.
Hvorfor dette ikke er svaret
Alt over hviler på én værhendelse, 8. juli 2025, med fire ensemblemedlemmer per modell. Datoen ble valgt fordi rangeringen flagget tre tilstander på rad, men regnet falt i Finland og Karelen, 656 kilometer fra nærmeste norske måler. Norge var nesten tørt den dagen, så ingenting av dette er sammenlignet med faktiske observasjoner. Sannheten her er MEPS-analysen.
Oppgavens spørsmål avgjøres et annet sted: varsler for hele testperioden, august 2025 til september 2026, som ingen av modellene har sett, sammenlignet med døgnnedbør fra 714 norske målere. Det er samme oppskrift MEPS allerede er målt med, og den fant 58 prosent av døgnene over 20 millimeter og 37 prosent av døgnene over 50.
Det som står igjen
Evalueringen er klar til å kjøre: 403 døgn, tre modeller, fire medlemmer, 60 timer fram. Den trenger rundt 120 timer på et grafikkort.
Der stopper det for øyeblikket. Alle brukbare kort på maskinen er opptatt, flere av dem av jobber med en ukes tidsgrense, og køen anslår at selv en test på 40 minutter starter om fem dager. Ett kort står ledig, men det er ødelagt: driveren svarer ikke, og jobben min kjørte videre på CPU uten å si fra. Det er verdt en melding til driftsfolkene.
Så nå venter jeg. Modellene er ferdige, koden er klar, og oppskriften er skrevet ned. Det som gjenstår er et grafikkort som er ledig lenge nok.
