Alt til nå har handlet om at maskineriet skulle virke. 1. april 2025 var en tilfeldig dag uten vær av betydning i seg selv — den var valgt fordi den lot seg kjøre, ikke fordi den betydde noe. Oppgaven handler om ekstremvær, og ingenting jeg hadde gjort testet det.
- oktober 2025 er den kraftigste hendelsen i hele tiårsmaterialet: sytten stasjoner over sin egen 99-persentil samme døgn, flere enn Hans. Den ligger innenfor arkivet. Med MARS-tilgangen på plass kunne den globale halvdelen for første gang initialiseres fra operasjonell analyse — kilden Bris faktisk er trent på — og LAM-en hentes fra MEPS for den faktiske datoen.
Dette er den første kjøringen som stiller spørsmålet oppgaven handler om.
Kontrollen er hele poenget
Et gitterpunkt er ikke en målestasjon. En rute på 2,5 kilometer er et arealgjennomsnitt, en måler er et punkt, og punktet kan fint få mer enn ruta det ligger i. Enhver sammenligning av den typen viser et underestimat, uansett hvor god modellen er.
Så tallet alene sier ingenting. Det som sier noe, er MEPS.
MEPS kjørte sin egen prognose for samme døgn, fra samme syklus Bris ble initialisert fra, på nøyaktig samme rutenett. Jeg scorer den mot de samme målerne, med samme nærmeste-punkt-regel, i samme døgnvindu. Alt det en punkt-mot-rute-sammenligning koster, koster den begge to like mye.
Da er avstanden mellom dem modellen, ikke metoden.
Resultatet
678 målere rapporterte i MEPS-domenet det døgnet.

| snitt | 90-pst | 99-pst | maks | ≥50 mm | ≥75 mm | |
|---|---|---|---|---|---|---|
| Observert | 24,3 | 60,3 | 91,4 | 143,5 | 127 | 24 |
| MEPS | 22,2 | 53,3 | 91,9 | 108,7 | 81 | 26 |
| Bris | 14,9 | 40,7 | 56,4 | 71,3 | 21 | 0 |
MEPS treffer 99-persentilen på 91,9 mot observerte 91,4. Den treffer antall målere over 75 millimeter med 26 mot 24. Den er ikke perfekt — den bommer på plasseringen, og maksimum er 108 mot 143 — men fordelingen er riktig.
Bris ligger på 0,62 av observert snitt der MEPS ligger på 0,91. Og over 75 millimeter finnes den ikke. Ikke ett eneste av 678 punkter. Modellens høyeste verdi noe sted i domenet er 71 millimeter, mens 24 målere målte over 75 og den våteste målte 143,5.

Spredningsplottet viser hva slags feil dette er. Bris er ikke tilfeldig dårlig — de røde punktene ligger systematisk under diagonalen, og hele skyen stopper i et vannrett tak ved 71 millimeter. MEPS' blå punkter spriker langt mer, både over og under, men de går gjennom taket.
Det er forskjellen på å bomme og på ikke å kunne treffe.
Hva slags svikt dette er
Forholdstallet ligger nær 0,6 gjennom hele fordelingen, ikke bare i halen. Det er verdt å merke seg, fordi det peker mot en generell tørr bias i dette tilfellet snarere enn en mekanisme som spesifikt demper ekstremer. Det stemmer med at glattingstesten fant mer varians hos modellen, ikke mindre.
Men konsekvensen er i halen uansett. Terskler som utløser varsler — 75 millimeter, 100 millimeter — nås aldri. En modell kan ha en jevn tørr bias og likevel være ubrukelig til det den skal brukes til, hvis biasen er stor nok til at grensene aldri krysses.
To feil jeg gjorde underveis
Begge trakk i retning av å smigre modellen, og begge er verdt å skrive ned.
Døgnvinduet. Frosts døgnnedbør er en 06–06-sum. Det står i elementets egen beskrivelse. Jeg summerte 00–00 første gang, altså seks timer forskjøvet. Det ga 0,70 i stedet for 0,62 — feilen fikk modellen til å se bedre ut enn den er, og et forskjøvet vindu er ikke til å skille fra en ekte tørr bias hvis man aldri sjekker.
Utvalget. Første forsøk scoret bare mot de stasjonene som definerte hendelsen. Det måler feil ting. De stasjonene er valgt nettopp fordi de observerte noe uvanlig høyt, så selv en perfekt prognose ville scoret som underestimat der — det er regresjon mot gjennomsnittet, ikke modellfeil. Tallet i tabellen er over alle 678 målere, uten betinging. Halen rapporteres ved siden av, som det den er.
Hva dette ikke er
Én hendelse. Én modellversjon. Én dato, ett initialiseringstidspunkt, ett døgn.
Nærmeste gitterpunkt uten interpolasjon, som er en hard sammenligning — men den er lik for begge modellene, og det er derfor kontrollen bærer.
Og en påminnelse som gjelder alt her: dette er den deterministiske MEPS-kjøringen, ikke ensemblet, og Bris er en CRPS-trent modell som er ment å beskrive en fordeling. Å sammenligne ett medlem med ett medlem er ikke urimelig, men det er heller ikke hele bildet.
Seks hendelser til ligger innenfor arkivet. Det er de som avgjør om 4. oktober var representativ eller et enkelttilfelle, og det er den neste jobben.
