Når man trener en modell, forventer man en tapskurve som faller og flater ut. Det er tegnet på at modellen har lært det den kan. Treningstapet til halearmen ser ikke slik ut i det hele tatt. Valideringstapet fra den samme treningen gjør det.
Her er begge, og forklaringen på hvorfor de forteller to ulike historier.
Treningstapet: hvert steg for seg
Dette ser ikke ut som en modell som lærer. De fleste punktene ligger i et bånd rundt 2, men noen stikker høyt opp, helt til 10. Det er ingen tydelig nedgang fra start til slutt.
Ser man på snittet over 150 steg om gangen, blir bildet roligere, men ikke klarere:
Halearmens snitt vandrer opp og ned mellom 2,0 og 2,4 og ender bare litt lavere enn der det startet, fra 2,20 til 2,05. Kontrollarmens snitt faller litt, fra 1,87 til 1,82, men nesten umerkelig.
Valideringstapet: samme tilstander hver gang
Her ser alt ut som det skal. Begge armene faller raskt de første 500 til 1 000 stegene og flater så ut. De siste 1 000 stegene gir bare to til fire prosent av den samlede forbedringen. Modellen har konvergert.
Begge armene er bedre enn urørt Bris på hvert eneste sjekkpunkt. Halearmen ender på 2,260, kontrollarmen på 2,243. Halearmen er altså bedre enn ingen finjustering, men dårligere enn vanlig finjustering.
Hvorfor de to ser så forskjellige ut
Det er den samme treningen, de samme vektene og den samme modellen. Forskjellen ligger i hva hvert punkt måler.
Ett treningssteg er én værtilstand. Hvert steg trener på én tilstand med tre ensemblemedlemmer. Tapet for det steget sier derfor mest om hvor vanskelig akkurat den dagen var. En rolig høytrykksdag gir lavt tap og en stormfull dag høyt, uansett hvor mye modellen har lært. Kurven over treningssteg er like mye en kurve over været i treningsdataene som over modellen.
Forbedringen er liten, og støyen er stor. Finjusteringen starter fra en modell som allerede er ferdig trent. Den gjør små justeringer, og hele forbedringen er rundt to prosent. Fra steg til steg varierer tapet med tjue prosent eller mer. En forbedring på to prosent drukner i det.
Haleleddet gjør det verre for halearmen. På ekstreme dager vokser haleleddet kraftig, siden det er ganget med en vekt på 13 716. Det er de dagene som gir toppene opp mot 10 i den første grafen. Kontrollarmen har ikke haleleddet, og derfor heller ingen slike topper.
Læringsraten er lav med vilje. Ved finjustering skal modellen flytte seg forsiktig, så den lærer langsomt og jevnt. Det gir ingen bratt nedgang i starten, slik man ser når man trener fra bunnen av.
Valideringstapet fjerner nesten all denne støyen. Det regnes ut på de samme tolv tilstandene ved hvert sjekkpunkt. Når været er det samme hver gang, er det bare modellen som endrer seg, og da synes den lille forbedringen tydelig.
Det er som å følge formen til en løper. Måler man tiden på en ny rute hver dag, noen ganger flat og noen ganger i motbakke, sier tiden mest om ruten. Løper hun den samme ruten hver gang, ser man om hun faktisk blir raskere.
Det ingen av kurvene viser
Valideringstapet viser at halearmen er dårligere enn kontrollarmen, men ikke hvorfor. Grunnen, at ensemblet ble for sikkert på seg selv, synes verken i treningstapet eller i valideringstapet. Den kom først fram da jeg lagde varsler fra sjekkpunktene og sammenlignet hvor mye medlemmene var uenige med hvor mye de bommet.
Tapskurvene sier om en modell har lært. Varslene sier hva den har lært. Derfor bedømmes de nye variantene på varsler, ikke på tap.
