Taligenkänning och modeller
Whisper
En öppen taligenkänningsmodell från OpenAI, som kan köras på egen dator.
Whisper är en taligenkänningsmodell som OpenAI släppte öppet 2022. Den tränades på mycket stora mängder ljud på många språk, och den kan laddas ner och köras på egen dator utan att be någon om lov.
Det sista är skälet till att den betyder så mycket.
Varför den förändrade fältet
Före Whisper var användbar taligenkänning i praktiken en molntjänst du köpte tillgång till. Efter Whisper kunde vem som helst köra en bra modell lokalt, utan kostnad per minut och utan att ljudet lämnade datorn.
Det öppnade transkribering för allt som inte kan laddas upp: patientsamtal, klientmöten, forskningsdata, personalärenden.
Modell, inte tjänst
Whisper är en modell, alltså en fil med vikter. Den har inget användargränssnitt, den hanterar inte filer åt dig, och den skiljer inte talare åt. Det gör programvaran runt den. När två verktyg båda ”använder Whisper” kan de ändå ge ganska olika resultat, beroende på vilken version och storlek de kör, och vad de gör före och efter.
Mindre språk
Whisper är tränad brett och internationellt, och varje mindre språk är ett bland många. Den hanterar nordiskt standardtal väl, men träffar sämre på bredare dialekt än modeller som vidaretränats på ett enskilt språk. NB-Whisper är just en sådan modell för norska.