Talegjenkjenning og modeller
NB-Whisper
Nasjonalbibliotekets videretrente versjon av Whisper, tilpasset norsk tale og dialekt.
NB-Whisper er en familie talegjenkjenningsmodeller fra Nasjonalbiblioteket, bygget ved å videretrene Whisper på store mengder norsk tale.
Utgangspunktet er problemet at internasjonale modeller har hørt lite norsk. Norsk er et lite språk, og en modell trent på alt den kommer over, får mange tusen ganger mer engelsk. Resultatet er at norsk fungerer, men blir et biprodukt.
Hva videretreningen gjør
Modellen får høre mye norsk tale med fasittekst, fra en samling som dekker dialektbredden. Etter det kjenner den igjen mønstre den før måtte gjette på: bergensk r, nordnorsk tonefall, østnorske sammentrekninger.
Effekten er størst nettopp der norsk er vanskeligst. På tydelig østnorsk normaltale i god lyd er forskjellen fra en generell modell liten. På bred dialekt er den ikke subtil.
Hva den ikke løser
- Egennavn. Norske etternavn og stedsnavn er fortsatt den største feilkilden.
- Nynorsk. Uttalen bestemmer ikke skriftspråket, og modellene skriver som regel bokmål uansett hva som blir sagt.
- Kodeveksling. Norsk med engelske fagord innimellom er fortsatt krevende. Se kodeveksling.
- Flere talere i samme rom. Det er et diariseringsproblem, ikke et modellproblem.
Åpent tilgjengelig
Modellene er publisert åpent og kan kjøres lokalt, på samme måte som Whisper. Det er grunnen til at flere norske verktøy bygger på dem.
Se også
Whisper, finjustering, ordfeilrate, og artikkelen tale til tekst på norsk.