Talegenkendelse og modeller
NB-Whisper
Det norske Nationalbibliotekets videretrænede version af Whisper, tilpasset norsk tale og dialekt.
NB-Whisper er en familie af talegenkendelsesmodeller fra det norske Nationalbibliotek, bygget ved at videretræne Whisper på store mængder norsk tale.
Udgangspunktet er det problem, at internationale modeller har hørt lidt norsk. Norsk er et lille sprog, og en model, der trænes på alt, den kommer over, får mange tusind gange mere engelsk. Resultatet er, at norsk fungerer, men bliver et biprodukt. Det samme gælder dansk.
Hvad videretræningen gør
Modellen får hørt meget norsk tale med facittekst, fra en samling, der dækker dialektbredden. Derefter genkender den mønstre, den før måtte gætte på.
Effekten er størst netop dér, hvor sproget er sværest. På tydelig standardtale i god lyd er forskellen fra en generel model lille. På bred dialekt er den ikke subtil.
Hvad den ikke løser
- Egennavne. Efternavne og stednavne er stadig den største fejlkilde.
- Nynorsk. Udtalen bestemmer ikke skriftsproget, og modellerne skriver som regel bokmål, uanset hvad der bliver sagt.
- Kodeskift. Tale med engelske fagord indimellem er stadig krævende. Se kodeskift.
- Flere talere i samme rum. Det er et diariseringsproblem, ikke et modelproblem.
Åbent tilgængelig
Modellerne er udgivet åbent og kan køres lokalt, på samme måde som Whisper. Det er grunden til, at flere nordiske værktøjer bygger på dem.