Talegenkendelse og modeller

NB-Whisper

Det norske Nationalbibliotekets videretrænede version af Whisper, tilpasset norsk tale og dialekt.

Engelsk: NB-Whisper

NB-Whisper er en familie af talegenkendelsesmodeller fra det norske Nationalbibliotek, bygget ved at videretræne Whisper på store mængder norsk tale.

Udgangspunktet er det problem, at internationale modeller har hørt lidt norsk. Norsk er et lille sprog, og en model, der trænes på alt, den kommer over, får mange tusind gange mere engelsk. Resultatet er, at norsk fungerer, men bliver et biprodukt. Det samme gælder dansk.

Hvad videretræningen gør

Modellen får hørt meget norsk tale med facittekst, fra en samling, der dækker dialektbredden. Derefter genkender den mønstre, den før måtte gætte på.

Effekten er størst netop dér, hvor sproget er sværest. På tydelig standardtale i god lyd er forskellen fra en generel model lille. På bred dialekt er den ikke subtil.

Hvad den ikke løser

  • Egennavne. Efternavne og stednavne er stadig den største fejlkilde.
  • Nynorsk. Udtalen bestemmer ikke skriftsproget, og modellerne skriver som regel bokmål, uanset hvad der bliver sagt.
  • Kodeskift. Tale med engelske fagord indimellem er stadig krævende. Se kodeskift.
  • Flere talere i samme rum. Det er et diariseringsproblem, ikke et modelproblem.

Åbent tilgængelig

Modellerne er udgivet åbent og kan køres lokalt, på samme måde som Whisper. Det er grunden til, at flere nordiske værktøjer bygger på dem.

Se også

Whisper, finjustering, ordfejlrate.

Tale, skrevet ud

Sayable transskriberer tale med dialekt, skelner talerne og laver et udkast til referat. Gratis at komme i gang.