Talegenkendelse og modeller
ASR
Automatic speech recognition, det engelske fagbegreb for automatisk talegenkendelse.
ASR står for automatic speech recognition. Det er fagbegrebet for talegenkendelse, og det, du møder i teknisk dokumentation, forskningsartikler og API-navne.
Du ser også STT, speech-to-text, som betyder det samme. ASR bruges mest i forskningssammenhæng, STT mest i produktsammenhæng.
Hvorfor du møder forkortelsen
Feltet er engelsksproget. Skal du læse om, hvor god en model er på dansk, finde et API eller sammenligne to leverandører teknisk, er ASR det ord, du søger på. Danske »talegenkendelse« giver langt færre og mindre præcise resultater.
Det, ASR ikke omfatter
- Taleridentifikation, altså hvem der taler. Det hedder speaker recognition eller diarisering, når det handler om at dele optagelsen efter taler.
- Talesyntese, altså at lave tale ud fra tekst. Det er TTS, text-to-speech, og går den modsatte vej.
- Sprogforståelse. ASR skriver ordene ned. Hvad de betyder, håndteres af en sprogmodel bagefter.