Talegjenkjenning og modeller

ASR

Automatic speech recognition, det engelske fagbegrepet for automatisk talegjenkjenning.

Engelsk: automatic speech recognition ·Også kalt: automatisk talegjenkjenning, speech-to-text, STT

ASR står for automatic speech recognition. Det er fagbegrepet for talegjenkjenning, og det du møter i teknisk dokumentasjon, forskningsartikler og API-navn.

Du ser også STT, speech-to-text, som betyr det samme. ASR brukes mest i forskningssammenheng, STT mest i produktsammenheng.

Hvorfor du møter forkortelsen

Feltet er engelskspråklig. Skal du lese om hvor god en modell er på norsk, finne et API, eller sammenligne to leverandører teknisk, er ASR ordet du søker på. Norske «talegjenkjenning» gir langt færre og mindre presise treff.

Det ASR ikke omfatter

  • Taleridentifikasjon, altså hvem som snakker. Det heter speaker recognition eller diarisering når det handler om å dele opptaket etter taler.
  • Talesyntese, altså å lage tale fra tekst. Det er TTS, text-to-speech, og går motsatt vei.
  • Språkforståelse. ASR skriver ned ordene. Hva de betyr, håndteres av en språkmodell etterpå.

Se også

Talegjenkjenning, ordfeilrate, Whisper.

Norsk tale, skrevet ut

Sayable transkriberer norsk med dialekt, skiller talerne og lager referatutkast. Gratis å komme i gang.