Taligenkänning och modeller
Språkmodell
En modell som förutsäger sannolika ordföljder, och som används både i transkribering och för att göra sammanfattningar.
En språkmodell är en modell som tränats på stora mängder text, och som förutsäger vilka ord som sannolikt följer på varandra.
I transkribering spelar den två roller.
1. Den avgör tveksamma fall
Ljudet ensamt är ofta tvetydigt. ”Vi tar det på beredningsmötet” och ”vi tar det på beredningen, mötet” låter identiska. Modellen väljer den ordföljd som är mest sannolik i sammanhanget.
Det är också förklaringen till ett mönster många känner igen: systemet träffar bra på vanliga meningar och missar egennamn. Vanliga ordföljder har modellen sett miljontals gånger. Ditt efternamn har den aldrig sett.
2. Den gör sammanfattningen
Ett transkript från ett timslångt möte är runt 8000 ord. Att göra om det till ett protokoll med beslut och uppgifter är en uppgift för en språkmodell, inte för taligenkänningen. Det är två helt olika led i kedjan, även om de ofta säljs som en produkt.
Stora språkmodeller
LLM, large language model, används om de stora modellerna av typen GPT och Claude. De är språkmodeller i samma mening, bara mycket större och mer allmänna. I transkriberingssammanhang används de nästan alltid i led 2, till sammanfattning och strukturering, inte till själva taligenkänningen.