Als u dicteersoftware heeft vergeleken, heeft u waarschijnlijk een handvol percentages verzameld — 99%, 97%, 95% — en gemerkt dat ze u niet helpen kiezen. Dat komt niet doordat de getallen oneerlijk zijn. Het komt doordat één enkel nauwkeurigheidscijfer een andere vraag beantwoordt dan de vraag die u stelt.
U wilt weten: hoe goed begrijpt dit mij, aan mijn bureau, met mijn microfoon? Een gepubliceerd nauwkeurigheidscijfer beantwoordt: hoe goed transcribeerde deze engine één specifieke set opnames die geen van ons beiden heeft gehoord? Die twee vragen kunnen heel verschillende antwoorden hebben.
Deze pagina legt uit hoe de meting werkt, zodat u het cijfer van elke leverancier — inclusief alles wat u over ons ziet — kunt lezen en weten wat het waard is.
Woordfoutratio, in gewone taal
Spraakherkenningsnauwkeurigheid wordt normaal gesproken uitgedrukt als woordfoutratio, meestal geschreven als WER. Het is het aandeel woorden dat fout is uitgekomen. Lager is beter, en "95% nauwkeurig" is gewoon een andere manier om "5% WER" te schrijven.
Wat als fout telt, is specifieker dan de meeste mensen verwachten. Er zijn drie soorten fouten, en die worden bij elkaar opgeteld:
- Substituties — een woord kwam eruit als een ander woord. U zei "hun", er verscheen "hen".
- Weglatingen — een woord dat u zei, ontbreekt in de transcriptie.
- Toevoegingen — er verschijnt een woord dat u nooit heeft gezegd. Achtergrondspraak en ademgeluid veroorzaken dit.
Tel de drie bij elkaar op en deel door het aantal woorden dat u daadwerkelijk heeft gesproken. Stel dat u een alinea van 100 woorden dicteert en de transcriptie vier foute woorden, één ontbrekend woord en één extra woord bevat: dat is zes fouten op 100 woorden, een WER van 6%, oftewel "94% nauwkeurig".
Eén gevolg is de moeite waard om te weten, want het verklaart veel verwarrende marketing: WER kan boven de 100% uitkomen. Als de software meer woorden toevoegt dan u heeft gesproken — wat gebeurt in een rumoerige ruimte — kan het aantal fouten hoger zijn dan het aantal woorden. Een cijfer dat niet boven de 100 kan uitkomen, is geen woordfoutratio.
Waarom dezelfde software bij twee mensen verschillende resultaten geeft
De engine is maar één van de factoren die uw nauwkeurigheid bepalen, en vaak niet de belangrijkste. De rest is uw situatie:
- Uw microfoon, en waar die zich bevindt. Dit is meestal de grootste factor, en de goedkoopste om te verhelpen. Een headsetmicrofoon op een paar centimeter van uw mond hoort iets heel anders dan een laptopmicrofoon aan de andere kant van het bureau.
- De ruimte. Een televisie op de achtergrond, een ventilator, een open raam, een ruimte met harde oppervlakken en galm. Dat alles bereikt de spraakherkenning samen met uw stem.
- Wat u dicteert. Alledaagse tekst is het eenvoudige geval. Namen, medische of juridische terminologie, onderdeelnummers, adressen en afkortingen zijn veel lastiger, omdat de software moet kiezen tussen woorden die op elkaar lijken.
- Hoe u spreekt. Accent, spreektempo, volume, of u zinnen aan elkaar laat lopen, of u wegzakt aan het eind. Niets daarvan is een gebrek — het is gewoon variatie waar de engine wel of niet goed mee omgaat.
- Welk model u gebruikt. De meeste software die op het apparaat zelf draait, wordt geleverd met meerdere modellen van verschillende grootte. Een klein model dat probleemloos draait op een oudere laptop, maakt over het algemeen meer fouten dan een groot model op een snelle machine.
Twee mensen die dezelfde software met dezelfde instellingen gebruiken, kunnen alleen al hierdoor meerdere procentpunten uit elkaar liggen. Dat is de kloof die geen gepubliceerd cijfer voor u kan dichten.
Wat een benchmarkcijfer werkelijk meet
Gepubliceerde woordfoutratio's komen uit standaard onderzoeksdatasets — vaste verzamelingen opnames met geverifieerde transcripties, zodat verschillende systemen op hetzelfde materiaal kunnen worden beoordeeld. Dat is echt nuttig voor de mensen die de software bouwen: zo kunnen zij zien of het model van deze maand beter is dan dat van vorige maand.
Als koopgids is het veel minder nuttig, om drie redenen:
- De opnames bent u niet. Benchmarkaudio heeft zijn eigen accenten, zijn eigen microfoons en zijn eigen onderwerpen, en geen daarvan zijn de uwe.
- Verschillende leveranciers rapporteren verschillende tests. Twee cijfers gemeten op twee datasets zijn niet vergelijkbaar, zelfs als beide eerlijk worden gerapporteerd. Hardop voorgelezen luisterboekspraak en spontane conversatie leveren bij dezelfde engine heel verschillende scores op.
- De omstandigheden worden vaak weggelaten. Een cijfer dat wordt genoemd zonder de dataset, de microfoon en de spreekstijl, is een bewering die u niet kunt controleren.
Als u wel een cijfer ziet, is de nuttige vraag niet "is het hoog?" maar "gemeten waarop?" Als dat niet wordt vermeld, is het cijfer versiering.
Twee verschillende ontwerpfilosofieën
Er is een echt technisch verschil tussen de oudere en nieuwere benaderingen van spraakherkenning, en het is de moeite waard om dat te begrijpen, omdat het verandert wat "nauwkeurigheid" eigenlijk betekent voor een bepaald product.
Getrainde profielen. De traditionele desktopbenadering bouwt een profiel van uw persoonlijke stem en woordenschat. U besteedt er vooraf tijd aan, en u kunt het blijven bijleren — uw eigen terminologie toevoegen, de namen van uw collega's, de woorden die in uw vakgebied worden gebruikt. Dragon is het bekendste product dat op deze manier is gebouwd, en Nuance claimt zelf tot 99% herkenningsnauwkeurigheid. De prijs die u ervoor betaalt, is de installatietijd, en het feit dat u zelf het profiel moet onderhouden.
Algemene modellen. De nieuwere benadering traint één keer één groot model op een zeer breed scala aan spraak, en levert datzelfde model aan iedereen. OpenAI's Whisper-modellen zijn het bekendste open voorbeeld; het oorspronkelijke Whisper-paper beschrijft training op ongeveer 680.000 uur audio. Er is geen inwerkstap — u installeert het en begint te praten — en er is dan ook geen manier om het uw stem aan te leren. Wat u op de eerste dag krijgt, is grotendeels wat u later ook krijgt, afgezien van wat de software er zelf omheen toevoegt, zoals een persoonlijke woordenlijst.
Geen van beide benaderingen is simpelweg beter. Als u de hele dag specialistische woordenschat dicteert, is de mogelijkheid om de software te trainen echt geld waard. Als u iets wilt installeren en vanmiddag al wilt gebruiken, is een inwerksessie een kostenpost zonder voordeel. Welke situatie op u van toepassing is, kan geen percentage u vertellen.
Test het in tien minuten op uw eigen stem
Dit is de enige benchmark die uw vraag beantwoordt, en u kunt hem eenvoudig uitvoeren op elk dicteerhulpmiddel met een proefperiode — ook op de gratis hulpmiddelen die al op uw computer staan.
- Schrijf eerst een korte passage op — 150 tot 200 woorden. Gebruik uw eigen tekst, geen voorbeeldalinea: uw eigen e-mailstijl, uw eigen onderwerpen, de namen die u daadwerkelijk typt.
- Lees het hardop voor aan de software op de manier waarop u normaal spreekt, zittend waar u normaal zit.
- Vergelijk de twee naast elkaar en tel de substituties, weglatingen en toevoegingen. Deel door uw aantal woorden.
- Herhaal het nog eens met een headsetmicrofoon als u de eerste keer een ingebouwde microfoon gebruikte. Alleen al deze verandering is vaak meer waard dan het overstappen naar een ander product.
- Doe dan een realistische test. Dicteer iets zonder script — een echte e-mail — want spreken vanaf een blad is makkelijker dan spreken uit uw hoofd, en het tweede getal is degene waar u het mee moet doen.
Laat dezelfde passage door twee of drie hulpmiddelen lopen, en u heeft iets wat geen enkele review u kan geven: een vergelijking op uw stem, uw microfoon en uw ruimte. Als een hulpmiddel niet uitgeprobeerd kan worden voordat u betaalt, weegt dat ook mee.
Het resultaat interpreteren
Een paar procentpunten WER doen er minder toe dan waar de fouten vallen. Software die af en toe een kort woord mist, maar elke naam goed krijgt, is prettiger in gebruik dan software met een beter cijfer die de namen van uw collega's verhaspelt. Een fout woord corrigeren kost een moment; het opmerken kost aandacht.
Beoordeel dus de transcriptie, niet het getal. Lees wat eruit is gekomen, vraag u af hoeveel opruimwerk het nodig heeft, en vraag u af of dat minder werk is dan typen zou zijn geweest. Dat is de hele vraag.
Waar CaringDictate staat
Wij publiceren geen nauwkeurigheidspercentage. We zouden er wel een kunnen produceren — dat kan iedereen — maar het zou gemeten zijn op opnames die niet uw stem zijn, en het als voorspelling van uw ervaring presenteren zou misleidend zijn.
CaringDictate gebruikt open spraakherkenningsmodellen die op uw eigen computer draaien, en wordt geleverd met meerdere modelgroottes zodat het past bij de machine die u heeft. Er is een gratis proefperiode van zeven dagen, die precies daarom bestaat: zodat deze vraag wordt beantwoord door uw eigen stem en niet door onze marketing. Als de gratis spraaktypen die al in Windows is ingebouwd goed genoeg scoort voor u wanneer u de test hierboven uitvoert, is dat een prima uitkomst — gebruik die en houd uw geld.
Waar u vanaf hier naartoe kunt
Het verklarende woordenlijst spraaktypen legt de rest van de terminologie uit die u tegenkomt tijdens het vergelijken. De vergelijking met Dragon behandelt de verschillen op productniveau, en de privacygids behandelt waar uw audio naartoe gaat bij lokale versus cloudhulpmiddelen.