Om du har jämfört dikteringsprogramvaror har du förmodligen samlat på dig en handfull procenttal — 99 %, 97 %, 95 % — och upptäckt att de inte hjälper dig att välja. Det är inte för att talen är ohederliga. Det är för att en enskild träffsäkerhetssiffra svarar på en annan fråga än den du ställer.
Du vill veta: hur väl kommer det här att förstå mig, vid mitt skrivbord, med min mikrofon? En publicerad träffsäkerhetssiffra svarar på: hur väl transkriberade den här motorn en viss uppsättning inspelningar som ingen av oss har hört? De två frågorna kan ha mycket olika svar.
Den här sidan förklarar hur mätningen fungerar, så att du kan läsa vilken leverantörs siffra som helst — inklusive någon du ser om oss — och veta vad den är värd.
Ordfelfrekvens, på vanlig svenska
Taligenkänningens träffsäkerhet rapporteras normalt som ordfelfrekvens, vanligen skrivet WER. Det är andelen ord som kom ut fel. Lägre är bättre, och "95 % träffsäkerhet" är bara ett annat sätt att skriva "5 % WER".
Vad som räknas som fel är mer specifikt än de flesta förväntar sig. Det finns tre sorters fel, och de läggs ihop:
- Substitutioner — ett ord kom ut som ett annat ord. Du sa "deras", det skrev "där".
- Utelämningar — ett ord du sa saknas i transkriptionen.
- Tillägg — ett ord dyker upp som du aldrig sa. Bakgrundstal och andningsljud orsakar det här.
Lägg ihop de tre och dela med antalet ord du faktiskt sa. Säg att du dikterar ett stycke på 100 ord och transkriptionen har fyra fel ord, ett saknat ord och ett extra ord: det är sex fel på 100 ord, en WER på 6 %, eller "94 % träffsäkerhet".
En konsekvens är värd att veta, eftersom den förklarar en hel del förvirrande marknadsföring: WER kan överstiga 100 %. Om programvaran lägger till fler ord än du sa — vilket händer i ett bullrigt rum — kan felantalet vara större än ordantalet. En siffra som inte kan gå över 100 är inte en ord- felfrekvens.
Varför samma programvara ger två personer olika resultat
Motorn är bara en av sakerna som avgör din träffsäkerhet, och ofta inte den viktigaste. Resten är din situation:
- Din mikrofon, och var den sitter. Det här är oftast den enskilt största faktorn, och den billigaste att åtgärda. En headsetmikrofon några centimeter från munnen hör något ganska annorlunda än en bärbar dators mikrofon tvärs över skrivbordet.
- Rummet. En tv i bakgrunden, en fläkt, ett öppet fönster, ett rum med hårda ytor och eko. Allt det når fram till igenkänningsmotorn tillsammans med din röst.
- Vad du dikterar. Vardaglig prosa är det enkla fallet. Namn, medicinsk eller juridisk terminologi, artikelnummer, adresser och förkortningar är mycket svårare, eftersom programvaran väljer mellan ord som låter lika.
- Hur du talar. Dialekt, tempo, volym, om du kör ihop meningar, om du tystnar mitt i. Inget av det är ett fel — det är bara variation som motorn antingen hanterar eller inte.
- Vilken modell du kör. De flesta programvaror som körs på enheten levereras med flera modeller av olika storlek. En liten modell som körs bekvämt på en äldre bärbar dator gör i allmänhet fler fel än en stor på en snabb dator.
Två personer som kör identisk programvara, med identiska inställningar, kan hamna flera procentenheter isär bara på det här. Det är gapet ingen publicerad siffra kan täppa till åt dig.
Vad ett jämförelsetal faktiskt mäter
Publicerade ordfelfrekvenser kommer från standardiserade forskningsdataset — fasta samlingar av inspelningar med verifierade transkriptioner, så att olika system kan bedömas mot samma material. Det är genuint användbart för dem som bygger programvaran: det är så man ser om den här månadens modell är bättre än förra månadens.
Det är mycket mindre användbart som köpguide, av tre skäl:
- Inspelningarna är inte dig. Jämförelseljudet har sina egna dialekter, sina egna mikrofoner och sitt eget ämnesinnehåll, inget av det är ditt.
- Olika leverantörer rapporterar olika tester. Två siffror mätta på två olika dataset går inte att jämföra, även när båda är ärligt rapporterade. Uppläst ljudbokstal och spontant samtal ger mycket olika resultat från samma motor.
- Förhållandena utelämnas ofta. En siffra angiven utan dataset, mikrofon och talstil är inget påstående du kan kontrollera.
När du väl ser en siffra är den användbara frågan inte "är den hög?" utan "uppmätt på vad?" Om det inte anges är siffran bara dekoration.
Två olika designfilosofier
Det finns en verklig teknisk skillnad mellan de äldre och nyare metoderna för igenkänning, och det är värt att förstå eftersom det förändrar vad "träffsäkerhet" ens betyder för en given produkt.
Tränade profiler. Den traditionella skrivbordsmetoden bygger upp en profil av din individuella röst och ditt ordförråd. Du lägger tid i förväg, och du kan fortsätta lära den — lägga till din egen terminologi, dina kollegers namn, orden ditt yrke använder. Dragon är den mest kända produkten byggd på det sättet, och Nuances eget material påstår upp till 99 % igenkänningsträffsäkerhet. Nackdelen är installationstiden, och att profilen är din att underhålla.
Generella modeller. Den nyare metoden tränar en stor modell på ett mycket brett spektrum av tal, en gång, och levererar samma modell till alla. OpenAIs Whisper-modeller är det mest kända öppna exemplet; den ursprungliga Whisper- artikeln beskriver träning på omkring 680 000 timmar ljud. Det finns inget registreringssteg — du installerar det och börjar tala — och det finns lika lite något sätt att lära det din röst. Vad du får dag ett är i stort sett vad du får senare, förutom vad programvaran lägger till runt modellen, som en personlig ordlista.
Ingen av metoderna är helt enkelt bättre. Om du dikterar specialistordförråd hela dagen är möjligheten att träna programvaran värd riktiga pengar. Om du vill installera något och använda det i eftermiddag är en registreringssession en kostnad utan fördel. Vilken som beskriver dig är inget en procentsats kan berätta för dig.
Testa det på din egen röst på tio minuter
Det här är det enda jämförelsetalet som svarar på din fråga, och det är lätt att köra på vilket dikteringsverktyg som helst med en provperiod — inklusive de gratis som redan finns på din dator.
- Skriv ut ett kort textstycke först — 150 till 200 ord. Använd ditt eget skrivande, inte ett exempelstycke: din e-poststil, ditt ämnesinnehåll, namnen du faktiskt skriver.
- Läs det högt in i programvaran på det sätt du normalt talar, sittande där du normalt sitter.
- Jämför de två sida vid sida och räkna substitutionerna, utelämningarna och tilläggen. Dela med ditt ordantal.
- Upprepa det en gång med en headsetmikrofon om du gjorde första försöket med en inbyggd. Den här enda förändringen är ofta värd mer än att byta produkt.
- Gör sedan ett realistiskt försök. Diktera något oskrivet — ett riktigt mejl — för det går lättare att tala från en sida än att tala från huvudet, och den andra siffran är den du kommer att leva med.
Kör samma textstycke genom två eller tre verktyg så har du något ingen recension kan ge dig: en jämförelse på din röst, din mikrofon och ditt rum. Om ett verktyg inte går att prova innan du betalar är det också värt att väga in.
Att läsa resultatet
Några procentenheter WER spelar mindre roll än var felen hamnar. Programvara som missar det enstaka korta ordet men får alla namn rätt är trevligare att använda än programvara med bättre poäng som förvanskar dina kollegers namn. Att rätta ett felaktigt ord kostar ett ögonblick; att lägga märke till det kostar uppmärksamhet.
Så bedöm transkriptionen, inte siffran. Läs vad som kom ut, fråga hur mycket städning det behöver, och fråga om det är mindre arbete än det hade varit att skriva det. Det är hela frågan.
Var CaringDictate hamnar
Vi publicerar inte en träffsäkerhetsprocent. Vi skulle kunna ta fram en — vem som helst kan — men den skulle mätas på inspelningar som inte är din röst, och att presentera den som en förutsägelse om din upplevelse vore vilseledande.
CaringDictate använder öppna taligenkänningsmodeller som körs på din egen dator, och det levereras med flera modellstorlekar så att det passar den maskin du har. Det finns en gratis sjudagars provperiod, som finns just för att den här frågan ska avgöras av din egen röst snarare än av vår marknadsföring. Om den gratis rösttypning som redan finns inbyggd i Windows räcker bra nog för dig när du kör testet ovan, är det ett bra utfall — använd det och behåll dina pengar.
Vart du går härifrån
Rutan ordlista för rösttypning förklarar resten av vokabulären du kommer att möta när du handlar. Den Dragon-jämförelsen täcker skillnader på produktnivå, och integritetsguide täcker var ditt ljud hamnar i lokala jämfört med molnbaserade verktyg.