Pokud jste porovnávali diktovací software, pravděpodobně jste nasbírali hrst procent — 99 %, 97 %, 95 % — a zjistili, že vám při výběru nepomáhají. Není to proto, že by ta čísla byla nepoctivá. Je to proto, že jediné číslo přesnosti odpovídá na jinou otázku, než jakou kladete.

Chcete vědět: jak dobře tohle porozumí mně, u mého stolu, s mým mikrofonem? Zveřejněné číslo přesnosti odpovídá na: jak dobře tento engine přepsal jednu konkrétní sadu nahrávek, kterou žádný z nás nikdy neslyšel? Tyto dvě otázky mohou mít velmi odlišné odpovědi.

Tato stránka vysvětluje, jak měření funguje, abyste dokázali přečíst číslo od jakéhokoli dodavatele — včetně toho, které vidíte o nás — a věděli, jakou má hodnotu.

Chybovost slov (word error rate) jednoduše

Přesnost rozpoznávání řeči se obvykle udává jako chybovost slov (word error rate), obvykle zkracovaná jako WER. Je to podíl slov, která vyšla špatně. Nižší je lepší, a „95% přesnost" je jen jiný způsob, jak napsat „5% WER".

Co se počítá jako chyba, je konkrétnější, než většina lidí čeká. Existují tři druhy chyb a sčítají se dohromady:

  • Záměny — slovo vyšlo jako jiné slovo. Řekli jste například „sud“ a software napsal „soud“.
  • Vynechání — slovo, které jste řekli, v přepisu chybí.
  • Vložení navíc — objeví se slovo, které jste nikdy neřekli. Způsobuje to řeč na pozadí a zvuk dechu.

Všechny tři typy se sečtou a vydělí počtem slov, která jste skutečně řekli. Řekněme, že nadiktujete odstavec o 100 slovech a přepis má čtyři špatná slova, jedno chybějící slovo a jedno slovo navíc: to je šest chyb ve 100 slovech, WER 6 %, neboli „94% přesnost".

Jeden důsledek stojí za to znát, protože vysvětluje spoustu matoucího marketingu: WER může přesáhnout 100 %. Pokud software vloží víc slov, než jste řekli — což se stává v hlučné místnosti — počet chyb může být vyšší než počet slov. Číslo, které nemůže přesáhnout 100, není chybovost slov.

Proč stejný software dává dvěma lidem různé výsledky

Engine je jen jedna z věcí, které rozhodují o vaší přesnosti, a často ne ta nejdůležitější. Zbytek je vaše situace:

  • Váš mikrofon, a kde se nachází. Toto bývá obvykle jednoznačně největší faktor, a nejlevnější na opravu. Mikrofon headsetu pár centimetrů od úst slyší něco docela jiného než mikrofon notebooku přes celý stůl.
  • Místnost. Televize v pozadí, ventilátor, otevřené okno, místnost s tvrdými povrchy a ozvěnou. To všechno se dostane k rozpoznávači spolu s vaším hlasem.
  • Co diktujete. Běžný text je snadný případ. Jména, lékařská nebo právní terminologie, čísla dílů, adresy a zkratky jsou mnohem těžší, protože software vybírá mezi slovy, která znějí podobně.
  • Jak mluvíte. Přízvuk, tempo, hlasitost, zda spojujete věty dohromady, zda vám hlas na konci utichá. Nic z toho není chyba — je to prostě variabilita, se kterou si engine buď poradí, nebo ne.
  • Jaký model používáte. Většina softwaru běžícího přímo v zařízení nabízí několik modelů různých velikostí. Malý model, který pohodlně běží na starším notebooku, obecně dělá víc chyb než velký model na rychlém počítači.

Dva lidé se stejným softwarem a stejným nastavením se mohou jen kvůli tomuto všemu lišit o několik procentních bodů. To je propast, kterou za vás žádné zveřejněné číslo nepřeklene.

Co benchmarkové číslo ve skutečnosti měří

Zveřejněné hodnoty chybovosti slov pocházejí ze standardních výzkumných datových sad — pevných souborů nahrávek s ověřenými přepisy, aby bylo možné hodnotit různé systémy podle stejného materiálu. To je pro lidi, kteří software vyvíjejí, opravdu užitečné: takto poznají, zda je letošní model lepší než ten loňský.

Jako průvodce nákupem je to mnohem méně užitečné, a to ze tří důvodů:

  • Nahrávky nejste vy. Benchmarkové nahrávky mají vlastní přízvuky, vlastní mikrofony a vlastní témata, z nichž nic není vaše.
  • Různí dodavatelé uvádějí různé testy. Dvě čísla naměřená na dvou různých datových sadách nejsou srovnatelná, i když jsou obě poctivě uvedená. Nahlas čtená audiokniha a spontánní konverzace přinesou u stejného enginu velmi odlišné výsledky.
  • Podmínky se často vynechávají. Číslo uvedené bez datové sady, mikrofonu a stylu mluvy není tvrzení, které si dokážete ověřit.

Když nějaké číslo uvidíte, užitečná otázka nezní „je vysoké?", ale „naměřené na čem?" Pokud to není uvedeno, je to číslo jen ozdoba.

Dvě odlišné návrhové filozofie

Mezi staršími a novějšími přístupy k rozpoznávání je skutečný technický rozdíl, a stojí za to mu porozumět, protože mění, co „přesnost" u daného produktu vůbec znamená.

Natrénované profily. Tradiční desktopový přístup vytváří profil vašeho individuálního hlasu a slovní zásoby. Na začátku strávíte nějaký čas, a pak ho můžete dál učit — přidávat vlastní terminologii, jména kolegů, slova z vašeho oboru. Dragon je nejznámější takto postavený produkt, a vlastní materiály Nuance tvrdí až 99% přesnost rozpoznávání. Nevýhodou je čas na nastavení a fakt, že profil je na vás ho udržovat.

Obecné modely. Novější přístup jednou natrénuje jeden velký model na velmi širokém spektru řeči a stejný model pošle úplně všem. Modely Whisper od OpenAI jsou nejznámějším otevřeným příkladem; původní práce o Whisperu popisuje trénování na přibližně 680 000 hodinách zvuku. Neexistuje žádný úvodní krok — nainstalujete a začnete mluvit — a stejně tak neexistuje způsob, jak ho naučit váš hlas. To, co dostanete první den, je zhruba to, co dostanete i později, kromě toho, co software kolem modelu přidá, jako je osobní seznam slov.

Žádný z přístupů není prostě lepší. Pokud celý den diktujete odbornou slovní zásobu, možnost natrénovat software má reálnou hodnotu. Pokud chcete něco nainstalovat a používat to hned dnes odpoledne, úvodní trénovací sezení je náklad bez přínosu. Co z toho popisuje vás, vám žádné procento neřekne.

Vyzkoušejte to na vlastním hlase za deset minut

Toto je jediný benchmark, který odpoví na vaši otázku, a snadno ho spustíte na jakémkoli diktovacím nástroji se zkušební verzí — včetně těch bezplatných, které už máte v počítači.

  • Nejdřív si napište krátkou pasáž — 150 až 200 slov. Použijte svůj vlastní text, ne ukázkový odstavec: svůj styl e-mailů, svá témata, jména, která skutečně píšete.
  • Přečtěte ji nahlas do softwaru způsobem, jakým byste normálně mluvili, a sedíce tam, kde normálně sedíte.
  • Porovnejte oba texty vedle sebe a spočítejte záměny, vynechání a vložení navíc. Vydělte je počtem svých slov.
  • Zopakujte to jednou s mikrofonem headsetu pokud jste první pokus dělali se zabudovaným mikrofonem. Tato jediná změna je často cennější než výměna produktu.
  • Pak proveďte realistický pokus. Nadiktujte něco nepřipraveného — skutečný e-mail — protože mluvit podle textu na stránce je snazší než mluvit z hlavy, a to druhé číslo je to, se kterým budete žít.

Projeďte stejnou pasáž přes dva nebo tři nástroje a budete mít něco, co vám žádná recenze nedá: srovnání na vašem hlase, vašem mikrofonu a vaší místnosti. Pokud nástroj nelze vyzkoušet před zaplacením, i to stojí za zvážení.

Čtení výsledku

Na pár procentních bodech WER méně záleží než na tom, kam chyby padají. Software, který občas vynechá krátké slovo, ale všechna jména zvládne správně, se používá příjemněji než software s lepším skóre, který komolí jména vašich kolegů. Oprava špatného slova stojí chvilku; všimnout si ho stojí pozornost.

Posuzujte tedy přepis, ne číslo. Přečtěte si, co vzniklo, zeptejte se, kolik úprav to potřebuje, a zeptejte se, zda je to méně práce, než by bylo psaní na klávesnici. To je celá otázka.

Kde stojí CaringDictate

Nezveřejňujeme procento přesnosti. Mohli bychom nějaké vytvořit — dokáže to každý — ale bylo by naměřené na nahrávkách, které nejsou váš hlas, a prezentovat ho jako předpověď vaší vlastní zkušenosti by bylo zavádějící.

CaringDictate používá otevřené modely rozpoznávání řeči, které běží přímo na vašem počítači, a nabízí několik velikostí modelů, aby se vešel na počítač, který máte. Existuje bezplatná sedmidenní zkušební verze, a existuje přesně proto, aby tuto otázku rozhodl váš vlastní hlas, ne náš marketing. Pokud vám bezplatné hlasové psaní, které už je zabudované ve Windows, při testu výše vyjde dost dobře, je to dobrý výsledek — používejte ho a nechte si své peníze.

Kam dál odtud

Pole slovníček pojmů hlasového psaní vysvětluje zbytek terminologie, se kterou se při výběru setkáte. Srovnání s Dragon pokrývá rozdíly na úrovni produktu, a průvodce soukromím pokrývá to, kam putuje váš zvuk u lokálních versus cloudových nástrojů.