Przez dwie dekady Dragon NaturallySpeaking był złotym standardem dokładności dyktowania. Ta pozycja się zmienia. Silnik Whisper firmy OpenAI, w szczególności wariant Large v3 Turbo wydany w 2024 roku, osiągnął parytet z Dragonem przy ogólnym dyktowaniu i przewyższa go w wielu konkretnych przypadkach. Ten artykuł omawia to, co naprawdę wiemy na temat tego porównania, wraz ze źródłami.

Co oznacza „dokładność” w dyktowaniu

Dokładność dyktowania mierzy się zwykle jako współczynnik błędów słów (Word Error Rate, WER), czyli odsetek słów, które wyszły błędnie w transkrypcji. Im niżej, tym lepiej. WER na poziomie 5% oznacza, że 95 ze 100 słów jest poprawnych.

WER waha się ogromnie w zależności od warunków: głosu mówiącego, jakości mikrofonu, hałasu w tle, dziedziny słownictwa, stylu dyktowania. Liczba odniesienia ma znaczenie tylko wtedy, gdy znasz warunki, w jakich ją zmierzono.

Whisper Large v3 Turbo: opublikowane liczby

OpenAI opublikowało Whisper Large v3 Turbo w 2024 roku jako szybszy wariant Whisper Large v3 o porównywalnej dokładności. Podawane współczynniki błędów słów na standardowych testach porównawczych:

  • Whisper Large v3 (oryginał): 13,20% WER uśrednione na zbiorach wielojęzycznych
  • Whisper Large v3 Turbo: 13,40% WER — w granicach 0,2% od oryginału
  • Warunki czyste, tylko język angielski: 3–5% WER (97–95% dokładności)

Wariant Turbo działa około 4× szybciej niż v3 przy zasadniczo takiej samej dokładności. To silnik, którego używa CaringDictate.

W typowym zastosowaniu CaringDictate (angielski, ciche pomieszczenie, przyzwoity mikrofon) rzeczywista dokładność wynosi średnio 96–97% przy ciągłym dyktowaniu. Odpowiada to opublikowanym przez OpenAI liczbom dla czystych warunków angielskich i jest tym, co podajemy na naszych stronach marketingowych.

Zapewnienia Dragon o dokładności

Dragon historycznie reklamował dokładność 99%. Drobny druk: liczbę tę osiągano u przeszkolonych użytkowników z wysokiej jakości mikrofonami nagłownymi w cichym otoczeniu, po obszernym treningu głosowym. Nieprzeszkolony użytkownik Dragon pierwszego dnia widzi zazwyczaj raczej około 92–94% dokładności.

U przeszkolonych użytkowników Dragon Professional Individual z odpowiednią konfiguracją rzeczywista dokładność mieści się zazwyczaj w przedziale 95–98% przy ogólnym dyktowaniu. W wyspecjalizowanych dziedzinach (medycyna, prawo) przeszkolony Dragon może sięgnąć 98–99% przy słownictwie, do którego został dostosowany.

Szczere porównanie bezpośrednie

Dla nieprzeszkolonego użytkownika, z ogólnym zestawem słuchawkowym USB, dyktującego potoczny angielski: silniki oparte na Whisper (CaringDictate) zwykle wygrywają. Whisper nie wymaga treningu głosowego i działa dobrze od razu po wyjęciu z pudełka na szerokim zakresie głosów, na których został wytrenowany (ponad 680 000 godzin wielojęzycznego audio).

Dla przeszkolonego użytkownika, z mikrofonem najwyższej jakości (Plantronics, Andrea USB), dyktującego wyspecjalizowane słownictwo: przeszkolony Dragon Professional wciąż może zyskać przewagę przy konkretnym słownictwie, do którego został wytrenowany. Przy ogólnym pisaniu ta przewaga znacznie się zmniejsza.

Dla osób, dla których angielski nie jest językiem ojczystym, osób z akcentem lub osób z łagodną dyzartrią wynikającą ze schorzeń medycznych: Whisper ma wyraźną przewagę. Korpus treningowy był znacznie bardziej zróżnicowany niż w przypadku Dragona, a rozpoznawanie zauważalnie lepiej radzi sobie z różnicami w mowie.

Dla osób ze znaczną dyzartrią (zaawansowana choroba Parkinsona, ALS wpływające na mowę, mózgowe porażenie dziecięce wpływające na mowę): ani Whisper, ani Dragon nie jest właściwym narzędziem. Voiceitt jest zbudowany specjalnie dla tego przypadku i jest znacznie lepszy od obu, choć znacznie droższy.

Szybkość

Prawdziwą przewagą Whisper Turbo nad Dragonem jest szybkość. Whisper Large v3 Turbo na nowoczesnym sprzęcie (Intel i5 z ostatnich 5 lat, Apple Silicon lub dowolny nowoczesny procesor AMD) tworzy transkrypcję szybciej niż w czasie rzeczywistym — co oznacza, że możesz dyktować zdanie, a słowa pojawiają się, zanim skończysz mówić. Dragon również przetwarza w czasie rzeczywistym, ale ma bardziej zauważalne opóźnienie przy pierwszym słowie każdej wypowiedzi.

Przy dłuższym dyktowaniu ta różnica w szybkości ma głównie charakter psychologiczny. Przy dyktowaniu krótkich wiadomości (komentarze na Facebooku, szybkie e-maile) reaktywność Whisper Turbo wydaje się zauważalnie lepsza.

Kwestia danych treningowych

Tradycyjna przewaga Dragona w dokładności wynikała z nadzorowanego treningu głosowego: czytałeś Dragonowi długi fragment, a on budował osobisty model, który rozpoznawał Twój głos lepiej niż jego model domyślny. To działało, ale wymagało sporo czasu na początku.

Whisper nie działa w ten sposób. Został wytrenowany jednorazowo na ogromnym wielojęzycznym korpusie przez OpenAI, a powstały model jest tym, którego uruchamia każdy użytkownik Whisper. Nie trenujesz go na swoim głosie. Albo działa na Twoim głosie, albo nie — a szerokie dane treningowe oznaczają, że działa całkiem dobrze na większości głosów.

Wniosek dla użytkowników: z Dragonem możesz poświęcić czas na trening, by poprawić dokładność. Z Whisper to, co dostajesz pierwszego dnia, to to, co dostajesz w dniu 365. Dla większości użytkowników jest to zaleta, a nie wada — i tak nie chcieli poświęcać godziny na trening Dragona. Dla zaawansowanych użytkowników z technicznym słownictwem brak możliwości treningu głosowego Whisper jest realnym ograniczeniem.

Kwestia utrzymania

Dragon Professional Individual jest zamrożony na wersji 16 od 2023 roku. Silnik rozpoznawania nie jest aktualizowany. Microsoft przekierował Dragona na korporacyjny rynek medyczny i pozwala konsumenckiemu Dragonowi się zestarzeć.

Whisper natomiast jest aktywnie rozwijany przez OpenAI i społeczność open source. Whisper v3 został wydany w 2023 roku, Whisper v3 Turbo w 2024 roku, a kolejne modele są w aktywnym rozwoju. CaringDictate jest dostarczany dziś z v3 Turbo i zaktualizuje się do nowszych modeli jako bezpłatna aktualizacja, gdy okażą się lepsze.

W perspektywie pięcioletniej jest to najważniejsza różnica. Zamrożony silnik rozpoznawania będzie nadal działać, ale nie skorzysta ze znaczących ulepszeń zachodzących w innych miejscach tej dziedziny.

Dla konkretnych grup użytkowników

Osoby starsze z ogólnym angielskim słownictwem: Whisper (poprzez CaringDictate) to lepszy wybór. Bez treningu, bez złożoności konfiguracji, działa dobrze od razu po wyjęciu z pudełka.

Pracownicy medyczni dyktujący notatki kliniczne: Przeszkolony Dragon Medical One wciąż jest standardem branżowym. Słownictwo medyczne Whisper jest dobre, ale nie tak wyspecjalizowane.

Prawnicy dyktujący dokumenty prawne: Przeszkolony Dragon Professional z niestandardowym słownictwem trudno pobić. Whisper dobrze radzi sobie z większością prawniczego angielskiego, ale brakuje mu możliwości dostosowania.

Dorośli ze schorzeniami medycznymi wpływającymi na dłonie, ale nie na mowę: Whisper poprzez CaringDictate to to, co byśmy zalecili. Bez obciążenia treningiem, lepsza dokładność przy różnicach w mowie i znacznie taniej.

Osoby, dla których angielski nie jest językiem ojczystym: Whisper ma wyraźną przewagę. Wielojęzyczny korpus treningowy oznacza, że radzi sobie z akcentami znacznie lepiej niż modele Dragona trenowane na angielskim.

Podsumowanie

Whisper Large v3 Turbo i przeszkolony Dragon Professional dzieli teraz zaledwie kilka punktów procentowych w ogólnej dokładności dyktowania. Dla większości użytkowników, zwłaszcza osób starszych i użytkowników ze schorzeniami medycznymi, praktyczne zalety Whisper (brak treningu, lepsza obsługa akcentów, aktywny rozwój, znacznie niższy koszt) przeważają nad resztkową przewagą Dragona przy wyspecjalizowanym słownictwie.

CaringDictate jest zbudowany na Whisper Large v3 Turbo, ponieważ wierzymy, że to właściwy silnik dla naszych odbiorców. 30-dniowy zwrot pieniędzy oznacza, że możesz porównać samodzielnie bez żadnego ryzyka.

Gdzie iść dalej

Przeczytaj pełne porównanie CaringDictate z Dragon pod kątem różnic na poziomie produktu (cena, UX, aktualizacje, zwrot pieniędzy), a nasz przewodnik po prywatności jeśli przetwarzanie lokalne kontra w chmurze ma znaczenie w Twojej sytuacji.