二十年來,Dragon NaturallySpeaking 一直是口述準確度的黃金標準。如今這個地位正在改變。OpenAI 的 Whisper 引擎,尤其是 2024 年推出的 Large v3 Turbo 版本,在一般口述上已達到與 Dragon 並駕齊驅的水準,並在許多特定情況下超越它。本文將透過資料來源,逐步說明關於這項比較我們實際所知的一切。

口述中所謂的「準確度」是什麼意思

口述準確度通常以字詞錯誤率(WER)衡量,也就是轉錄稿中出錯字詞所占的百分比。數字愈低愈好。WER 為 5% 代表每 100 個字裡有 95 個是正確的。

WER 會因條件不同而有極大差異:說話者的嗓音、麥克風品質、背景噪音、詞彙領域、口述風格。唯有當你知道某個基準數字是在什麼條件下測得的,它才有意義。

Whisper Large v3 Turbo:已公布的數字

OpenAI 於 2024 年推出 Whisper Large v3 Turbo,作為 Whisper Large v3 的更快版本,準確度相當。在標準基準測試上回報的字詞錯誤率為:

  • Whisper Large v3(原始版): 在多語言資料集上平均為 13.20% WER
  • Whisper Large v3 Turbo: 13.40% WER——與原始版相差在 0.2% 之內
  • 純英語、乾淨條件下: 3-5% WER(準確度 97-95%)

Turbo 版的執行速度約為 v3 的 4 倍,準確度卻幾乎相同。這正是 CaringDictate 所採用的引擎。

在 CaringDictate 的典型使用情境下(英語、安靜的房間、品質不錯的麥克風),連續口述的真實準確度平均為 96-97%。這與 OpenAI 公布的英語乾淨條件數字相符,也是我們在行銷頁面上所報告的數字。

Dragon 的準確度宣稱

Dragon 一向標榜 99% 的準確度。小字寫著:這個數字是在訓練過的使用者、搭配高品質耳機麥克風、在安靜環境中、經過大量語音訓練後達成的。一名第一天未經訓練的 Dragon 使用者,通常看到的準確度比較接近 92-94%。

對於設定妥當、訓練過的 Dragon Professional Individual 使用者來說,一般口述的真實準確度通常落在 95-98% 的範圍。在專業領域(醫療、法律),訓練過的 Dragon 在它所客製化的詞彙上,能逼近 98-99%。

誠實的正面對決

對於一名未經訓練、使用一般 USB 耳機麥克風、口述會話式英語的使用者:以 Whisper 為基礎的引擎(CaringDictate)通常勝出。Whisper 不需要語音訓練,在它所訓練過的廣泛嗓音範圍內,開箱即用就表現良好(超過 680,000 小時的多語言音訊)。

對於一名訓練過、使用頂級麥克風(Plantronics、Andrea USB)、口述專業詞彙的使用者:訓練過的 Dragon Professional 在它所訓練過的特定詞彙上,仍能略勝一籌。但在一般寫作上,這個優勢就大幅縮小了。

對於非母語英語使用者、有口音的說話者,或因醫療病症而有輕度構音障礙的說話者:Whisper 有明顯的優勢。它的訓練語料比 Dragon 的多元得多,辨識上能明顯更好地處理語音的變化。

對於有顯著構音障礙的說話者(嚴重的帕金森氏症、影響言語的 ALS、影響言語的腦性麻痺):Whisper 和 Dragon 都不是合適的工具。Voiceitt 是專為這種情況打造的,明顯比兩者都更好,儘管價格貴上許多。

速度

Whisper Turbo 相較 Dragon 真正的優勢在於速度。Whisper Large v3 Turbo 在現代硬體上(過去 5 年內的 Intel i5、Apple Silicon,或任何現代 AMD CPU)能以快過即時的速度產生轉錄——也就是說,你口述一個句子,字詞會在你說完之前就出現。Dragon 同樣是即時處理,但在每段話的第一個字上,延遲較為明顯。

對於長篇口述而言,這個速度差異大多只是心理上的。但對於短訊息口述(Facebook 留言、快速回信),Whisper Turbo 的反應靈敏度感覺明顯更好。

關於訓練資料的問題

Dragon 傳統上的準確度優勢,來自監督式的語音訓練:你會讀一長段文字給 Dragon 聽,它便建立一個比預設模型更能辨識你嗓音的個人模型。這個方法有效,但需要可觀的前期時間投入。

Whisper 並非如此運作。它由 OpenAI 在一個龐大的多語言語料上訓練過一次,得出的模型就是每一位 Whisper 使用者所執行的那一個。你不需要用自己的嗓音去訓練它。它要嘛適用於你的嗓音,要嘛不適用——而廣泛的訓練資料代表它對大多數嗓音都運作得相當好。

對使用者的意涵是:用 Dragon,你可以花時間訓練來提升準確度。用 Whisper,你第一天得到的,就是你第 365 天得到的。對多數使用者而言,這是優點而非缺點——反正他們本來就不想花一小時訓練 Dragon。但對於有技術詞彙的進階使用者而言,無法用語音訓練 Whisper 是個實實在在的限制。

關於維護的問題

Dragon Professional Individual 自 2023 年起就凍結在第 16 版。辨識引擎不再更新。Microsoft 已把 Dragon 轉向企業醫療市場,任由消費者版的 Dragon 逐漸淘汰。

相較之下,Whisper 由 OpenAI 與開源社群積極開發。Whisper v3 於 2023 年推出,Whisper v3 Turbo 於 2024 年推出,後續模型也正積極開發中。CaringDictate 目前隨附 v3 Turbo,並會在更新的模型證明更優秀時,以免費更新的形式更新到這些模型。

放眼五年的時間跨度,這是最重要的差異。一個凍結的辨識引擎仍會繼續運作,但它無法享有這個領域其他地方正在發生的大幅進步。

針對特定使用者族群

使用一般英語詞彙的年長使用者: Whisper(透過 CaringDictate)是更好的選擇。不需訓練、沒有設定上的複雜度,開箱即用就表現良好。

口述臨床紀錄的醫療專業人員: 訓練過的 Dragon Medical One 仍是業界標準。Whisper 的醫療詞彙不錯,但沒那麼專業化。

口述法律文件的律師: 搭配自訂詞彙、訓練過的 Dragon Professional 難以擊敗。Whisper 對大多數法律英語處理得很好,但缺乏可客製化的能力。

手部受影響但言語不受影響、患有醫療病症的成年人: 我們會建議透過 CaringDictate 使用 Whisper。沒有訓練的負擔、對語音變化的準確度更佳,而且便宜許多。

非母語英語使用者: Whisper 有明顯的優勢。多語言的訓練語料,意味著它處理口音的能力遠勝於 Dragon 那些以英語訓練的模型。

結論

如今,Whisper Large v3 Turbo 與訓練過的 Dragon Professional,在一般口述準確度上已相差不到幾個百分點。對多數使用者而言,尤其是年長者與患有醫療病症的使用者,Whisper 的實際優勢(不需訓練、更佳的口音處理、積極的開發、低廉許多的成本)勝過了 Dragon 在專業詞彙上殘存的優勢。

CaringDictate 建構於 Whisper Large v3 Turbo 之上,因為我們相信這是最適合我們客群的引擎。30 天退款代表你可以毫無風險地自行比較。

從這裡往下該怎麼走

閱讀完整的 CaringDictate 與 Dragon 比較 了解產品層面的差異(價格、使用體驗、更新、退款),以及我們的 隱私指南 若本機處理相較雲端處理對你的情況很重要的話。