如果您一直在比較語音輸入軟體,可能已經蒐集了一些百分比——99%、97%、95%——卻發現它們對您做決定沒什麼幫助。這並不是因為這些數字不誠實,而是因為單一的準確率數字,回答的是與您所問的問題不同的問題。

您想知道的是: 在我的書桌前、用我的麥克風,這款軟體能聽懂我到什麼程度? 而公佈的準確率數字回答的是: 這套引擎在一組我們兩人都沒聽過的特定錄音上,轉錄得如何? 這兩個問題可能有截然不同的答案。

這個頁面說明測量方式的運作原理,讓您在看到任何廠商的數字時——包括您在我們這裡看到的數字——都能了解它的實際價值。

白話解釋字詞錯誤率

語音辨識準確率通常以 字詞錯誤率(通常縮寫為 WER)呈現,指的是出錯字詞所佔的比例。數字越低越好,「95% 準確率」只是「5% WER」的另一種寫法。

什麼算是「錯誤」,比大多數人預期的更為明確。錯誤共有三種,並會加總計算:

  • 替換錯誤 ——說出的字被輸出成了另一個字。您說「their」,它卻打出「there」。
  • 刪除錯誤 ——您說過的字,並未出現在轉錄文字中。
  • 插入錯誤 ——文字中出現了您根本沒說過的字。背景人聲與呼吸雜音都可能造成這種情況。

將這三種錯誤加總,再除以您實際說出的字詞數。假設您口述了一段 100 個字的段落,轉錄結果中有四個字錯誤、一個字遺漏、一個字多出來:那就是在 100 個字中出現六個錯誤,WER 為 6%,也就是「94% 準確率」。

有一個結果值得了解,因為它能解釋許多令人困惑的行銷說法: WER 可以超過 100%。如果軟體插入的字比您實際說出的還多——在嘈雜的房間裡就可能發生——錯誤數量就可能超過字詞總數。一個無法超過 100 的數字,就不是字詞錯誤率。

為什麼同一款軟體會讓兩個人得到不同結果

引擎只是決定準確率的其中一項因素,而且往往不是最重要的一項。其餘的則取決於您自身的情況:

  • 您的麥克風,以及它擺放的位置。 這通常是單一影響最大的因素,也是最便宜就能改善的一項。距離嘴邊只有幾公分的耳機麥克風,所聽到的內容,與放在桌子對面的筆記型電腦麥克風截然不同。
  • 所在的房間。 背景的電視聲、風扇聲、打開的窗戶、有回音的硬質表面房間——這一切都會和您的聲音一起被辨識器接收到。
  • 您口述的內容。 日常用語是最容易的情況。人名、醫療或法律術語、零件編號、地址與縮寫則困難得多,因為軟體必須在發音相近的字詞之間做出選擇。
  • 您說話的方式。 口音、語速、音量、是否會把句子連在一起說、是否會愈說愈小聲。這些都不是缺點——只是引擎能否處理的各種變化而已。
  • 您執行的是哪一種模型。 大多數裝置端軟體會提供多種不同大小的模型。能在舊款筆記型電腦上順暢執行的小型模型,通常會比在高效能電腦上執行的大型模型犯下更多錯誤。

即使兩個人使用完全相同的軟體與設定,僅憑上述這些因素,結果就可能相差好幾個百分點。這就是任何公佈的數字都無法為您填補的差距。

基準測試數字實際測量的是什麼

公佈的字詞錯誤率,來自標準的研究資料集——固定的錄音集合,附有經過驗證的逐字稿,讓不同系統能以相同素材評分。這對開發軟體的人來說確實有用:這正是判斷這個月的模型是否優於上個月的方式。

但作為選購指南,它的用處就小得多,原因有三:

  • 這些錄音不是您。 基準測試的錄音有其自身的口音、麥克風與主題內容,沒有一項是您的。
  • 不同廠商公佈的是不同的測試。 在兩個不同資料集上測得的兩個數字並不能互相比較,即使兩者都是誠實公佈的結果。同一套引擎在朗讀有聲書與即興對話上,得出的分數會截然不同。
  • 測試條件通常被省略。 一個沒有附上資料集、麥克風與說話風格的數字,是您無法查證的說法。

當您看到一個數字時,值得問的問題不是「它高不高?」,而是「這是在什麼條件下測得的?」如果沒有說明,這個數字就只是裝飾。

兩種不同的設計理念

新舊兩種辨識方式之間確實存在技術上的差異,值得了解,因為這會改變「準確率」對某項產品究竟代表什麼意義。

訓練式語音檔。 傳統的桌面型方式,會為您個人的聲音與詞彙建立一份專屬語音檔。您需要先投入時間,之後也能持續教它——加入您自己的專業術語、同事的姓名、您所屬領域使用的字詞。Dragon 是以這種方式建構的最知名產品,Nuance 自家的資料宣稱辨識準確率最高可達 99%。代價則是設定所需的時間,以及這份語音檔需要由您自行維護。

通用模型。 較新的方式,是用極為廣泛的語音資料,一次訓練出一個大型模型,然後將同一個模型提供給所有人。OpenAI 的 Whisper 模型是最知名的開放範例;Whisper 原始論文描述其訓練資料約有 68 萬小時的音訊。這種方式沒有註冊訓練步驟——安裝好就能直接開口說話——但同樣地,也沒有辦法教它認識您的聲音。除了軟體在模型之外額外加入的功能(例如個人詞彙清單),您第一天得到的效果,大致上就是之後會持續得到的效果。

這兩種方式並無絕對的優劣之分。如果您整天都要口述專業詞彙,能夠訓練軟體就有實際的價值。如果您想要安裝完就在今天下午開始使用,那麼註冊訓練過程就只是一項沒有回報的成本。哪一種情況更符合您,不是一個百分比數字能告訴您的。

用十分鐘,以自己的聲音測試

這是唯一能回答您問題的基準測試,而且很容易在任何提供試用的語音輸入工具上執行——包括電腦裡已有的免費工具。

  • 先寫出一小段文字 ——約 150 到 200 字。使用您自己的文字,而非範例段落:您慣用的郵件風格、您的主題內容、您實際會打出的姓名。
  • 把它唸給軟體聽 以您平常說話的方式,坐在您平常會坐的位置。
  • 將兩份內容並排比較 並計算替換、刪除與插入錯誤的次數,再除以您的字詞總數。
  • 改用耳機麥克風再測一次 如果您第一次是用內建麥克風測試的話。單單這項改變,往往比更換產品更有效果。
  • 接著再做一次貼近實際情況的測試。 口述一些沒有事先寫好的內容——一封真正要寄出的電子郵件——因為照著文字唸,永遠比從腦中想出來說更容易,而第二個數字才是您日後實際會面對的結果。

用同一段文字測試兩到三款工具,您就能得到任何評測都給不了的東西:一個以您的聲音、您的麥克風、您所在的房間為基礎的比較結果。如果某款工具無法在付款前試用,這一點也值得列入考量。

解讀測試結果

WER 相差幾個百分點,其實不如錯誤出現在哪裡來得重要。偶爾漏掉一個短字、但能正確辨識每個人名的軟體,用起來會比分數更高、卻把同事名字打錯的軟體更令人愉快。修正一個錯字只需片刻,但發現它卻需要專注力。

所以,請評斷轉錄出來的文字內容,而不是那個數字。閱讀輸出的結果,想想它需要多少修改,並問問自己這是否比直接打字更省力。這就是全部的問題所在。

CaringDictate 的立場

我們不會公佈準確率百分比。我們當然可以做出一個——每個人都做得到——但那會是根據不是您聲音的錄音測得的結果,若把它當作對您實際體驗的預測來呈現,會有誤導之嫌。

CaringDictate 使用開放式語音辨識模型,在您自己的電腦上執行,並提供多種模型大小,以配合您現有的電腦效能。我們提供免費七天試用,其存在的目的,正是讓這個問題交由您自己的聲音來決定,而不是由我們的行銷說法來決定。如果您用上述方法測試後,發現 Windows 內建的免費語音輸入表現就已足夠好,那是個很好的結果——請使用它,並省下這筆錢。

從這裡往下該怎麼走

那個 語音輸入詞彙表 說明您在選購過程中會遇到的其餘詞彙。 Dragon 比較 涵蓋產品層級的差異,而 隱私指南 則說明本機端與雲端工具在音訊處理位置上的差異。