您不應該需要翻譯才能購買一個其主要工作是將您的話語轉化為文字的工具。本頁面定義了您在比較語音輸入軟體時會遇到的每個術語 — 包括我們自己設定畫面中的術語。每個定義都是一句話;其後的詳細資訊為選讀。
基本概念
語音輸入
語音輸入是指您大聲說話,同時軟體將您的話語轉化為書面文字。人們也稱之為語音打字或語音轉文字。這三個名稱都意味著同一件事:您說話,電腦打字。
語音打字
語音輸入是語音聽寫的另一種說法 — 用說話代替打字,文字會出現在您的文字游標所在的位置。Windows 將其內建工具稱為「語音輸入」(Win+H 功能)。CaringDictate 在大多數程式中執行相同的工作,且沒有內建工具的超時限制。
語音轉文字
語音轉文字是一種將口語音訊轉換為書面文字的技術。在技術文章中,您會看到它縮寫為 STT。當產品說「由語音轉文字技術驅動」時,它指的是語音輸入。
語音辨識
語音辨識是電腦理解人類語音的更廣泛領域 — 包括您說了什麼(語音輸入)和您想表達什麼(命令)。語音輸入應用程式使用語音辨識來寫下您的話語。語音助理則使用它來執行命令。
轉錄
轉錄是指將語音錄音 — 會議、採訪、語音郵件 — 事後轉化為書面文件。語音輸入是即時的(您在說話時看到文字出現);轉錄通常是稍後從檔案進行。像 Otter.ai 這樣的工具是轉錄工具,而不是語音輸入工具。
辨識原理
語音模型(辨識模型)
語音模型是語音輸入程式的訓練大腦 — 實際理解語音的文件。更大的模型通常更準確,但需要更強大的電腦。CaringDictate 會選擇適合您機器的模型大小,從約 190 MB 到約 3.1 GB。
Whisper
Whisper 是 OpenAI 於 2022 年發布的開源語音模型系列,以其在多種語言中接近人類的準確性而聞名。它是許多現代語音聽寫和轉錄產品(包括 CaringDictate)的引擎。由於它是開源的,因此可以完全在您自己的電腦上運行。
裝置內建(離線)辨識
裝置內建辨識表示您的語音在您自己的電腦上處理 — 音訊絕不會傳輸到公司的伺服器。這無需網路即可運作,保護您的私人想法,並且不會因為服務中斷而停止運作。CaringDictate 就是這樣運行的。
雲端辨識
雲端辨識是指您的語音透過網路串流傳送至廠商的伺服器,在該處轉換為文字後再傳回。辨識作業是在伺服器上進行,而非在您自己的裝置上。任何特定工具的辨識方式,都會在其官方文件中說明,有些產品甚至同時提供兩種方式——值得實際查證,而非自行假設。
準確度(詞錯誤率)
準確度是語音輸入程式正確識別的詞彙百分比;詞錯誤率 (WER) 是反向測量的相同概念 — 即識別錯誤的百分比。現代基於 Whisper 的語音輸入在清晰的英語語音上具有高度準確性。結果會因麥克風品質、背景噪音以及您說話的清晰度而異。
延遲
延遲是指完成一個句子到看到文字出現之間的時間差。低於約三分之一秒會感覺即時;超過這個時間就會感覺卡頓。裝置內建辨識避免了伺服器往返,這有助於減少延遲。
自動語言偵測
自動語言偵測表示軟體無需告知即可判斷您正在說哪種語言。如果您在一天中切換語言,這會很有用。CaringDictate 的「自動」設定在其支援的 20 種語言中執行此功能。
日常使用語音聽寫應用程式
說話按鈕(熱鍵)
說話按鈕是啟動和停止語音聽寫的單一按鍵或滑鼠按鈕。在 CaringDictate 中,預設是右 Ctrl 鍵,您可以將其更改為任何對您的手來說舒適的按鍵或滑鼠按鈕。
按住說話(按住以說話)
按住說話表示在您說話時按住說話按鈕,並在完成時釋放 — 就像對講機一樣。適用於短暫的語音輸入:搜尋框、快速回覆。另一種選擇是輕觸切換,更適合較長的寫作。
切換(輕觸以說話)
切換模式表示輕觸說話按鈕一次開始聽寫,再輕觸一次停止。在此期間您的雙手完全自由 — 當按住按鍵不舒服時,或當您聽寫長篇內容時,這會很有幫助。
喚醒詞(語音啟動)
喚醒詞是您大聲說出的一個詞組 — 例如「開始聽寫」 — 它無需觸摸鍵盤或滑鼠即可開始語音聽寫。當觸及鍵盤很困難時,這一點最為重要。CaringDictate 在 3.5 版中添加了用戶可設定的語音啟動功能。
聽寫指示器
聽寫指示器是螢幕上顯示麥克風正在運作且您的話語正在被聽到的微小信號。一個值得信賴的指示器很重要:您絕不應該懷疑電腦是否正在聽寫。
語音指令
語音指令是口頭指示 — 例如「新行」或「刪除那個」 — 用於控制格式而不是寫入文字。語音聽寫應用程式在這方面差異很大。簡單的指令涵蓋了大多數日常寫作;重度免手動電腦控制是一個單獨的類別(請參閱 Voice Access)。
標點符號指令
標點符號指令是說出「句號」、「逗號」或「問號」來插入標點符號。像 Whisper 這樣的現代引擎也會根據您的措辭和停頓自動標點,因此您通常可以自然地說話。
自訂詞典(詞彙列表)
自訂詞典是您個人的名稱和特殊詞彙列表,辨識器應該信任這些詞彙 — 姓氏、藥物名稱、行業術語。一次添加「Zofran」或「Oaxaca」勝過永遠糾正它。CaringDictate 在「寫作與詞彙」下包含一個。
文字插入
文字插入是指您口述的文字如何實際出現在文件中——應用程式會逐鍵輸入或一次性貼上。在不同程式中,貼上整個詞組更快且更可靠,這就是 CaringDictate 傳送文字的方式。
Windows 專用術語
Win+H (Windows 語音輸入)
Win+H 是在 Windows 10 和 11 上開啟內建語音輸入列的鍵盤快捷鍵。免費、內建於 Windows,是日常聽寫的合理首選試用工具。Windows 11 也內建 Voice Access,提供完整的電腦語音控制,並附有自訂詞彙與文字校正功能。
Windows Voice Access
Voice Access 是 Windows 11 的免手持電腦控制功能——透過語音點擊、捲動和切換視窗,並包含聽寫功能。它專為透過語音完全控制電腦而設計。如果您主要想要的是舒適的寫作,專用的聽寫工具通常是更好的選擇。
Windows 語音辨識 (WSR)
Windows Speech Recognition 是較舊的內建聽寫工具,Microsoft 已棄用它,轉而使用 Voice Access。如果您在舊電腦上依賴 WSR,它的退役通常是您刻意選擇替代品,而不是繼承 Windows 下一個提供的任何工具的時機。
麥克風隱私設定
麥克風隱私設定是 Windows 的開關,用於決定哪些程式可以使用您的麥克風。如果聽寫應用程式聽不到任何聲音,這是第一個要檢查的地方:設定 → 隱私權與安全性 → 麥克風。
預設麥克風
預設麥克風是 Windows 交給程式使用的麥克風,除非程式另有選擇。筆記型電腦通常有多個(內建、耳機、網路攝影機)。選擇正確的麥克風——靠近您的嘴巴,遠離風扇——比任何設定更能提高準確性。
購買條款
一次性購買(永久授權)
一次性購買意味著支付一次費用並擁有該軟體——無需每月或每年支付費用即可繼續使用。CaringDictate 僅需 $49,並包含更新。另一種模式是訂閱,只要您繼續輸入,就會持續收費。
訂閱
訂閱是每月或每年支付費用以持續存取軟體——停止支付,它就會停止運作。對於有持續伺服器成本的服務來說是合理的;對於完全在您自己電腦上運行的工具來說,則更難以證明其合理性。在選擇之前,請比較五年的總費用。
席位(設備授權)
一個席位是指一個已安裝的程式副本;一個 3 席位授權涵蓋您的三台電腦。CaringDictate 的 $49 授權包含 3 個席位——桌上型電腦、筆記型電腦和另一台。
免費試用
免費試用是在付款前提供完整功能的試用期——CaringDictate 的試用期為 7 天,無需信用卡。在您自己的電腦上,使用您自己的麥克風和您自己的聲音進行試用,勝過任何評論或準確性圖表。
免費更新
免費更新意味著軟體的新版本已包含在您已支付的價格中,無需額外的升級費用。在購買任何一次性軟體之前值得檢查:一些「永久」許可證會將您鎖定在您購買的版本上,並再次收取升級費用。
字數限制(使用限制)
字數限制是您可聽寫量的限制——在訂閱聽寫服務的免費層級中很常見。裝置上的工具沒有理由限制您;沒有伺服器費用。CaringDictate 沒有限制。
GPU 加速
GPU 加速意味著使用您電腦的顯示晶片來比主處理器更快地運行語音模型。這就是為什麼遊戲筆記型電腦的轉錄速度明顯更快的原因。並非必需——CaringDictate 也可以在配備較小模型的普通機器上運行。
系統需求
系統要求是程式良好運行所需的最低電腦規格。對於 CaringDictate:Windows 10(64 位元,版本 1903)或 Windows 11,4 GB RAM,以及數 GB 的可用磁碟空間。
簡短版本
聽寫、語音輸入和語音轉文字都意味著同一件事:您說話,電腦打字。購買時真正重要的選擇是您的語音在哪裡處理(在您的電腦上或在某人的伺服器上),您如何開始和停止它(一個舒適的說話按鈕,或一個喚醒詞),以及 您如何支付 (一次性,或永久擁有)。CaringDictate 的答案是:在您的電腦上,任何您喜歡的按鈕 — $49 一次付費,並提供 7 天 免費試用 試用期,讓您先確認它是否適合您的聲音。