您不应该需要翻译来购买一个其全部工作就是将您的词语转化为文本的工具。本页面定义了您在比较听写软件时会遇到的每个术语——包括我们自己设置屏幕中的术语。每个定义都是一句话;其后的详细信息是可选阅读。

基础知识

听写

听写是指大声说话,同时软件将您的词语转化为书面文本。人们也称之为语音输入或语音转文本。这三个名称都意味着同一件事:您说话,电脑打字。

语音输入

语音输入是听写的另一个名称——用说话代替打字,文字会出现在您的文本光标所在的位置。Windows 将其内置工具称为“语音输入”(Win+H 功能)。CaringDictate 在大多数程序中完成同样的工作,且没有内置工具的超时限制。

语音转文本

语音转文本是将口语音频转换为书面词语的技术。您会在技术文章中看到它缩写为 STT。当一个产品说“由语音转文本提供支持”时,它指的是听写。

语音识别

语音识别是计算机理解人类语音的更广泛领域——包括您所说的(听写)和您所指的(命令)。听写应用程序使用语音识别来记录您的词语。语音助手使用它来执行命令。

转录

转录是将语音录音——会议、采访、语音邮件——事后转化为书面文档。听写是实时的(您在说话时看到词语出现);转录通常稍后从文件进行。像 Otter.ai 这样的工具是转录工具,而不是听写工具。

识别工作原理

语音模型(识别模型)

语音模型是听写程序的“训练大脑”——实际理解语音的文件。更大的模型通常更准确,但需要更强大的电脑。CaringDictate 会选择适合您机器的模型大小,从大约 190 MB 到大约 3.1 GB。

Whisper

Whisper 是 OpenAI 于 2022 年发布的一个开源语音模型系列,以其在多种语言中接近人类的准确性而闻名。它是许多现代听写和转录产品(包括 CaringDictate)背后的引擎。因为它开源,所以可以完全在您自己的计算机上运行。

设备端(离线)识别

设备端识别意味着您的语音在您自己的计算机上处理——音频绝不会传输到公司的服务器。这在没有互联网的情况下也能工作,保护私人想法的隐私,并且永远不会因为服务中断而停止工作。这就是 CaringDictate 的运行方式。

云端识别

云端识别指的是您的语音通过互联网传输到某家公司的服务器,在那里被转换为文字,再传回给您。识别过程发生在服务器上,而不是您自己的设备上。任何特定工具的识别方式,都会在其自身文档中说明,有些产品还同时提供两种方式——值得实际查证,而不是想当然。

准确性(词错误率)

准确率是听写程序正确识别的词语百分比;词错误率 (WER) 是反向测量的相同概念——即识别错误的百分比。现代基于 Whisper 的听写在清晰的英语语音上具有很高的准确性。结果会因麦克风质量、背景噪音和您说话的清晰度而异。

延迟

延迟是指完成一个句子到看到文本出现之间的时间间隔。低于大约三分之一秒的感觉是即时的;超过这个时间就会感觉卡顿。设备上的识别避免了与服务器之间的往返,这有所帮助。

自动语言检测

自动语言检测意味着软件无需告知即可识别您正在说的语言。如果您在一天中切换语言,这会很有用。CaringDictate 的“自动”设置在其支持的 20 种语言中实现了这一点。

日常使用听写应用

说话按钮(热键)

说话按钮是启动和停止听写的单个按键或鼠标按钮。在 CaringDictate 中,默认是右 Ctrl 键,您可以将其更改为任何对您的手来说舒适的按键或鼠标按钮。

按住说话(按住以说话)

按住说话意味着在您说话时按住说话按钮,并在说完后松开——就像对讲机一样。适用于短时输入:搜索框、快速回复。另一种选择是轻触切换,更适合长时间写作。

切换(轻触说话)

切换模式意味着轻触说话按钮一次开始听写,再轻触一次停止。在此期间您的双手完全自由——当按住按键不舒服时,或者当您听写长篇内容时,这会很有帮助。

唤醒词(语音激活)

唤醒词是您大声说出的短语——例如“开始听写”——它可以在不接触键盘或鼠标的情况下开始听写。当够到键盘很困难时,这一点最为重要。CaringDictate 在 3.5 版本中添加了用户可设置的语音激活功能。

监听指示器

监听指示器是屏幕上的一个小信号,显示麦克风正在工作,并且您的声音正在被听到。一个可靠的指示器很重要:您永远不应该怀疑电脑是否正在监听。

语音命令

语音命令是口头指令——例如“新行”或“删除那个”——它们控制格式而不是书写文字。听写应用在这方面差异很大。简单的命令涵盖了大多数日常写作;重度免提电脑控制是一个单独的类别(参见 Voice Access)。

标点符号命令

标点符号命令是说出“句号”、“逗号”或“问号”来插入标点符号。像 Whisper 这样的现代引擎也会根据您的措辞和停顿自动添加标点,因此您通常可以自然地说话。

自定义词典(词汇表)

自定义词典是您个人信任的名称和特殊词汇列表——家族姓氏、药物名称、行业术语。添加一次“Zofran”或“Oaxaca”胜过永远纠正它。CaringDictate 在“写作与词语”下包含一个。

文本插入

文本插入是指听写词语实际出现在文档中的方式——应用程序要么逐个按键输入,要么一次性粘贴。粘贴整个短语在不同程序中更快、更可靠,这就是 CaringDictate 以这种方式传递文本的原因。

Windows 专用术语

Win+H(Windows 语音输入)

Win+H 是在 Windows 10 和 Windows 11 上打开系统内置语音输入栏的键盘快捷键。它免费、内置于 Windows,是日常听写值得首先尝试的选项。Windows 11 还内置了 Voice Access,它增加了对电脑的完整语音控制,以及自定义词汇和文本纠正功能。

Windows Voice Access

Voice Access 是 Windows 11 的免提电脑控制功能——通过语音点击、滚动和切换窗口,并包含听写功能。它专为通过语音进行全面的电脑控制而设计。如果您主要想要的是舒适的写作,那么专用的听写工具通常更适合。

Windows 语音识别 (WSR)

Windows 语音识别是较旧的内置听写工具,微软已弃用它,转而支持 Voice Access。如果您在旧电脑上依赖 WSR,那么它退役时通常是您刻意选择替代品的时候,而不是被动接受 Windows 接下来提供的任何工具。

麦克风隐私设置

麦克风隐私设置是 Windows 中的开关,用于决定哪些程序可以使用您的麦克风。如果听写应用听不到任何声音,这里是第一个需要检查的地方:设置 → 隐私和安全性 → 麦克风。

默认麦克风

默认麦克风是 Windows 分配给程序的麦克风,除非程序另行选择。笔记本电脑通常有多个麦克风(内置、耳机、网络摄像头)。选择正确的麦克风——靠近您的嘴巴,远离风扇——比任何设置都能更有效地提高准确性。

购买条款

一次性购买(永久许可)

一次性购买意味着一次性付款并拥有该软件——无需每月或每年付费即可继续使用。CaringDictate 售价 $49,一次性购买,包含更新。另一种模式是订阅,只要您继续使用,就会持续收费。

订阅

订阅是每月或每年付费以持续访问软件——停止付费,它就会停止工作。对于有持续服务器成本的服务来说是合理的;但对于完全在您自己电脑上运行的工具来说,则更难证明其合理性。选择前请比较五年总费用。

席位(设备许可)

一个席位是指一个程序的安装副本;3 席位许可涵盖您的三台电脑。CaringDictate 的 $49 许可包含 3 个席位——台式机、笔记本电脑和另外一台。

免费试用

免费试用是在付费前提供一个功能齐全的试用期——CaringDictate 的试用期为 7 天,无需信用卡。在您自己的电脑上,使用您自己的麦克风和您自己的声音进行试用,胜过任何评论或准确性图表。

免费更新

免费更新意味着软件的新版本包含在您已支付的价格中,无需单独的升级费用。在购买任何一次性软件之前值得检查:一些“永久”许可证会将您锁定在您购买的版本上,并再次收取升级费用。

字数限制(使用限制)

字数限制是您听写量的限制——在订阅听写服务的免费层级中很常见。设备上的工具没有理由对您进行计量;没有服务器费用。CaringDictate 没有字数限制。

GPU 加速

GPU 加速意味着使用您电脑的图形芯片来比主处理器更快地运行语音模型。这就是为什么游戏笔记本电脑转录速度明显更快的原因。这不是必需的——CaringDictate 也可以在普通机器上使用较小的模型运行。

系统要求

系统要求是程序良好运行所需的最低电脑配置。对于 CaringDictate:Windows 10(64 位,版本 1903)或 Windows 11,4 GB 内存,以及几 GB 的可用磁盘空间。

简短版本

听写、语音输入和语音转文本都意味着同一件事:您说话,电脑打字。购买时真正重要的选择是您的语音在哪里处理(在您的电脑上或在某个服务器上),您如何开始和停止它(一个舒适的说话按钮,或一个唤醒词),以及 您如何支付 (一次性,或永久)。CaringDictate 的答案是:在您的电脑上,任何您喜欢的按钮—— 一次付费 $49,以及 7 天的 免费试用 来首先检查它是否适合您的声音。