如果您一直在比较语音输入软件,大概已经收集了一堆百分比——99%、97%、95%——却发现它们对您做选择没什么帮助。这不是因为这些数字不诚实,而是因为单一的准确率数字回答的,是和您要问的问题不一样的另一个问题。

您想知道的是: 在我的书桌前、用我的麦克风,这款软件能把我理解到什么程度? 而公布的准确率数字回答的是: 这个引擎在转录一批我们谁都没听过的特定录音时,表现如何? 这两个问题的答案可能天差地别。

这个页面解释了这项测量是如何进行的,这样您在看到任何厂商公布的数字时——包括您在我们这里看到的数字——都能明白它到底值多少参考价值。

词错误率,说人话

语音识别准确率通常以 词错误率来报告,通常缩写为 WER。它指的是识别结果中出错的词所占的比例。数值越低越好,“95% 准确率”其实就是“5% 词错误率”的另一种说法。

怎样才算“出错”,比大多数人想象的要具体得多。错误分为三类,会被加在一起计算:

  • 替换错误 ——一个词被识别成了另一个词。您说的是“their”,它打出来的是“there”。
  • 遗漏错误 ——您说过的一个词,在转录结果里不见了。
  • 插入错误 ——出现了一个您根本没说过的词。背景说话声和呼吸噪音是常见的原因。

把这三类错误加起来,再除以您实际说出的词数。比如您口述了一段 100 词的文字,转录结果里有四个词错了、少了一个词、多了一个词:也就是 100 个词里出了六个错,词错误率为 6%,也就是“94% 准确率”。

有一个结果值得了解,因为它能解释不少令人困惑的宣传说法: 词错误率可以超过 100%。如果软件插入的多余词语比您实际说的词还多——在嘈杂的房间里就会发生这种情况——错误数就可能超过词数本身。一个永远不会超过 100 的数字,其实就不是真正的词错误率。

为什么同一款软件给两个人的结果不一样

识别引擎只是决定准确率的因素之一,而且往往还不是最重要的那个。剩下的因素取决于您自身的情况:

  • 您的麦克风,以及它放在哪里。 这通常是影响最大的单一因素,也是最容易改善的。距离嘴边只有几厘米的耳麦麦克风,和放在桌子另一头的笔记本电脑麦克风,听到的内容会完全不同。
  • 房间环境。 背景里的电视声、风扇声、打开的窗户、有回声的硬质表面房间——这些声音都会和您的声音一起传到识别系统里。
  • 您口述的内容本身。 日常语句是最容易的情况。人名、医学或法律术语、零件编号、地址和缩写要难得多,因为软件需要在发音相近的词之间做出判断。
  • 您说话的方式。 口音、语速、音量、是否把句子连在一起说、说到后面是否越来越轻——这些都不是缺点,只是引擎能不能处理好的一种差异而已。
  • 您使用的是哪个模型。 大多数本地处理软件都会提供几种不同大小的模型。能在老旧笔记本电脑上流畅运行的小模型,出错通常会比在高性能电脑上运行的大模型更多。

两个人使用完全相同的软件、完全相同的设置,仅凭以上这些因素,结果就可能相差好几个百分点。这个差距,任何公布的数字都无法替您填补。

跑分数字到底测量的是什么

公布的词错误率来自标准的研究数据集——一批固定的录音,配有经过核实的转录文本,方便不同系统在相同材料上打分比较。这对开发软件的人来说确实很有用:这是判断这个月的模型是否比上个月更好的方法。

但作为购买参考,它的用处要小得多,原因有三:

  • 录音里的人不是您。 跑分用的音频有它自己的口音、自己的麦克风、自己的主题内容,这些都跟您没有关系。
  • 不同厂商测试的项目也不同。 在两个不同数据集上测出的两个数字,即便双方都如实公布,也没有可比性。同一个引擎,处理朗读式有声书语音和处理即兴对话,得出的分数会完全不同。
  • 测试条件常常被省略不提。 一个没有说明数据集、麦克风和说话方式的数字,是一个您无从核实的说法。

当您看到一个数字时,值得问的不是“它高不高”,而是“它是在什么条件下测出来的”。如果没有说明,这个数字就只是装饰。

两种不同的设计理念

较早和较新的识别技术之间存在真实的技术差异,这一点值得了解,因为它会改变“准确率”对某款具体产品到底意味着什么。

可训练档案。 传统的桌面方案会为您个人的声音和词汇建立一份档案。您需要先花时间设置,之后还可以持续训练它——加入您自己的专业术语、同事的姓名、您所在行业常用的词语。Dragon 是采用这种方式的最知名产品,Nuance 自己的资料宣称识别准确率最高可达 99%。相应的代价是设置所需的时间,以及这份档案需要您自己持续维护。

通用模型。 较新的方案是用极其广泛的语音数据一次性训练出一个大模型,然后把同一个模型分发给所有人。OpenAI 的 Whisper 模型是最知名的开放示例;Whisper 的原始论文描述其训练用了大约 68 万小时的音频。这种方式没有注册训练步骤——安装好就能直接开口说话——但同样也无法针对您的声音进行训练。除了软件在模型之外附加的功能(比如个人词汇表)之外,您第一天用到的效果,和之后用到的大体上是一样的。

两种方案并没有哪个绝对更好。如果您整天都要口述专业词汇,能够训练软件这一点就实实在在值这个价钱。如果您只是想装上就用、今天下午就要用,那注册训练环节就只是有成本没好处。您属于哪一种情况,不是一个百分比数字能告诉您的。

用十分钟,在自己的声音上测试一下

这是唯一能回答您真正问题的测试方法,而且在任何提供试用的语音输入工具上都很容易操作——包括您电脑上已有的免费工具。

  • 先写一段短文字 ——150 到 200 词左右。用您自己平时写的内容,而不是范文:您的邮件风格、您常写的主题、您实际会打的那些人名。
  • 把它对着软件大声读出来 按您平时说话的方式,坐在您平时坐的地方。
  • 把两段文字放在一起对比 数出替换、遗漏和插入错误各有多少,再除以总词数。
  • 换用耳麦麦克风再测一次 如果您第一次用的是内置麦克风的话。光是这一个改变,往往比换一款产品更有效果。
  • 然后再做一次真实场景的测试。 口述一些没有事先写好的内容——比如一封真实的邮件——因为照着文字念,比凭脑子直接说要容易得多,而第二个数字才是您日后要面对的真实结果。

用同一段文字在两三款工具上分别测试,您就能得到任何测评都给不了您的东西:一份基于您的声音、您的麦克风和您房间的真实对比。如果某款工具不能先试用再付费,这一点也值得纳入考虑。

如何解读测试结果

词错误率相差几个百分点,重要性其实不如错误出现在哪里。一款偶尔漏掉几个短词、但每个人名都识别准确的软件,用起来会比一款分数更高、却总是把同事姓名弄错的软件更让人省心。改正一个错词只需要一点时间,但发现它需要的是注意力。

所以要评判的是转录结果本身,而不是那个数字。读一读出来的内容,看看需要花多少功夫去整理,再想想这是不是比打字更省事。这就是全部的问题所在。

CaringDictate 处于什么位置

我们不公布一个准确率百分比。我们本可以像所有人一样给出一个数字,但那是在不是您声音的录音上测出来的,把它当作对您实际体验的预测来呈现,会有误导性。

CaringDictate 使用开放的语音识别模型,在您自己的电脑上运行,并提供几种不同大小的模型,以适配您现有的设备。我们提供 7 天免费试用,正是为了让这个问题由您自己的声音来解答,而不是由我们的宣传来解答。如果您按上面的方法测试后,发现 Windows 自带的免费语音输入已经足够好用,那也是个好结果——用它,把钱省下来。

接下来该去哪里

信息流顶部那个 语音输入术语表 解释了您在挑选产品过程中会遇到的其他术语。 Dragon 对比 介绍了产品层面的差异,而 隐私指南 则说明了本地处理和云端处理工具中,您的音频数据会流向何处。