二十年来,Dragon NaturallySpeaking一直是听写准确率的黄金标准。这一地位正在改变。OpenAI的Whisper引擎,尤其是2024年发布的Large v3 Turbo版本,在通用听写上已经与Dragon持平,并在许多具体场景中超越了它。本文将结合资料来源,梳理我们对这一对比的实际了解。
听写中的"准确率"是什么意思
听写准确率通常用词错误率(WER)来衡量,也就是转录稿中出错单词所占的百分比。越低越好。WER为5%意味着每100个单词里有95个是正确的。
WER会因条件不同而差异极大:说话人的嗓音、麦克风质量、背景噪音、词汇领域、听写风格。只有当你知道一个基准数字是在什么条件下测得的,它才有意义。
Whisper Large v3 Turbo:公布的数据
OpenAI在2024年发布了Whisper Large v3 Turbo,作为Whisper Large v3的一个更快的版本,准确率相当。在标准基准上报告的词错误率如下:
- Whisper Large v3(原版): 在多语言数据集上的平均WER为13.20%
- Whisper Large v3 Turbo: WER为13.40%——与原版相差在0.2%以内
- 纯英文、干净条件下: WER为3-5%(准确率97-95%)
Turbo版本的运行速度比v3快约4倍,而准确率基本相同。这正是CaringDictate所使用的引擎。
对于CaringDictate的典型使用场景(英语、安静的房间、像样的麦克风),连续听写的实际准确率平均为96-97%。这与OpenAI针对纯英文干净条件公布的数据相符,也是我们在营销页面上所报告的数字。
Dragon的准确率宣称
Dragon历来宣传99%的准确率。但细则是:这个数字是在经过训练的用户、配备高质量耳机麦克风、处于安静环境、并经过大量语音训练之后才达到的。一个第一天、未经训练的Dragon用户,准确率通常更接近92-94%。
对于经过训练、并正确配置的Dragon Professional Individual用户,通用听写的实际准确率通常在95-98%之间。对于专业领域(医学、法律),经过训练的Dragon在为其定制过的词汇上可以提升到98-99%。
实事求是的正面对决
对于一个未经训练的用户,使用普通USB耳机,听写口语化英语:基于Whisper的引擎(CaringDictate)通常胜出。Whisper不需要语音训练,开箱即用,在它训练过的广泛嗓音上都表现良好。
对于一个经过训练的用户,使用顶级麦克风(Plantronics、Andrea USB),听写专业词汇:经过训练的Dragon Professional在它专门训练过的词汇上仍可略胜一筹。但在通用写作上,这一优势会大幅缩小。
对于非英语母语者、带口音的说话者,或因病症而有轻度构音障碍的说话者:Whisper有明显优势。它的训练语料比Dragon的多样得多,对语音变化的识别能力也明显更强。
对于有显著构音障碍的说话者(严重的帕金森病、影响言语的肌萎缩侧索硬化症(ALS)、影响言语的脑性瘫痪):Whisper和Dragon都不是合适的工具。Voiceitt正是为这种情况打造的,明显比这两者都好,尽管价格要贵得多。
速度
Whisper Turbo相对Dragon的真正优势在于速度。Whisper Large v3 Turbo在现代硬件上(近5年的Intel i5,或Apple Silicon,或任何现代AMD CPU)的转录速度快于实时——也就是说,你口述一个句子,文字在你说完之前就出现了。Dragon同样能实时处理,但在每段话第一个词上的延迟更明显。
对于长篇听写,这种速度差异大多是心理层面的。对于短消息听写(Facebook评论、快速邮件),Whisper Turbo的响应灵敏度感觉明显更好。
训练数据的问题
Dragon传统上的准确率优势,来自有监督的语音训练:你会朗读一长段文字给Dragon,它会建立一个能比默认模型更好地识别你嗓音的个人模型。这种方式有效,但需要大量的前期时间投入。
Whisper不是这样工作的。它由OpenAI在一个庞大的多语言语料库上一次性训练完成,最终得到的模型,就是每一个Whisper用户所运行的那个。你不用拿自己的嗓音去训练它。它要么对你的嗓音有效,要么无效——而广泛的训练数据意味着,它对大多数嗓音都能相当好地工作。
对用户的意味:用Dragon,你可以投入训练时间来提高准确率。用Whisper,你第一天得到什么,第365天还是得到什么。对大多数用户来说,这是一项优点,而不是缺点——他们本来就不想花一个小时去训练Dragon。但对于有技术词汇的高级用户,无法用语音训练Whisper是一个实实在在的局限。
维护更新的问题
Dragon Professional Individual自2023年起一直停留在第16版。识别引擎不再更新。微软已经把Dragon转向企业级医疗领域,让面向消费者的Dragon自然淘汰。
相比之下,Whisper由OpenAI和开源社区积极开发。Whisper v3于2023年发布,Whisper v3 Turbo于2024年发布,后续模型也在积极开发中。CaringDictate如今搭载的是v3 Turbo,当更新的模型被证明更好时,会作为免费更新升级过去。
放眼五年的时间跨度,这是最重要的区别。一个被冻结的识别引擎会继续工作,但它无法从这一领域其他地方正在发生的大量改进中受益。
针对特定用户群体
使用通用英语词汇的年长用户: Whisper(通过CaringDictate)是更好的选择。无需训练,没有设置上的复杂,开箱即用,表现良好。
听写临床记录的医疗专业人员: 经过训练的Dragon Medical One仍是业界标准。Whisper的医学词汇不错,但没有那么专业化。
听写法律文书的律师: 带自定义词汇、经过训练的Dragon Professional很难被超越。Whisper能很好地处理大多数法律英语,但缺乏可定制性。
患有影响双手但不影响言语的疾病的成年人: 我们会推荐通过CaringDictate使用Whisper。没有训练负担,在语音变化上准确率更好,而且便宜得多。
非英语母语者: Whisper有明显优势。多语言训练语料意味着它处理口音的能力远胜于Dragon的英语训练模型。
结论
如今,Whisper Large v3 Turbo与经过训练的Dragon Professional,在通用听写准确率上已经只相差几个百分点。对大多数用户而言,尤其是年长者和患有疾病的用户,Whisper的实际优势(无需训练、口音处理更好、积极开发、成本低得多)超过了Dragon在专业词汇上残存的优势。
CaringDictate构建在Whisper Large v3 Turbo之上,是因为我们相信这是最适合我们用户群体的引擎。30天退款意味着你可以毫无风险地自己来比较。
接下来该去哪里
阅读完整的 CaringDictate与Dragon对比 了解产品层面的差异(价格、用户体验、更新、退款),还有我们的 隐私指南 如果本地处理与云端处理的区别对你的情况很重要的话。