大多数使用语音听写的人从不去想自己的声音究竟去了哪里。营销话术告诉你软件是“私密的”或“安全的”,你大体上就信了。但对于医疗对话、财务写作和私人通信,这份信任值得更多审视。下面讲讲当你向不同产品听写时,究竟发生了什么。

云端与本地的区别

语音识别可以在两个根本不同的地方运行:互联网上某处的服务器(云端),或者你自己电脑的处理器(本地、on-device)。用户体验是相似的——你说话,文字出现——但隐私影响截然不同。

基于云端的听写 会把你的语音音频发送到服务器,识别在那里运行,再把生成的文字发回来。你的声音被上传到了第三方的基础设施上。那段音频是否被存储、记录、用于训练、与合作伙伴共享,还是被删除,完全取决于供应商的政策——而你通常没有读过那些政策。

本地/on-device 听写 使用下载好的模型,在你自己电脑的 CPU 上运行识别。你的语音音频永远不会离开设备。没有任何东西可供任何人记录、存储或训练,因为一开始就没有任何东西被上传。

2026 年哪些工具属于哪一类

本地(你的声音留在你的电脑上):

  • CaringDictate —— 完全本地。Whisper Large v3 Turbo 在你的 CPU 上运行。永远不上传任何东西。 隐私政策见此。
  • Dragon Professional Individual v16 —— 本地。识别技术较老旧,但运行在你的电脑上。
  • 较新的 Mac 和 iPhone 上的 Apple Dictation —— 在带有 Apple 神经网络引擎的设备上为本地处理(2020 年及以后的 Mac、iPhone XS 或更新机型)。较旧的 Apple 设备会把音频发送到 Apple 服务器。
  • Windows 11 上的 Microsoft Voice Access —— 本地。
  • VoiceInk(Mac) —— 本地。

云端(你的声音被发往服务器):

  • Dragon Anywhere —— 仅限云端。
  • Dragon Medical One —— 仅限云端。
  • Otter.ai —— 仅限云端。
  • Wispr Flow —— 基于云端(尽管其营销暗示并非如此;其识别运行在他们的服务器上)。
  • Google Docs Voice Typing —— 仅限云端。音频被发送给 Google。
  • Voiceitt —— 仅限云端。
  • 较旧的 Apple 设备 —— 云端,音频被发送到 Apple 服务器。

对于涉及 HIPAA 相关对话、敏感财务讨论、法律特权顾虑的用户,或者只是出于不想让第三方听到自己声音的个人偏好——云端这一类是绝对不能接受的。

“符合 HIPAA”通常意味着什么(以及不意味着什么)

许多云端听写服务都宣传自己“符合 HIPAA”。这听起来像是一种隐私保证。但大多数情况下并不是。

对云端供应商而言,符合 HIPAA 通常意味着该供应商已与受保实体(医院、诊所)签署了业务伙伴协议、实施了某些访问控制,并遵循某些审计要求。它 并不 意味着你的声音没有被上传到他们的服务器。它意味着他们按照 HIPAA 规则来处理那次上传——其中仍然包括存储这些数据、有员工能够访问它,以及(在许多情况下)将其用于改进服务。

对于一位希望自己的声音永远不离开电脑的个人患者或家属来说,正确的检验标准不是“它符合 HIPAA 吗?”,正确的检验标准是“它是本地的吗?”。如果答案是肯定的,那么隐私在技术上由架构保证,而非由政策保证。如果答案是否定的——即便那项云端服务符合 HIPAA——你的声音也已经被上传了。

即便在云端服务上,实际会被存储什么

对于云端听写服务,被存储的内容各不相同。常见的模式包括:

  • 音频录音 —— 为改进服务、调试或模型训练而保留。有些服务允许你选择退出;许多服务不允许。
  • 文字转录稿 —— 文本输出往往被无限期存储。大多数用户没有意识到,他们听写的一切内容的转录稿都存在于云端。
  • 元数据 —— 时间、设备信息、IP 地址。对分析有用,但它仍然是关于你使用情况的数据。
  • 声纹档案 —— 有些服务会随时间为更好的识别而建立你的嗓音档案。这是字面意义上的声纹,带有生物识别方面的含义。

本地听写工具不存在以上任何一项,因为没有任何东西被上传。

“AI 训练”问题

如今许多人对自己的声音或文字被用于训练 AI 模型,有理由感到警惕。云端听写服务往往(并非总是)在其服务条款中包含训练数据条款。这些条款授予供应商一项许可,可使用你的音频和转录稿来改进其识别模型。

对某些用户来说这没问题。对另一些人来说——尤其是那些写医疗状况、家庭事务或受知识产权保护的工作的人——这是无法接受的。防范之道是使用本地听写。使用 CaringDictate(以及任何其他完全本地的工具)时,没有任何东西被上传,所以也就没有任何东西可供训练。

需要联网这个问题

一个相关但独立的问题:云端听写需要联网。如果你家里的网络断了,你的云端听写就无法工作。如果你正在某个连接不佳的地方旅行,你的听写质量可能下降,甚至完全失灵。对于出于无障碍原因依赖听写的用户来说,这种对稳定网络连接的依赖是一个隐患。

本地听写无需联网即可工作。CaringDictate 在初次安装时下载一次识别模型,从那之后,它就完全离线工作。这对旅行、对时断时续的连接,以及对那些(越来越少见的)你根本不想让电脑事事都向外联网汇报的情况,都很重要。

CaringDictate 具体如何处理隐私

我们的架构特意设计得便于验证:

  • Whisper Large v3 Turbo(识别引擎)在安装时下载一次,并存储在你的电脑上。
  • 当你听写时,音频由麦克风采集,由 Whisper 在你的 CPU 上处理,并转换为文字。随后音频缓冲区即被丢弃。
  • 文字被注入到光标所在的任意文本框中。
  • 没有任何东西被发送到互联网。没有任何东西被记录。没有任何东西被存储。
  • 你可以用任何网络监控工具来验证这一点——CaringDictate 在听写过程中不建立任何对外连接。

CaringDictate 产生的唯一网络流量,发生在初次安装期间(下载识别模型以及任何更新检查)。安装完成后,它就完全离线。

按使用场景给出的实用建议

用于一般听写(邮件、文档、网页表单): 任何本地听写工具都可以——CaringDictate、Dragon,或者较新 Mac 上的 Apple Dictation。

用于医疗对话或 HIPAA 相关工作: 仅限本地才是正确答案。CaringDictate 正是专为此打造;旧版 Dragon Professional 也可以(尽管它缺少更新)。

用于你想转录的会议: Otter.ai 是标准选择,但它基于云端——务必确保会议中的每个人都同意这一点。

用于隐私敏感的个人写作(日记、回忆录): 绝对要用本地。CaringDictate 或较旧的 Apple Dictation。彻底避开云端服务。

接下来该去哪里

关于 CaringDictate 如何处理你数据的完整技术细节,请见我们的 隐私政策。如需与基于云端的替代方案对比,请见 对比 Dragon Anywhere, 对比 Wispr Flow, 对比 Otter.ai.