20年にわたり、Dragon NaturallySpeakingは音声認識精度のゴールドスタンダードでした。その地位は変わりつつあります。OpenAIのWhisperエンジン、とりわけ2024年に公開されたLarge v3 Turboは、一般的な音声入力でDragonと同等に達し、多くの特定のケースではそれを上回っています。この記事では、出典を示しながら、この比較について私たちが実際に分かっていることを順を追って説明します。
音声入力における「精度」の意味
音声入力の精度は通常、単語誤り率(WER)として測定されます。これは、書き起こしの中で間違って出力される単語の割合です。低いほど良いということになります。WERが5%なら、100語のうち95語が正しいという意味です。
WERは条件によって大きく変わります。話者の声、マイクの品質、背景雑音、語彙の分野、口述のスタイルなどです。ベンチマークの数字は、それがどんな条件下で測定されたかを知って初めて意味を持ちます。
Whisper Large v3 Turbo:公開されている数字
OpenAIは2024年に、Whisper Large v3 Turboを、同等の精度を持つWhisper Large v3のより高速な派生版として公開しました。標準的なベンチマークで報告された単語誤り率は次のとおりです。
- Whisper Large v3(オリジナル): 多言語データセット全体で平均13.20%のWER
- Whisper Large v3 Turbo: 13.40%のWER——オリジナルとの差は0.2%以内
- 英語のみのクリアな条件: 3〜5%のWER(97〜95%の精度)
Turbo派生版は、v3とほぼ同じ精度のまま、約4倍の速さで動作します。これはCaringDictateが使用しているエンジンです。
CaringDictateの典型的な使用ケース(英語、静かな部屋、まずまずのマイク)では、連続した口述での実際の精度は平均96〜97%です。これはOpenAIが公開している英語クリア条件の数字と一致しており、私たちのマーケティングページで報告している数字でもあります。
Dragonの精度に関する主張
Dragonは従来、99%の精度を謳ってきました。注意書きとしては、この数字は、高品質なヘッドセットマイクを使い、静かな環境で、入念な音声トレーニングを行った訓練済みのユーザーで達成されたものです。初日の未訓練のDragonユーザーは、たいてい92〜94%程度の精度になります。
適切にセットアップした訓練済みのDragon Professional Individualユーザーの場合、一般的な口述での実際の精度はたいてい95〜98%の範囲です。専門分野(医療、法律)では、訓練済みのDragonは、カスタマイズした語彙について98〜99%に届くこともあります。
正直な一騎打ち
汎用のUSBヘッドセットを使い、会話調の英語を口述する未訓練のユーザーの場合、Whisperベースのエンジン(CaringDictate)がたいてい勝ちます。Whisperは音声トレーニングを必要とせず、訓練に使われた幅広い声(68万時間以上の多言語音声)に対して、最初からうまく機能します。
トップクラスのマイク(Plantronics、Andrea USB)を使い、専門的な語彙を口述する訓練済みのユーザーの場合、訓練済みのDragon Professionalは、訓練した特定の語彙についてはまだ一歩リードできます。ただし一般的な文章ではその差はかなり縮まります。
英語を母語としない話者、なまりのある話者、あるいは病状による軽度の構音障害のある話者の場合、Whisperには明らかな優位性があります。学習コーパスがDragonよりはるかに多様で、音声のばらつきの処理が目に見えて優れています。
重度の構音障害のある話者(重度のパーキンソン病、発話に影響するALS、発話に影響する脳性麻痺)の場合、WhisperもDragonも適したツールではありません。Voiceittはまさにこのケースのために作られており、どちらよりも大幅に優れていますが、はるかに高価です。
速度
Whisper TurboのDragonに対する本当の優位性は速度です。最新のハードウェア(過去5年以内のIntel i5、Apple Silicon、あるいは最新のAMD CPU)上のWhisper Large v3 Turboは、リアルタイムより速く書き起こしを生成します——つまり、文章を口述すると、話し終える前に言葉が現れるのです。Dragonもリアルタイムで処理しますが、各発話の最初の単語で、より目立つ遅延があります。
長文の口述では、この速度の差はほとんど心理的なものです。短いメッセージの口述(Facebookのコメント、手早いメール)では、Whisper Turboの反応の良さは明らかに優れていると感じられます。
学習データの問題
Dragonの従来の精度面での優位性は、教師あり音声トレーニングから来ていました。Dragonに長い文章を読み上げると、Dragonは標準モデルよりもあなたの声をよりよく認識する個人モデルを構築します。これはうまく機能しましたが、かなりの初期時間を必要としました。
Whisperはこのようには動きません。OpenAIによって膨大な多言語コーパスで一度学習され、できあがったモデルがすべてのWhisperユーザーが動かすものです。あなたの声で学習させることはありません。あなたの声でうまく機能するか、しないかのどちらかです——そして幅広い学習データのおかげで、ほとんどの声でそれなりにうまく機能します。
ユーザーにとっての意味するところはこうです。Dragonでは、精度を上げるために学習の時間を費やせます。Whisperでは、初日に得られるものが365日目に得られるものです。ほとんどのユーザーにとって、これはバグではなく利点です——そもそもDragonの学習に1時間を費やしたくなかったのですから。専門的な語彙を持つパワーユーザーにとっては、Whisperを音声トレーニングできないことは本物の制約です。
メンテナンスの問題
Dragon Professional Individualは2023年以来、バージョン16で凍結されています。認識エンジンは更新されていません。Microsoftは、Dragonを企業向け医療に方針転換し、消費者向けDragonは自然消滅させようとしています。
対照的にWhisperは、OpenAIとオープンソースコミュニティによって活発に開発されています。Whisper v3は2023年に、Whisper v3 Turboは2024年に公開され、後継モデルも活発に開発中です。CaringDictateは現在v3 Turboを搭載しており、より優れたものが実証されれば、新しいモデルへ無料アップデートで更新していきます。
5年というスパンで見れば、これが最も重要な違いです。凍結された認識エンジンは動き続けますが、この分野の他の場所で起きている大きな改善の恩恵は受けられません。
特定のユーザー層について
一般的な英語の語彙を使う高齢のユーザー: Whisper(CaringDictate経由)が、より良い選択です。トレーニングなし、セットアップの複雑さなし、最初からうまく機能します。
臨床記録を口述する医療従事者: 訓練済みのDragon Medical Oneが、いまだに業界標準です。Whisperの医療語彙は優れていますが、それほど専門的ではありません。
法律文書を口述する弁護士: カスタム語彙を備えた訓練済みのDragon Professionalは、なかなか勝ちにくい相手です。Whisperはほとんどの法律英語をうまく扱いますが、カスタマイズ性に欠けます。
発話ではなく手に影響する病状を持つ成人: CaringDictate経由のWhisperを私たちはおすすめします。トレーニングの手間がなく、音声のばらつきに対する精度が高く、はるかに安価です。
英語を母語としない話者: Whisperには明らかな優位性があります。多言語の学習コーパスのおかげで、Dragonの英語で学習したモデルよりも、なまりをはるかにうまく扱います。
結論
Whisper Large v3 Turboと訓練済みのDragon Professionalは、いまや一般的な口述の精度において数パーセントの差に収まっています。ほとんどのユーザー、とりわけ高齢者や病状を持つユーザーにとっては、Whisperの実用的な利点(トレーニング不要、なまりへの対応の良さ、活発な開発、はるかに低いコスト)が、専門語彙におけるDragonのわずかに残る優位性を上回ります。
CaringDictateがWhisper Large v3 Turboの上に作られているのは、これが私たちの利用者にとって正しいエンジンだと信じているからです。30日間の返金保証があるので、リスクなしにご自身で比べていただけます。
ここからどこへ進むか
完全版もお読みください CaringDictate 対 Dragon の比較 製品レベルの違い(価格、UX、アップデート、返金)について。そして私たちの プライバシーガイド は、ローカル処理かクラウド処理かがあなたの状況にとって重要な場合に。