Два десятилетия Dragon NaturallySpeaking был золотым стандартом точности диктовки. Это положение меняется. Механизм Whisper от OpenAI, в особенности вариант Large v3 Turbo, выпущенный в 2024 году, достиг паритета с Dragon в общей диктовке и превосходит его во многих конкретных случаях. Эта статья разбирает то, что мы действительно знаем о сравнении, со ссылками на источники.
Что означает «точность» в диктовке
Точность диктовки обычно измеряется как доля ошибочных слов (WER), то есть процент слов, которые в расшифровке выходят неправильными. Чем ниже, тем лучше. WER 5% означает, что 95 слов из 100 верны.
WER сильно варьируется в зависимости от условий: голоса говорящего, качества микрофона, фонового шума, тематической области и стиля диктовки. Эталонное число имеет смысл только тогда, когда вы знаете условия, при которых оно было измерено.
Whisper Large v3 Turbo: опубликованные цифры
OpenAI опубликовала Whisper Large v3 Turbo в 2024 году как более быстрый вариант Whisper Large v3 с сопоставимой точностью. Заявленные доли ошибочных слов на стандартных эталонных тестах:
- Whisper Large v3 (оригинальный): 13,20% WER в среднем по многоязычным наборам данных
- Whisper Large v3 Turbo: 13,40% WER — в пределах 0,2% от оригинала
- Только английский в чистых условиях: 3–5% WER (точность 97–95%)
Вариант Turbo работает примерно в 4 раза быстрее v3 при практически той же точности. Это тот механизм, который использует CaringDictate.
Для типичного сценария использования CaringDictate (английский язык, тихая комната, приличный микрофон) реальная точность в среднем составляет 96–97% при непрерывной диктовке. Это соответствует опубликованным OpenAI цифрам для английского в чистых условиях и тому, что мы указываем на наших маркетинговых страницах.
Заявления Dragon о точности
Dragon исторически рекламировал точность 99%. Мелкий шрифт: это число достигалось у обученных пользователей с высококачественными микрофонами-гарнитурами в тихих условиях, после обширного обучения голоса. Необученный пользователь Dragon в первый день обычно видит скорее точность 92–94%.
У обученных пользователей Dragon Professional Individual с правильной настройкой реальная точность обычно находится в диапазоне 95–98% при общей диктовке. Для специализированных областей (медицина, юриспруденция) обученный Dragon может выходить на 98–99% по лексике, под которую он был настроен.
Честное сравнение лицом к лицу
Для необученного пользователя с обычной USB-гарнитурой, диктующего разговорный английский: механизмы на основе Whisper (CaringDictate) обычно выигрывают. Whisper не требует обучения голоса и хорошо работает «из коробки» на широком диапазоне голосов, на которых он был обучен (более 680 000 часов многоязычного аудио).
Для обученного пользователя с микрофоном высшего качества (Plantronics, Andrea USB), диктующего специализированную лексику: обученный Dragon Professional всё ещё может вырываться вперёд по той конкретной лексике, под которую он был обучен. Преимущество значительно сокращается при общем письме.
Для не носителей английского языка, говорящих с акцентом или говорящих с лёгкой дизартрией вследствие медицинских состояний: у Whisper явное преимущество. Обучающий корпус был гораздо более разнообразным, чем у Dragon, и распознавание заметно лучше справляется с вариациями речи.
Для говорящих со значительной дизартрией (тяжёлая болезнь Паркинсона, БАС, затрагивающий речь, ДЦП, затрагивающий речь): ни Whisper, ни Dragon не являются подходящим инструментом. Voiceitt создан специально для этого случая и значительно лучше любого из них, хотя и намного дороже.
Скорость
Настоящее преимущество Whisper Turbo перед Dragon — это скорость. Whisper Large v3 Turbo на современном оборудовании (Intel i5 последних 5 лет, или Apple Silicon, или любой современный процессор AMD) выдаёт расшифровку быстрее реального времени — то есть вы можете продиктовать предложение, и слова появятся раньше, чем вы закончите говорить. Dragon тоже обрабатывает в реальном времени, но имеет более заметную задержку на первом слове каждого высказывания.
Для диктовки длинных текстов эта разница в скорости в основном психологическая. Для диктовки коротких сообщений (комментарии в Facebook, быстрые письма) отзывчивость Whisper Turbo ощущается заметно лучше.
Вопрос обучающих данных
Традиционное преимущество Dragon в точности происходило от управляемого обучения голоса: вы зачитывали Dragon длинный отрывок, и он строил персональную модель, которая распознавала ваш голос лучше, чем его модель по умолчанию. Это работало, но требовало значительных затрат времени на старте.
Whisper работает не так. Он был обучен на огромном многоязычном корпусе один раз, силами OpenAI, и получившаяся модель — это то, что запускает каждый пользователь Whisper. Вы не обучаете его на своём голосе. Он либо работает на вашем голосе, либо нет — и широкие обучающие данные означают, что он работает на большинстве голосов достаточно хорошо.
Следствие для пользователей: с Dragon вы можете потратить время на обучение, чтобы повысить точность. С Whisper то, что вы получаете в первый день, — это то, что вы получаете и на 365-й день. Для большинства пользователей это достоинство, а не недостаток — они и так не хотели тратить час на обучение Dragon. Для опытных пользователей с технической лексикой невозможность обучить Whisper голосом является реальным ограничением.
Вопрос сопровождения
Dragon Professional Individual заморожен на версии 16 с 2023 года. Механизм распознавания не обновляется. Microsoft переориентировала Dragon на корпоративную медицину и позволяет потребительскому Dragon устаревать.
Whisper, напротив, активно развивается силами OpenAI и сообщества открытого исходного кода. Whisper v3 был выпущен в 2023 году, Whisper v3 Turbo в 2024 году, и модели-преемники находятся в активной разработке. CaringDictate поставляется с v3 Turbo сегодня и будет обновляться до новых моделей в виде бесплатного обновления, когда они докажут своё превосходство.
В перспективе пяти лет это самая важная разница. Замороженный механизм распознавания продолжит работать, но не будет пользоваться существенными улучшениями, происходящими в других местах в этой области.
Для конкретных групп пользователей
Пожилые пользователи с общей английской лексикой: Whisper (через CaringDictate) — лучший выбор. Никакого обучения, никакой сложности настройки, хорошо работает «из коробки».
Медицинские специалисты, диктующие клинические записи: Обученный Dragon Medical One по-прежнему является отраслевым стандартом. Медицинская лексика Whisper хороша, но не настолько специализирована.
Юристы, диктующие юридические документы: Обученный Dragon Professional с пользовательской лексикой трудно превзойти. Whisper справляется с большинством юридического английского хорошо, но ему не хватает возможностей настройки.
Взрослые с заболеваниями, затрагивающими руки, но не речь: Whisper через CaringDictate — это то, что мы бы рекомендовали. Никаких затрат на обучение, лучшая точность при вариациях речи и гораздо дешевле.
Не носители английского языка: У Whisper явное преимущество. Многоязычный обучающий корпус означает, что он справляется с акцентами гораздо лучше, чем модели Dragon, обученные на английском.
Итог
Whisper Large v3 Turbo и обученный Dragon Professional теперь находятся в пределах нескольких процентных пунктов друг от друга по точности общей диктовки. Для большинства пользователей, особенно пожилых и пользователей с медицинскими состояниями, практические преимущества Whisper (никакого обучения, лучшая обработка акцентов, активная разработка, гораздо более низкая стоимость) перевешивают остаточное преимущество Dragon по специализированной лексике.
CaringDictate построен на Whisper Large v3 Turbo, потому что мы считаем, что это правильный механизм для нашей аудитории. 30-дневный возврат средств означает, что вы можете сравнить сами без всякого риска.
Куда двигаться дальше
Прочитайте полное сравнение CaringDictate и Dragon для различий на уровне продукта (цена, удобство использования, обновления, возврат средств), и наше руководство по конфиденциальности если для вашей ситуации важна локальная обработка против облачной.