Если вы сравнивали программы для надиктовки, вы наверняка собрали несколько процентов — 99%, 97%, 95% — и заметили, что они не помогают сделать выбор. Дело не в том, что эти цифры нечестные. Дело в том, что единая цифра точности отвечает на вопрос, отличный от того, который задаёте вы.

Вы хотите знать: насколько хорошо программа поймёт именно меня, за моим столом, с моим микрофоном? Опубликованная цифра точности отвечает на вопрос: насколько хорошо этот движок расшифровал один конкретный набор записей, которых не слышали ни вы, ни мы? Ответы на эти два вопроса могут сильно различаться.

Эта страница объясняет, как работает это измерение, чтобы вы могли читать цифры любого поставщика — включая любые цифры о нас — и понимать, чего они стоят.

Частота словесных ошибок простыми словами

Точность распознавания речи обычно указывается как частота словесных ошибок, обычно обозначаемая аббревиатурой WER. Это доля слов, распознанных неверно. Чем меньше — тем лучше, а «точность 95%» — это просто другой способ записать «5% WER».

То, что считается ошибкой, определено точнее, чем ожидает большинство людей. Есть три вида ошибок, и они складываются вместе:

  • Замены — слово распознано как другое слово. Вы сказали «their», а напечаталось «there».
  • Пропуски — сказанное вами слово отсутствует в расшифровке.
  • Вставки — появляется слово, которого вы не произносили. Причиной обычно становятся посторонняя речь на фоне и шум дыхания.

Сложите все три вида ошибок и разделите на количество слов, которые вы на самом деле произнесли. Допустим, вы надиктовали абзац из 100 слов, и в расшифровке четыре неверных слова, одно пропущенное и одно лишнее: это шесть ошибок на 100 слов, WER 6%, или «точность 94%».

Стоит знать одно следствие из этого — оно объясняет немало запутанной маркетинговой подачи: WER может превышать 100%. Если программа вставляет больше слов, чем вы произнесли, — а это случается в шумном помещении, — количество ошибок может превысить количество слов. Показатель, который не может превышать 100, — это не частота словесных ошибок.

Почему одна и та же программа даёт разным людям разные результаты

Движок распознавания — лишь один из факторов, определяющих вашу точность, и часто не самый важный. Остальное — это ваша ситуация:

  • Ваш микрофон и то, где он находится. Обычно это самый весомый фактор и самый дешёвый в исправлении. Микрофон гарнитуры в нескольких сантиметрах ото рта слышит совсем не то, что микрофон ноутбука на другом конце стола.
  • Помещение. Телевизор на фоне, вентилятор, открытое окно, помещение с твёрдыми поверхностями и эхом. Всё это доходит до распознавателя вместе с вашим голосом.
  • То, что вы надиктовываете. Обычная бытовая речь — самый простой случай. Имена, медицинская или юридическая терминология, номера деталей, адреса и аббревиатуры даются гораздо труднее, потому что программе приходится выбирать между словами, которые звучат похоже.
  • То, как вы говорите. Акцент, темп, громкость, слитно ли вы произносите фразы, затихает ли голос к концу. Ничто из этого не является недостатком — это просто вариативность, с которой движок либо справляется, либо нет.
  • Какую модель вы используете. Большинство локальных программ поставляются с несколькими моделями разного размера. Маленькая модель, комфортно работающая на старом ноутбуке, как правило, ошибается чаще, чем крупная модель на быстром компьютере.

Два человека с одинаковой программой и одинаковыми настройками могут разойтись на несколько процентных пунктов только из-за перечисленного выше. Этот разрыв не закроет ни одна опубликованная цифра.

Что на самом деле измеряет цифра из тестового бенчмарка

Опубликованные показатели частоты словесных ошибок берутся из стандартных исследовательских наборов данных — фиксированных коллекций записей с проверенными расшифровками, чтобы разные системы можно было оценивать на одном и том же материале. Это действительно полезно для тех, кто разрабатывает программное обеспечение: так можно понять, стала ли модель этого месяца лучше прошлой.

Но как руководство при выборе покупки это гораздо менее полезно, по трём причинам:

  • Записи в тесте — это не вы. У тестового аудио свои акценты, свои микрофоны и своя тематика — и ничто из этого не относится к вам.
  • Разные поставщики публикуют результаты разных тестов. Две цифры, измеренные на двух разных наборах данных, несопоставимы, даже если обе указаны честно. Чтение вслух в стиле аудиокниги и спонтанная разговорная речь дают у одного и того же движка совершенно разные результаты.
  • Условия измерения часто не указываются. Цифра, приведённая без указания набора данных, микрофона и стиля речи, — это утверждение, которое невозможно проверить.

Когда вы видите цифру, полезный вопрос — не «высокая ли она», а «на чём измерена?». Если это не указано, цифра — просто украшение.

Два разных подхода к проектированию

Между старым и новым подходами к распознаванию есть реальная техническая разница, и её стоит понимать, потому что она меняет само значение слова «точность» применительно к конкретному продукту.

Обучаемые профили. Традиционный настольный подход строит профиль вашего индивидуального голоса и словаря. Вы тратите время в начале, а затем можете продолжать обучать программу — добавлять собственную терминологию, имена коллег, слова из вашей профессии. Dragon — самый известный продукт, построенный по этому принципу, и, по собственным материалам Nuance, точность распознавания достигает 99%. Плата за это — время на настройку и то, что профиль нужно поддерживать самостоятельно.

Универсальные модели. Новый подход подразумевает однократное обучение одной большой модели на очень широком диапазоне речи, и эта же модель поставляется всем. Модели Whisper от OpenAI — самый известный открытый пример; в исходной статье про Whisper описано обучение примерно на 680 000 часов аудио. Здесь нет этапа обучения — вы устанавливаете программу и сразу начинаете говорить, — но точно так же нет способа обучить её вашему голосу. То, что вы получаете в первый день, в целом остаётся тем же и позже, если не считать того, что программа добавляет вокруг модели, например личный список слов.

Ни один из подходов нельзя назвать однозначно лучше. Если вы весь день надиктовываете узкоспециальную терминологию, возможность обучать программу стоит реальных денег. Если вы хотите установить что-то и начать пользоваться уже сегодня, сеанс обучения — это затраты без выгоды. Какой из вариантов подходит именно вам — этого не скажет никакой процент.

Проверьте на собственном голосе за десять минут

Это единственный тест, который отвечает на ваш вопрос, и его легко провести с любым инструментом надиктовки, у которого есть пробный период — включая бесплатные, уже установленные на вашем компьютере.

  • Сначала напишите короткий отрывок — на 150–200 слов. Используйте собственный текст, а не образец: свой стиль писем, свою тематику, имена, которые вы обычно печатаете.
  • Прочитайте его вслух в программу так, как вы обычно говорите, сидя там, где вы обычно сидите.
  • Сравните оба текста рядом и посчитайте замены, пропуски и вставки. Разделите на количество своих слов.
  • Повторите один раз с микрофоном-гарнитурой если первый раз вы использовали встроенный микрофон. Одна эта замена часто значит больше, чем смена продукта.
  • Затем проведите проверку в реальных условиях. Надиктуйте что-то незапланированное — настоящее письмо, — потому что говорить по написанному легче, чем говорить от себя, а именно со вторым показателем вам предстоит жить дальше.

Прогоните один и тот же отрывок через два-три инструмента, и вы получите то, чего не даст ни один обзор: сравнение на вашем голосе, вашем микрофоне и в вашей комнате. Если инструмент нельзя опробовать перед оплатой, это тоже стоит учесть.

Как читать результат

Несколько процентных пунктов WER значат меньше, чем то, где именно возникают ошибки. Программа, которая изредка пропускает короткое слово, но верно распознаёт все имена, пользоваться приятнее, чем программа с более высоким показателем, которая коверкает имена ваших коллег. Исправить неверное слово — секундное дело; заметить его — требует внимания.

Поэтому оценивайте расшифровку, а не цифру. Прочитайте, что получилось, оцените, сколько правки это требует, и подумайте, меньше ли это работы, чем набор текста вручную. Вот и весь вопрос.

Где здесь место CaringDictate

Мы не публикуем процент точности. Мы могли бы его получить — это может каждый, — но он был бы измерен на записях, которые не являются вашим голосом, и выдавать его за предсказание вашего опыта было бы вводящим в заблуждение.

CaringDictate использует открытые модели распознавания речи, которые работают на вашем собственном компьютере, и поставляется с несколькими размерами моделей, чтобы подойти именно вашему компьютеру. Есть бесплатная семидневная пробная версия, которая существует именно для того, чтобы этот вопрос решался вашим собственным голосом, а не нашей рекламой. Если бесплатный голосовой набор текста, уже встроенный в Windows, показывает достаточно хороший результат, когда вы проведёте описанный выше тест, — это хороший исход: пользуйтесь им и сохраните свои деньги.

Куда двигаться дальше

Поле глоссарий терминов голосового набора текста объясняет остальные термины, которые вы встретите при выборе программы. А сравнение с Dragon рассказывает о различиях на уровне продуктов, а руководство по конфиденциальности рассказывает о том, куда попадает ваше аудио в локальных и облачных инструментах.