Si ha estado comparando software de dictado, probablemente haya reunido un puñado de porcentajes —99%, 97%, 95%— y haya descubierto que no le ayudan a elegir. No es porque las cifras sean deshonestas. Es porque una sola cifra de precisión responde a una pregunta distinta de la que usted está haciendo.

Usted quiere saber: ¿qué tan bien me va a entender esto, en mi escritorio, con mi micrófono? Una cifra de precisión publicada responde: ¿qué tan bien transcribió este motor un conjunto particular de grabaciones que ninguno de los dos ha escuchado? Esas dos preguntas pueden tener respuestas muy distintas.

Esta página explica cómo funciona la medición, para que pueda leer la cifra de cualquier proveedor —incluida cualquiera que vea sobre nosotros— y saber cuánto vale.

La tasa de error de palabras, en lenguaje sencillo

La precisión del reconocimiento de voz normalmente se reporta como tasa de error de palabras, normalmente escrita WER. Es la proporción de palabras que salieron mal. Cuanto más baja, mejor, y «95% de precisión» es solo otra forma de escribir «5% de WER».

Lo que cuenta como error es más específico de lo que la mayoría de la gente espera. Hay tres tipos de error, y se suman entre sí:

  • Sustituciones —una palabra salió como una palabra distinta. Usted dijo «su» y el sistema escribió «tú».
  • Eliminaciones —una palabra que usted dijo falta en la transcripción.
  • Inserciones —aparece una palabra que usted nunca dijo. El habla de fondo y el ruido de la respiración provocan este tipo de error.

Sume los tres y divida entre el número de palabras que realmente dijo. Supongamos que dicta un párrafo de 100 palabras y la transcripción tiene cuatro palabras equivocadas, una palabra que falta y una palabra de más: eso son seis errores en 100 palabras, una WER del 6%, o un «94% de precisión».

Vale la pena conocer una consecuencia, porque explica bastante marketing confuso: la WER puede superar el 100%. Si el software inserta más palabras de las que usted dijo —algo que ocurre en una habitación ruidosa—, el número de errores puede ser mayor que el número de palabras. Una cifra que no puede superar 100 no es una tasa de error de palabras.

Por qué el mismo software da resultados distintos a dos personas

El motor es solo una de las cosas que determinan su precisión, y a menudo no la más importante. El resto es su situación particular:

  • Su micrófono, y dónde está colocado. Esto suele ser el factor más determinante, y el más barato de corregir. Un micrófono de auriculares a pocos centímetros de la boca oye algo bastante distinto de un micrófono de portátil al otro lado del escritorio.
  • La habitación. Una televisión de fondo, un ventilador, una ventana abierta, una habitación de superficies duras con eco. Todo eso llega al sistema de reconocimiento junto con su voz.
  • Lo que está dictando. La prosa cotidiana es el caso fácil. Los nombres, la terminología médica o legal, los números de pieza, las direcciones y las siglas son mucho más difíciles, porque el software está eligiendo entre palabras que suenan parecido.
  • Cómo habla usted. El acento, el ritmo, el volumen, si encadena las frases o si va bajando la voz al final. Nada de esto es un defecto: es simplemente una variación que el motor maneja bien o no.
  • Qué modelo ejecuta. La mayoría del software local incluye varios modelos de distintos tamaños. Un modelo pequeño que se ejecuta cómodamente en un portátil antiguo generalmente cometerá más errores que uno grande en un equipo rápido.

Dos personas que ejecutan un software idéntico, con ajustes idénticos, pueden quedar separadas por varios puntos porcentuales solo por todo esto. Esa es la brecha que ninguna cifra publicada puede cerrar por usted.

Qué mide realmente una cifra de referencia

Las tasas de error de palabras publicadas provienen de conjuntos de datos de investigación estándar: colecciones fijas de grabaciones con transcripciones verificadas, de modo que distintos sistemas se puedan puntuar sobre el mismo material. Eso es genuinamente útil para las personas que construyen el software: es la forma de saber si el modelo de este mes es mejor que el del mes pasado.

Es mucho menos útil como guía de compra, por tres razones:

  • Las grabaciones no son usted. El audio de referencia tiene sus propios acentos, sus propios micrófonos y sus propios temas, ninguno de los cuales es el suyo.
  • Distintos proveedores reportan pruebas distintas. Dos cifras medidas sobre dos conjuntos de datos distintos no son comparables, aunque ambas se reporten con honestidad. La lectura en voz alta de un audiolibro y una conversación espontánea producen puntuaciones muy distintas con el mismo motor.
  • A menudo se omiten las condiciones. Una cifra citada sin el conjunto de datos, el micrófono y el estilo de habla no es una afirmación que se pueda comprobar.

Cuando vea una cifra, la pregunta útil no es «¿es alta?», sino «¿medida sobre qué?». Si eso no se indica, la cifra es decoración.

Dos filosofías de diseño distintas

Existe una diferencia técnica real entre los enfoques más antiguos y los más recientes del reconocimiento, y vale la pena entenderla porque cambia lo que «precisión» siquiera significa para un producto dado.

Perfiles entrenados. El enfoque tradicional de escritorio construye un perfil de su voz y su vocabulario individuales. Dedica tiempo al principio, y puede seguir enseñándole: añadiendo su propia terminología, los nombres de sus colegas, las palabras que usa su profesión. Dragon es el producto más conocido construido de esta manera, y los propios materiales de Nuance afirman hasta un 99% de precisión de reconocimiento. La contrapartida es el tiempo de configuración, y el hecho de que el perfil es suyo de mantener.

Modelos generales. El enfoque más reciente entrena un modelo grande sobre una gama muy amplia de habla, una sola vez, y envía el mismo modelo a todo el mundo. Los modelos Whisper de OpenAI son el ejemplo abierto más conocido; el artículo original de Whisper describe un entrenamiento con alrededor de 680.000 horas de audio. No hay ningún paso de inscripción: lo instala y empieza a hablar, y del mismo modo no hay forma de enseñarle su voz. Lo que obtiene el primer día es, a grandes rasgos, lo que obtiene después, aparte de lo que el software añada alrededor del modelo, como una lista personal de palabras.

Ningún enfoque es simplemente mejor. Si dicta vocabulario especializado todo el día, poder entrenar el software vale dinero de verdad. Si quiere instalar algo y usarlo esta misma tarde, una sesión de inscripción es un coste sin ninguna ventaja. Cuál le describe a usted no es algo que un porcentaje pueda decirle.

Pruébelo con su propia voz en diez minutos

Esta es la única prueba que responde a su pregunta, y es fácil de hacer con cualquier herramienta de dictado que tenga una prueba, incluidas las gratuitas que ya tiene en su equipo.

  • Primero escriba un pasaje corto —de 150 a 200 palabras. Use su propia escritura, no un párrafo de ejemplo: su estilo de correo, sus temas habituales, los nombres que realmente escribe.
  • Léalo en voz alta al software de la forma en que hablaría normalmente, sentado donde normalmente se sienta.
  • Compare los dos lado a lado y cuente las sustituciones, eliminaciones e inserciones. Divida entre su número de palabras.
  • Repítalo una vez con un micrófono de auriculares si hizo la primera prueba con uno integrado. Este único cambio a menudo vale más que cambiar de producto.
  • Después haga una prueba realista. Dicte algo improvisado, un correo real, porque hablar leyendo una página es más fácil que hablar desde la cabeza, y ese segundo número es con el que va a convivir.

Pase el mismo pasaje por dos o tres herramientas y tendrá algo que ninguna reseña puede darle: una comparación sobre su voz, su micrófono y su habitación. Si una herramienta no se puede probar antes de pagar, eso también vale la pena tenerlo en cuenta.

Interpretar el resultado

Unos pocos puntos porcentuales de WER importan menos que dónde caen los errores. Un software que se salta alguna palabra corta de vez en cuando pero acierta todos los nombres es más agradable de usar que uno con mejor puntuación que destroza los nombres de sus colegas. Corregir una palabra equivocada cuesta un momento; darse cuenta de ella cuesta atención.

Así que juzgue la transcripción, no el número. Lea lo que salió, pregúntese cuánto arreglo necesita, y pregúntese si eso supone menos trabajo del que habría sido escribirlo. Esa es toda la cuestión.

Dónde se sitúa CaringDictate

No publicamos un porcentaje de precisión. Podríamos generar uno —cualquiera puede—, pero se mediría sobre grabaciones que no son su voz, y presentarlo como una predicción de su experiencia sería engañoso.

CaringDictate usa modelos abiertos de reconocimiento de voz que se ejecutan en su propio equipo, e incluye varios tamaños de modelo para adaptarse al equipo que tenga. Hay una prueba gratuita de siete días, que existe precisamente para que esta cuestión la resuelva su propia voz y no nuestro marketing. Si la escritura por voz gratuita ya integrada en Windows le da un buen resultado cuando haga la prueba anterior, ese es un buen desenlace: úsela y ahórrese el dinero.

A dónde ir desde aquí

El cuadro glosario de escritura por voz explica el resto del vocabulario que se encontrará mientras compara opciones. La comparación con Dragon cubre las diferencias a nivel de producto, y la guía de privacidad cubre a dónde va su audio en las herramientas locales frente a las de la nube.