Si vous avez comparé des logiciels de dictée, vous avez probablement collecté une poignée de pourcentages — 99 %, 97 %, 95 % — et constaté qu'ils ne vous aident pas à choisir. Ce n'est pas parce que ces chiffres sont malhonnêtes. C'est parce qu'un chiffre de précision unique répond à une question différente de celle que vous posez.

Vous voulez savoir : à quel point cela me comprendra-t-il, à mon bureau, avec mon microphone ? Un chiffre de précision publié répond à : à quel point ce moteur a-t-il transcrit un ensemble particulier d'enregistrements qu'aucun de nous deux n'a entendu ? Ces deux questions peuvent avoir des réponses très différentes.

Cette page explique comment fonctionne la mesure, afin que vous puissiez lire le chiffre de n'importe quel fournisseur — y compris tout ce que vous verrez à notre sujet — et savoir ce qu'il vaut.

Le taux d'erreur de mots, en langage simple

La précision de la reconnaissance vocale est normalement exprimée sous forme de taux d'erreur de mots, généralement noté WER (de l'anglais word error rate). C'est la proportion de mots ressortis faux. Plus le chiffre est bas, mieux c'est, et « 95 % de précision » n'est qu'une autre façon d'écrire « 5 % de WER ».

Ce qui compte comme faux est plus précis que ce que la plupart des gens imaginent. Il existe trois types d'erreurs, qui s'additionnent :

  • Les substitutions — un mot est ressorti sous la forme d'un autre mot. Vous avez dit « ou », il a tapé « où ».
  • Les omissions — un mot que vous avez dit est absent de la transcription.
  • Les insertions — un mot apparaît alors que vous ne l'avez jamais dit. Les bruits de fond et les respirations en sont souvent la cause.

Additionnez les trois et divisez par le nombre de mots que vous avez réellement prononcés. Supposons que vous dictiez un paragraphe de 100 mots et que la transcription comporte quatre mots faux, un mot manquant et un mot en trop : cela fait six erreurs sur 100 mots, soit un WER de 6 %, ou « 94 % de précision ».

Une conséquence vaut la peine d'être connue, car elle explique une bonne partie du marketing déroutant : le WER peut dépasser 100 %. Si le logiciel insère plus de mots que vous n'en avez prononcé — ce qui arrive dans une pièce bruyante — le nombre d'erreurs peut dépasser le nombre de mots. Un chiffre qui ne peut pas dépasser 100 n'est pas un taux d'erreur de mots.

Pourquoi le même logiciel donne des résultats différents à deux personnes

Le moteur n'est qu'un des éléments qui déterminent votre précision, et souvent pas le plus important. Le reste, c'est votre situation :

  • Votre microphone, et où il se trouve. C'est généralement le facteur le plus important, et le moins coûteux à corriger. Un microphone de casque à quelques centimètres de votre bouche entend quelque chose de bien différent d'un microphone d'ordinateur portable de l'autre côté du bureau.
  • La pièce. Une télévision en fond sonore, un ventilateur, une fenêtre ouverte, une pièce aux surfaces dures qui produit de l'écho. Tout cela parvient au moteur de reconnaissance en même temps que votre voix.
  • Ce que vous dictez. La prose du quotidien est le cas facile. Les noms propres, la terminologie médicale ou juridique, les références de pièces, les adresses et les sigles sont bien plus difficiles, parce que le logiciel doit choisir entre des mots qui se ressemblent à l'oreille.
  • Votre façon de parler. Accent, rythme, volume, le fait d'enchaîner les phrases ou de laisser sa voix s'éteindre en fin de phrase. Rien de tout cela n'est un défaut — c'est simplement une variation que le moteur gère, ou ne gère pas.
  • Le modèle que vous utilisez. La plupart des logiciels fonctionnant sur l'appareil proposent plusieurs modèles de tailles différentes. Un petit modèle qui tourne confortablement sur un ordinateur portable plus ancien fera généralement plus d'erreurs qu'un grand modèle sur une machine rapide.

Deux personnes utilisant un logiciel identique, avec des réglages identiques, peuvent se retrouver à plusieurs points de pourcentage d'écart rien qu'avec tout cela. C'est l'écart qu'aucun chiffre publié ne peut combler à votre place.

Ce que mesure réellement un chiffre de référence

Les taux d'erreur de mots publiés proviennent de jeux de données de recherche standardisés — des collections fixes d'enregistrements accompagnés de transcriptions vérifiées, de sorte que différents systèmes puissent être notés sur le même matériel. C'est réellement utile pour les personnes qui créent le logiciel : c'est ainsi qu'on détermine si le modèle de ce mois-ci est meilleur que celui du mois dernier.

C'est beaucoup moins utile comme guide d'achat, pour trois raisons :

  • Les enregistrements, ce n'est pas vous. L'audio des jeux de référence a ses propres accents, ses propres microphones et ses propres sujets, qui ne sont pas les vôtres.
  • Différents fournisseurs rapportent différents tests. Deux chiffres mesurés sur deux jeux de données ne sont pas comparables, même lorsque les deux sont rapportés honnêtement. Une lecture à voix haute d'un livre audio et une conversation spontanée produisent des scores très différents avec le même moteur.
  • Les conditions sont souvent omises. Un chiffre cité sans le jeu de données, le microphone et le style de parole n'est pas une affirmation que vous pouvez vérifier.

Quand vous voyez un chiffre, la question utile n'est pas « est-il élevé ? » mais « mesuré sur quoi ? ». Si cela n'est pas précisé, le chiffre n'est que de la décoration.

Deux philosophies de conception différentes

Il existe une réelle différence technique entre les approches plus anciennes et plus récentes de la reconnaissance, et cela vaut la peine de la comprendre, car cela change ce que « précision » signifie même pour un produit donné.

Les profils entraînés. L'approche traditionnelle de bureau construit un profil de votre voix et de votre vocabulaire individuels. Vous y consacrez du temps au départ, et vous pouvez continuer à l'entraîner — en ajoutant votre propre terminologie, les noms de vos collègues, les mots utilisés dans votre profession. Dragon est le produit le plus connu construit de cette manière, et les propres documents de Nuance affirment jusqu'à 99 % de précision de reconnaissance. La contrepartie, c'est le temps de configuration, et le fait que le profil vous appartient de l'entretenir.

Les modèles généraux. L'approche plus récente entraîne un grand modèle unique sur un très large éventail de parole, une seule fois, et livre ce même modèle à tout le monde. Les modèles Whisper d'OpenAI en sont l'exemple ouvert le plus connu ; l'article original sur Whisper décrit un entraînement sur environ 680 000 heures d'audio. Il n'y a aucune étape d'inscription — vous l'installez et vous parlez — mais il n'y a pas non plus de moyen de lui enseigner votre voix. Ce que vous obtenez le premier jour est globalement ce que vous obtiendrez plus tard, en dehors de ce que le logiciel ajoute autour du modèle, comme une liste de mots personnelle.

Aucune des deux approches n'est simplement meilleure. Si vous dictez du vocabulaire spécialisé toute la journée, pouvoir entraîner le logiciel vaut de l'argent réel. Si vous voulez installer quelque chose et vous en servir cet après-midi même, une séance d'inscription est un coût sans contrepartie. Laquelle des deux vous décrit n'est pas quelque chose qu'un pourcentage peut vous dire.

Testez-le avec votre propre voix en dix minutes

C'est le seul test de référence qui répond à votre question, et il est facile à réaliser sur n'importe quel outil de dictée proposant un essai — y compris les outils gratuits déjà présents sur votre ordinateur.

  • Rédigez d'abord un court passage — 150 à 200 mots. Utilisez votre propre écriture, pas un paragraphe d'exemple : votre style de courriel, vos sujets habituels, les noms que vous tapez réellement.
  • Lisez-le à voix haute dans le logiciel de la façon dont vous parlez normalement, assis là où vous vous asseyez normalement.
  • Comparez les deux côte à côte et comptez les substitutions, les omissions et les insertions. Divisez par votre nombre de mots.
  • Répétez une fois avec un microphone de casque si vous avez fait le premier essai avec un microphone intégré. Ce seul changement vaut souvent plus qu'un changement de produit.
  • Puis faites un essai réaliste. Dictez quelque chose de non préparé — un vrai courriel — car parler à partir d'un texte écrit est plus facile que parler spontanément, et c'est le second chiffre avec lequel vous devrez vivre.

Faites passer le même texte dans deux ou trois outils, et vous aurez quelque chose qu'aucun avis ne peut vous donner : une comparaison sur votre voix, votre microphone et votre pièce. Si un outil ne peut pas être essayé avant de payer, cela vaut aussi la peine d'être pris en compte.

Lire le résultat

Quelques points de pourcentage de WER comptent moins que l'endroit où tombent les erreurs. Un logiciel qui manque parfois un petit mot mais reconnaît correctement tous les noms est plus agréable à utiliser qu'un logiciel avec un meilleur score qui déforme les noms de vos collègues. Corriger un mot faux coûte un instant ; le remarquer coûte de l'attention.

Jugez donc la transcription, pas le chiffre. Lisez ce qui en est sorti, demandez-vous combien de nettoyage cela demande, et demandez-vous si c'est moins de travail que de le taper aurait été. C'est toute la question.

Où se situe CaringDictate

Nous ne publions pas de pourcentage de précision. Nous pourrions en produire un — tout le monde le peut — mais il serait mesuré sur des enregistrements qui ne sont pas votre voix, et le présenter comme une prédiction de votre expérience serait trompeur.

CaringDictate utilise des modèles ouverts de reconnaissance vocale qui s'exécutent sur votre propre ordinateur, et propose plusieurs tailles de modèles pour s'adapter à la machine que vous avez. Il existe un essai gratuit de sept jours, qui existe précisément pour que cette question soit tranchée par votre propre voix plutôt que par notre marketing. Si la saisie vocale gratuite déjà intégrée à Windows obtient un score suffisant pour vous lorsque vous faites le test ci-dessus, c'est un bon résultat — utilisez-la et gardez votre argent.

Où aller à partir d'ici

La glossaire de la saisie vocale explique le reste du vocabulaire que vous rencontrerez en comparant les options. Le comparatif avec Dragon couvre les différences au niveau des produits, et le guide de confidentialité couvre l'endroit où va votre audio dans les outils locaux comparés aux outils cloud.