Vous ne devriez pas avoir besoin d'un traducteur pour acheter un outil dont le seul travail est de transformer vos mots en texte. Cette page définit chaque terme que vous rencontrerez en comparant les logiciels de dictée — y compris ceux de nos propres écrans de paramètres. Chaque définition est une phrase ; les détails qui suivent sont une lecture facultative.
Les bases
Dictée
La dictée consiste à parler à voix haute pendant qu'un logiciel transforme vos mots en texte écrit. Les gens l'appellent aussi saisie vocale ou reconnaissance vocale. Les trois noms signifient la même chose : vous parlez, l'ordinateur tape.
Saisie vocale
La saisie vocale est un autre nom pour la dictée — parler au lieu de taper, avec les mots apparaissant là où se trouve votre curseur de texte. Windows appelle son outil intégré « saisie vocale » (la fonction Win+H). CaringDictate fait le même travail dans la plupart des programmes, sans les délais d'attente de l'outil intégré.
Reconnaissance vocale
La reconnaissance vocale est la technologie qui convertit l'audio parlé en mots écrits. Vous la verrez abrégée en STT dans les articles techniques. Lorsqu'un produit dit « alimenté par la reconnaissance vocale », cela signifie la dictée.
Reconnaissance vocale
La reconnaissance vocale est le domaine plus large de la compréhension du langage humain par les ordinateurs — à la fois ce que vous avez dit (dictée) et ce que vous vouliez dire (commandes). Une application de dictée utilise la reconnaissance vocale pour écrire vos mots. Un assistant vocal l'utilise pour agir en conséquence.
Transcription
La transcription consiste à transformer un enregistrement de parole — une réunion, une interview, un message vocal — en un document écrit après coup. La dictée est en direct (vous voyez les mots apparaître au fur et à mesure que vous parlez) ; la transcription se fait généralement plus tard, à partir d'un fichier. Des outils comme Otter.ai sont des outils de transcription, pas des outils de dictée.
Comment fonctionne la reconnaissance
Modèle vocal (modèle de reconnaissance)
Un modèle vocal est le cerveau entraîné d'un programme de dictée — le fichier qui comprend réellement la parole. Les modèles plus grands sont généralement plus précis mais nécessitent un ordinateur plus puissant. CaringDictate choisit la taille de modèle qui convient à votre machine, d'environ 190 Mo à environ 3,1 Go.
Whisper
Whisper est une famille de modèles vocaux open-source publiée par OpenAI en 2022, reconnue pour sa précision quasi-humaine dans de nombreuses langues. C'est le moteur de nombreux produits de dictée et de transcription modernes, y compris CaringDictate. Parce qu'il est open-source, il peut fonctionner entièrement sur votre propre ordinateur.
Reconnaissance sur l'appareil (hors ligne)
La reconnaissance sur l'appareil signifie que votre parole est traitée sur votre propre ordinateur — l'audio ne transite jamais vers le serveur d'une entreprise. Cela fonctionne sans internet, garde vos pensées privées et ne cesse jamais de fonctionner parce qu'un service est en panne. C'est ainsi que fonctionne CaringDictate.
Reconnaissance dans le cloud
La reconnaissance dans le cloud signifie que votre voix est transmise par internet vers les serveurs d'une entreprise, convertie en texte là-bas, puis renvoyée. La reconnaissance a lieu sur un serveur plutôt que sur votre machine. L'endroit où un outil donné effectue sa reconnaissance est précisé dans sa propre documentation, et certains produits proposent les deux — mieux vaut vérifier que supposer.
Précision (taux d'erreur de mots)
La précision est le pourcentage de mots qu'un programme de dictée reconnaît correctement ; le taux d'erreur de mot (WER) est la même idée mesurée à l'envers — le pourcentage d'erreurs. La dictée moderne basée sur Whisper est très précise sur la parole anglaise claire. Les résultats varient en fonction de la qualité du microphone, du bruit de fond et de la clarté de votre élocution.
Latence
La latence est le délai entre la fin d'une phrase et l'apparition du texte. Moins d'environ un tiers de seconde semble instantané ; bien au-delà, cela semble lent. La reconnaissance sur l'appareil évite l'aller-retour vers un serveur, ce qui est un avantage.
Détection automatique de la langue
La détection automatique de la langue signifie que le logiciel détermine la langue que vous parlez sans que vous ayez à le lui indiquer. Utile si vous passez d'une langue à l'autre au cours de la journée. Le réglage « Automatique » de CaringDictate le fait pour ses 20 langues prises en charge.
Utiliser une application de dictée au quotidien
Bouton de parole (raccourci clavier)
Le bouton de parole est la touche unique ou le bouton de la souris qui démarre et arrête la dictée. Dans CaringDictate, la valeur par défaut est la touche Ctrl droite, et vous pouvez la modifier pour n'importe quelle touche ou bouton de la souris qui est confortable pour vos mains.
Appuyer pour parler (maintenir pour parler)
Appuyer pour parler signifie maintenir le bouton de parole enfoncé pendant que vous parlez et le relâcher lorsque vous avez terminé — comme un talkie-walkie. Bon pour de courtes rafales : une boîte de recherche, une réponse rapide. L'alternative est le mode bascule (appuyer pour activer/désactiver), mieux pour l'écriture plus longue.
Bascule (appuyer pour parler)
Le mode bascule signifie appuyer une fois sur le bouton de parole pour commencer à écouter et appuyer à nouveau pour arrêter. Vos mains sont complètement libres entre-temps — utile lorsque maintenir une touche est inconfortable, ou lorsque vous dictez de longs passages.
Mot d'activation (activation vocale)
Un mot d'activation est une phrase que vous prononcez à voix haute — comme « commencer la dictée » — qui démarre la dictée sans toucher du tout le clavier ou la souris. Cela est le plus important lorsque l'accès au clavier est difficile. CaringDictate a ajouté l'activation vocale configurable par l'utilisateur dans la version 3.5.
Indicateur d'écoute
L'indicateur d'écoute est le petit signal à l'écran qui montre que le microphone est actif et que vos mots sont entendus. Un indicateur fiable est important : vous ne devriez jamais avoir à vous demander si l'ordinateur écoute.
Commandes vocales
Les commandes vocales sont des instructions prononcées — comme « nouvelle ligne » ou « supprimer cela » — qui contrôlent la mise en forme au lieu d'écrire des mots. Les applications de dictée diffèrent beaucoup à cet égard. Les commandes simples couvrent la plupart des écritures quotidiennes ; le contrôle informatique mains libres intensif est une catégorie distincte (voir Voice Access).
Commandes de ponctuation
Les commandes de ponctuation consistent à dire « point », « virgule » ou « point d'interrogation » à voix haute pour insérer la ponctuation. Les moteurs modernes comme Whisper ponctuent également automatiquement à partir de votre phrasé et de vos pauses, vous pouvez donc souvent parler naturellement.
Dictionnaire personnalisé (liste de mots)
Un dictionnaire personnalisé est votre liste personnelle de noms et de mots spéciaux auxquels le système de reconnaissance doit faire confiance — noms de famille, noms de médicaments, jargon de l'industrie. Ajouter « Zofran » ou « Oaxaca » une seule fois vaut mieux que de le corriger indéfiniment. CaringDictate en inclut un sous Écriture et mots.
Insertion de texte
L'insertion de texte est la manière dont les mots dictés arrivent physiquement dans votre document — l'application les tape touche par touche ou les colle en un seul bloc. Coller des phrases entières est plus rapide et beaucoup plus fiable dans différents programmes, c'est pourquoi CaringDictate fournit le texte de cette manière.
Termes spécifiques à Windows
Win+H (saisie vocale Windows)
Win+H est le raccourci clavier qui ouvre la barre de dictée vocale intégrée de Windows, sur Windows 10 et 11. Gratuit, intégré à Windows, et une première option sensée à essayer pour la dictée au quotidien. Windows 11 inclut également Voice Access, qui ajoute un contrôle vocal complet du PC ainsi qu'un vocabulaire personnalisé et une correction de texte.
Windows Voice Access
Voice Access est la fonction de contrôle d'ordinateur mains libres de Windows 11 — cliquer, faire défiler et changer de fenêtre par la voix, avec dictée incluse. Il est conçu pour un contrôle complet de l'ordinateur par la voix. Si ce que vous voulez principalement est une écriture confortable, un outil de dictée dédié est généralement plus approprié.
Reconnaissance vocale Windows (WSR)
La reconnaissance vocale Windows est l'ancien outil de dictée intégré que Microsoft a déprécié au profit de Voice Access. Si vous comptiez sur WSR sur un ancien PC, son retrait est généralement le moment de choisir délibérément un remplaçant plutôt que d'hériter de l'outil que Windows proposera ensuite.
Paramètres de confidentialité du microphone
Les paramètres de confidentialité du microphone sont les commutateurs Windows qui décident quels programmes peuvent utiliser votre microphone. Si une application de dictée n'entend rien, c'est le premier endroit où chercher : Paramètres → Confidentialité et sécurité → Microphone.
Microphone par défaut
Le microphone par défaut est celui que Windows attribue aux programmes, à moins qu'ils n'en choisissent un autre. Les ordinateurs portables en ont souvent plusieurs (intégré, casque, webcam). Choisir le bon — près de votre bouche, loin des ventilateurs — améliore la précision plus que n'importe quel réglage.
Conditions d'achat
Achat unique (licence perpétuelle)
Un achat unique signifie payer une fois et posséder le logiciel — pas de frais mensuels ou annuels pour continuer à l'utiliser. CaringDictate coûte $49 une seule fois, avec les mises à jour incluses. Le modèle alternatif, les abonnements, continue de facturer tant que vous continuez à taper.
Abonnement
Un abonnement consiste à payer mensuellement ou annuellement pour un accès continu à un logiciel — si vous arrêtez de payer, il cesse de fonctionner. C'est raisonnable pour les services avec des coûts de serveur continus ; plus difficile à justifier pour un outil fonctionnant entièrement sur votre propre ordinateur. Comparez les totaux sur cinq ans avant de choisir.
Poste (licence par appareil)
Un poste est une copie installée d'un programme ; une licence de 3 postes couvre trois de vos ordinateurs. La licence à $49 de CaringDictate inclut 3 postes — ordinateur de bureau, ordinateur portable et un de plus.
Essai gratuit
Un essai gratuit est une période d'essai complète avant de payer — celui de CaringDictate dure 7 jours sans carte requise. Un essai sur votre propre ordinateur, avec votre propre microphone et votre propre voix, vaut mieux que n'importe quelle critique ou tableau de précision.
Mises à jour gratuites
Les mises à jour gratuites signifient que les nouvelles versions du logiciel sont incluses dans le prix que vous avez déjà payé, sans frais de mise à niveau séparés. Il est bon de vérifier avant d'acheter un logiciel unique : certaines licences « perpétuelles » vous figent sur la version que vous avez achetée et facturent à nouveau les mises à niveau.
Limite de mots (limite d'utilisation)
Une limite de mots est une restriction sur la quantité que vous pouvez dicter — courante sur les niveaux gratuits des services de dictée par abonnement. Les outils sur appareil n'ont aucune raison de vous limiter ; il n'y a pas de facture de serveur. CaringDictate n'a pas de limite.
Accélération GPU
L'accélération GPU signifie l'utilisation de la puce graphique de votre ordinateur pour exécuter le modèle vocal plus rapidement que le processeur principal ne le pourrait. C'est pourquoi un ordinateur portable de jeu transcrit nettement plus vite. Non requis — CaringDictate fonctionne également sur des machines ordinaires avec des modèles plus petits.
Configuration requise
Les exigences système sont les spécifications minimales d'ordinateur dont un programme a besoin pour bien fonctionner. Pour CaringDictate : Windows 10 (64 bits, version 1903) ou Windows 11, 4 Go de RAM et quelques Go d'espace disque libre.
La version courte
Dictée, saisie vocale et reconnaissance vocale signifient tous la même chose : vous parlez, l'ordinateur tape. Les choix qui comptent vraiment lors de l'achat sont où votre voix est traitée (sur votre ordinateur ou sur le serveur de quelqu'un d'autre), comment vous la démarrez et l'arrêtez (un bouton de parole confortable, ou un mot d'activation), et comment vous payez (une fois, ou pour toujours). Les réponses de CaringDictate sont : sur votre ordinateur, n'importe quel bouton que vous aimez — $49 une seule fois, avec 7 jours gratuit pour vérifier qu'il convient à votre voix avant tout.