Non dovresti aver bisogno di un traduttore per acquistare uno strumento il cui unico compito è trasformare le tue parole in testo. Questa pagina definisce ogni termine che incontrerai confrontando i software di dettatura — inclusi quelli nelle nostre schermate delle impostazioni. Ogni definizione è una frase; i dettagli successivi sono una lettura facoltativa.
Le basi
Dettatura
La dettatura è parlare ad alta voce mentre il software trasforma le tue parole in testo scritto. Le persone la chiamano anche digitazione vocale o speech-to-text. Tutti e tre i nomi significano la stessa cosa: tu parli, il computer digita.
Digitazione vocale
Scrittura vocale è un altro nome per dettatura — parlare invece di scrivere a tastiera, con le parole che compaiono ovunque si trovi il cursore di testo. Windows chiama il suo strumento integrato "digitazione vocale" (la funzione Win+H). CaringDictate svolge lo stesso lavoro nella maggior parte dei programmi, senza i time-out dello strumento integrato.
Speech-to-text
Speech-to-text è la tecnologia che converte l'audio parlato in parole scritte. Lo vedrai abbreviato come STT negli articoli tecnici. Quando un prodotto dice "powered by speech-to-text", significa dettatura.
Riconoscimento vocale
Il riconoscimento vocale è il campo più ampio in cui i computer comprendono il linguaggio umano — sia ciò che hai detto (dettatura) sia ciò che intendevi (comandi). Un'app di dettatura utilizza il riconoscimento vocale per scrivere le tue parole. Un assistente vocale lo usa per agire su di esse.
Trascrizione
La trascrizione è la trasformazione di una registrazione vocale — una riunione, un'intervista, un messaggio vocale — in un documento scritto a posteriori. La dettatura è in tempo reale (vedi le parole apparire mentre parli); la trascrizione di solito avviene in seguito, da un file. Strumenti come Otter.ai sono strumenti di trascrizione, non strumenti di dettatura.
Come funziona il riconoscimento
Modello vocale (modello di riconoscimento)
Un modello vocale è il cervello addestrato di un programma di dettatura — il file che effettivamente comprende il parlato. I modelli più grandi sono di solito più accurati ma richiedono un computer più potente. CaringDictate sceglie la dimensione del modello che si adatta alla Sua macchina, da circa 190 MB a circa 3.1 GB.
Whisper
Whisper è una famiglia di modelli vocali open-source rilasciata da OpenAI nel 2022, nota per la sua precisione quasi umana in molte lingue. È il motore dietro molti prodotti moderni di dettatura e trascrizione, incluso CaringDictate. Poiché è open source, può funzionare interamente sul tuo computer.
Riconoscimento sul dispositivo (offline)
Il riconoscimento sul dispositivo significa che il tuo parlato viene elaborato sul tuo computer — l'audio non viaggia mai verso il server di un'azienda. Funziona senza internet, mantiene privati i pensieri e non smette mai di funzionare perché un servizio è inattivo. È così che funziona CaringDictate.
Riconoscimento cloud
Il riconoscimento cloud significa che la Sua voce viene trasmessa via internet ai server di un'azienda, convertita lì in testo, e rinviata indietro. Il riconoscimento avviene su un server anziché sul Suo computer. Dove un determinato strumento esegue il riconoscimento è indicato nella sua documentazione, e alcuni prodotti offrono entrambe le opzioni — vale la pena verificare piuttosto che dare per scontato.
Precisione (tasso di errore delle parole)
L'accuratezza è la percentuale di parole che un programma di dettatura riconosce correttamente; il tasso di errore sulle parole (WER) è la stessa idea misurata al contrario — la percentuale che sbaglia. La dettatura moderna basata su Whisper è molto accurata sul parlato inglese chiaro. I risultati variano con la qualità del microfono, il rumore di fondo e la chiarezza con cui parla.
Latenza
La latenza è il ritardo tra la fine di una frase e la comparsa del testo. Meno di circa un terzo di secondo sembra istantaneo; molto di più sembra lento. Il riconoscimento sul dispositivo evita il viaggio di andata e ritorno a un server, il che aiuta.
Rilevamento automatico della lingua
Il rilevamento automatico della lingua significa che il software capisce quale lingua stai parlando senza che gli venga detto. Utile se passi da una lingua all'altra durante la giornata. L'impostazione "Automatico" di CaringDictate lo fa per le sue 20 lingue supportate.
Usare un'app di dettatura quotidianamente
Pulsante di dettatura (tasto di scelta rapida)
Il pulsante di dettatura è il singolo tasto o pulsante del mouse che avvia e interrompe la dettatura. In CaringDictate l'impostazione predefinita è il tasto Ctrl destro, e puoi cambiarlo con qualsiasi tasto o pulsante del mouse che sia comodo per le tue mani.
Premi per parlare (tieni premuto per parlare)
Premi per parlare significa tenere premuto il pulsante di dettatura mentre parli e rilasciarlo quando hai finito — come un walkie-talkie. Ottimo per brevi raffiche: una casella di ricerca, una risposta rapida. L'alternativa è tocca per attivare/disattivare, migliore per la scrittura più lunga.
Attiva/Disattiva (tocca per parlare)
La modalità Attiva/Disattiva significa toccare il pulsante di dettatura una volta per iniziare ad ascoltare e toccarlo di nuovo per fermarsi. Le tue mani sono completamente libere nel frattempo — utile quando tenere premuto un tasto è scomodo, o quando detti lunghi passaggi.
Parola di attivazione (attivazione vocale)
Una parola di attivazione è una frase che dici ad alta voce — come "inizia a dettare" — che avvia la dettatura senza toccare affatto la tastiera o il mouse. Questo è più importante quando raggiungere la tastiera è la parte difficile. CaringDictate ha aggiunto l'attivazione vocale impostabile dall'utente nella versione 3.5.
Indicatore di ascolto
L'indicatore di ascolto è il piccolo segnale sullo schermo che mostra che il microfono è attivo e le tue parole vengono ascoltate. Un indicatore affidabile è importante: non dovresti mai doverti chiedere se il computer sta ascoltando.
Comandi vocali
I comandi vocali sono istruzioni pronunciate — come "nuova riga" o "cancella quello" — che controllano la formattazione invece di scrivere parole. Le app di dettatura differiscono molto qui. I comandi semplici coprono la maggior parte della scrittura quotidiana; il controllo del computer a mani libere più avanzato è una categoria separata (vedi Voice Access).
Comandi di punteggiatura
I comandi di punteggiatura consistono nel dire "punto", "virgola" o "punto interrogativo" ad alta voce per inserire la punteggiatura. I motori moderni come Whisper punteggiano anche automaticamente dalla tua fraseologia e dalle pause, quindi spesso puoi semplicemente parlare naturalmente.
Dizionario personalizzato (elenco di parole)
Un dizionario personalizzato è il tuo elenco personale di nomi e parole speciali di cui il riconoscitore dovrebbe fidarsi — nomi di famiglia, nomi di farmaci, gergo di settore. Aggiungere "Zofran" o "Oaxaca" una volta è meglio che correggerlo per sempre. CaringDictate ne include uno sotto Scrittura e parole.
Inserimento testo
L'inserimento del testo è il modo in cui le parole dettate arrivano fisicamente nel tuo documento — l'app le digita tasto per tasto o le incolla in un unico pezzo. Incollare intere frasi è più veloce e molto più affidabile tra diversi programmi, motivo per cui CaringDictate fornisce il testo in questo modo.
Termini specifici di Windows
Win+H (digitazione vocale di Windows)
Win+H è la combinazione di tasti che apre la barra di digitazione vocale integrata di Windows, su Windows 10 e 11. Gratuita, integrata in Windows e una scelta sensata da provare per prima per la dettatura quotidiana. Windows 11 include anche Voice Access, che aggiunge il controllo vocale completo del PC insieme a vocabolario personalizzato e correzione del testo.
Windows Voice Access
Voice Access è la funzione di controllo del computer a mani libere di Windows 11 — cliccare, scorrere e cambiare finestre con la voce, con dettatura inclusa. È progettato per il controllo completo del computer tramite voce. Se ciò che desidera principalmente è una scrittura confortevole, uno strumento di dettatura dedicato è solitamente la scelta migliore.
Riconoscimento vocale di Windows (WSR)
Il Riconoscimento vocale di Windows è lo strumento di dettatura integrato più vecchio che Microsoft ha deprecato a favore di Voice Access. Se Lei si affidava a WSR su un PC più vecchio, il suo ritiro è solitamente il momento di scegliere deliberatamente un sostituto piuttosto che ereditare qualsiasi strumento Windows offra in seguito.
Impostazioni privacy del microfono
Le impostazioni privacy del microfono sono gli interruttori di Windows che decidono quali programmi possono usare il Suo microfono. Se un'app di dettatura non sente nulla, questo è il primo posto dove guardare: Impostazioni → Privacy e sicurezza → Microfono.
Microfono predefinito
Il microfono predefinito è quello che Windows assegna ai programmi a meno che non scelgano diversamente. I laptop spesso ne hanno diversi (integrato, cuffie, webcam). Scegliere quello giusto — vicino alla Sua bocca, lontano dalle ventole — migliora la precisione più di qualsiasi impostazione.
Termini di acquisto
Acquisto una tantum (licenza perpetua)
Un acquisto una tantum significa pagare una volta e possedere il software — nessuna tariffa mensile o annuale per continuare a usarlo. CaringDictate costa $49 una volta, con aggiornamenti inclusi. Il modello alternativo, gli abbonamenti, continua a addebitare finché Lei continua a digitare.
Abbonamento
Un abbonamento è il pagamento mensile o annuale per l'accesso continuato al software — smetta di pagare e smette di funzionare. Ragionevole per servizi con costi server continui; più difficile da giustificare per uno strumento che funziona interamente sul Suo computer. Confronti i totali quinquennali prima di scegliere.
Posto (licenza per dispositivo)
Un posto è una copia installata di un programma; una licenza da 3 posti copre tre dei Suoi computer. La licenza di CaringDictate da $49 include 3 posti — desktop, laptop e uno in più.
Prova gratuita
Una prova gratuita è un periodo di prova completo prima del pagamento — quella di CaringDictate dura 7 giorni senza carta richiesta. Una prova sul Suo computer, con il Suo microfono e la Sua voce, batte qualsiasi recensione o grafico di precisione.
Aggiornamenti gratuiti
Aggiornamenti gratuiti significa che le nuove versioni del software sono incluse nel prezzo che ha già pagato, senza una tariffa di upgrade separata. Vale la pena verificarlo prima di acquistare qualsiasi software una tantum: alcune licenze "perpetue" La bloccano sulla versione che ha acquistato e Le fanno pagare di nuovo gli upgrade.
Limite di parole (limite di utilizzo)
Un limite di parole è un limite su quanto Lei può dettare — comune nei livelli gratuiti dei servizi di dettatura in abbonamento. Gli strumenti sul dispositivo non hanno motivo di misurare il Suo utilizzo; non c'è una fattura del server. CaringDictate non ha limiti.
Accelerazione GPU
L'accelerazione GPU significa usare il chip grafico del Suo computer per eseguire il modello vocale più velocemente di quanto potrebbe fare il processore principale. È il motivo per cui un laptop da gaming trascrive notevolmente più velocemente. Non è richiesta — CaringDictate funziona anche su macchine ordinarie con modelli più piccoli.
Requisiti di sistema
I requisiti di sistema sono le specifiche minime del computer di cui un programma ha bisogno per funzionare bene. Per CaringDictate: Windows 10 (64-bit, versione 1903) o Windows 11, 4 GB di RAM e qualche GB di spazio libero su disco.
La versione breve
Dettatura, digitazione vocale e speech-to-text significano tutti la stessa cosa: Lei parla, il computer digita. Le scelte che contano davvero al momento dell'acquisto sono dove viene elaborata la Sua voce (sul Suo computer o sul server di qualcun altro), come lo avvia e lo ferma (un comodo pulsante di conversazione, o una parola di attivazione), e come paga (una volta, o per sempre). Le risposte di CaringDictate sono: sul Suo computer, qualsiasi pulsante Lei preferisca — $49 una volta sola, con una prova di 7 giorni prova gratuita per verificare prima che si adatti alla tua voce.