Você não deveria precisar de um tradutor para comprar uma ferramenta cujo único trabalho é transformar suas palavras em texto. Esta página define cada termo que você encontrará ao comparar softwares de ditado — incluindo aqueles em nossas próprias telas de configurações. Cada definição é uma frase; os detalhes após ela são leitura opcional.

O básico

Ditado

Ditado é falar em voz alta enquanto o software transforma suas palavras em texto escrito. As pessoas também o chamam de digitação por voz ou fala para texto. Todos os três nomes significam a mesma coisa: você fala, o computador digita.

Digitação por voz

Digitação por voz é outro nome para ditado — falar em vez de digitar, com as palavras aparecendo onde quer que esteja o cursor de texto. O Windows chama a sua ferramenta integrada de 'digitação por voz' (o recurso Win+H). O CaringDictate faz o mesmo trabalho na maioria dos programas, sem os tempos limite da ferramenta integrada.

Fala para texto

Fala para texto é a tecnologia que converte áudio falado em palavras escritas. Você o verá abreviado como STT em artigos técnicos. Quando um produto diz "alimentado por fala para texto", significa ditado.

Reconhecimento de fala

Reconhecimento de fala é o campo mais amplo de computadores que entendem a fala humana — tanto o que você disse (ditado) quanto o que você quis dizer (comandos). Um aplicativo de ditado usa o reconhecimento de fala para escrever suas palavras. Um assistente de voz o usa para agir sobre elas.

Transcrição

Transcrição é transformar uma gravação de fala — uma reunião, uma entrevista, um correio de voz — em um documento escrito após o fato. O ditado é ao vivo (você vê as palavras aparecerem enquanto fala); a transcrição geralmente acontece depois, a partir de um arquivo. Ferramentas como Otter.ai são ferramentas de transcrição, não ferramentas de ditado.

Como funciona o reconhecimento

Modelo de voz (modelo de reconhecimento)

Um modelo de voz é o cérebro treinado de um programa de ditado — o arquivo que de fato entende a fala. Modelos maiores costumam ser mais precisos, mas precisam de um computador mais potente. O CaringDictate escolhe o tamanho de modelo que se encaixa na sua máquina, de cerca de 190 MB a cerca de 3.1 GB.

Whisper

Whisper é uma família de modelos de voz de código aberto lançada pela OpenAI em 2022, conhecida pela precisão quase humana em muitos idiomas. É o motor por trás de muitos produtos modernos de ditado e transcrição, incluindo o CaringDictate. Por ser de código aberto, pode ser executado inteiramente no seu próprio computador.

Reconhecimento no dispositivo (offline)

Reconhecimento no dispositivo significa que a sua fala é processada no seu próprio computador — o áudio nunca viaja para o servidor de uma empresa. Isso funciona sem internet, mantém os pensamentos privados e nunca para de funcionar porque um serviço está inativo. É assim que o CaringDictate funciona.

Reconhecimento na nuvem

Reconhecimento na nuvem significa que a sua voz é transmitida pela internet até aos servidores de uma empresa, convertida em texto aí, e enviada de volta. O reconhecimento acontece num servidor, e não na sua máquina. Onde cada ferramenta faz o seu reconhecimento está indicado na respetiva documentação, e alguns produtos oferecem ambas as opções — vale a pena verificar em vez de presumir.

Precisão (taxa de erro de palavra)

Precisão é a porcentagem de palavras que um programa de ditado acerta; a taxa de erro de palavras (WER) é a mesma ideia medida ao contrário — a porcentagem que ele erra. O ditado moderno baseado no Whisper é altamente preciso em fala clara em inglês. Os resultados variam com a qualidade do microfone, o ruído de fundo e o quão claramente você fala.

Latência

Latência é o atraso entre terminar uma frase e ver o texto aparecer. Abaixo de cerca de um terço de segundo parece instantâneo; muito além disso parece lento. O reconhecimento no dispositivo evita a viagem de ida e volta a um servidor, o que ajuda.

Deteção automática de idioma

A deteção automática de idioma significa que o software descobre qual idioma você está a falar sem que lhe seja dito. Útil se você alternar entre idiomas durante o dia. A configuração "Automático" do CaringDictate faz isso em seus 20 idiomas suportados.

Usar uma aplicação de ditado no dia a dia

Botão de fala (tecla de atalho)

O botão de fala é a única tecla ou botão do rato que inicia e para o ditado. No CaringDictate, o padrão é a tecla Ctrl direita, e você pode alterá-lo para qualquer tecla ou botão do rato que seja confortável para as suas mãos.

Pressionar para falar (manter pressionado para falar)

Pressionar para falar significa manter o botão de fala pressionado enquanto você fala e soltá-lo quando terminar — como um walkie-talkie. Bom para rajadas curtas: uma caixa de pesquisa, uma resposta rápida. A alternativa é tocar para alternar, melhor para escrita mais longa.

Alternar (tocar para falar)

O modo de alternância significa tocar no botão de fala uma vez para começar a ouvir e tocar novamente para parar. As suas mãos ficam completamente livres entretanto — útil quando segurar uma tecla é desconfortável, ou quando você dita passagens longas.

Palavra de ativação (ativação por voz)

Uma palavra de ativação é uma frase que você diz em voz alta — como "começar a ditar" — que inicia o ditado sem tocar no teclado ou no rato. Isso é mais importante quando alcançar o teclado é a parte difícil. O CaringDictate adicionou ativação por voz configurável pelo utilizador na versão 3.5.

Indicador de escuta

O indicador de escuta é o pequeno sinal no ecrã que mostra que o microfone está ativo e as suas palavras estão a ser ouvidas. Um indicador fiável é importante: você nunca deve ter de se perguntar se o computador está a ouvir.

Comandos de voz

Comandos de voz são instruções faladas — como "nova linha" ou "apagar isso" — que controlam a formatação em vez de escrever palavras. As aplicações de ditado diferem muito aqui. Comandos simples cobrem a maioria da escrita diária; o controlo pesado do computador sem as mãos é uma categoria separada (ver Voice Access).

Comandos de pontuação

Comandos de pontuação são dizer "ponto", "vírgula" ou "ponto de interrogação" em voz alta para inserir pontuação. Motores modernos como o Whisper também pontuam automaticamente a partir da sua fraseologia e pausas, então você pode frequentemente apenas falar naturalmente.

Dicionário personalizado (lista de palavras)

Um dicionário personalizado é a sua lista pessoal de nomes e palavras especiais em que o reconhecedor deve confiar — nomes de família, nomes de medicamentos, jargão da indústria. Adicionar "Zofran" ou "Oaxaca" uma vez é melhor do que corrigi-lo para sempre. O CaringDictate inclui um em Escrita e palavras.

Inserção de texto

A inserção de texto é como as palavras ditadas chegam fisicamente ao seu documento — a aplicação digita-as tecla a tecla ou cola-as de uma só vez. Colar frases inteiras é mais rápido e muito mais fiável em diferentes programas, razão pela qual o CaringDictate entrega o texto dessa forma.

Termos específicos do Windows

Win+H (digitação por voz do Windows)

Win+H é o atalho de teclado que abre a barra de digitação por voz incluída no Windows 10 e 11. Gratuito, já incluído no Windows e uma primeira opção sensata a experimentar para o ditado do dia a dia. O Windows 11 também inclui o Voice Access, que acrescenta controlo total do PC por voz, juntamente com vocabulário personalizado e correção de texto.

Windows Voice Access

O Voice Access é o recurso de controle de computador sem as mãos do Windows 11 — clicar, rolar e alternar janelas por voz, com ditado incluído. Ele foi desenvolvido para controle total do computador por voz. Se o que você mais deseja é uma escrita confortável, uma ferramenta de ditado dedicada geralmente é a melhor opção.

Reconhecimento de Fala do Windows (WSR)

O Reconhecimento de Fala do Windows é a ferramenta de ditado integrada mais antiga que a Microsoft descontinuou em favor do Voice Access. Se você dependia do WSR em um PC mais antigo, sua descontinuação é geralmente o momento de escolher um substituto deliberadamente, em vez de herdar a próxima ferramenta que o Windows oferecer.

Configurações de privacidade do microfone

As configurações de privacidade do microfone são os interruptores do Windows que decidem quais programas podem usar seu microfone. Se um aplicativo de ditado não ouve nada, este é o primeiro lugar para procurar: Configurações → Privacidade e segurança → Microfone.

Microfone padrão

O microfone padrão é aquele que o Windows entrega aos programas, a menos que eles escolham de forma diferente. Laptops geralmente têm vários (integrado, fone de ouvido, webcam). Escolher o certo — perto da sua boca, longe de ventiladores — melhora a precisão mais do que qualquer configuração.

Termos de compra

Compra única (licença perpétua)

Uma compra única significa pagar uma vez e possuir o software — sem taxa mensal ou anual para continuar usando-o. O CaringDictate custa $49 uma única vez, com atualizações incluídas. O modelo alternativo, as assinaturas, continua cobrando enquanto você continuar digitando.

Assinatura

Uma assinatura é o pagamento mensal ou anual para acesso contínuo ao software — pare de pagar e ele para de funcionar. Razoável para serviços com custos contínuos de servidor; mais difícil de justificar para uma ferramenta que roda inteiramente no seu próprio computador. Compare os totais de cinco anos antes de escolher.

Licença de uso (licença por dispositivo)

Uma licença de uso é uma cópia instalada de um programa; uma licença de 3 usos cobre três dos seus computadores. A licença de $49 do CaringDictate inclui 3 licenças de uso — desktop, laptop e mais uma.

Teste gratuito

Um teste gratuito é um período de experimentação com todos os recursos antes de pagar — o do CaringDictate dura 7 dias sem necessidade de cartão. Um teste no seu próprio computador, com seu próprio microfone e sua própria voz, supera qualquer avaliação ou gráfico de precisão.

Atualizações gratuitas

Atualizações gratuitas significam que novas versões do software estão incluídas no preço que você já pagou, sem uma taxa de upgrade separada. Vale a pena verificar antes de comprar qualquer software de pagamento único: algumas licenças 'perpétuas' prendem você na versão que comprou e cobram de novo pelos upgrades.

Limite de palavras (limite de uso)

Um limite de palavras é um limite de quanto você pode ditar — comum em níveis gratuitos de serviços de ditado por assinatura. Ferramentas no dispositivo não têm motivo para te limitar; não há conta de servidor. O CaringDictate não tem limite.

Aceleração por GPU

A aceleração por GPU significa usar o chip gráfico do seu computador para executar o modelo de voz mais rápido do que o processador principal conseguiria. É por isso que um laptop gamer transcreve visivelmente mais rápido. Não é obrigatório — o CaringDictate também funciona em máquinas comuns com modelos menores.

Requisitos do sistema

Requisitos de sistema são as especificações mínimas de computador que um programa precisa para rodar bem. Para o CaringDictate: Windows 10 (64 bits, versão 1903) ou Windows 11, 4 GB de RAM e alguns GB de espaço livre em disco.

A versão curta

Ditado, digitação por voz e fala para texto significam a mesma coisa: você fala, o computador digita. As escolhas que realmente importam ao comprar são onde sua voz é processada (no seu computador ou no servidor de alguém), como você o inicia e para (um botão de fala confortável, ou uma palavra de ativação), e como você paga (uma vez, ou para sempre). As respostas do CaringDictate são: no seu computador, qualquer botão que você quiser — $49 uma única vez, com um período de 7 dias de avaliação gratuita para verificar se se adapta à sua voz primeiro.