Por duas décadas, o Dragon NaturallySpeaking foi o padrão-ouro de precisão de ditado. Essa posição está mudando. O mecanismo Whisper, da OpenAI, em especial a variante Large v3 Turbo lançada em 2024, alcançou a paridade com o Dragon para o ditado geral e o supera em muitos casos específicos. Este artigo percorre o que realmente sabemos sobre a comparação, com fontes.
O que "precisão" significa no ditado
A precisão do ditado costuma ser medida como Taxa de Erro de Palavras (WER, na sigla em inglês), que é a porcentagem de palavras que saem erradas na transcrição. Quanto menor, melhor. Uma WER de 5% significa que 95 de cada 100 palavras estão corretas.
A WER varia enormemente dependendo das condições: a voz de quem fala, a qualidade do microfone, o ruído de fundo, o domínio do vocabulário, o estilo de ditado. Um número de referência só é significativo quando você sabe em que condições ele foi medido.
Whisper Large v3 Turbo: os números publicados
A OpenAI publicou o Whisper Large v3 Turbo em 2024 como uma variante mais rápida do Whisper Large v3 com precisão comparável. As taxas de erro de palavras reportadas em benchmarks padrão:
- Whisper Large v3 (original): 13,20% de WER, em média, em conjuntos de dados multilíngues
- Whisper Large v3 Turbo: 13,40% de WER — dentro de 0,2% do original
- Condições limpas, apenas em inglês: 3-5% de WER (97-95% de precisão)
A variante Turbo roda cerca de 4× mais rápido que o v3 com essencialmente a mesma precisão. É esse o mecanismo que o CaringDictate usa.
Para o caso de uso típico do CaringDictate (inglês, ambiente silencioso, microfone razoável), a precisão no mundo real fica em média de 96 a 97% no ditado contínuo. Isso corresponde aos números publicados pela OpenAI para condições limpas em inglês e é o que informamos em nossas páginas de marketing.
As alegações de precisão do Dragon
O Dragon historicamente anunciava 99% de precisão. A letra miúda: esse número foi alcançado com usuários treinados, microfones de headset de alta qualidade em ambientes silenciosos, após um treinamento de voz extenso. Um usuário de Dragon não treinado, no primeiro dia, costuma ver algo mais próximo de 92 a 94% de precisão.
Para usuários treinados do Dragon Professional Individual com a configuração adequada, a precisão no mundo real costuma ficar na faixa de 95 a 98% no ditado geral. Para domínios especializados (medicina, direito), o Dragon treinado pode chegar a 98-99% no vocabulário para o qual foi personalizado.
O confronto honesto, lado a lado
Para um usuário não treinado, com um headset USB genérico, ditando inglês coloquial: os mecanismos baseados em Whisper (CaringDictate) normalmente vencem. O Whisper não exige treinamento de voz e funciona bem logo de início na ampla variedade de vozes com que foi treinado (mais de 680.000 horas de áudio multilíngue).
Para um usuário treinado, com um microfone de alta qualidade (Plantronics, Andrea USB), ditando vocabulário especializado: o Dragon Professional treinado ainda pode ficar à frente no vocabulário específico para o qual foi treinado. A vantagem diminui consideravelmente para a escrita geral.
Para falantes não nativos de inglês, falantes com sotaque ou falantes com disartria leve causada por condições médicas: o Whisper tem uma vantagem clara. O corpus de treinamento foi muito mais diverso que o do Dragon, e o reconhecimento lida visivelmente melhor com a variação na fala.
Para falantes com disartria significativa (Parkinson grave, ELA afetando a fala, paralisia cerebral afetando a fala): nem o Whisper nem o Dragon é a ferramenta certa. O Voiceitt foi feito especificamente para esse caso e é significativamente melhor do que qualquer um dos dois, embora muito mais caro.
Velocidade
A verdadeira vantagem do Whisper Turbo sobre o Dragon é a velocidade. O Whisper Large v3 Turbo em hardware moderno (Intel i5 dos últimos 5 anos, ou Apple Silicon, ou qualquer CPU AMD moderna) produz a transcrição mais rápido que em tempo real — ou seja, você pode ditar uma frase e as palavras aparecem antes de você terminar de falar. O Dragon também processa em tempo real, mas tem uma latência mais perceptível na primeira palavra de cada elocução.
Para ditado de textos longos, essa diferença de velocidade é, em sua maior parte, psicológica. Para o ditado de mensagens curtas (comentários no Facebook, e-mails rápidos), a capacidade de resposta do Whisper Turbo parece notavelmente melhor.
A questão dos dados de treinamento
A tradicional vantagem de precisão do Dragon vinha do treinamento de voz supervisionado: você lia uma passagem longa para o Dragon, e ele construía um modelo pessoal que reconhecia sua voz melhor do que o modelo padrão. Isso funcionava, mas exigia um tempo inicial considerável.
O Whisper não funciona assim. Ele foi treinado uma vez sobre um vasto corpus multilíngue, pela OpenAI, e o modelo resultante é o que todo usuário do Whisper executa. Você não o treina com a sua voz. Ele funciona ou não na sua voz — e os amplos dados de treinamento significam que ele funciona razoavelmente bem na maioria das vozes.
A implicação para os usuários: com o Dragon, você pode gastar tempo de treinamento para melhorar a precisão. Com o Whisper, o que você tem no primeiro dia é o que você tem no dia 365. Para a maioria dos usuários, isso é uma vantagem, não um defeito — eles não queriam mesmo passar uma hora treinando o Dragon. Para usuários avançados com vocabulário técnico, a impossibilidade de treinar o Whisper com a voz é uma limitação real.
A questão da manutenção
O Dragon Professional Individual está congelado na versão 16 desde 2023. O mecanismo de reconhecimento não está sendo atualizado. A Microsoft direcionou o Dragon para o setor médico empresarial e está deixando o Dragon de consumo envelhecer.
O Whisper, por outro lado, é desenvolvido ativamente pela OpenAI e pela comunidade de código aberto. O Whisper v3 foi lançado em 2023, o Whisper v3 Turbo em 2024, e modelos sucessores estão em desenvolvimento ativo. O CaringDictate vem hoje com o v3 Turbo e será atualizado para modelos mais novos como uma atualização gratuita quando eles se mostrarem melhores.
Num horizonte de cinco anos, essa é a diferença mais importante. Um mecanismo de reconhecimento congelado vai continuar funcionando, mas não vai se beneficiar das melhorias substanciais que acontecem em outras partes da área.
Para grupos específicos de usuários
Usuários idosos com vocabulário geral em inglês: O Whisper (via CaringDictate) é a melhor escolha. Sem treinamento, sem complexidade de configuração, funciona bem logo de início.
Profissionais de saúde ditando notas clínicas: O Dragon Medical One treinado ainda é o padrão do setor. O vocabulário médico do Whisper é bom, mas não tão especializado.
Advogados ditando documentos jurídicos: O Dragon Professional treinado com vocabulário personalizado é difícil de superar. O Whisper lida bem com a maior parte do inglês jurídico, mas não tem a mesma capacidade de personalização.
Adultos com condições médicas que afetam as mãos, mas não a fala: O Whisper via CaringDictate é o que recomendaríamos. Sem o trabalho extra de treinamento, melhor precisão na variação da fala e muito mais barato.
Falantes não nativos de inglês: O Whisper tem uma vantagem clara. O corpus de treinamento multilíngue faz com que ele lide muito melhor com sotaques do que os modelos do Dragon, treinados em inglês.
Conclusão
O Whisper Large v3 Turbo e o Dragon Professional treinado estão hoje a poucos pontos percentuais de distância um do outro na precisão de ditado geral. Para a maioria dos usuários, especialmente os idosos e os usuários com condições médicas, as vantagens práticas do Whisper (sem treinamento, melhor tratamento de sotaques, desenvolvimento ativo, custo muito menor) superam a vantagem residual do Dragon em vocabulário especializado.
O CaringDictate é construído sobre o Whisper Large v3 Turbo porque acreditamos que esse é o mecanismo certo para o nosso público. O reembolso de 30 dias significa que você pode comparar por conta própria, sem risco.
Para onde ir a partir daqui
Leia a comparação completa entre CaringDictate e Dragon para conhecer as diferenças no nível do produto (preço, experiência de uso, atualizações, reembolso), e o nosso guia de privacidade se o processamento local em comparação ao processamento na nuvem for importante para a sua situação.