A maioria das pessoas que usa ditado por voz nunca pensa para onde a sua voz realmente vai. O marketing diz que o software é "privado" ou "seguro" e você em geral confia nisso. Para conversas médicas, escrita financeira e correspondência pessoal, essa confiança merece mais escrutínio. Veja o que realmente acontece quando você dita em diferentes produtos.
A distinção entre nuvem e local
O reconhecimento de voz pode rodar em dois lugares fundamentalmente diferentes: em um servidor em algum lugar na internet (nuvem), ou no processador do seu próprio computador (local, no dispositivo). A experiência de uso é parecida — você fala, as palavras aparecem — mas as implicações de privacidade são muito diferentes.
Ditado baseado na nuvem envia o áudio da sua voz para um servidor, onde o reconhecimento roda, e devolve o texto resultante. A sua voz foi enviada para a infraestrutura de terceiros. Se aquele áudio é armazenado, registrado, usado para treinamento, compartilhado com parceiros ou excluído depende inteiramente das políticas do fornecedor — que normalmente você não leu.
Ditado local/no dispositivo roda o reconhecimento no processador do seu próprio computador usando um modelo baixado. O áudio da sua voz nunca sai do dispositivo. Não há nada para ninguém registrar, armazenar ou treinar, porque nada foi enviado em primeiro lugar.
Quais ferramentas são quais, em 2026
Local (a sua voz fica no seu computador):
- CaringDictate — totalmente local. O Whisper Large v3 Turbo roda no seu próprio computador. Nada enviado, nunca. Política de privacidade aqui.
- Dragon Professional Individual v16 — local. O reconhecimento é executado no seu próprio computador.
- Apple Dictation em Macs e iPhones mais recentes — local em dispositivos com o Apple Neural Engine (Macs de 2020+, iPhone XS ou mais novo). Dispositivos Apple mais antigos enviam áudio para os servidores da Apple.
- Microsoft Voice Access no Windows 11 — local.
- VoiceInk (Mac) — local.
Nuvem (a sua voz vai para um servidor):
- Dragon Medical One — só na nuvem.
- Otter.ai — só na nuvem.
- Wispr Flow — baseado na nuvem; o reconhecimento funciona nos seus servidores.
- Google Docs Voice Typing — só na nuvem. Áudio enviado para o Google.
- Voiceitt — só na nuvem.
- Dispositivos Apple mais antigos — nuvem, áudio enviado para os servidores da Apple.
Para usuários com conversas relevantes para a HIPAA, discussões financeiras sensíveis, preocupações com sigilo jurídico, ou simplesmente preferência pessoal por não ter terceiros os ouvindo — a categoria da nuvem está totalmente fora de cogitação.
O que "compatível com a HIPAA" geralmente significa (e não significa)
Muitos serviços de ditado na nuvem anunciam ser "compatíveis com a HIPAA". Isso soa como uma garantia de privacidade. Na maior parte das vezes, não é.
A conformidade com a HIPAA para um fabricante na nuvem significa tipicamente que o fabricante assinou Acordos de Associado Comercial com entidades abrangidas (hospitais, clínicas), implementou determinados controlos de acesso, e segue determinados requisitos de auditoria. O que não não significa é que a sua voz fica no seu computador: com um serviço na nuvem, o áudio continua a ser enviado ao fabricante, e a HIPAA regula como é tratado, e não se é transmitido ou não. O que cada fabricante em particular faz com ele está definido na sua própria política de privacidade e nos seus termos, que é o documento a ler.
Para um paciente individual ou familiar que quer que a sua voz nunca saia do seu computador, o teste certo não é 'isto é compatível com a HIPAA?'. O teste certo é 'isto é local?'. Se a resposta for sim, a sua voz nunca sai do seu computador por design — não por política. Se a resposta for não — mesmo que o serviço de nuvem seja compatível com a HIPAA — a sua voz foi enviada.
O que realmente fica armazenado, mesmo em serviços de nuvem
Para serviços de ditado na nuvem, o que fica armazenado varia. Os padrões comuns incluem:
- Gravações de áudio — o período de retenção varia consoante o fabricante e o plano; a política de privacidade do fabricante é o local onde isto está indicado.
- Transcrições — os textos resultantes muitas vezes ficam armazenados indefinidamente. A maioria dos usuários não percebe que as transcrições de tudo o que ditam existem na nuvem.
- Metadados — horário, informações do dispositivo, endereço IP. Útil para análises, mas ainda assim é dado sobre o seu uso.
- Perfis de voz — alguns serviços constroem um perfil da sua voz ao longo do tempo para melhorar o reconhecimento. Isso é uma impressão de voz literal, o que tem implicações biométricas.
Nada disso existe para as ferramentas de ditado local, porque nada foi enviado.
A questão do "treinamento de IA"
Muitas pessoas agora estão, com razão, receosas de ter a sua voz ou escrita usadas para treinar modelos de IA. Os serviços de ditado na nuvem frequentemente (nem sempre) incluem cláusulas de dados de treinamento nos termos de serviço. Essas cláusulas concedem ao fornecedor uma licença para usar o seu áudio e transcrições para melhorar os modelos de reconhecimento deles.
Para alguns usuários, isso é aceitável. Para outros — especialmente os que escrevem sobre condições médicas, assuntos de família ou trabalho protegido intelectualmente — isso é inaceitável. A defesa é usar o ditado local. Com o CaringDictate (e qualquer outra ferramenta totalmente local), nada foi enviado, então não há nada para treinar.
A questão da exigência de internet
Uma questão relacionada, mas separada: o ditado na nuvem exige internet. Se a sua internet doméstica está fora do ar, o seu ditado na nuvem não funciona. Se você está viajando para algum lugar com conectividade ruim, a qualidade do seu ditado pode piorar ou falhar por completo. Para usuários que dependem do ditado por motivos de acessibilidade, essa dependência de uma conexão de internet estável é uma vulnerabilidade.
O ditado local funciona sem internet. O CaringDictate baixa o modelo de reconhecimento uma vez durante a instalação inicial e, a partir daquele ponto, funciona totalmente offline. Isso importa para viagens, para conexões intermitentes e para os casos (cada vez mais raros) em que você simplesmente não quer que o seu computador fique mandando tudo para fora.
Como o CaringDictate lida com a privacidade especificamente
A nossa arquitetura é intencionalmente simples de verificar:
- O Whisper Large v3 Turbo (o motor de reconhecimento) é baixado uma vez durante a instalação e armazenado no seu computador.
- Quando você dita, o áudio é capturado pelo microfone, processado pelo Whisper no seu próprio computador e convertido em texto. O buffer de áudio é então descartado.
- O texto é inserido no campo de texto que estiver com o cursor.
- A sua voz e o seu texto ditado nunca são enviados pela internet, nunca são carregados e nunca são armazenados em nenhum servidor.
- Você pode verificar isso com qualquer ferramenta de monitoramento de rede — o CaringDictate não faz nenhuma conexão de saída durante o ditado.
O único tráfego de rede que o CaringDictate gera é durante a instalação inicial (baixando o modelo de reconhecimento e quaisquer verificações de atualização). Uma vez instalado, ele fica totalmente offline.
Recomendações práticas por caso de uso
Para ditado geral (e-mail, documentos, formulários da web): Qualquer ferramenta de ditado local serve — CaringDictate, Dragon ou Apple Dictation em um Mac mais recente.
Para conversas médicas ou trabalho relevante para a HIPAA: Apenas local é a resposta certa. O CaringDictate foi criado especificamente para isto, e o Dragon Professional também executa o seu reconhecimento no próprio computador.
Para reuniões que você quer transcrever: O Otter.ai é a escolha padrão, mas é baseado na nuvem — certifique-se de que todos na reunião consentem com isso.
Para escrita pessoal sensível à privacidade (diários, memórias): Definitivamente local. CaringDictate ou Apple Dictation mais antigo. Evite serviços de nuvem por completo.
Para onde ir a partir daqui
Para o detalhe técnico completo sobre como o CaringDictate lida com os seus dados, veja nossa política de privacidade. Para comparações com outras opções, consulte Dragon, vs Wispr Flow, vs Otter.ai.