Todo produto de ditado importante — Dragon, Otter, o ditado do Google, o ditado da Apple, todos os serviços SaaS de transcrição em nuvem — envia sua voz por meio do servidor de terceiros. O áudio é capturado em seu dispositivo, transmitido por HTTPS para um data center, transcrito lá e o texto é devolvido. Às vezes, o áudio é armazenado. Às vezes, é usado para treinar modelos. Às vezes, é “anonimizado”, termo que perdeu grande parte de seu significado.
Achamos que esse é o padrão incorreto.
O que as pessoas realmente ditam
Quando se começa a observar o uso real, o conteúdo do ditado quase nunca é casual. É:
- Notas médicas — um médico transcrevendo uma consulta.
- Rascunhos legais — um advogado ditando uma petição ou uma carta ao cliente.
- Jornalismo — entrevistas com fontes identificadas que assumiram que a gravação não sairia do aparelho do jornalista.
- Notas de terapia — um psicólogo redigindo resumos de sessões.
- Estratégia de negócios — um executivo redigindo memorandos sobre negócios, pessoas e dinheiro.
- Diários pessoais — as coisas que as pessoas realmente pensam, e que ninguém mais deveria ler.
Tudo isso é rotineiramente enviado para serviços em nuvem por padrão. Muitas vezes em violação da HIPAA, do GDPR, do sigilo advogado-cliente ou da decência comum — porque o usuário não percebeu ou não tinha alternativa.
O que o Voice Pro faz de diferente
- Sem nuvem, ponto final. Não há opção de "enviar para o servidor para maior precisão". O modelo roda na sua CPU ou GPU. Essa é a única opção.
- Sem telemetria. O aplicativo não faz contato com estatísticas de uso, relatórios de falhas ou qualquer outra coisa. As únicas chamadas de rede são (a) verificação de licença na inicialização, (b) verificação de atualização, (c) downloads manuais opcionais de modelos. Todas as três são documentadas e podem ser desativadas.
- Não é necessária conta para transcrever. Você pode usar a versão de teste de 14 dias sem criar uma conta. Um e-mail é necessário apenas se você quiser comprar uma licença.
- O áudio nunca toca o disco. O buffer de áudio fica na RAM durante a transcrição e é liberado no momento em que o texto é produzido. Nada para vazar, nada para recuperar forense.
Os modelos locais realmente conseguem competir com a nuvem?
Há dois anos, não. Um modelo local de 100 MB em uma CPU de laptop não conseguia nem se aproximar do que o data center do Google fazia com 200 GB de modelo e 40 GPUs.
Hoje, sim. O Qwen3-ASR 3B rodando em uma CPU de gama média atinge taxas de erro de palavra dentro de 2% dos grandes provedores de nuvem na maioria dos idiomas, e supera nelas em idiomas de baixo recurso onde os provedores de nuvem têm menos dados de treinamento. Para ditado especificamente — utterances curtas e intencionais — a lacuna é próxima de 0%. O ASR local tornou-se silenciosamente bom o suficiente, e continua melhorando. Somos apenas os que escolhemos entregá-lo.
O princípio
Sua voz é o dado mais pessoal que você gera. Ela carrega sua identidade, seus pensamentos, as pessoas sobre as quais você fala, as palavras que você escolheu quando ninguém estava editando. Ela não deve sair do seu computador, a menos que você a envie para algum lugar de forma explícita e consciente.
Isso não é uma frase de marketing. Essa é a razão inteira pela qual o produto existe.