Hoje, o Brethof Voice Pro v1.0 está disponível para download no Windows 10/11 e Linux (Ubuntu, Fedora, Arch). É um aplicativo de desktop que captura áudio do seu microfone, executa um modelo ASR baseado em Qwen localmente na sua CPU ou GPU, e digita o texto transcrito na janela em que você está focado.
O que é lançado na v1.0
- 30 idiomas de transcrição mais 38 idiomas de tradução — Árabe, Cantonês, Chinês, Tcheco, Dinamarquês, Holandês, Inglês, Filipino, Finlandês, Francês, Alemão, Grego, Hindi, Croata, Húngaro, Indonésio, Italiano, Japonês, Coreano, Macedônio, Malaio, Persa, Polonês, Português, Romeno, Russo, Sérvio, Eslovaco, Esloveno, Espanhol, Sueco, Tailandês, Turco, Ucraniano, Vietnamita, Búlgaro.
- Ditado com tecla de atalho global — Pressione sua tecla de atalho em qualquer lugar, fale, solte, e o texto é digitado no aplicativo em foco.
- 100% offline — Sem nuvem, sem telemetria, sem necessidade de conta para transcrever.
- Três níveis de modelo — base (rápido, 0,6B parâmetros), médio (1,7B), grande (3B). Escolha de acordo com seu hardware.
- Redução de ruído por meio do DeepFilterNet e detecção de atividade de voz via Silero VAD, ambos rodando localmente.
- Palavras-chave — injetar nomes, siglas e termos de domínio como dicas em tempo de inferência (sem necessidade de retreinamento).
Uma coisa não na v1.0: fine-tuning do modelo. Builds anteriores tinham isso via PyTorch, mas quando migramos a inferência para GGUF quebramos o pipeline de treinamento e não o estamos disponibilizando até que a etapa de conversão esteja sólida. Veja o post sobre o roteiro de fine-tuning.
Preços
Compra única, sem assinatura:
- Personal — 2 máquinas, cobre uso comercial individual e de freelancer. Veja os preços.
- Business — uso em equipes/organizações com descontos por volume a partir de 10 assentos. Veja os preços.
- Teste gratuito de 14 dias — Sem cartão de crédito, todos os recursos desbloqueados.
Os preços se ajustam automaticamente por região: se você estiver na Europa Oriental, Sudeste Asiático, América Latina ou África, verá preços ajustados por paridade de poder de compra.
O que acertamos
O que mais nos agrada é tempo até a primeira palavra. Abra o aplicativo, pressione sua tecla de atalho e fale. Sem cadastro. Sem navegador. Sem necessidade de fazer upload. Sem espera por transmissão pela nuvem. Em um laptop de gama média, o Voice Pro transcreve uma frase de cinco segundos em menos de 400 ms com o modelo básico. Essa velocidade era exatamente o objetivo.
O que vem a seguir
- build do macOS — em andamento, meta para o 3º trimestre de 2026.
- Ajuste fino da sua voz e vocabulário — disponível assim que o pipeline de conversão de PyTorch para GGUF estiver pronto. Meta para o 3º trimestre de 2026.
- Modo de transmissão em tempo real — As palavras aparecem à medida que você fala, e não após soltar a tecla de atalho.
- Mais níveis de modelo — um modelo de dispositivo de borda ultrapequeno para hardware de baixo custo, e um modelo de 7B para máquinas mais potentes.
Se você está esperando por uma ferramenta de ditado que respeite a privacidade, hoje é o dia. Baixe a versão de teste, dite por 14 dias e nos avise onde ela falha. Nós lemos cada e-mail.