Cada producto importante de dictado —Dragon, Otter, el dictado de Google, el dictado de Apple, todos los servicios en la nube para transcripción— envía tu voz a través del servidor de otra persona. El audio se captura en tu equipo, se transmite por HTTPS a un centro de datos, se transcribe allí y luego el texto vuelve a ti. A veces el audio se almacena. A veces se utiliza para entrenar modelos. A veces se “anonimiza”, término que ya ha perdido casi todo su significado.
Creemos que ese es el valor predeterminado incorrecto.
Lo que la gente dicta realmente
Una vez que comienza a observar el uso real, el contenido del dictado casi nunca es casual. Es:
- Notas médicas: un médico transcribiendo una consulta.
- Borradores legales: un abogado dictando una moción o una carta para un cliente.
- Periodismo — entrevistas con fuentes nombradas que asumieron que la grabación no saldría de la máquina del periodista.
- Notas de terapia — un psicólogo redactando resúmenes de sesiones.
- Estrategia empresarial: un ejecutivo que redacta memorandos sobre acuerdos, personas y dinero.
- Diarios personales: lo que la gente realmente piensa, algo que nadie más debería leer jamás.
Todo eso se carga rutinariamente en servicios en la nube por defecto. A menudo, en violación de HIPAA, GDPR, el privilegio abogado-cliente o incluso de las normas básicas de decencia, porque el usuario no se dio cuenta o no tenía otra alternativa.
Qué hace diferente Voice Pro
- Sin nube, punto. No hay ningún interruptor para "enviar al servidor para mayor precisión". El modelo se ejecuta en tu CPU o GPU. Esa es la única opción.
- Sin telemetría. La aplicación no llama a casa con estadísticas de uso, informes de fallos ni nada más. Las únicas llamadas de red son (a) verificación de licencia al inicio, (b) verificación de actualizaciones, (c) descargas manuales opcionales de modelos. Las tres están documentadas y pueden desactivarse.
- No se requiere cuenta para transcribir. Puede utilizar la prueba de 14 días sin crear una cuenta. Solo se necesita un correo electrónico si desea comprar una licencia.
- El audio nunca se guarda en el disco. El búfer de audio reside en la RAM durante la transcripción y se libera en el momento en que se produce el texto. Nada que filtrar, nada que recuperar forensemente.
¿Pueden los modelos locales realmente igualarse a los de la nube?
Hace dos años, no. Un modelo local de 100 MB en la CPU de un portátil no podía compararse con lo que el centro de datos de Google lograba con 200 GB de modelo y 40 GPUs.
Hoy, sí. Qwen3-ASR 3B ejecutándose en una CPU de gama media alcanza tasas de error por palabra dentro del 2% de los grandes proveedores de la nube en la mayoría de los idiomas, y supera En lenguas con escasos recursos, donde los proveedores de nube cuentan con menos datos de entrenamiento. En cuanto al dictado en particular —expresiones cortas e intencionadas—, la brecha es cercana al 0%. El ASR local se ha vuelto silenciosamente lo suficientemente bueno, y sigue mejorando. Somos nosotros quienes decidimos implementarlo.
El principio
Su voz es el dato más personal que genera. Contiene su identidad, sus pensamientos, las personas de las que habla y las palabras que eligió cuando nadie las editaba. No debería salir de su máquina a menos que usted la envíe explícita y conscientemente a algún lugar.
Esa no es una frase de marketing. Esa es la razón entera de que el producto exista.