Ogni prodotto di dettatura principale — Dragon, Otter, la dettatura di Google, la dettatura di Apple, ogni SaaS di trascrizione su cloud — invia la tua voce attraverso il server di qualcun altro. L'audio viene catturato sulla tua macchina, trasmesso via HTTPS a un data center, trascritto lì e il testo viene restituito. A volte l'audio viene memorizzato. A volte viene utilizzato per addestrare modelli. A volte viene "anonimizzato", una parola che ha perso gran parte del suo significato.
Riteniamo che questa sia l'impostazione predefinita sbagliata.
Cosa dettano realmente le persone
Una volta che inizi a osservare l'uso reale, il contenuto della dettatura non è quasi mai informale. È:
- Note mediche: un medico che trascrive una consulenza.
- Bozze legali: un avvocato che detta una mozione o una lettera per un cliente.
- Giornalismo — interviste con fonti nominate che presumevano che la registrazione non sarebbe mai uscita dalla macchina del giornalista.
- Note terapeutiche: uno psicologo che redige i riassunti delle sedute.
- Strategia aziendale: un dirigente che redige memorandum su accordi, persone e denaro.
- Diari personali: le cose che le persone pensano davvero, che nessun altro dovrebbe mai leggere.
Tutto questo viene di norma caricato sui servizi cloud per impostazione predefinita. Spesso in violazione di HIPAA, GDPR, segreto professionale avvocato-cliente o semplice decenza — perché l'utente non se ne rendeva conto o non aveva alternative.
In cosa Voice Pro è diverso
- Nessuna modalità cloud, punto. Non esiste un toggle per "inviare al server per una maggiore accuratezza". Il modello gira sulla tua CPU o GPU. Questa è l'unica opzione.
- Nessuna telemetria. L'app non invia dati a casa con statistiche d'uso, report di crash o qualsiasi altra cosa. Le uniche chiamate di rete sono (a) controllo licenza all'avvio, (b) controllo aggiornamenti, (c) download manuali opzionali dei modelli. Tutti e tre sono documentati e possono essere disabilitati.
- Non è richiesto un account per trascrivere. Puoi usare la prova di 14 giorni senza creare un account. L'email serve solo se vuoi acquistare una licenza.
- L'audio non viene mai scritto su disco. Il buffer audio vive in RAM durante la trascrizione e viene liberato nel momento in cui il testo viene prodotto. Niente da far trapelare, niente da recuperare a livello forense.
I modelli locali possono davvero eguagliare il cloud?
Due anni fa, no. Un modello locale da 100 MB su una CPU di laptop non poteva nemmeno avvicinarsi a ciò che il data center di Google riusciva a fare con 200 GB di modello e 40 GPU.
Oggi, sì. Qwen3-ASR 3B in esecuzione su una CPU di fascia media raggiunge tassi di errore per parola entro il 2% rispetto ai grandi provider cloud sulla maggior parte delle lingue, e batte Per le lingue a risorse limitate, dove i fornitori di cloud dispongono di meno dati di addestramento. Per la dettatura in particolare — enunciati brevi e intenzionali — il divario è prossimo allo 0%. L'ASR locale è diventato discretamente valido e continua a migliorare. Siamo semplicemente noi a scegliere di distribuirlo.
Il principio
La tua voce è il dato personale più intimo che generi. Porta con sé la tua identità, i tuoi pensieri, le persone di cui parli, le parole che hai scelto quando nessuno le modificava. Non dovrebbe lasciare il tuo dispositivo a meno che tu non lo invii esplicitamente e consapevolmente da qualche parte.
Quella non è una frase pubblicitaria. È l’intera ragione per cui il prodotto esiste.