L’addestramento vocale personale è incluso in Brethof Voice Pro. Ottimizza il modello di riconoscimento sulla tua voce, localmente, con un solo clic: nessuna riga di comando, nessun cloud. Ecco come funziona.
Come funziona
Ogni volta che correggi una parola riconosciuta erroneamente, l'app salva il frammento audio e la tua correzione in un dataset di addestramento locale. La scheda di addestramento nella finestra principale mostra quanti campioni e minuti hai acquisito: fai clic per sfogliare, riprodurre o eliminare le voci. Quando sei pronto, la scheda Addestramento effettua il fine-tuning di un adattatore LoRA sulla tua voce.
Il pipeline seleziona automaticamente il proprio backend: un NVIDIA CUDA build (cu128 PyTorch, installato automaticamente in un venv cache al primo avvio) quando è presente una GPU compatibile, altrimenti un CPU fallback. Quando l'addestramento termina, la LoRA viene fusa con il modello base ed esportata in GGUF affinché llama.cpp possa caricarla: passa al tuo modello personale da Impostazioni → Modelli. La conversione da PyTorch a GGUF che in precedenza bloccava questo processo è ora completata e funziona end-to-end.
Cosa ottieni
- Raccolta dati nell'app. Le correzioni diventano automaticamente dati di addestramento — basta continuare a usare l'app.
- Affinamento LoRA con un solo clic. Addestra sulla tua GPU (NVIDIA CUDA) o CPU. Barra di avanzamento, non un file di log.
- Esportazione automatica in GGUF. Il modello addestrato viene fuso e convertito per te: nessuna operazione manuale.
- Versionamento del modello. Tieni il modello stock accanto a quello fine-tunato e passa dall'uno all'altro nelle impostazioni.
- Parole chiave per il vocabolario. Aggiungi nomi, acronimi e termini di prodotto nella finestra Hotwords: l'applicazione è istantanea, senza necessità di riaddestramento.
A chi riguarda
- Parlanti non madrelingua. Oggi gli accenti marcati garantiscono un'accuratezza di base solida, ma è solo con il fine-tuning sulla propria voce che l'accuratezza sale oltre il 95%.
- Utenti medici, legali e tecnici. Nomi di farmaci, citazioni di sentenze, identificatori del codice sorgente: tutti traggono un enorme vantaggio da un vocabolario personalizzato.
- Utenti con difficoltà di parola. Il fine-tuning su discorsi disartrici o atipici è uno degli utilizzi a più alto valore del training locale. I servizi cloud commerciali non lo offrono.
- Lingue a risorse limitate. I modelli base sono efficaci nelle lingue più diffuse e meno performanti in quelle meno comuni. Effettuando il fine-tuning su poche ore del tuo audio, il divario si riduce rapidamente.
Cosa non cambia
- L'addestramento gira localmente. I campioni vocali non lasciano mai il tuo dispositivo. È proprio questo il punto.
- Il tuo modello fine-tuned è tuo. Non lo carichiamo. Non lo mettiamo in un modello “condiviso”. Rimane sul tuo disco.
- Incluso gratuitamente con qualsiasi licenza a pagamento. Non si tratta di un aggiornamento separato. Se possedete già Personal o Business, riceverete l'interfaccia di addestramento nell'aggiornamento che lo include.
Disponibilità
Disponibile ora — L'addestramento della voce personale è incluso nella build corrente e funziona end-to-end su Linux e Windows. Gratuito con qualsiasi licenza a pagamento; i dati della tua voce non lasciano mai la tua macchina.
Hai un caso d'uso specifico per il fine-tuning: vocabolari specializzati, accenti insoliti, parlato atipico? Faccelo sapere per continuare a migliorare il sistema: [email protected].