Trening głosu osobistego został wprowadzony w Brethof Voice Pro. Dostrój model rozpoznawania do własnego głosu, lokalnie, jednym kliknięciem — bez wiersza poleceń, bez chmury. Oto jak to działa.
Jak to działa
Za każdym razem, gdy poprawiasz błędnie rozpoznane słowo, aplikacja zapisuje klip audio i twoją poprawkę do lokalnego zbioru danych treningowych. Karta treningowa w głównym oknie pokazuje, ile próbek i minut zebrałeś — kliknij ją, aby przeglądać, odtwarzać lub usuwać wpisy. Gdy będziesz gotowy, zakładka Trening dostraja adapter LoRA na twoim głosie.
System automatycznie wybiera swój backend: an NVIDIA CUDA buduje (cu128 PyTorch, automatycznie instalowany do pamięci podręcznej venv przy pierwszym uruchomieniu), gdy dostępna jest kompatybilna karta GPU, w przeciwnym razie CPU zapasowy. Po zakończeniu trenowania LoRA jest scalana z modelem bazowym i eksportowana do GGUF, aby llama.cpp mogła ją załadować — przełącz się na swój osobisty model w Ustawieniach → Modele. Konwersja z PyTorch na GGUF, która wcześniej blokowała ten proces, jest ukończona i działa w całości.
To, co otrzymujesz
- Zbieranie danych w aplikacji. Poprawki automatycznie stają się danymi do treningu – po prostu kontynuuj korzystanie z aplikacji.
- Jednoklikowy fine-tuning LoRA. Szkolenie na Twojej GPU (NVIDIA CUDA) lub CPU. Pasek postępu, a nie plik dziennika.
- Automatyczny eksport do GGUF. Przeszkolony model jest scalany i konwertowany za Ciebie — bez żadnych kroków ręcznych.
- Wersjonowanie modeli. Zachowaj model domyślny obok tego dostosowanego i przełączaj się między nimi w ustawieniach.
- Słowa kluczowe dla słownictwa. Dodaj nazwy, akronimy i terminy produktowe w oknie dialogowym Hotwords — zmiany są stosowane natychmiast, bez konieczności ponownego trenowania.
Dla kogo to ma znaczenie
- Osoby nieposługujące się językiem ojczystym. Obecnie silne akcenty zapewniają już solidną dokładność bazową, ale dopiero fine-tuning na własnym głosie pozwala osiągnąć poziom powyżej 95%.
- Użytkownicy z branży medycznej, prawnej i technicznej. Nazwy leków, cytaty z orzecznictwa, identyfikatory bazy kodu — wszystko to odnosi ogromne korzyści z niestandardowego słownika.
- Użytkownicy z zaburzeniami mowy. Fine-tuning na mowie dysartrycznej lub nietypowej to jedno z najbardziej wartościowych zastosowań lokalnego treningu. Komercyjne usługi chmurowe go nie oferują.
- Języki o ograniczonych zasobach. Modele bazowe są dobre w popularnych językach, a słabsze w rzadziej używanych. Doprecyzowanie na kilku godzinach własnego audio szybko zamyka tę lukę.
Co się nie zmienia
- Szkolenie działa lokalnie. Próbki głosu nigdy nie opuszczają Twojego urządzenia. W tym właśnie polega cała idea.
- Twój model do fine-tuningu należy do Ciebie. Nie przesyłamy go. Nie agregujemy go do „wspólnego” modelu. Żyje na Twoim dysku.
- Dostępne bezpłatnie z każdą płatną licencją. To nie jest osobna aktualizacja. Jeśli posiadasz teraz licencję Personal lub Business, otrzymasz interfejs treningu w aktualizacji, która go wprowadza.
Dostępność
Dostępne teraz — Trening głosu osobistego jest dostępny w bieżącej wersji i działa w pełni na Linuxie i Windowsie. Dostępny za darmo z każdą licencją płatną; Twoje dane głosowe nigdy nie opuszczają Twojej maszyny.
Masz konkretny przypadek użycia do fine-tuningu — specjalistyczne słownictwo, nietypowe akcenty, atypowa mowa? Daj nam znać, abyśmy mogli dalej go udoskonalać: [email protected].