Dziś Brethof Voice Pro v1.0 jest dostępny do pobrania na Windows 10/11 i Linux (Ubuntu, Fedora, Arch). Jest to aplikacja desktopowa, która przechwytuje dźwięk z mikrofonu i uruchamia model ASR oparty na Qwen. lokalnie na Twoim CPU lub GPU, a następnie wpisuje transkrybowany tekst do dowolnego okna, na którym skupione jest Twoje okno.
Co zawiera wersja 1.0
- 30 języków transkrypcji plus 38 języków tłumaczenia — arabski, kantonski, chiński, czeski, duński, niderlandzki, angielski, filipiński, fiński, francuski, niemiecki, grecki, hindi, chorwacki, węgierski, indonezyjski, włoski, japoński, koreański, macedoński, malajski, perski, polski, portugalski, rumuński, rosyjski, serbski, słowacki, słoweński, hiszpański, szwedzki, tajski, turecki, ukraiński, wietnamski, bułgarski.
- Dyktowanie za pomocą globalnego skrótu klawiszowego — naciśnij skrót klawiszowy w dowolnym miejscu, mów, puść, a tekst zostanie wpisany do aktywnego okna aplikacji.
- 100% offline — Bez chmury, bez telemetrii, bez wymogu tworzenia konta do transkrypcji.
- Trzy poziomy modeli — bazowy (szybki, 0,6 mld parametrów), średni (1,7 mld), duży (3 mld). Wybierz w zależności od swojego sprzętu.
- Redukcja szumu za pośrednictwem DeepFilterNet i wykrywanie aktywności głosu za pośrednictwem Silero VAD, oba działają lokalnie.
- Słowa kluczowe — wstrzykuj nazwy, akronimy i terminy branżowe jako wskazówki w czasie wnioskowania (nie wymaga ponownego trenowania).
Jedna rzecz nie w v1.0: dopracowywanie modelu. Wcześniejsze kompilacje miały to za pośrednictwem PyTorch, ale gdy przenieśliśmy wnioskowanie na GGUF, zepsuliśmy potok treningowy i nie udostępniamy tego, dopóki krok konwersji nie będzie solidny. Zobacz post dotyczący planu dopracowywania.
Ceny
Zakup jednorazowy, bez subskrypcji:
- Personal — 2 maszyny, obejmuje indywidualne i freelancerskie zastosowania komercyjne. Zobacz ceny.
- Business — użycie zespołowe/organizacyjne z rabatami ilościowymi od 10 licencji. Zobacz ceny.
- 14-dniowy bezpłatny okres próbny — Bez karty kredytowej, wszystkie funkcje odblokowane.
Ceny automatycznie dostosowują się do regionu: jeśli znajdujesz się w Europie Wschodniej, Azji Południowo-Wschodniej, Ameryce Łacińskiej lub Afryce, zobaczysz ceny według paritetu siły nabywczej.
To, co zrobiliśmy dobrze
To, z czego jesteśmy najbardziej zadowoleni, to czas do pierwszego słowa. Otwórz aplikację, naciśnij skrót, mów. Bez rejestracji. Bez przeglądarki. Bez przesyłania. Bez czekania na obieg chmurowy. Na laptopie średniej klasy Voice Pro transkrybuje pięciosekundowe zdanie w mniej niż 400 ms z modelem bazowym. Ta szybkość była całym sensem.
Co dalej
- kompilacja macOS — w toku, cel: III kwartał 2026 roku.
- Fine-tuning na twoim głosie i słownictwie — pojawi się, gdy tylko potok konwersji PyTorch na GGUF będzie gotowy. Cel: III kwartał 2026 roku.
- Tryb strumieniowania w czasie rzeczywistym — Słowa pojawiają się w trakcie mówienia, a nie po naciśnięciu klawisza skrótu.
- Więcej poziomów modeli — ultramały model dla urządzeń brzegowych przeznaczony dla sprzętu o niskich parametrach oraz model 7B dla wydajnych maszyn.
Jeśli czekałeś na narzędzie do dyktowania, które szanuje prywatność, to dziś jest ten dzień. Pobierz wersję próbną, dyktuj przez 14 dni i daj nam znać, gdzie się psuje. Czytamy każdy e-mail.