Każdy główny produkt do dyktowania — Dragon, Otter, dyktowanie Google’a, dyktowanie Apple’a, każde chmurowe SaaS do transkrypcji — przesyła twój głos przez serwer kogoś innego. Dźwięk jest przechwytywany na twoim komputerze, przesyłany przez HTTPS do centrum danych, tam transkrybowany, a tekst wraca. Czasami dźwięk jest przechowywany. Czasami jest wykorzystywany do trenowania modeli. Czasami jest „anonimizowany”, co jest określeniem, które straciło już większość swojego znaczenia.
Uważamy, że to zły domyślny wybór.
To, co ludzie faktycznie dyktują
Gdy zaczniesz obserwować rzeczywiste użycie, treść dyktowania prawie nigdy nie jest swobodna. To jest:
- Notatki medyczne — lekarz transkrybujący konsultację.
- Projekty dokumentów prawnych — prawnik dyktujący wniosek lub list do klienta.
- Dziennikarstwo — wywiady z wymienionymi z imienia źródłami, które zakładały, że nagranie nie opuści urządzenia dziennikarza.
- Notatki z terapii — psycholog spisujący streszczenia sesji.
- Strategia biznesowa — menedżer sporządzający notatki dotyczące umów, ludzi i finansów.
- Dzienniki osobiste — rzeczy, o których ludzie naprawdę myślą, których nikt inny nie powinien nigdy przeczytać.
Wszystko to domyślnie jest regularnie przesyłane do usług chmurowych. Często wbrew przepisom HIPAA, GDPR, tajemnicy adwokackiej lub podstawowej przyzwoitości – ponieważ użytkownik nie zdawał sobie z tego sprawy lub nie miał alternatywy.
Co robi inaczej Voice Pro
- Tryb bez chmury, bez wyjątków. Nie ma przełącznika „wyślij do serwera dla lepszej dokładności”. Model działa na Twojej CPU lub GPU. To jedyna opcja.
- Brak telemetrii. Aplikacja nie wysyła do domu statystyk użytkowania, raportów o awariach ani niczego innego. Jedyne wywołania sieciowe to: (a) sprawdzenie licencji przy starcie, (b) sprawdzenie aktualizacji, (c) opcjonalne ręczne pobieranie modeli. Wszystkie trzy są udokumentowane i można je wyłączyć.
- Nie wymagane jest konto do transkrypcji. Możesz skorzystać z 14-dniowego okresu próbnego bez zakładania konta. Adres e-mail jest potrzebny tylko wtedy, gdy chcesz kupić licencję.
- Audio nigdy nie trafia na dysk. Bufor audio znajduje się w pamięci RAM podczas transkrypcji i jest zwalniany w momencie wygenerowania tekstu. Nic do wycieku, nic do odzyskania metodami kryminalistycznymi.
Czy modele lokalne mogą naprawdę dorównać chmurze?
Dwa lata temu — nie. Lokalny model o rozmiarze 100 MB działający na procesorze laptopa nie był w stanie dorównać temu, co centrum danych Google osiągało z modelem o rozmiarze 200 GB i 40 kartami GPU.
Dziś tak. Qwen3-ASR 3B działający na procesorze średniej klasy osiąga wskaźniki błędów słów w granicach 2% od dużych dostawców chmury w większości języków, a pokonuje dla języków o niskim zasobności danych, gdzie dostawcy chmury mają mniej danych treningowych. W przypadku dyktowania – krótkich, celowych wypowiedzi – różnica wynosi blisko 0%. Lokalne ASR stało się cicho wystarczająco dobre i stale się poprawia. My po prostu decydujemy się je dostarczyć.
Zasada
Twój głos to najbardziej osobiste dane, jakie generujesz. Przenosi twoją tożsamość, twoje myśli, osoby, o których mówisz, słowa, które wybrałeś, gdy nikt ich nie edytował. Nie powinien opuszczać twojego urządzenia, chyba że wyraźnie i świadomie wyślesz go gdzieś.
To nie jest hasło marketingowe. To jest cały powód istnienia tego produktu.