Секој главен производ за диктирање — Dragon, Otter, Google-овото диктирање, Apple-овото диктирање, секој облачен SaaS за транскрипција — го испраќа вашиот глас преку туѓ сервер. Аудиото се снима на вашата машина, се пренесува преку HTTPS до податочен центар, се транскрибира таму и текстот се враќа назад. Понекогаш аудиото се складира. Понекогаш се користи за обука на модели. Понекогаш е „анонимизирано“, што е збор што го изгубил најголемиот дел од своето значење.
Сметаме дека тоа е погрешна стандардна вредност.
Што луѓето всушност диктираат
Штом почнете да гледате реална употреба, содржината на диктирањето речиси никогаш не е неформална. Таа е:
- Медицински белешки — лекар што транскрибира консултација.
- Правни нацрти — адвокат што диктира предлог или писмо до клиент.
- Новинарство — интервјуа со именувани извори кои претпоставуваа дека снимката нема да ја напушти машината на новинарот.
- Белешки од терапија — психолог кој пишува резимеа на сесиите.
- Бизнис стратегија – извршен директор што пишува меморандуми за договори, луѓе и пари.
- Лични дневници — работите што луѓето навистина ги мислат, а кои никој друг никогаш не треба да ги прочита.
Сето тоа по стандардна поставка се отпрема во облачни услуги. Често во кршење на HIPAA, GDPR, адвокатско-клиентската тајност или основна пристојност – затоа што корисникот не сфаќал, или немал алтернатива.
Што прави Voice Pro поинаку
- Без облачен режим, точка. Не постои прекинувач за „испраќање на сервер за подобра точност“. Моделот работи на вашиот CPU или GPU. Тоа е единствената опција.
- Без телеметрија. Апликацијата не испраќа податоци за употреба, извештаи за грешки или било што друго. Единствените мрежни повици се: (а) проверка на лиценцата при стартување, (б) проверка за ажурирања, (ц) опционално рачно преземање на модели. Сите три се документирани и можат да се оневозможат.
- Не е потребна сметка за транскрипција. Можете да го користите 14-дневниот пробен период без да креирате сметка. Е-пошта е потребна само ако сакате да купите лиценца.
- Аудиото никогаш не се зачувува на диск. Аудио баферот живее во RAM за време на транскрипцијата и се ослободува во моментот кога текстот е произведен. Нема ништо што може да протече, ништо што може форензички да се поврати.
Можат ли локалните модели навистина да се натпреваруваат со облакот?
Пред две години, не. Локален модел од 100 MB на процесор на лаптоп не можеше да се спротивстави на она што го правеше центарот за податоци на Google со 200 GB модел и 40 GPU картички.
Денес, да. Qwen3-ASR 3B кој работи на CPU од средна класа постигнува стапки на грешки во зборови во рамките на 2% во споредба со големите облачни провајдери за повеќето јазици, и победува за јазици со малку ресурси каде облачните провајдери имаат помалку податоци за обука. За диктирање специфично — кратки, намерни изјави — разликата е поблиску до 0%. Локалниот ASR стана доволно добар и постојано се подобрува. Ние само сме тие што одлучуваат да го испорачаат.
Принципот
Вашиот глас е најличните податоци што ги создавате. Тој го носи вашиот идентитет, вашите мисли, луѓето за кои зборувате, зборовите што ги избравте кога никој не уредуваше. Не треба да го напушта вашиот компјутер освен ако експлицитно и свесно не го испратите некаде.
Тоа не е маркетиншка фраза. Тоа е единствената причина зошто производот постои.