Все основные приложения для диктовки — Dragon, Otter, сервисы диктовки от Google и Apple, а также все облачные сервисы транскрипции типа SaaS — передают ваш голос через чужие серверы. Аудио записывается на вашем устройстве, затем передается по протоколу HTTPS в центр обработки данных, там происходит транскрипция, после чего текст возвращается обратно. Иногда аудио хранится, иногда используется для обучения моделей, а иногда «анонимизируется» — термин, который уже почти потерял свое первоначальное значение.
Мы считаем, что это неверный вариант по умолчанию.
Что люди диктуют на самом деле
Как только вы начнете смотреть реальное использование, становится ясно, что содержание диктовки почти никогда не бывает случайным. Оно:
- Медицинские записи — врач транскрибирует консультацию.
- Юридические проекты — адвокат, диктующий ходатайство или письмо клиента.
- Журналистика — интервью с именованными источниками, которые предполагали, что запись не покинет компьютер журналиста.
- Заметки терапии — краткое описание сеансов, составляемое психологом.
- Бизнес-стратегия — руководитель составляет служебные записки о сделках, кадрах и финансах.
- Личные журналы — то, о чем люди действительно думают, и что никто другой никогда не должен читать.
Всё это по умолчанию регулярно загружается в облачные сервисы. Часто это происходит в нарушение требований HIPAA, GDPR, адвокатской тайны или просто здравого смысла — потому что пользователь не осознавал этого или не имел альтернативы.
Чем отличается Voice Pro
- Без облачного режима, и точка. Нет опции «отправить на сервер для повышения точности». Модель работает на вашем CPU или GPU. Это единственный вариант.
- Телеметрии нет. Приложение не отправляет на сервер статистику использования, отчеты о сбоях или что-либо еще. Единственные сетевые запросы — это (а) проверка лицензии при запуске, (б) проверка на наличие обновлений, (в) необязательное ручное загрузчение моделей. Все три вида запросов задокументированы, и их можно отключить.
- Для транскрипции аккаунт не требуется. Вы можете воспользоваться 14-дневной пробной версией без создания учетной записи. Электронная почта требуется только в случае покупки лицензии.
- Аудио никогда не записывается на диск. Аудиобуфер хранится в ОЗУ во время транскрипции и освобождается сразу после генерации текста. Нет ничего, что можно было бы утечь или восстановить с помощью криминалистических методов.
Могут ли локальные модели действительно сравниться с облачными?
Два года назад — нет. Локальная модель объемом 100 МБ на процессоре ноутбука не могла сравниться с тем, что делал центр обработки данных Google с использованием модели объемом 200 ГБ и 40 графических процессоров.
Сегодня — да. Qwen3-ASR 3B, работающий на процессоре среднего класса, достигает показателей WER в пределах 2% от крупных облачных провайдеров для большинства языков, и превосходит для языков с малым объемом данных, где у облачных провайдеров меньше обучающих данных. Для диктовки, в частности — коротких, осознанных высказываний — разница составляет около 0%. Локальная ASR стала достаточно качественной и продолжает улучшаться. Мы просто выбираем поставлять ее.
Принцип
Ваш голос — это самые личные данные, которые вы генерируете. Он несет вашу идентичность, ваши мысли, имена людей, о которых вы говорите, и слова, которые вы выбираете, когда никто не редактирует текст. Он не должен покидать ваш компьютер, если только вы явно и осознанно не отправите его куда-либо.
Это не рекламный слоган. Это и есть причина существования продукта.