Персональное обучение голоса включено в Brethof Voice Pro. Дообучите модель распознавания на вашем собственном голосе локально одним кликом — без командной строки, без облака. Вот как это работает.
Как это работает
Каждый раз, когда вы исправляете неправильно распознанное слово, приложение сохраняет аудиоклип и вашу коррекцию в локальный набор данных для обучения. На карточке обучения в главном окне отображается количество собранных образцов и минут — нажмите на неё, чтобы просмотреть, воспроизвести или удалить записи. Когда вы будете готовы, вкладка Обучение настроит адаптер LoRA под ваш голос.
Система автоматически выбирает свой бэкенд: а NVIDIA CUDA собирается (cu128 PyTorch, автоматически устанавливается в кэшированную среду venv при первом запуске), если имеется совместимая GPU; в противном случае — ЦПУ резервный вариант. По окончании обучения LoRA сливается с базовой моделью и экспортируется в GGUF, чтобы llama.cpp мог её загрузить — переключитесь на свою личную модель в разделе Settings → Models. Преобразование из PyTorch в GGUF, которое раньше блокировало этот процесс, теперь завершено и работает полностью автоматически.
Что вы получаете
- Сбор данных внутри приложения. Исправления автоматически становятся данными для обучения — просто продолжайте использовать приложение.
- Однокликовая тонкая настройка LoRA. Обучение на вашем GPU (NVIDIA CUDA) или CPU. Полоса прогресса, а не файл журнала.
- Автоматический экспорт в GGUF. Обученная модель объединяется и преобразуется для вас — без необходимости вручную выполнять какие-либо действия.
- Версионирование моделей. Сохраняйте базовую модель рядом с вашей настроенной и переключайтесь между ними в настройках.
- Ключевые слова для словаря. Добавьте имена, аббревиатуры и термины продуктов в диалоговое окно «Ключевые слова» — изменения применяются мгновенно, повторное обучение не требуется.
Для кого это важно
- Носители языка-не-родного. Сегодня системы с сильным акцентом обеспечивают надежную базовую точность, но тонкая настройка на вашем собственном голосе позволяет поднять этот показатель до 95% и выше.
- Пользователи из сферы медицины, права и техники. Названия лекарств, цитаты из судебной практики, идентификаторы кодовой базы — всё это в значительной степени выигрывает от использования специального словаря.
- Пользователи с нарушениями речи. Тонкая настройка для дисартрии или атипичной речи является одним из наиболее ценных применений локального обучения. Коммерческие облачные сервисы этого не предоставляют.
- Языки с низким уровнем ресурсов. Базовые модели хороши на популярных языках и слабее на менее распространенных. Дообучение на нескольких часах ваших собственных аудиоданных быстро сокращает этот разрыв.
Что не меняется
- Обучение выполняется локально. Образцы голоса никогда не покидают ваше устройство. В этом и заключается вся суть.
- Ваша дообученная модель принадлежит вам. Мы не загружаем его. Мы не объединяем его в «общую» модель. Он находится на вашем диске.
- Бесплатно с любой платной лицензией. Это не отдельное обновление. Если у вас сейчас есть версии Personal или Business, вы получите интерфейс обучения в обновлении, которое его поставляется.
Доступность
Доступно сейчас — обучение на личном голосе доступно в текущей сборке и работает полностью на Linux и Windows. Бесплатно с любой платной лицензией; ваши голосовые данные никогда не покидают ваш компьютер.
У вас есть конкретный сценарий использования для тонкой настройки — специализированная лексика, необычные акценты, нетипичная речь? Сообщите нам, чтобы мы продолжали улучшать продукт: [email protected].