Тренування персонального голосу постачається разом із Brethof Voice Pro. Доналаштуйте модель розпізнавання на вашому власному голосі локально одним натисканням — без командного рядка, без хмари. Ось як це працює.
Як це працює
Щоразу, коли ви виправляєте неправильно розпізнане слово, застосунок зберігає аудіокліп і ваше виправлення в локальний навчальний набір даних. Картка навчання в головному вікні показує, скільки зразків і хвилин ви зібрали — натисніть на неї, щоб переглянути, відтворити або видалити записи. Коли ви готові, вкладка «Навчання» виконує тонке налаштування адаптера LoRA під ваш голос.
Піплайн автоматично вибирає свій бекенд: а NVIDIA CUDA збірка (cu128 PyTorch, автоматично встановлюється у кешований venv під час першого запуску), якщо наявна сумісна GPU; інакше — ЦПУ резервний варіант. Коли навчання завершиться, LoRA буде об’єднано з базовою моделлю та експортовано у формат GGUF, щоб llama.cpp міг її завантажити — перейдіть до своєї персональної моделі у розділі Налаштування → Моделі. Перетворення з PyTorch у GGUF, яке раніше блокувало цей процес, тепер виконується повністю.
Що ви отримуєте
- Збір даних у додатку. Виправлення автоматично стають навчальними даними — просто продовжуйте користуватися застосунком.
- Одноклікове донавчання LoRA. Тренуйтеся на своїй GPU (NVIDIA CUDA) або CPU. Індикатор прогресу, а не файл журналу.
- Автоматичний експорт у формат GGUF. Навчена модель об'єднується та перетворюється для вас — без додаткових ручних дій.
- Версіонування моделей. Зберігайте стандартну модель поруч із доопрацьованою та перемикайтеся між ними в налаштуваннях.
- Ключові слова для розширення словникового запасу. Додайте імена, абревіатури та терміни продуктів у діалоговому вікні Hotwords — це застосується миттєво, без необхідності повторного навчання.
Для кого це має значення
- Носії іншої мови. Сьогодні сильні акценти забезпечують стабільну базову точність, але доопрацювання на основі вашого голосу дозволяє досягти рівня точності 95% і вище.
- Медичні, юридичні та технічні користувачі. Назви ліків, посилання на судову практику, ідентифікатори кодової бази — усе це значно виграє від спеціального словника.
- Користувачі з порушеннями мовлення. Тонке налаштування на дизартричному чи атиповому мовленні — одне з найцінніших застосувань локального навчання. Комерційні хмарні сервіси цього не пропонують.
- Мови з обмеженими ресурсами. Базові моделі добре працюють з популярними мовами, але гірше — з менш поширеними. Після тонкого налаштування на кількох годинах власного аудіо розрив швидко скорочується.
Що не змінюється
- Навчання відбувається локально. Зразки голосу ніколи не залишають ваш пристрій. У цьому і полягає суть.
- Ваша доопрацьована модель належить вам. Ми не завантажуємо його. Ми не об’єднуємо його в «спільну» модель. Він живе на вашому диску.
- Безкоштовно з будь-якою платною ліцензією. Це не окреме оновлення. Якщо у вас вже є версія Personal або Business, ви отримаєте інтерфейс навчання у оновленні, яке його постачає.
Доступність
Доступно зараз — Програма для тренування особистого голосу вже є у поточній версії та працює повністю на Linux та Windows. Безкоштовна разом із будь-якою платною ліцензією; ваші дані голосу ніколи не покидають ваш комп’ютер.
У вас є конкретний сценарій використання для доопрацювання — спеціалізовані словники, незвичайні акценти, атипова мова? Повідомте нам, щоб ми продовжували вдосконалювати систему: [email protected].