Huấn luyện giọng nói cá nhân đã được tích hợp trong Brethof Voice Pro. Tinh chỉnh mô hình nhận diện trên giọng nói của chính bạn, cục bộ, chỉ với một cú nhấp chuột — không cần dòng lệnh, không cần đám mây. Dưới đây là cách hoạt động.
Cách hoạt động
Mỗi lần bạn sửa một từ bị nhận diện sai, ứng dụng sẽ lưu đoạn âm thanh và lời sửa của bạn vào tập dữ liệu huấn luyện cục bộ. Thẻ huấn luyện trên cửa sổ chính hiển thị số mẫu và số phút bạn đã thu thập — nhấp vào đó để xem, phát lại hoặc xóa các mục. Khi bạn sẵn sàng, tab Huấn luyện sẽ tinh chỉnh một bộ chuyển đổi LoRA dựa trên giọng nói của bạn.
Đường ống xử lý tự động chọn backend: một NVIDIA CUDA build (cu128 PyTorch, tự động cài đặt vào venv đã lưu trữ trong lần chạy đầu tiên) khi có GPU tương thích, nếu không thì có CPU Giải pháp dự phòng. Khi quá trình huấn luyện kết thúc, LoRA sẽ được hợp nhất với mô hình gốc và xuất ra dạng GGUF để llama.cpp có thể tải nó — hãy chuyển sang mô hình cá nhân của bạn từ mục Cài đặt → Mô hình. Việc chuyển đổi từ PyTorch sang GGUF, vốn trước đây gây cản trở, giờ đã được thực hiện và diễn ra một cách liên tục từ đầu đến cuối.
Những gì bạn nhận được
- Thu thập dữ liệu trong ứng dụng. Các bản sửa lỗi trở thành dữ liệu huấn luyện tự động — chỉ cần tiếp tục sử dụng ứng dụng.
- Tinh chỉnh LoRA chỉ với một cú nhấp chuột. Huấn luyện trên GPU của bạn (NVIDIA CUDA) hoặc CPU. Có thanh tiến trình, không có tệp nhật ký.
- Xuất tự động định dạng GGUF. Mô hình đã huấn luyện được hợp nhất và chuyển đổi sẵn cho bạn — không cần bước thủ công nào.
- Quản lý phiên bản mô hình. Giữ mô hình gốc bên cạnh mô hình đã tinh chỉnh của bạn và chuyển đổi giữa chúng trong cài đặt.
- Từ khóa cho vốn từ vựng. Thêm tên, viết tắt và thuật ngữ sản phẩm vào hộp thoại Hotwords — được áp dụng ngay lập tức, không cần huấn luyện lại.
Đối tượng quan tâm
- Người không phải bản ngữ. Các giọng nặng hiện nay đã có độ chính xác nền tảng khá tốt, nhưng việc tinh chỉnh theo giọng nói của riêng bạn mới là yếu tố đưa độ chính xác lên mức 95%+.
- Người dùng trong lĩnh vực y tế, pháp lý và kỹ thuật. Tên thuốc, trích dẫn án lệ, mã định danh cơ sở mã — tất cả đều được hưởng lợi rất nhiều từ việc sử dụng từ vựng tùy chỉnh.
- Người dùng gặp khó khăn về phát âm. Tinh chỉnh cho giọng nói khó phát âm hoặc bất thường là một trong những ứng dụng giá trị nhất của việc huấn luyện cục bộ. Các dịch vụ đám mây thương mại không cung cấp tính năng này.
- Ngôn ngữ có nguồn lực hạn chế. Các mô hình cơ sở hoạt động tốt ở các ngôn ngữ phổ biến và yếu hơn ở các ngôn ngữ ít phổ biến. Tinh chỉnh trên vài giờ dữ liệu âm thanh của riêng bạn và khoảng cách này sẽ được thu hẹp nhanh chóng.
Những gì không thay đổi
- Việc huấn luyện được thực hiện cục bộ. Các mẫu giọng nói không bao giờ rời khỏi máy của bạn. Đó chính là mục đích chính.
- Mô hình đã được tinh chỉnh của bạn thuộc về bạn. Chúng tôi không tải nó lên. Chúng tôi không gộp nó vào một mô hình "chia sẻ". Nó tồn tại trên ổ đĩa của bạn.
- Miễn phí khi mua bất kỳ giấy phép trả phí nào. Không phải là một bản nâng cấp riêng biệt. Nếu bạn đang sở hữu Personal hoặc Business, bạn sẽ nhận được giao diện huấn luyện trong bản cập nhật phát hành tính năng này.
Tình trạng khả dụng
Có sẵn ngay bây giờ — Huấn luyện giọng nói cá nhân có trong bản dựng hiện tại và chạy trọn vẹn trên Linux và Windows. Miễn phí với bất kỳ giấy phép trả phí nào; dữ liệu giọng nói của bạn không bao giờ rời khỏi máy.
Bạn có trường hợp sử dụng tinh chỉnh cụ thể nào — từ vựng chuyên ngành, giọng địa phương khác thường, giọng nói bất thường? Hãy cho chúng tôi biết để chúng tôi tiếp tục cải thiện tính năng này: [email protected].