Brethof Voice Pro 现已推出个人语音训练功能。只需点击一下,即可在本地针对您的声音微调识别模型——无需命令行,无需云端。具体操作如下。
工作原理
每次你纠正一个被错误识别的单词时,应用都会将音频片段和你的纠正保存到本地训练数据集中。主窗口的训练卡片显示你捕获了多少样本和分钟数——点击它即可浏览、回放或删除条目。当你准备好时,训练选项卡会在你的声音上微调 LoRA 适配器。
该管道会自动选择其后端:一个 NVIDIA CUDA 当存在兼容的GPU时进行构建(使用cu128 PyTorch,首次运行时自动安装到缓存的venv中),否则使用 CPU 回退方案。训练完成后,LoRA将与基础模型合并并导出为GGUF格式,以便llama.cpp加载它——您可以在“设置”→“模型”中切换到您的个人模型。此前阻碍此步骤的PyTorch到GGUF转换已完成,并可实现端到端运行。
您将获得什么
- 应用内数据收集。 更正自动成为训练数据——只需继续使用应用程序即可。
- 一键式 LoRA 微调。 可在 GPU(NVIDIA CUDA)或 CPU 上进行训练。显示进度条,而非日志文件。
- 自动导出 GGUF。 训练好的模型会自动合并并转换——无需手动操作。
- 模型版本控制。 将原始模型与您微调后的模型一起保留,并在设置中切换使用。
- 用于词汇的热词。 在“热词”对话框中添加名称、缩写和产品术语——立即生效,无需重新训练。
适用人群
- 非母语使用者。 如今,浓重口音已能获得扎实的基线准确率,但通过针对您自己的声音进行微调,准确率才能跃升至 95% 以上。
- 医疗、法律和技术领域用户。 药品名称、判例法引用、代码库标识符——所有这些都从自定义词汇表中获益巨大。
- 言语障碍用户。 针对构音障碍或非典型语音进行微调,是本地训练最具价值的用途之一。商业云服务不提供此功能。
- 低资源语言。 基础模型在常用语言上表现良好,而在较少使用的语言上表现较弱。用您自己的音频数据微调几小时,差距就会迅速缩小。
保持不变的内容
- 训练在本地进行。 语音样本永远不会离开您的设备。这正是其核心所在。
- 您经过微调的模型归您所有。 我们不会上传它,也不会将其整合到“共享”模型中。它就存储在你的磁盘上。
- 任何付费许可证均免费包含。 并非单独的升级。如果您目前拥有 Personal 或 Business,在包含该功能的更新中即可获得训练界面。
可用性
现已推出 — 个人语音训练功能已包含在当前版本中,可在 Linux 和 Windows 上端到端运行。任何付费许可证均免费包含此功能;您的语音数据永远不会离开您的机器。
有特定的微调应用场景吗——专业词汇、特殊口音、非典型语音?请告诉我们,以便我们不断改进: [email protected].