個人語音訓練功能已內建於 Brethof Voice Pro。只需一撳,即可喺本地針對自己嘅聲音微調識別模型——無需命令列,亦無需上雲。以下係運作方式。
運作原理
每當你更正一個錯誤識別嘅詞語,應用程式會將音頻片段同你嘅更正儲存到本地訓練數據集。主視窗嘅訓練卡片顯示你收集咗幾多個樣本同幾多分鐘——撳佢可以瀏覽、播放或刪除條目。當你準備好,「訓練」分頁會喺你嘅聲音上微調 LoRA 適配器。
管線會自動揀後端:一個 NVIDIA CUDA 當有相容嘅 GPU 時會進行建置(cu128 PyTorch,首次運行時會自動安裝到緩存嘅虛擬環境中),否則就係 CPU 回退方案。當訓練完成後,LoRA會同基準模型合併並導出為GGUF格式,咁樣 llama.cpp 就能載入佢——可透過「設定」→「模型」切換到個人使用嘅模型。過去阻礙此過程嘅 PyTorch 轉 GGUF 嘅步驟已解決,且能端對端執行。
你會得到啲乜
- 應用程式內部嘅數據收集。 修正會自動變成訓練數據——只要繼續用個 app 就得。
- 一鍵 LoRA 微調。 用您嘅 GPU(NVIDIA CUDA)或 CPU 進行訓練。有進度條,唔係日誌檔。
- 自動 GGUF 匯出。 經過訓練嘅模型會為您自動合併並轉換——完全唔使手動操作。
- 模型版本控制。 將原裝模型同你微調好嘅模型一齊保留,喺設定入面隨時切換。
- 用熱詞嚟處理詞彙。 喺「熱詞」對話框加入名稱、縮寫同產品術語——即時生效,唔使重新訓練。
呢個功能對邊個最重要
- 非母語使用者。 而家,口音好重嘅語音已經有唔錯嘅基礎準確率,但係要達到95%以上,就要靠針對你自己把聲做微調。
- 醫療、法律同技術領域嘅用戶。 藥物名稱、判例引用、代碼庫標識——全部都可以由自訂詞彙表度得到極大幫助。
- 言語障礙嘅使用者。 針對口齒不清或非典型語音進行微調,係本地訓練中價值最高嘅用途之一。商業雲端服務唔提供呢個功能。
- 資源較少嘅語言。 基礎模型喺熱門語言表現良好,喺較少用嘅語言則較弱。用你自己嘅音頻進行幾小時嘅微調,差距就會迅速縮細。
乜嘢會保持不變
- 訓練喺本地進行。 語音樣本永遠唔會離開你部機。呢個就係成個重點。
- 你微調過嘅模型係屬於你嘅。 我哋唔會上載佢。我哋亦都唔會將佢合併到「共享」模型入面。佢只係存喺你部機嘅磁碟度。
- 任何付費授權均可免費使用。 唔係獨立嘅升級。如果你而家已經擁有 Personal 定 Business,咁喺推出佢嘅更新入面就會包含相關嘅訓練用使用者介面。
可用性
現已推出 — 個人語音訓練功能已喺現行版本推出,喺 Linux 同 Windows 上完整運作。任何付費授權都免費附送;你嘅語音資料永遠唔會離開你嘅電腦。
有特定嘅微調應用場景嗎?例如需要專業術語、特殊口音或非典型說話方式?請告訴我哋,以便我哋持續改進佢: [email protected].