Brethof Voice Proにパーソナルボイストレーニング機能を搭載しました。ワンクリックで、コマンドラインもクラウドも使わずに、ご自身の声で認識モデルをローカルにファインチューニングできます。仕組みは以下の通りです。
仕組み
誤認識された単語を修正するたびに、アプリはその音声クリップとあなたの修正内容をローカルのトレーニングデータセットに保存します。メインウィンドウのトレーニングカードには、収集されたサンプル数と分数が表示され、クリックするとエントリを閲覧、再生、または削除できます。準備ができたら、「トレーニング」タブであなたの声に合わせてLoRAアダプタをファインチューニングします。
パイプラインはバックエンドを自動的に選択します: NVIDIA CUDA 互換性のあるGPUが存在する場合はbuild(cu128 PyTorch、初回実行時にキャッシュされたvenvへ自動インストール)が使用され、そうでない場合は CPU フォールバック。トレーニングが終了すると、LoRAはベースモデルとマージされ、GGUFにエクスポートされるため、llama.cppで読み込めます——設定 → モデルから自分のモデルに切り替えてください。かつてこれを妨げていたPyTorchからGGUFへの変換は完了し、エンドツーエンドで動作します。
手に入るもの
- アプリ内でのデータ収集。 修正は自動的にトレーニングデータになります — アプリを使い続けるだけです。
- ワンクリックでのLoRA微調整。 GPU(NVIDIA CUDA)またはCPU上でトレーニングを行います。ログファイルではなく進捗バーが表示されます。
- GGUF形式での自動エクスポート トレーニング済みモデルは統合・変換済みです——手動の手順は不要です。
- モデルのバージョン管理。 ファインチューニング済みモデルと標準モデルの両方を保持し、設定で切り替えられるようにしてください。
- 語彙用のホットワード。 「Hotwords」ダイアログで名前、頭字語、製品用語を追加すれば、即座に適用され、再学習は不要です。
対象ユーザー
- 非ネイティブスピーカー 現在でも強いアクセントで十分な基本精度が得られますが、自分の声でファインチューニングを行うことで、精度は95%以上にまで向上します。
- 医療、法律、技術分野のユーザー。 薬品名、判例の引用、コードベースの識別子——これらすべてが、カスタム語彙によって大きな恩恵を受けます。
- 言語障害のあるユーザー。 構音障害や非典型的な発話に対するファインチューニングは、ローカルトレーニングの最も価値の高い用途の一つです。商用クラウドサービスでは提供されていません。
- リソースが少ない言語。 ベースモデルは主要言語では優れていますが、マイナー言語では性能が劣ります。数時間の自製オーディオでファインチューニングすれば、その差はすぐに縮まります。
変わらないものは何か
- トレーニングはローカルで実行されます。 音声サンプルは決してあなたのマシンから外に出ません。それこそが要点です。
- あなたの微調整済みモデルは、あなたのものです。 私たちはそれをアップロードしません。「共有」モデルにプールすることもありません。それはあなたのディスク上にあります。
- 有料ライセンスをお持ちの方なら無料。 別個のアップグレードではありません。現在PersonalまたはBusinessをお使いの場合、該当機能を搭載したアップデートでトレーニングUIが利用可能になります。
利用状況
現在入手可能 — パーソナルボイストレーニングは現在のビルドに搭載され、LinuxおよびWindows上でエンドツーエンドで動作します。有料ライセンスをお持ちの方には無料です。あなたの音声データがマシンの外に出ることは決してありません。
特定のファインチューニング用途(専門用語、特殊なアクセント、非典型的な話し方など)をお持ちですか?その旨をお知らせいただければ、引き続き改善してまいります。 [email protected].