Dragon、Otter、Googleの音声入力、Appleの音声入力、あらゆるクラウド文字起こしSaaSといった主要な音声入力製品は、すべてあなたの声を第三者のサーバーを経由させます。音声はあなたの端末でキャプチャされ、HTTPSを通じてデータセンターにストリーミングされ、そこで文字起こしされ、テキストが返されます。時には音声が保存され、時にはモデルの訓練に使用され、時には「匿名化」されますが、この言葉はもはやほとんど意味を失っています。
私たちはそれが間違ったデフォルトだと思います。
人々が実際に口述する内容
実際の使用例を見始めると、ディクテーションの内容はほとんどがカジュアルなものではありません。それは以下の通りです:
- 医療メモ——医師が診察内容を文字起こししている様子。
- 法的文書——弁護士が申立書や依頼人への手紙を口述する際のもの。
- ジャーナリズム――録音が記者のマシンから外に出ないと思っていた名前の特定された情報提供者へのインタビュー。
- 療法記録――心理学者がセッションの概要を記述したもの。
- ビジネス戦略 — 取引、人材、資金に関するメモを作成する経営者
- 個人日記――人々が実際に考えていることで、他の誰にも読まれるべきではないもの。
それらはすべて、デフォルトでクラウドサービスに自動的にアップロードされる。多くの場合、ユーザーが気づかなかったり代替手段がなかったりするため、HIPAAやGDPR、弁護士と依頼人の間の秘密保持義務、あるいは基本的な倫理規範に違反してしまう。
Voice Proが他と異なる点は何か
- クラウドモードなし、それだけです。 「より高い精度のためにサーバーに送信する」という切り替え機能はありません。モデルはユーザーのCPUまたはGPUで動作します。それが唯一の選択肢です。
- テレメトリなし。 このアプリは、使用統計やクラッシュレポートなどをサーバーに送信しません。ネットワーク通信は、(a)起動時のライセンスチェック、(b)アップデートチェック、(c)任意の手動モデルダウンロードのみです。これら3つはすべて文書化されており、無効化できます。
- 文字起こしにアカウントは不要です。 アカウントを作成しなくても14日間のトライアルを利用できます。ライセンスを購入したい場合のみ、メールアドレスが必要です。
- オーディオはディスクに保存されない。 文字起こし中、オーディオバッファはRAM上に存在し、テキストが生成された瞬間に解放されます。漏れるものも、フォレンジック的に復元できるものもありません。
ローカルモデルは本当にクラウドに匹敵できるのか?
2年前なら不可能でした。ノートパソコンのCPUに搭載された100MBのモデルでは、Googleのデータセンターが200GBのモデルと40台のGPUを使って行っていた処理には到底及びませんでした。
現在です。中級クラスのCPUで動作するQwen3-ASR 3Bは、ほとんどの言語において大手クラウドプロバイダーと同等の2%以内の単語誤り率を達成しています。 上回る クラウドプロバイダーがトレーニングデータをあまり持っていない低リソース言語においてです。特にディクテーション(短く意図的な発話)の場合、その差はほぼ0%に近くなります。ローカルASRは静かに十分な性能に達しており、さらに向上し続けています。私たちはそれを搭載することを選んだだけです。
原則
あなたの音声は、あなたが生成するデータの中で最も個人的なものです。そこにはあなたのアイデンティティ、思考、話題にしている人々、そして誰にも編集されずにあなたが選んだ言葉が込められています。明示的かつ意図的にどこかへ送信しない限り、その音声はあなたのマシンの外に出るべきではありません。
それはマーケティングのキャッチコピーではありません。それこそが、この製品が存在するすべての理由です。