所有主要的聽寫軟體——Dragon、Otter、Google 的聽寫功能、Apple 的聽寫功能,以及所有的雲端轉錄 SaaS 服務——都會將您的語音通過他人的伺服器傳輸。音訊會在您的設備上被錄下,透過 HTTPS 流傳至資料中心,在那裡進行轉錄,之後再將文字回傳給您。有時這些音訊會被儲存起來,有時用於訓練模型,而有時則會被「匿名化」處理,不過這個詞已經失去了大部分原本的含義。
我們認為那是錯誤的預設值。
人們實際上所口述的內容
一旦開始觀察實際使用情況,聽寫的內容幾乎從來都不是隨意的。它是:
- 醫療筆記——醫生轉錄諮詢過程。
- 法律文件草稿——律師口述的申請書或委託人信件。
- 新聞業——對那些認為錄音不會流出記者設備的來源人物進行的採訪。
- 治療筆記——心理師撰寫的會談摘要。
- 商業策略——由高層主管撰寫有關交易、人員及資金方面的備忘錄。
- 個人日記——那些人們真實的想法,不該讓任何人讀到。
所有這些資料通常會依預設上傳至雲端服務。這往往違反了 HIPAA、GDPR、律師客戶特權或基本道德規範——因為使用者未察覺,或沒有其他選擇。
Voice Pro 的不同之處
- 無雲端模式,絕對如此。 沒有「傳送至伺服器以提升精確度」的切換開關。模型在您的 CPU 或 GPU 上運行。這是唯一的選項。
- 無遙測資料。 該應用程式不會回傳使用統計、當機報告或任何其他資訊。唯一的網路呼叫包括:(a) 啟動時的授權檢查,(b) 更新檢查,(c) 可選的手動模型下載。這三項皆有文件說明,且皆可停用。
- 轉錄無需帳號。 您可以在不建立帳號的情況下使用 14 天試用版。只有在想要購買授權時才需要提供電子郵件。
- 音訊從未寫入磁碟。 在轉錄過程中,音訊緩衝區存在於 RAM 中,一旦文字產生便會被釋放。沒有什麼可洩漏,也無法透過鑑識手段復原。
本地模型真的能與雲端相媲美嗎?
兩年前,不可能。當時筆電 CPU 上 100 MB 的本地模型,根本無法與谷歌資料中心使用 200 GB 模型和 40 個 GPU 所達到的效果相提並論。
現在可以。在中階 CPU 上運行的 Qwen3-ASR 3B,在大多數語言上的詞錯誤率與大型雲端服務商相差在 2% 以內,且 擊敗 在雲端供應商訓練資料較少的低資源語言上。專門針對聽寫——簡短且有意圖的語句——差距更接近 0%。本地 ASR 已悄然變得足夠好,且持續進步。我們只是選擇將其推出的那群人。
原則
你的聲音是你所產生的最具個人特徵的資料。它承載著你的身份、你的想法、你正在談論的人,以及你在沒有任何人編輯時所選擇的詞句。除非你明確且知情地將其傳送到某處,否則它不應該離開你的裝置。
那不是行銷話術,而是該產品存在的全部理由。