每个主要的听写产品——Dragon、Otter、Google 的听写、Apple 的听写、每个云转录 SaaS——都会将你的声音通过他人的服务器传输。音频在你的机器上被捕获,通过 HTTPS 流式传输到数据中心,在那里转录,然后文本返回。有时音频会被存储。有时它被用于训练模型。有时它被“匿名化”,这是一个已经失去大部分含义的词。
我们认为这是错误的默认设置。
人们实际口述的内容
一旦开始观察实际使用情况,就会发现口述内容几乎从不随意。它们是:
- 医疗笔记——医生转录问诊内容。
- 法律文书——律师口述的动议或客户信函。
- 新闻报道——对假设录音不会离开记者设备的具名消息来源进行的采访。
- 治疗记录——心理学家撰写的会诊总结。
- 商业战略——高管起草关于交易、人员和资金的备忘录。
- 个人日记——人们真正思考的内容,其他人绝不应阅读。
所有这些内容默认情况下通常会被上传到云服务。这往往违反了 HIPAA、GDPR、律师-客户特权,或仅仅是基本道德规范——因为用户没有意识到这一点,或者没有其他选择。
Voice Pro 的独特之处
- 无云模式,绝对如此。 没有用于“发送到服务器以提高精度”的切换选项。该模型在您的 CPU 或 GPU 上运行。这是唯一的选项。
- 无遥测。 该应用不会向服务器回传使用统计、崩溃报告或任何其他信息。唯一的网络调用包括:(a) 启动时的许可证检查,(b) 更新检查,(c) 可选的手动模型下载。这三项均已记录在案且均可禁用。
- 转录无需账号。 您可以使用 14 天试用期而无需创建账户。仅在购买许可证时才需要电子邮件地址。
- 音频从不写入磁盘。 转录期间,音频缓冲区驻留在 RAM 中,文本生成完成后立即释放。没有可泄露的数据,也没有可供取证恢复的内容。
本地模型真的能与云端相媲美吗?
两年前,不行。当时笔记本电脑的CPU所拥有的100MB模型,根本无法与谷歌数据中心利用200GB的模型数据及40块GPU所实现的处理能力相媲美。
今天,确实如此。在普通级 CPU 上运行的 Qwen3-ASR 3B,在大多数语言上的词错误率与大型云服务提供商的误差率仅相差 2% 左右,并且 击败 在云服务提供商训练数据较少的低资源语言中。对于听写——简短、有意的发音——差距接近 0%。本地 ASR 已经变得足够好,并且还在不断进步。我们只是选择将其交付给用户。
核心理念
你的声音是你生成的最具个人特征的数据。它承载着你的身份、你的思想、你谈论的对象,以及你在无人编辑的情况下所选择的词汇。除非你明确且知情地将其发送到其他地方,否则它不应离开你的计算机。
这不是营销话术。这是该产品存在的唯一理由。