Mọi sản phẩm ghi chép giọng nói phổ biến – Dragon, Otter, tính năng ghi chép giọng nói của Google, tính năng ghi chép giọng nói của Apple, cùng mọi dịch vụ SaaS chuyên xử lý âm thanh trên nền tảng đám mây – đều gửi giọng nói của bạn qua máy chủ của bên thứ ba. Âm thanh được ghi lại trên thiết bị của bạn, sau đó được truyền qua HTTPS đến trung tâm dữ liệu, được chuyển thành văn bản tại đó, rồi kết quả mới được gửi trả lại. Đôi khi âm thanh được lưu trữ; đôi khi nó được sử dụng để huấn luyện các mô hình; đôi khi nó được “ẩn danh hóa”, một thuật ngữ đã mất đi phần lớn ý nghĩa ban đầu của nó.
Chúng tôi cho rằng đó là giá trị mặc định sai.
Những gì mọi người thực sự nói
Khi bắt đầu quan sát các tình huống sử dụng thực tế, nội dung của phần ghi âm hầu như không bao giờ mang tính chất ngẫu hứng. Đó là:
- Ghi chú y khoa — bác sĩ phiên âm một buổi tư vấn.
- Dự thảo pháp lý — luật sư ghi chú một đơn kiến nghị hoặc thư cho khách hàng.
- Báo chí — các cuộc phỏng vấn với những nguồn tin được nêu tên, những người cho rằng bản ghi âm sẽ không rời khỏi máy của nhà báo.
- Ghi chú trị liệu — một nhà tâm lý học viết tóm tắt buổi trị liệu.
- Chiến lược kinh doanh — một nhà điều hành soạn thảo các ghi nhớ về các thương vụ, con người và tiền bạc.
- Nhật ký cá nhân — những suy nghĩ thực sự của con người, điều mà không ai khác nên đọc.
Tất cả những điều đó thường xuyên được tải lên các dịch vụ đám mây theo mặc định. Thường là vi phạm HIPAA, GDPR, quyền bí mật giữa luật sư và khách hàng, hoặc cả sự lịch sự cơ bản — vì người dùng không nhận thức được hoặc không có lựa chọn nào khác.
Voice Pro làm khác biệt ở điểm nào
- Không có chế độ đám mây, chấm hết. Không có tùy chọn “gửi lên máy chủ để tăng độ chính xác”. Mô hình chạy trên CPU hoặc GPU của bạn. Đó là tùy chọn duy nhất.
- Không có telemetry. Ứng dụng không gửi dữ liệu về máy chủ bao gồm thống kê sử dụng, báo cáo lỗi hoặc bất kỳ thứ gì khác. Các kết nối mạng duy nhất là (a) kiểm tra giấy phép khi khởi động, (b) kiểm tra cập nhật, (c) tải xuống mô hình thủ công (tùy chọn). Cả ba đều được ghi chép rõ ràng và có thể bị vô hiệu hóa.
- Không cần tài khoản để phiên âm. Bạn có thể sử dụng bản dùng thử 14 ngày mà không cần tạo tài khoản. Địa chỉ email chỉ cần thiết nếu bạn muốn mua giấy phép.
- Âm thanh không bao giờ ghi xuống đĩa. Bộ đệm âm thanh tồn tại trong RAM trong quá trình ghi chép và được giải phóng ngay khi văn bản được tạo ra. Không có gì rò rỉ, không có gì để khôi phục bằng phân tích kỹ thuật.
Liệu các mô hình cục bộ có thể thực sự sánh ngang với đám mây?
Hai năm trước, điều đó là không thể. Một mô hình 100 MB chạy trên CPU máy tính xách tay không thể nào so sánh với những gì trung tâm dữ liệu của Google đang làm với mô hình 200 GB và 40 GPU.
Hiện tại thì có. Qwen3-ASR 3B chạy trên CPU tầm trung đạt tỷ lệ lỗi từ (WER) thấp hơn 2% so với các nhà cung cấp đám mây lớn trên hầu hết các ngôn ngữ, và vượt trội hơn chúng trên các ngôn ngữ ít tài nguyên, nơi các nhà cung cấp đám mây có ít dữ liệu huấn luyện hơn. Riêng với đọc chính tả — những câu ngắn, có chủ đích — khoảng cách gần bằng 0%. ASR cục bộ đã âm thầm đủ tốt, và ngày càng tốt hơn. Chúng tôi chỉ là những người chọn phát hành nó.
Nguyên tắc
Giọng nói của bạn là dữ liệu cá nhân quan trọng nhất mà bạn tạo ra. Nó mang theo danh tính của bạn, suy nghĩ của bạn, những người bạn đang đề cập đến, và những từ ngữ bạn chọn khi không có ai chỉnh sửa. Nó không nên rời khỏi máy của bạn trừ khi bạn chủ động, biết rõ ràng gửi nó đến nơi khác.
Đó không phải là một câu khẩu hiệu tiếp thị. Đó chính là lý do tồn tại của sản phẩm.