Setiap produk dikte utama — Dragon, Otter, dikte Google, dikte Apple, setiap SaaS transkripsi cloud — mengirimkan suara Anda melalui server pihak lain. Audio ditangkap di mesin Anda, dialirkan melalui HTTPS ke pusat data, ditranskripsikan di sana, lalu teksnya dikirim kembali. Terkadang audio disimpan. Terkadang digunakan untuk melatih model. Terkadang "dianonimkan", sebuah kata yang sebagian besar maknanya sudah hilang.
Kami rasa itu merupakan pengaturan bawaan yang salah.
Apa yang sebenarnya didiktekan oleh orang-orang
Begitu Anda mulai melihat penggunaan nyata, isi dikte hampir selalu tidak kasual. Isinya adalah:
- Catatan medis — seorang dokter yang mentranskripsikan konsultasi.
- Draf hukum — seorang pengacara yang mendiktekan mosi atau surat klien.
- Jurnalisme — wawancara dengan sumber bernama yang berasumsi bahwa rekaman tidak akan meninggalkan mesin jurnalis.
- Catatan terapi—ringkasan sesi yang ditulis oleh seorang psikolog.
- Strategi bisnis — seorang eksekutif yang menyusun memo mengenai kesepakatan, orang, dan uang.
- Jurnal pribadi — hal-hal yang sebenarnya dipikirkan seseorang, yang seharusnya tidak pernah dibaca orang lain.
Semua itu secara rutin diunggah ke layanan cloud secara default. Seringkali melanggar HIPAA, GDPR, kerahasiaan pengacara-klien, atau sekadar etika dasar — karena pengguna tidak menyadari atau tidak memiliki alternatif.
Apa yang dilakukan Voice Pro secara berbeda
- Tanpa mode cloud, tanpa pengecualian. Tidak ada tombol untuk "kirim ke server untuk akurasi yang lebih baik". Model berjalan di CPU atau GPU Anda. Itu satu-satunya pilihan.
- Tanpa telemetri. Aplikasi ini tidak mengirimkan statistik penggunaan, laporan crash, atau informasi lainnya. Satu-satunya panggilan jaringan adalah (a) pemeriksaan lisensi saat startup, (b) pemeriksaan pembaruan, (c) unduhan model manual opsional. Ketiganya didokumentasikan dan dapat dinonaktifkan.
- Tidak diperlukan akun untuk melakukan transkripsi. Anda dapat menggunakan uji coba 14 hari tanpa membuat akun. Email hanya diperlukan jika Anda ingin membeli lisensi.
- Audio tidak pernah menyentuh disk. Buffer audio berada di RAM selama proses transkripsi dan dibebaskan begitu teks dihasilkan. Tidak ada yang bocor, tidak ada yang dapat dipulihkan secara forensik.
Bisakah model lokal benar-benar menyamai cloud?
Dua tahun yang lalu, tidak. Model lokal berkapasitas 100 MB di CPU laptop tidak bisa menyaingi apa yang dilakukan pusat data Google dengan model 200 GB dan 40 GPU.
Hari ini, ya. Qwen3-ASR 3B yang berjalan di CPU kelas menengah mencapai tingkat kesalahan kata dalam selisih 2% dari penyedia cloud besar pada sebagian besar bahasa, dan mengalahkan mereka pada bahasa dengan sumber daya rendah di mana penyedia cloud memiliki data pelatihan lebih sedikit. Untuk dikte secara khusus — ucapan singkat yang disengaja — kesenjangan itu mendekati 0%. ASR lokal telah secara diam-diam menjadi cukup baik, dan terus membaik. Kami hanyalah pihak yang memilih untuk mengirimkannya.
Prinsipnya
Suara Anda adalah data paling pribadi yang Anda hasilkan. Suara tersebut membawa identitas Anda, pikiran-pikiran Anda, orang-orang yang Anda bicarakan, serta kata-kata yang Anda pilih ketika tidak ada yang mengeditnya. Suara tersebut tidak boleh meninggalkan mesin Anda kecuali jika Anda secara eksplisit dan sadar mengirimkannya ke suatu tempat.
Itu bukan slogan pemasaran. Itulah alasan utama mengapa produk tersebut ada.