Dragon, Otter, Google’ın dikte özelliği, Apple’ın dikte özelliği ve tüm bulut tabanlı transkripsiyon SaaS hizmetleri gibi tüm önemli dikte ürünleri sesinizi başka birinin sunucusu üzerinden gönderir. Sesiniz cihazınızda yakalanır, HTTPS üzerinden bir veri merkezine aktarılır, orada transkribe edilir ve metin size geri döner. Bazen ses dosyaları saklanır; bazen modelleri eğitmek için kullanılır; bazen de anlamının çoğunu yitirmiş olan “anonimleştirme” işlemine tabi tutulur.
Bunun yanlış bir varsayılan olduğunu düşünüyoruz.
İnsanların aslında neyi dikte ettikleri
Gerçek kullanımı izlemeye başladığınızda, dikte içeriği neredeyse hiç rastgele olmaz. Yani:
- Tıbbi notlar — bir doktorun konsültasyonu yazıya dökmesi.
- Hukuki taslaklar — bir avukatın dava dilekçesi veya müvekkil mektubu dikte etmesi.
- Gazetecilik — kaydın gazetecinin cihazından çıkmayacağını varsayan adı geçen kaynaklarla yapılan röportajlar.
- Terapi notları — bir psikoloğun seans özetlerini yazdığı.
- İş stratejisi — anlaşmalar, insanlar, para hakkında notlar hazırlayan bir yönetici.
- Kişisel günlükler — insanların gerçekten düşündükleri, başkalarının asla görmemesi gereken şeyler.
Tüm bunlar varsayılan olarak düzenli olarak bulut hizmetlerine yüklenir. Genellikle HIPAA, GDPR, avukat-müvekkil gizliliği veya temel nezaket kurallarının ihlali sonucunda olur; çünkü kullanıcı bunun farkında değildir ya da başka seçeneği yoktur.
Voice Pro’nun farklı yaptığı şeyler
- Hiçbir bulut modu yok, kesinlikle. “Daha yüksek doğruluk için sunucuya gönder” seçeneği yoktur. Model CPU veya GPU üzerinde çalışır. Tek seçenek budur.
- Hiçbir telemetri yok. Uygulama kullanım istatistikleri, çökme raporları veya başka hiçbir şeyi sunucuya göndermez. Tek ağ çağrıları şunlardır: (a) başlangıçta lisans kontrolü, (b) güncelleme kontrolü, (c) isteğe bağlı manuel model indirmeleri. Üçü de belgelenmiş ve devre dışı bırakılabilir.
- Transkript etmek için hesap gerekmez. Hesap oluşturmadan 14 günlük deneme sürümünü kullanabilirsiniz. Bir lisans satın almak istiyorsanız yalnızca e-posta gerekir.
- Ses asla diske yazılmaz. Transkripsiyon sırasında ses arabelleği RAM’de bulunur ve metin oluşturulduğu anda serbest bırakılır. Sızdırılacak hiçbir şey yok, adli analizle geri kazanılabilecek hiçbir şey yok.
Yerel modeller gerçekten bulutla eşit seviyede olabilir mi?
İki yıl önce hayır. Bir dizüstü bilgisayarın CPU’sunda bulunan yerel 100 MB’lık model, Google’ın veri merkezinin 200 GB’lık model ve 40 GPU ile yaptıklarına ulaşamazdı.
Evet, bugün. Orta seviye bir CPU üzerinde çalışan Qwen3-ASR 3B, çoğu dilde büyük bulut sağlayıcılarınınkine %2 civarında yakın kelime hata oranlarına ulaşır ve yeniyor Bulut sağlayıcılarının daha az eğitim verisi bulunduğu, düşük kaynaklı dillerde kullanım için. Özellikle de kısa ve amaçlı ifadeler olan dikte işlemlerinde bu fark %0’a yakındır. Yerel ASR sistemleri giderek yeterli hale gelmiştir ve sürekli gelişmektedir. Biz sadece bunları piyasaya sürmeyi seçenleriz.
İlke
Sesiniz, ürettiğiniz en kişisel veridir. Kimliğinizi, düşüncelerinizi, bahsettiğiniz kişileri ve kimsenin müdahale etmediği bir ortamda seçtiğiniz kelimeleri içerir. Açıkça ve bilinçli olarak başka bir yere göndermedikçe bu veri makinenizden çıkmamalıdır.
Bu bir pazarlama sloganı değil. Bu, ürünün var olmasının tek nedenidir.