كل منتج رئيسي للكتابة الصوتية — Dragon، وOtter، وكتابة Google الصوتية، وكتابة Apple الصوتية، وكل خدمات SaaS للنسخ السحابي — يرسل صوتك عبر خادم شخص آخر. يتم التقاط الصوت على جهازك، وبثه عبر HTTPS إلى مركز بيانات، حيث يتم نسخه، ثم يعود النص. أحياناً يتم تخزين الصوت. وأحياناً يُستخدم لتدريب النماذج. وأحياناً يتم "إخفاء هويته"، وهو مصطلح فقد معظم معناه.
نعتقد أن هذا هو الإعداد الافتراضي الخاطئ.
ما يمليه الناس فعليًا
بمجرد أن تبدأ في مراقبة الاستخدام الفعلي، يكون محتوى الكتابة الصوتية نادرًا ما يكون عفويًا. بل هو:
- ملاحظات طبية — طبيب يدوّن محتوى الاستشارة.
- مسودات قانونية — محامٍ ينطق بنص طلب أو رسالة إلى العميل.
- الصحافة — مقابلات مع مصادر محددة افترضوا أن التسجيل لن يغادر جهاز الصحفي.
- ملاحظات العلاج — طبيب نفسي يكتب ملخصات الجلسات.
- استراتيجية Business — موظف تنفيذي يُعد مذكرات حول الصفقات والأشخاص والأموال.
- اليوميات الشخصية — ما يفكر فيه الناس فعليًا، والذي لا ينبغي لأحد آخر أن يقرأه أبدًا.
يتم رفع كل ذلك بشكل روتيني إلى خدمات السحابة افتراضيًا. وغالبًا ما ينتهك ذلك معايير HIPAA وGDPR وسرية العلاقة بين المحامي وموكله، أو مجرد اللياقة الأساسية — لأن المستخدم لم يدرك ذلك أو لم يكن لديه بديل.
ما الذي يفعله Voice Pro بشكل مختلف
- بدون وضع سحابي، نهائيًا. لا يوجد مفتاح لـ "إرسال إلى الخادم للحصول على دقة أفضل". يعمل النموذج على وحدة المعالجة المركزية أو وحدة معالجة الرسومات الخاصة بك. هذا هو الخيار الوحيد.
- لا بيانات تليمترية. التطبيق لا يرسل إلى الخادم إحصائيات الاستخدام أو تقارير الأعطال أو أي شيء آخر. المكالمات الشبكية الوحيدة هي (أ) التحقق من الترخيص عند بدء التشغيل، (ب) التحقق من التحديثات، (ج) تنزيل النماذج يدويًا اختياريًا. جميعها موثقة ويمكن تعطيلها.
- لا حاجة إلى حساب للتسجيل. يمكنك استخدام النسخة التجريبية لمدة 14 يومًا دون إنشاء حساب. لا يُطلب البريد الإلكتروني إلا إذا أردت شراء رخصة.
- لا يلامس الصوت القرص أبدًا. يبقى مخزن الصوت في ذاكرة الوصول العشوائي أثناء النسخ ويُحرَّر فور إنتاج النص. لا شيء يتسرب، ولا شيء يمكن استرجاعه جنائيًا.
هل يمكن للنماذج المحلية حقًا منافسة السحابة؟
قبل عامين، لا. لم يكن بمقدور نموذج محلي بحجم 100 ميغابايت يعمل على معالج اللابتوب أن يضاهي ما كان يفعله مركز بيانات جوجل باستخدام نموذج بحجم 200 جيجابايت و40 وحدة معالجة رسومات.
اليوم، نعم. يحقق Qwen3-ASR 3B الذي يعمل على معالج متوسط الفئة معدلات أخطاء في الكلمات ضمن 2% من مزودي الخدمات السحابية الكبرى في معظم اللغات، و يتفوق على عليها في اللغات منخفضة الموارد حيث يمتلك مزودو السحابة بيانات تدريب أقل. بالنسبة للإملاء تحديدًا — عبارات قصيرة مقصودة — تقترب الفجوة من 0%. أصبح التعرف المحلي على الكلام جيدًا بما يكفي، ويستمر في التحسن. نحن فقط من نختار توفيره.
المبدأ
صوتك هو أكثر البيانات الشخصية التي تنتجها. فهو يحمل هويتك، وأفكارك، والأشخاص الذين تتحدث عنهم، والكلمات التي اخترتها عندما لم يكن أحد يعدّلها. لا ينبغي أن يغادر جهازك إلا إذا أرسلته عمدًا وبشكل واعٍ إلى مكان ما.
هذا ليس سطرًا تسويقيًا. بل هو السبب الكامل لوجود المنتج.