تمام برنامههای اصلی دیکته — Dragon، Otter، دیکته گوگل، دیکته اپل، و تمام سرویسهای SaaS مربوط به ترجمه صوتی به متن — صدای شما را از طریق سرورهای دیگران ارسال میکنند. صدا در دستگاه شما ضبط شده، از طریق HTTPS به یک مرکز داده ارسال میشود، در آنجا ترجمه شده و سپس متن مربوطه برگردانده میشود. گاهی اوقات صدا ذخیره میشود؛ گاهی برای آموزش مدلها استفاده میشود؛ و گاهی نیز «بینام» میشود، که این واژه بیشتر معنای خود را از دست داده است.
فکر میکنیم آن تنظیم پیشفرض اشتباهی است.
آنچه مردم واقعاً دیکته میکنند
وقتی شروع به مشاهده استفاده واقعی کنید، محتوای دیکته تقریباً هرگز غیررسمی نیست. بلکه:
- یادداشتهای پزشکی — پزشکی که در حال رونویسی مشاوره است.
- پیشنویسهای حقوقی — وکیلی که یک درخواست یا نامه موکل را دیکته میکند.
- روزنامهنگاری — مصاحبه با منابع نامبردهای که فرض میکردند ضبط از دستگاه روزنامهنگار خارج نخواهد شد.
- یادداشتهای درمانی — روانشناسی که خلاصه جلسات را مینویسد.
- استراتژی Business — مدیری که یادداشتهایی درباره معاملات، افراد و پول تهیه میکند
- ژورنالهای شخصی — چیزهایی که مردم واقعاً فکر میکنند، که هیچکس دیگری نباید آنها را بخواند.
تمام این موارد بهطور پیشفرض در سرویسهای ابری آپلود میشوند. اغلب این کار نقض HIPAA، GDPR، رازداری وکیل-موکل، یا حتی شرافت انسانی است — زیرا کاربر متوجه نشده یا جایگزینی نداشته است.
Voice Pro چه تفاوتی دارد؟
- بدون حالت ابری، به هیچ وجه. هیچ گزینهای برای «فرستادن به سرور جهت دقت بیشتر» وجود ندارد. مدل روی CPU یا GPU شما اجرا میشود؛ این تنها گزینه است.
- بدون تلهمتری. این اپلیکیشن، آمار استفاده، گزارشهای خرابی یا هر چیز دیگری را به سرور ارسال نمیکند. تنها تماسهای شبکهای عبارتند از: (الف) بررسی مجوز در زمان راهاندازی، (ب) بررسی وجود بهروزرسانی، (ج) دانلود دستی مدلها (که اختیاری است). هر سه مورد مذکور مستند شدهاند و میتوان آنها را غیرفعال کرد.
- برای رونویسی نیازی به حساب کاربری نیست. میتوانید از نسخه آزمایشی ۱۴ روزه بدون ایجاد حساب استفاده کنید. تنها در صورتی نیاز به ایمیل دارید که بخواهید یک مجوز خریداری کنید.
- صوت هرگز روی دیسک نوشته نمیشود. بافر صوتی در حین تبدیل به متن، در RAM ذخیره میشود و به محض تولید متن، آزاد میگردد. چیزی برای نشت وجود ندارد و چیزی برای بازیابی از طریق روشهای پزشکی قانونی نیز وجود ندارد.
آیا مدلهای محلی واقعا میتوانند با مدلهای ابری رقابت کنند؟
دو سال پیش، خیر. یک مدل محلی ۱۰۰ مگابایتی روی پردازنده لپتاپ نمیتوانست با کاری که مرکز داده گوگل با ۲۰۰ گیگابایت از این مدلها و ۴۰ کارت گرافیک انجام میداد، رقابت کند.
امروز، بله. Qwen3-ASR 3B که روی یک پردازنده میانرده اجرا میشود، در اکثر زبانها نرخ خطای کلمات را تا ۲٪ نزدیک به ارائهدهندگان بزرگ ابری میرساند، و شکست میدهد در زبانهای کممنبع که ارائهدهندگان ابری دادههای آموزشی کمتری دارند. برای دیکته بهطور خاص — ابراههای کوتاه و هدفمند — این شکاف به نزدیک ۰٪ میرسد. ASR محلی بهطور خاموش به اندازه کافی خوب شده و همچنان بهتر میشود. ما فقط کسانی هستیم که تصمیم میگیریم آن را عرضه کنیم.
اصل
صدای شما شخصیترین دادهای است که تولید میکنید. حامل هویت شما، افکارتان، افرادی که دربارهشان صحبت میکنید و کلماتی است که وقتی هیچکس ویرایشگر نبود انتخاب کردهاید. مگر اینکه صراحتاً و با آگاهی آن را به جایی ارسال کنید، نباید از دستگاه شما خارج شود.
آن یک شعار بازاریابی نیست؛ آن دلیل اصلی وجود این محصول است.