हर प्रमुख डिक्टेशन उत्पाद — Dragon, Otter, Google का डिक्टेशन, Apple का डिक्टेशन, हर क्लाउड ट्रांसक्रिप्शन SaaS — आपकी आवाज़ को किसी अन्य के सर्वर के माध्यम से भेजता है। ऑडियो आपके मशीन पर रिकॉर्ड होता है, HTTPS के माध्यम से एक डेटा सेंटर तक भेजा जाता है, वहाँ उसका ट्रांसक्रिप्शन किया जाता है, और फिर टेक्स्ट वापस आता है। कभी-कभी ऑडियो को संग्रहीत कर लिया जाता है। कभी-कभी इसका उपयोग मॉडलों को प्रशिक्षित करने हेतु किया जाता है। कभी-कभी इसे "एनोमिमाइज़" किया जाता है, जो एक ऐसा शब्द है जिसका अधिकांश अर्थ खो चुका है।
हमारा मानना है कि यह गलत डिफ़ॉल्ट है।
लोग वास्तव में क्या डिक्टेट करते हैं
जब आप वास्तविक उपयोग को देखना शुरू करते हैं, तो Dictation की सामग्री लगभग कभी भी Casual नहीं होती। यह होती है:
- मेडिकल नोट्स — एक डॉक्टर परामर्श को ट्रांसक्राइब कर रहा हो।
- कानूनी मसौदे — कोई वकील किसी याचिका या क्लाइंट पत्र को लिखवा रहा हो।
- पत्रकारिता — उन व्यक्तियों के साथ साक्षात्कार, जिन्होंने यह माना कि रिकॉर्डिंग पत्रकार के डिवाइस से बाहर नहीं जाएगी।
- थेरेपी नोट्स — एक मनोवैज्ञानिक द्वारा सत्र सारांश लिखना।
- व्यवसायिक रणनीति – ऐसी योजनाएँ जिन्हें कार्यकारी अधिकारी सौदों, कर्मचारियों और धन से संबंधित मुद्दों पर तैयार करते हैं।
- व्यक्तिगत जर्नल — वे बातें जो लोग वास्तव में सोचते हैं, जिन्हें किसी और को कभी नहीं पढ़ना चाहिए।
यह सब डिफ़ॉल्ट रूप से क्लाउड सेवाओं में अपलोड हो जाता है। अक्सर यह HIPAA, GDPR, वकील-ग्राहक गोपनीयता, या साधारण नैतिकता के उल्लंघन के कारण होता है — क्योंकि उपयोगकर्ता को इसका एहसास नहीं होता, या उसके पास कोई विकल्प ही नहीं होता।
Voice Pro क्या अलग करता है
- कोई क्लाउड मोड नहीं, बिना किसी अपवाद के। बेहतर सटीकता के लिए सर्वर पर भेजें" का कोई टॉगल नहीं है। मॉडल आपकी CPU या GPU पर चलता है। यही एकमात्र विकल्प है।
- कोई टेलीमेट्री नहीं। यह ऐप उपयोग संबंधी आंकड़ों, क्रैश रिपोर्टों, या किसी अन्य जानकारी को भेजता नहीं है। नेटवर्क कॉल्स केवल निम्नलिखित हैं: (अ) शुरुआत में लाइसेंस जाँच, (ब) अपडेट जाँच, (स) वैकल्पिक रूप से मैन्युअल रूप से मॉडल डाउनलोड करना। इन तीनों का विवरण दिया गया है और उन्हें निष्क्रिय भी किया जा सकता है।
- ट्रांसक्राइब करने के लिए कोई खाता आवश्यक नहीं है। आप बिना कोई खाता बनाए 14 दिनों के परीक्षण संस्करण का उपयोग कर सकते हैं। केवल तभी ईमेल की आवश्यकता होती है जब आप लाइसेंस खरीदना चाहते हैं।
- ऑडियो कभी डिस्क पर नहीं जाता। ट्रांसक्रिप्शन के दौरान ऑडियो बफर RAM में ही रहता है, और जैसे ही टेक्स्ट तैयार हो जाता है, वह मुक्त हो जाता है। इसमें लीक होने वाली कोई चीज नहीं है, न ही इसे फ़ोरेंसिक तरीकों से पुनः प्राप्त किया जा सकता है।
क्या स्थानीय मॉडल वास्तव में क्लाउड के समकक्ष हो सकते हैं?
दो साल पहले, नहीं। लैपटॉप के CPU पर चलने वाला 100 MB का स्थानीय मॉडल वह नहीं कर सकता था जो Google का डेटा सेंटर 200 GB के मॉडल और 40 GPU के साथ कर रहा था।
आज, हाँ। मध्यम श्रेणी की CPU पर चलने वाला Qwen3-ASR 3B, अधिकांश भाषाओं में बड़े क्लाउड प्रदाताओं की तुलना में 2% के भीतर शब्द त्रुटि दर प्राप्त करता है, और बीट्स उन्हें उन कम-संसाधन वाली भाषाओं में उपयोग में लाया जाता है, जहाँ क्लाउड प्रदाताओं के पास प्रशिक्षण डेटा कम होता है। विशेष रूप से डिक्टेशन के लिए — छोटे, जानबूझकर कहे गए उच्चारण — यह अंतर लगभग 0% के करीब है। स्थानीय ASR चुपचाप काफी अच्छा हो गया है, और लगातार बेहतर होता जा रहा है। हम तो बस इसे शिप करने का चुनाव करने वाले हैं।
सिद्धांत
आपकी आवाज़ वह सबसे निजी डेटा है जो आप जनरेट करते हैं। इसमें आपकी पहचान, आपके विचार, आप जिन लोगों के बारे में बात कर रहे हैं, और वे शब्द शामिल हैं जिन्हें आपने बिना किसी के संपादन के चुना। इसे आपकी मशीन से तभी बाहर जाना चाहिए, जब आप स्पष्ट रूप से और जानबूझकर इसे कहीं भेजें।
वह कोई मार्केटिंग संदेश नहीं है। वही वह कारण है जिसके चलते यह उत्पाद अस्तित्व में है।