Fiecare produs major de dictare — Dragon, Otter, dictarea Google, dictarea Apple, orice serviciu SaaS de transcriere în cloud — trimite vocea dumneavoastră prin serverul altcuiva. Audio-ul este capturat pe mașina dumneavoastră, transmis prin HTTPS către un centru de date, transcris acolo, iar textul se întoarce. Uneori audio-ul este stocat. Uneori este folosit pentru antrenarea modelelor. Uneori este „anonimizat”, un termen care și-a pierdut cea mai mare parte din sens.
Considerăm că aceasta este setarea implicită greșită.
Ce dictează oamenii de fapt
Odată ce începeți să observați utilizarea reală, conținutul dictării nu este aproape niciodată ocazional. Este:
- Note medicale — un medic care transcrie o consultație.
- Proiecte juridice – un avocat care dictează o cerere sau o scrisoare către un client.
- Jurnalism – interviuri cu surse identificate care au presupus că înregistrarea nu va părăsi mașina jurnalistului.
- Note de terapie – un psiholog care redactează rezumatele sesiunilor.
- Strategie de afaceri – un executiv care redactează note interne despre afaceri, personal și bani.
- Jurnale personale — lucrurile la care oamenii chiar gândesc, pe care nimeni altcineva nu ar trebui să le citească vreodată.
Tot acest lucru este încărcat în mod obișnuit pe servicii cloud în mod implicit. Adesea, în încălcarea HIPAA, GDPR, a privilegiului avocat-client sau a simplei decențe – deoarece utilizatorul nu a realizat sau nu avea o alternativă.
Ce face Voice Pro diferit
- Fără cloud, punct. Nu există nicio opțiune pentru a „trimite la server pentru o acuratețe mai bună“. Modelul rulează pe CPU-ul sau GPU-ul tău. Aceasta este singura opțiune.
- Fără telemetrie. Aplicația nu trimite acasă statistici de utilizare, rapoarte de eroare sau orice altceva. Singurele apeluri de rețea sunt (a) verificarea licenței la pornire, (b) verificarea actualizărilor, (c) descărcările manuale opționale de modele. Toate trei sunt documentate și pot fi dezactivate.
- Nu este necesar un cont pentru a transcrie. Puteți utiliza perioada de probă de 14 zile fără a crea un cont. Adresa de e-mail este necesară doar dacă doriți să cumpărați o licență.
- Audio-ul nu atinge niciodată discul. Bufferul audio trăiește în RAM în timpul transcrierii și este eliberat în momentul în care textul este produs. Nimic de scurs, nimic de recuperat forensic.
Pot modelele locale să egaleze cu adevărat cele din cloud?
Acum doi ani, nu. Un model local de 100 MB pe CPU-ul unui laptop nu putea rivaliza cu ceea ce făcea centrul de date al Google cu 200 GB de model și 40 GPU-uri.
Astăzi, da. Qwen3-ASR 3B rulat pe un CPU de gamă medie atinge rate de eroare a cuvintelor la doar 2% față de marii furnizori cloud în majoritatea limbilor, și bate pe limbile cu resurse reduse unde furnizorii de cloud au mai puține date de antrenare. Pentru dictare specific — enunțuri scurte și intenționate — diferența este mai aproape de 0%. ASR-ul local a devenit liniștit suficient de bun și continuă să se îmbunătățească. Noi suntem doar cei care alegem să-l livrăm.
Principiul
Vocea dumneavoastră este cea mai personală informație pe care o generați. Ea poartă identitatea dumneavoastră, gândurile dumneavoastră, persoanele despre care vorbiți, cuvintele pe care le-ați ales când nimeni nu le edita. Nu ar trebui să părăsească dispozitivul dumneavoastră decât dacă îi trimiteți explicit și conștient datele undeva.
Aceasta nu este o frază de marketing. Acesta este întregul motiv pentru care produsul există.