Elk groot dictatieproduct — Dragon, Otter, Google's dictatie, Apple's dictatie, elke cloudtranscriptie-SaaS — stuurt uw stem via de server van iemand anders. De audio wordt op uw machine vastgelegd, via HTTPS naar een datacenter gestreamd, daar getranscribeerd en de tekst komt terug. Soms wordt de audio opgeslagen. Soms wordt deze gebruikt om modellen te trainen. Soms wordt het “geanonimiseerd”, een woord dat het grootste deel van zijn betekenis heeft verloren.
Wij vinden dat de standaardinstelling verkeerd is.
Wat mensen daadwerkelijk dicteren
Zodra u echt gebruik begint te bekijken, is de inhoud van dicteerinput bijna nooit casual. Het is:
- Medische notities — een arts die een consultatie transcribeert.
- Juridische concepten — een advocaat die een verzoekschrift of een klantbrief dicteert.
- Journalistiek — interviews met met naam genoemde bronnen die ervan uitgingen dat de opname het apparaat van de journalist niet zou verlaten.
- Therapienotities — een psycholoog die samenvattingen van sessies opstelt.
- Zakelijke strategie — een executive die memo's schrijft over deals, mensen en geld.
- Persoonlijke dagboeken — de dingen die mensen echt denken, die niemand anders ooit zou moeten lezen.
Dit wordt allemaal standaard routinematig geüpload naar clouddiensten. Vaak in strijd met HIPAA, GDPR, advocaat-clientprivilege of gewoon fatsoen — omdat de gebruiker het niet doorhad of geen alternatief had.
Wat Voice Pro anders doet
- Geen cloudmodus, punt. Er is geen schakelaar om "naar server te sturen voor meer nauwkeurigheid". Het model draait op je CPU of GPU. Dat is de enige optie.
- Geen telemetrie. De app belt niet naar huis met gebruiksstatistieken, crashrapporten of iets anders. De enige netwerkaanroepen zijn (a) licentiecontrole bij het opstarten, (b) updatecontrole, (c) optionele handmatige modeldownloads. Alle drie zijn gedocumenteerd en kunnen worden uitgeschakeld.
- Geen account nodig om te transcriberen. Je kunt de proefperiode van 14 dagen gebruiken zonder een account aan te maken. Een e-mailadres is alleen nodig als je een licentie wilt kopen.
- Audio raakt de schijf nooit. De audiobuffer bevindt zich in het RAM tijdens transcriptie en wordt vrijgegeven op het moment dat de tekst is geproduceerd. Niets om te lekken, niets om forensisch te herstellen.
Kunnen lokale modellen echt wedijveren met de cloud?
Twee jaar geleden, nee. Een lokaal 100 MB-model op de CPU van een laptop kon niet tippen aan wat het datacenter van Google deed met 200 GB aan model en 40 GPU's.
Vandaag, ja. Qwen3-ASR 3B die draait op een middenklasse CPU haalt op de meeste talen een woordfoutpercentage dat binnen 2% ligt van dat van de grote cloudaanbieders, en verslaat voor talen met weinig middelen, waar de cloudaanbieders minder trainingsgegevens hebben. Voor dictaat in het bijzonder – korte, doelgerichte uitspraken – is het verschil dichter bij 0%. Lokale ASR is al behoorlijk goed geworden en wordt steeds beter. Wij zijn gewoon degenen die ervoor kiezen het te leveren.
Het principe
Uw stem is de meest persoonlijke gegevens die u genereert. Het draagt uw identiteit, uw gedachten, de mensen over wie u spreekt, en de woorden die u koos toen er niemand was die ze bewerkte. Het mag uw apparaat niet verlaten tenzij u het expliciet en bewust ergens naartoe stuurt.
Dat is geen marketingzin. Dat is de hele reden waarom het product bestaat.