Alle store dikteringsprodukter – Dragon, Otter, Googles diktering, Apples diktering, alle cloud-transkriptions-SaaS – sender din stemme gennem en andens server. Lyden optages på din maskine, streames over HTTPS til et datacenter, transskriberes der, og teksten kommer tilbage. Nogle gange gemmes lyden. Nogle gange bruges den til at træne modeller. Nogle gange er den "anonymiseret", hvilket er et ord, der har mistet det meste af sin betydning.
Vi mener, at det er den forkerte standardindstilling.
Hvad folk faktisk dikterer
Når du begynder at se på reel brug, er indholdet i diktering næsten aldrig uformelt. Det er:
- Lægenotater – en læge, der transskriberer en konsultation.
- Juridiske udkast – en advokat, der dikterer en begæring eller et brev til en klient.
- Journalistik – interviews med navngivne kilder, der antog, at optagelsen ikke ville forlade journalistens maskine.
- Terapinotater – en psykolog, der skriver sessionsopsummeringer.
- Forretningsstrategi — en leder, der udarbejder notater om aftaler, personale og økonomi.
- Personlige dagbøger – det, folk faktisk tænker på, som ingen anden nogensinde bør læse.
Alt dette uploades som standard regelmæssigt til cloud-tjenester. Ofte i strid med HIPAA, GDPR, advokat-klient-fortrolighed eller almindelig anstændighed – fordi brugeren ikke var klar over det, eller ikke havde et alternativ.
Hvad Voice Pro gør anderledes
- Ingen cloud-tilstand, punktum. Der er ingen mulighed for at "sende til server for bedre nøjagtighed". Modellen kører på din CPU eller GPU. Det er den eneste mulighed.
- Ingen telemetri. Appen sender ikke data hjem om brug, fejlrapporter eller noget andet. De eneste netværkskald er (a) licenskontrol ved start, (b) opdateringskontrol, (c) valgfri manuel modeldownload. Alle tre er dokumenteret og kan deaktiveres.
- Ingen konto kræves til transskription. Du kan bruge prøveperioden på 14 dage uden at oprette en konto. En e-mail er kun nødvendig, hvis du ønsker at købe en licens.
- Lyden rører aldrig disken. Lydbufferen lever i RAM under transskriptionen og frigives i det øjeblik, teksten er produceret. Intet at lække, intet at gendanne forensisk.
Kan lokale modeller virkelig matche skyen?
For to år siden, nej. En lokal 100 MB-model på en laptop-CPU kunne ikke måle sig med, hvad Googles datacenter gjorde med 200 GB model og 40 GPU'er.
I dag, ja. Qwen3-ASR 3B, der kører på en CPU i mellemklassen, rammer ordfejlrate inden for 2 % af de store cloududbydere på de fleste sprog, og slår dem på sprog med begrænsede ressourcer, hvor cloududbyderne har mindre træningsdata. For diktering specifikt – korte, bevidste ytringer – er forskellen tættere på 0%. Lokal ASR er stille og roligt blevet god nok, og den bliver ved med at blive bedre. Vi er bare dem, der vælger at levere det.
Princippet
Din stemme er de mest personlige data, du genererer. Den bærer din identitet, dine tanker, de personer, du taler om, og de ord, du valgte, da ingen redigerede. Den bør ikke forlade din maskine, medmindre du eksplicit og med fuld bevidsthed sender den et sted hen.
Det er ikke en marketing-sætning. Det er hele årsagen til, at produktet eksisterer.