Mühendislik 8 Nisan 2026

Neden ONNX’ten ayrıldık GGUF

Daha küçük bir kurulum, daha hızlı soğuk başlatma ve artık platforma özgü çalışma zamanı paketleriyle uğraşmak yok. Bu değişikliğin arkasındaki mühendislik hikayesi.

Voice Pro’nun ilk sürümleri, resmi Qwen ASR ONNX dosyalarıyla birlikte ONNX Runtime kullanıyordu. Bu yöntem işe yarıyordu, ancak uygulamayı piyasaya sürmek zorlayıcıydı. Karşılaştığımız sorunlar ve uygulamanın şimdi neden farklı şekilde çalıştığı şöyle: llama.cpp GGUF ile quantize edilmiş modellerle.

Sorun 1: kurulum boyutu

ONNX Runtime + DirectML sağlayıcısı + CUDA sağlayıcısı + model ağırlıkları içeren Voice Pro’nun Windows sürümü piyasaya sürüldü 430 MB. Linux da benzerdi. Henüz denemedikleri bir dikte aracı için birinden bunu indirmesini istemek çok fazla şey istemektir.

GGUF build’i Windows’ta 83 MB. Derlenmiş llama.cpp binary’si oldukça küçüktür; quantize edilmiş temel model yaklaşık 60 MB’dır (fp16 ONNX olarak yaklaşık 200 MB) ve CPU, CUDA, DirectML ve Vulkan için ayrı execution-provider DLL’leri göndermiyoruz — llama.cpp tüm dördünü tek bir binary ile halleder.

Sorun 2: soğuk başlatma

Soğuk bir Windows yüklemesinde DirectML ile birlikte kullanılan ONNX Runtime’ın tahmin oturumunu başlatması 3–5 saniye sürdü. Kullanıcı, yeniden başlatmadan sonra ilk kez ilgili kısayolu kullanmaya çalıştığında her seferinde bu gecikmeyle karşılaştı. “Hemen konuşma” olmasının temel amacı olan bir dikte aracı için bu durum kabul edilemezdi.

llama.cpp, aynı donanımda GGUF modelini yaklaşık 400 ms soğuk başlatma süresinde yükler. Bellek eşlemeli ağırlıklar, grafik derleme adımı yok, başlatmak için başlatılacak wheel yok.

Sorun 3: paketleme cehennemi

ONNX Runtime, bir Python wheel olarak gelir; bu da şu anlama gelir: Python sürümü, işletim sistemi ve CPU mimarisine göre farklı wheel dosyaları. GPU hızlandırması eklenirse, bu değer CUDA sürümü ve DirectML sürümü ile çarpılır. Nuitka (paketleyicimiz) yanlış varyantı paketlemeye devam ediyordu. Altı koşullu dalı olan derleme betiklerimiz vardı.

llama.cpp tek bir C++ ikili dosyasıdır. Platform başına bir kez derlenir (Windows x64, Linux x64) ve Voice Pro’nun çağırdığı yerel bir yürütülebilir dosya olarak gönderilir. Çıkarım için Python çalışma zamanı bağımlılığı yoktur; Python sadece yapıştırıcı görevi görür.

Sorun 4: düşük boyutlardaki kalite

Kuantizasyonla ilgili endişe doğruluk kaybıdır. Pratikte, temel modelimiz Qwen3-ASR 0.6B’nin Q5_K_M quantize hali, iç değerlendirme setimizde tam fp16 ONNX sürümüne kıyasla %0,3 WER içinde ölçülmektedir. Q4_0 belirgin şekilde daha kötüdür, bu yüzden varsayılan olarak Q5_K_M gönderiyoruz. Maksimum doğruluk isteyen kullanıcılar model yöneticisinden fp16 katmanını indirebilir.

Vazgeçtiklerimiz

llama.cpp’nin ASR desteği, ONNX Runtime’ınkinden daha yenidir. Bazı egzotik model mimarileri için henüz GGUF dönüştürücüleri yok. Şimdilik bu önemli değil — Qwen3-ASR temiz bir şekilde dönüştürüyor — ancak gelecekte köklü olarak farklı bir ASR modeli denemek istersek yedek olarak ONNX yolunu korumamız gerekebilir.

Net sonuç: 5 kat daha küçük bir kurulum, yaklaşık 10 kat daha hızlı soğuk başlatma süresi ve on iki yerine sadece bir tane ikili dosya gerekiyor. Bunu en başından beri yapmalıydık.

İndir (83 MB) Tüm özellikleri gör

Kargolandığında duyacaksınız.

Yeni sürümler, gerçek kıyaslamalar ve ara sıra derinlemesine incelemeler. Spam yok, tek tıkla abonelikten çıkın.

İnşa ettiğimiz her şey

Voice Pro

Sesinizi öğrenen yerel konuşmadan metne dönüştürme. Süresiz lisans. Amiral gemimiz.

ÜCRETLİ · amiral gemisi

brethof-brain

Yapay zeka ajanlarınız için uzun vadeli bellek — tam metin + vektör + graf. Oturum başlangıcında bilgilendirilir, her istekte geri çağrılır ve otomatik olarak arşivlenir.

ÜCRETLİ · ücretsiz plan

3D Modeller

Baskıya hazır dijital modeller. GLB ve OBJ dahil. Ömür boyu erişim.

ÜCRETLİ · dijital katalog

3D Baskılar

Beş yazıcı ve gerçek kapasite. Henüz kendi kendine hizmet veren bir mağaza yok — ihtiyacınızı bize söyleyin, fiyat teklifimizi e-posta yoluyla gönderelim.

Randevu ile · Bize e-posta gönderin

Nova

YouTube kanalımız. Bir siber kaplan sunucu, yerel yapay zeka araçlarını ve bunların gerçekte ne yaptığını anlatıyor.

KANAL · canlı

Harika listeler

Yapay zeka kodlama araçları, MCP sunucuları, yerel yapay zeka ve yapay zeka için Linux ile ilgili özenle seçilmiş GitHub listeleri. Her girişin bir kaynak bağlantısı bulunmaktadır.

ÜCRETSİZ · seçilmiş

Kılavuzlar

Linux, Windows ve macOS üzerinde yerel yapay zeka için uzun formatlı kullanım kılavuzları; yapılandırma dosyaları da dahildir.

ÜCRETSİZ · canlı

Anti-dev seviye listesi

Negatif kürasyon: Zamanınızı boşa harcayan uygulamalar ve araçlar, sıralanmış. Kanıt gerekli.

ÜCRETSİZ · canlı

Brethof AI Hakkında

Kim olduğumuz, neden gizliliğe öncelik veren yapay zekalar geliştirdiğimiz ve ne yapmayacağımız.

Harici: YouTube · GitHub