วันนี้ Brethof Voice Pro v1.0 พร้อมดาวน์โหลดบน Windows 10/11 และ Linux (Ubuntu, Fedora, Arch) เป็นแอปพลิเคชันเดสก์ท็อปที่จับเสียงจากไมโครโฟนของคุณ รันโมเดล ASR ที่ใช้ Qwen ในเครื่องของคุณเอง บน CPU หรือ GPU ของคุณ แล้วพิมพ์ข้อความที่ถอดความแล้วลงในหน้าต่างที่คุณกำลังโฟกัสอยู่
สิ่งที่รวมอยู่ในเวอร์ชัน 1.0
- 30 ภาษาสำหรับการถอดเสียง และ 38 ภาษาสำหรับการแปล — ภาษาอาหรับ, ภาษาจีนกลาง, ภาษาจีน, ภาษาเช็ก, ภาษาเดนมาร์ก, ภาษาดัตช์, ภาษาอังกฤษ, ภาษาฟิลิปปินส์, ภาษาฟินแลนด์, ภาษาฝรั่งเศส, ภาษาเยอรมัน, ภาษากรีก, ภาษาฮินดี, ภาษาโครเอเชีย, ภาษาฮังการี, ภาษาอินโดนีเซีย, ภาษาอิตาลี, ภาษาญี่ปุ่น, ภาษาเกาหลี, ภาษามาซิโดเนีย, ภาษามาเลย์, ภาษาเปอร์เซีย, ภาษาโปแลนด์, ภาษาโปรตุเกส, ภาษาโรมาเนีย, ภาษารัสเซีย, ภาษาเซอร์เบีย, ภาษาสโลวัก, ภาษาสโลวีเนีย, ภาษาสเปน, ภาษาสวีเดน, ภาษาไทย, ภาษาตุรกี, ภาษายูเครน, ภาษาเวียดนาม, ภาษาบัลแกเรีย
- การพิมพ์ด้วยคีย์ลัดระดับระบบ — กดปุ่มลัดของคุณได้ทุกที่ พูดออกมาก่อน แล้วปล่อยมือ ข้อความจะถูกพิมพ์ลงในแอปที่กำลังใช้งานอยู่
- 100% ออฟไลน์ — ไม่มีระบบคลาวด์ ไม่มีข้อมูล telemetry ไม่ต้องสร้างบัญชีเพื่อทำการถอดความ
- ระดับโมเดลสามระดับ — ระดับพื้นฐาน (เร็ว, 0.6 พันล้านพารามิเตอร์), ระดับกลาง (1.7 พันล้าน), ระดับใหญ่ (3 พันล้าน) เลือกระดับตามสเปคฮาร์ดแวร์ของคุณ
- การลดเสียงรบกวน ผ่าน DeepFilterNet และ การตรวจจับกิจกรรมของเสียง ผ่าน Silero VAD โดยทั้งสองทำงานในเครื่องเดียวกัน
- คำสำคัญ — ใส่ชื่อ อักษรย่อ และคำที่เกี่ยวข้องกับโดเมนเป็นข้อมูลนำในช่วงเวลาการอนุมาน (ไม่ต้องฝึกโมเดลใหม่)
หนึ่งเครื่องมือ ไม่ ในเวอร์ชัน 1.0: มีการปรับแต่งโมเดล ในเวอร์ชันก่อนหน้านี้ใช้ PyTorch สำหรับการปรับแต่งโมเดล แต่เมื่อเราย้ายกระบวนการประมวลผลไปใช้ GGUF ก็ทำให้กระบวนการฝึกโมเดลไม่สามารถทำงานได้อีกต่อไป เราจึงยังไม่สามารถเผยแพร่เวอร์ชันนี้ได้จนกว่าขั้นตอนการแปลงจะสมบูรณ์ ดูที่ แผนการปรับแต่งเพิ่มเติม.
ราคา
ซื้อครั้งเดียว ไม่มีระบบสมาชิก:
- Personal — เครื่อง 2 เครื่อง ใช้ได้ทั้งสำหรับการใช้งานส่วนตัวและการใช้งานเชิงพาณิชย์แบบฟรีแลนซ์ ดูราคา.
- Business — การใช้งานของทีม/องค์กร พร้อมส่วนลดตามปริมาณเมื่อมี 10 ที่นั่งขึ้นไป ดูราคา.
- ทดลองใช้ฟรี 14 วัน — ไม่จำเป็นต้องใช้บัตรเครดิต ปลดล็อกฟีเจอร์ทั้งหมด
ราคาจะปรับตามภูมิภาคโดยอัตโนมัติ: หากคุณอยู่ในยุโรปตะวันออก เอเชียตะวันออกเฉียงใต้ ลาตินอเมริกา หรือแอฟริกา คุณจะเห็นราคาที่ปรับตามอำนาจซื้อในแต่ละพื้นที่
สิ่งที่เราทำถูกต้อง
สิ่งที่เราภูมิใจที่สุดคือ เวลาจนกว่าจะปรากฏคำแรก (time-to-first-word). เปิดแอป กดคีย์ลัด แล้วพูดออกมา ไม่จำเป็นต้องสมัครสมาชิก ไม่ต้องใช้เบราว์เซอร์ ไม่ต้องอัปโหลดข้อมูล และไม่ต้องรอการส่งข้อมูลผ่านคลาวด์ บนแล็ปท็อประดับกลาง Voice Pro สามารถถอดรหัสประโยคยาว 5 วินาทีได้ภายในเวลาไม่ถึง 400 มิลลิวินาที สำหรับรุ่นพื้นฐาน นี่แหละคือจุดเด่นของมัน
ขั้นตอนถัดไป
- รุ่นสำหรับ macOS — อยู่ระหว่างดำเนินการ คาดว่าจะเสร็จสมบูรณ์ในไตรมาสที่ 3 ปี 2026
- ปรับแต่งให้เหมาะกับเสียงและคลังคำศัพท์ของคุณ — จะเริ่มดำเนินการเมื่อกระบวนการแปลง PyTorch เป็น GGUF พร้อมใช้งาน โดยมีเป้าหมายไว้ในไตรมาสที่ 3 ของปี 2026
- โหมดสตรีมแบบเรียลไทม์ — คำจะปรากฏขึ้นขณะที่คุณพูด ไม่ใช่หลังจากที่คุณปล่อยคีย์ลัด
- ระดับโมเดลที่หลากหลายมากขึ้น — โมเดลอุปกรณ์ขนาดเล็กพิเศษสำหรับฮาร์ดแวร์ระดับต่ำ และโมเดล 7B สำหรับเครื่องจักรระดับสูง
หากคุณรอเครื่องมือบันทึกเสียงที่ให้ความเป็นส่วนตัว วันนี้คือวันที่คุณต้องการ ดาวน์โหลดเวอร์ชันทดลองใช้ บันทึกเสียงได้เป็นเวลา 14 วัน แล้วบอกเราว่ามีข้อบกพร่องตรงไหน เราจะอ่านอีเมลทุกฉบับ