Microsoft AI เปิดตัวโมเดลตระกูล MAI สายเสียงใหม่พร้อมกัน 3 ตัว ดังนี้
- MAI-Transcribe-2-Streaming เป็นโมเดลถอดเสียงพูด สายย่อยของ MAI‑Transcribe‑2 เน้นการถอดเสียงแบบเรียลไทม์ ค่า latency ต่ำที่ประมาณ 100ms รองรับ 60 ภาษา มีอัตราความผิดพลาด 2.5% ต่ำที่สุดในท้องตลาดตอนนี้, ค่าใช้งาน 0.54 ดอลลาร์ต่อเสียงพูด 1 ชั่วโมง
- MAI-Voice-2.1 โมเดลสร้างเสียงพูดเวอร์ชันอัพเกรดจาก MAI-Voice-2 เพิ่มภาษาที่รองรับจาก 15 ภาษาเป็น 23 ภาษา ตอนนี้มีภาษาไทยเรียบร้อยแล้ว, ค่าใช้งาน 22 ดอลลาร์ต่อ 1 ล้านตัวอักษร
- MAI-Voice-2.1-Flash โมเดลเวอร์ชันถูกของ MAI-Voice-2.1 เน้นลูกค้าที่ต้องการสร้างเสียงเยอะๆ และทำงานเร็ว, ค่าใช้งาน 15 ดอลลาร์ต่อ 1 ล้านตัวอักษร
โมเดลทั้ง 3 ตัวเปิดใช้งานแล้วผ่าน Microsoft Foundry และ OpenRouter
ที่มา - Microsoft
on