กูเกิลยังวนออกโมเดล Gemini เวอร์ชันย่อยๆ เฉพาะทางอย่างต่อเนื่อง (ส่วนตัวใหญ่สุดนั้น ชัดเจนแล้วว่า รอ Gemini 4 เลย) โมเดลตัวล่าสุดคือ โมเดลแปลงข้อความเป็นเสียงพูด (text-to-speech) ชื่อว่า Gemini 3.8 Flash TTS และ Gemini 3.8 Flash-Lite TTS (ก่อนหน้านี้เพิ่งมี Gemini 3.5 Transcribe ที่ทำด้านกลับกันคือ ถอดเสียงเป็นข้อความ)
โมเดลทั้งสองตัวเป็นการสร้างเสียงคุณภาพสูง เหมาะสำหรับงานโปรดักชัน พากย์เสียงตัวละครในเกม อ่านหนังสือเสียง เล่าพ็อดแคสต์ มีความสามารถในการควบคุมจังหวะ สำเนียง ให้เสียงที่เป็นธรรมชาติ รองรับภาษากว่า 100 ภาษา มีคลังเสียงสำหรับงานโปรดักชันมากกว่า 2,000 เสียงในภาษาต่างๆ และสามารถเลียนเสียงพูดจากคลิปเสียงตัวอย่างความยาว 30 วินาทีได้
Gemini 3.8 Flash TTS เน้นคุณภาพสูง ได้คะแนนอันดับหนึ่งในเบนช์มาร์คเสียง Hume AI Voice Design Benchmark ส่วน Gemini 3.8 Flash-Lite TTS เน้นราคาถูก แม้คุณภาพรองลงมาแต่ก็เป็นอันดับสองในเบนช์มาร์ค แพ้แค่ Flash TTS ตัวเดียว
โมเดลตัวนี้เริ่มใช้งานแล้วใน Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook, Google Vids
ที่มา - Google
on