เป็นจริง
กูเกิลเปิดตัวโมเดล Text-to-Speech (TTS) ใหม่ 2 รุ่นภายใต้แบรนด์ Gemini ซึ่งรองรับการสร้างเสียงพูดเทียมจากข้อความ รวมถึงความสามารถด้านการพากย์เสียง (dubbing) ด้วย AI ในระดับใหญ่ สะท้อนการขยายความสามารถของ Gemini จากงานข้อความและภาพ สู่งานด้านเสียงโดยตรง
โมเดลทั้งสองถูกวางตำแหน่งเป็นเครื่องมือสร้างเสียงพูดจากข้อความ โดยกูเกิลนำเสนอผ่านระบบนิเวศของ Gemini ทำให้นักพัฒนาและผู้ใช้สามารถเรียกใช้งานการสังเคราะห์เสียงได้ผ่านแพลตฟอร์มเดียวกับโมเดล AI หลักของบริษัท
การเปิดตัวครั้งนี้ทำให้ Gemini ครอบคลุมงานหลายรูปแบบ (multimodal) มากขึ้น โดยเพิ่มขีดความสามารถด้านเสียงเข้าไปเคียงข้างความสามารถด้านข้อความ รูปภาพ และวิดีโอที่มีมาก่อนหน้า
จุดเด่นที่กูเกิลเน้นย้ำคือการใช้งานด้านการพากย์เสียงขนาดใหญ่ (large-scale dubbing) ซึ่งโมเดล TTS สามารถนำไปประยุกต์กับเนื้อหาที่ต้องการแปลงเสียงพูดจำนวนมาก เช่น สื่อวิดีโอ คอนเทนต์ระดับโปรดักชัน หรือบริการที่ต้องการเสียงบรรยายหลายภาษา
การใช้ AI ทำพากย์เสียงถือเป็นตลาดที่แข่งขันสูง เมื่อผู้ให้บริการ AI รายใหญ่ต่างขยายความสามารถด้านเสียงของโมเดลตนเอง การที่กูเกิลเลือกเปิดตัวโมเดล TTS 2 รุ่นพร้อมกันแสดงถึงการกำหนดตำแหน่งผลิตภัณฑ์ให้แยกขั้นความสามารถหรือกรณีการใช้งาน
การเปิดตัวครั้งนี้ต่อยอดกลยุทธ์ของกูเกิลที่พยายามทำให้ Gemini เป็นแพลตฟอร์ม AI แบบครบวงจร โดยการเพิ่มโมเดล TTS ช่วยให้ธุรกิจและนักพัฒนาสามารถสร้างแอปพลิเคชันที่มีทั้งการสนทนาและการสร้างเสียงได้ในระบบเดียว
อย่างไรก็ตาม รายละเอียดเชิงเทคนิคของโมเดลทั้งสองรุ่น อาทิ ข้อแตกต่างเฉพาะระหว่างรุ่น หรือเงื่อนไขการใช้งาน ยังควรติดตามประกาศอย่างเป็นทางการจากกูเกิลเพิ่มเติม
โมเดล TTS ของ Gemini ทั้ง 2 รุ่นและความสามารถด้านการพากย์เสียงด้วย AI ขนาดใหญ่ของกูเกิลนั้น เป็นจริง