Đúng
Google đã chính thức phát hành hai mô hình chuyển văn bản thành giọng nói (TTS) thuộc dòng Gemini, hướng đến ứng dụng lồng tiếng (dubbing) trên quy mô lớn. Sự kiện này đánh dấu bước mở rộng danh mục AI tạo sinh của Google sang lĩnh vực âm thanh và giọng nói.
Theo thông tin được công bố, hai mô hình TTS mới thuộc dòng Gemini cho phép tạo giọng nói từ văn bản và được định vị cho các tác vụ lồng tiếng với khối lượng lớn, chẳng hạn như lồng tiếng nội dung đa ngôn ngữ. Việc phát hành đưa khả năng tổng hợp giọng nói trở thành một phần trong hệ sinh thái Gemini của Google.
Trọng tâm của đợt ra mắt là nhu cầu lồng tiếng quy mô lớn — lĩnh vực mà các doanh nghiệp sản xuất nội dung, giải trí và đa ngôn ngữ có nhu cầu cao về tự động hóa giọng nói. Google định vị hai mô hình TTS Gemini như công cụ phục vụ chính use case này, song các chi tiết kỹ thuật cụ thể về chất lượng giọng, số ngôn ngữ hỗ trợ hay phương thức cung cấp chưa được nêu trong thông tin đã công bố.
Động thái của Google diễn ra trong bối cảnh các hãng công nghệ lớn đang đẩy nhanh phát triển AI sinh giọng nói và âm thanh. Với việc bổ sung TTS vào dòng Gemini, Google gia tăng sức ép cạnh tranh với các nhà cung cấp AI giọng nói hiện có trên thị trường.
Thông tin trên được xác lập dựa trên các nguồn sơ cấp đã được xem xét, và kết luận cuối cùng là: Đúng.