광고
광고

SKIDIA's PaperBoy

ZH WIRE · 2026-09-24 14:55

谷歌推出两款Gemini文字转语音模型,大规模AI配音成现实

属实

谷歌正式发布两款基于Gemini的文字转语音(TTS)模型,将AI语音生成能力推向大规模配音应用场景。此举意味着谷歌在语音合成领域迈出重要一步,为内容创作者与企业提供原生集成于Gemini生态的配音工具。

원문 주장 (KR)
구글, 대규모 더빙용 AI까지…제미나이 TTS 모델 2종 출시

两款模型,定位配音场景

谷歌此次推出的TTS模型共有两种,均以Gemini系列为基础打造。发布重点明确指向“大规模配音”(dubbing)需求——即为视频、播客、有声书等多媒体内容批量生成语音旁白。相比传统的单句朗读式语音合成,配音场景对语调自然度、情感表达以及长文本一致性提出了更高要求,而这也正是谷歌强调新模型的核心能力所在。

嵌入Gemini生态的语音战略

新模型的推出并非孤立动作,而是谷歌将Gemini从纯文本与多模态理解模型向语音生成方向扩展的一环。通过在Gemini体系内直接提供TTS能力,谷歌可以在无需第三方语音引擎的情况下,为开发者与终端用户提供从内容理解到语音输出的完整链路。这对依赖外部配音服务商的内容制作流程而言,是一处显著的工作流简化。

此前,语音合成市场已有OpenAI、ElevenLabs等玩家深耕,情感化、拟人化配音逐渐成为竞争焦点。谷歌此时入场,凭借的是Gemini模型的多语言与上下文理解基础,使其语音输出在语义停顿、语气转换等方面具备与文本模型同源的语义把握能力。不过,谷歌方面在发布时的具体商用条款、计费方式与可用语言范围仍有待进一步确认,相关细节尚未完全公开。

结语

谷歌将配音级TTS能力纳入Gemini产品线,标志着大型语言模型厂商向语音生成领域的又一轮推进。综合目前公开的信息,该消息属实。

Sources — primary documents (10)
  1. https://www.etnews.com/20260924000040`
  2. https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/
  3. https://ai.google.dev/gemini-api/docs/changelog
  4. https://deepmind.google/models/gemini-audio/speech-generation/
  5. https://news.ycombinator.com/item?id=49817615
  6. https://developers.googleblog.com/gemini-api-io-updates/
  7. https://blog.google/innovation-and-ai/technology/developers-tools/gemini-2-5-text-to-speech/
  8. https://storage.googleapis.com/gweb-uniblog-publish-prod/images/gemini-audio__keyword__metacard_.width-1600.format-webp.webp
  9. https://storage.googleapis.com/gweb-uniblog-publish-prod/images/blog-gemini-3.8-flash-tts__evals_.width-100.format-webp_21WnKg9.webp
  10. https://lh3.googleusercontent.com/zyzIRuFpStX_vv6j8p-kdFyr6CAWeQZox6qgnTEkUEZreYR1XsJaTpfzCOmkSkogTmGEmVr9bDkwp8RI_plwzGnG4yft_EohErd8lI0_UgdiTw6RAg=w1440-h1440-n-nu-rw-lo

KR: /news/20260924-c72ac3 · 판정: 사실