谷歌推出两款Gemini语音模型,二者支持超100种语言和方言,提供2000多种声音

谷歌于当地时间9月23日推出Gemini 3.8 Flash TTS和Gemini 3.8 Flash-Lite TTS两款文本转语音模型,将Gemini在AI语音生成领域的布局进一步拓宽。

两款产品定位各异:Flash TTS偏重声音表现力与复杂创意场景,Flash-Lite TTS则优化大规模、低成本的语音生成,可应用于内容配音、音频制作以及实时语音代理。

据钛媒体快报,谷歌称,两款模型支持超过100种语言和方言,并提供2000多种可直接使用的声音。Flash TTS还支持基于30秒音频样本复制声音。

从谷歌开发者文档看,Gemini 3.8 Flash TTS覆盖130种语言,Flash-Lite TTS覆盖101种语言,并可根据文字指令对声音、语速、情绪和对话方式加以调节。

在Hume AI的Voice Design Benchmark中,Gemini 3.8 Flash TTS以71.4分居声音设计综合指标首位,两款模型在Hume AI Overall Quality Index中分别占据前两名。

谷歌将此次语音生成能力提升描述为从静态预设迈向动态创意工作室,新模型可支持创作者、开发者和企业获得更丰富、更具表现力的音频体验,并用于改进Gemini Notebook和Google Vids等产品。

Gemini 3.8 Flash TTS主要面向有声书、播客、游戏角色和互动媒体等创意应用,用户可凭自然语言提示词从零设计声音,如角色设定、口音和声音特征等;声音复制需获所有者同意,生成音频嵌入不可感知的SynthID水印以辨别AI生成语音。

市场有风险,投资需谨慎。本文为AI基于第三方数据生成,仅供参考,不构成个人投资建议。

财经频道更多独家策划、专家专栏,免费查阅>>

责任编辑:栎树
AI智能分析该文,为您挖掘投资机会该AI功能处于试用阶段,内容仅供参考,请仔细甄别!
展开
精彩推荐
加载更多
全部评论
热榜
关闭 下载金融界app
金融界App
金融界微博
金融界公众号