谷歌发布Gemini 3.8 Flash TTS/Flash-Lite TTS两款语音模型 - 果核剥壳

9月24日消息,谷歌宣布Gemini家族新增两款文本转语音模型——Gemini 3.8 Flash TTS和Gemini 3.8 Flash-Lite TTS,将语音生成从静态预设转变为动态创意工作室,帮助创作者、开发者和企业打造更丰富、更具表现力的音频体验,同时为Gemini Notebook和Google Vids等产品改进用户体验。

谷歌发布Gemini 3.8 Flash TTS/Flash-Lite TTS两款语音模型

两款新模型定位各有不同:

Gemini 3.8 Flash TTS:面向深度创意方向和角色设计,可通过自然语言提示从头创建全新语音,在游戏、沉浸式有声读物、播客和互动媒体中赋予角色生命力,还可对表演提示、节奏、方言转换等进行精细控制。

Gemini 3.8 Flash-Lite TTS:面向大容量、高性价比规模场景,针对大容量配音、音频内容创作和富有表现力的语音代理进行了优化,可对音调、节奏和表现力细微差别进行精细控制。

用户可以从原有30种原始语音扩展到无限语音库。具体功能包括:

生成式语音设计:通过自然语言提示,在100多种语言和方言中自定义角色、口音和语音特征,从头创建定制语音。
扩展语音库:可访问2000多种现成语音,覆盖墨西哥西班牙语、魁北克法语、苏格兰英语等区域变体。
语音复制:仅需30秒音频样本即可重现一致的声音特征,内置同意验证、SynthID水印和C2PA凭据,保护开发者和声音人才。
保存与扩展:可保存和管理自定义语音,确保在持续项目中保持一致性能,最小化漂移。
语音混音:即将推出,用户可从语音库选择语音,微调音色、音高、节奏和口音,或使用提示调整特征。
选好声音后,两款模型均支持精确控制每行台词的演绎:逐行指导表演(可编写舞台指导或让Gemini通过自然脚本提示引导交付,从平静客服到低声悬疑场景均可实现);长篇生成(在数小时连续音频中保持高语音质量、自然节奏和角色音色,扬声器漂移极小);原生双声音场景编排(从单个脚本无缝指导多轮对话,两种声音清晰分离);脚本化声音爆发和背景反馈(可添加<laughs>、<sigh>等非语言提示及mhm、yeah等倾听插入语,实现精确的喜剧时机和反应节奏)。

性能方面,Gemini 3.8 Flash TTS在Hume AI语音设计基准测试中以71.4分位居总体第一,口音建模(60.8分)同样领先。两款模型在Hume AI整体质量指数中分列第一、第二,较Gemini 3.1 Flash TTS在长格式内容和双扬声器剧本控制等用例中有重大改进。在Voice Arena盲法人类偏好评估中,两款模型在日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语和印地语等全球主要语言中处于领先地位。

安全方面,谷歌在语音创建和复制功能中内置了严格保护:语音复制需提供语音所有者的口头同意记录,与参考说话者匹配后才能创建;Gemini Audio模型生成的每个音频片段都带有难以察觉的SynthID水印,确保可检测AI生成语音、防止错误信息。

即日起,开发者可在Google AI Studio中体验这些语音生成功能。两款模型均已向开发者推送,可在Gemini API和Google AI Studio中使用;企业版即将通过Gemini Enterprise中的API推出;Gemini 3.8 Flash TTS可在Gemini Notebook中使用,Gemini 3.8 Flash-Lite TTS可在Google Vids中使用。

需要注意的是,通过AI Studio进行的语音复制在伊利诺伊州、德克萨斯州、欧洲经济区、英国、瑞士和印度不可用。

 

如果您喜欢本站,点击这儿不花一分钱捐赠本站

这些信息可能会帮助到你: 下载帮助 | 报毒说明 | 进站必看

修改版本安卓软件,加群提示为修改者自留,非本站信息,注意鉴别

赞 (0)
上一篇 2天前
下一篇 2天前

相关推荐

发表回复

评论问题之前,点击我,能帮你解决大部分问题

您的电子邮箱地址不会被公开。 必填项已用*标注