OpenAI将GPT-Live-1引入API:全双工语音对话,Full Duplex Bench测试超GPT-Realtime-2.1达30个百分点 - 果核剥壳

9月11日消息,OpenAI今日宣布将GPT-Live-1引入API,开发者可据此打造支持实时语音交互的应用和业务流程。该模型支持全双工对话,能够同时听取和输出语音,并在对话过程中处理打断、停顿及背景噪声。

OpenAI将GPT-Live-1引入API:全双工语音对话,Full Duplex Bench测试超GPT-Realtime-2.1达30个百分点

据介绍,GPT-Live-1将语音理解与语音输出整合在同一模型中,减少了传统“语音转文字—大语言模型—文字转语音”的多次衔接,从而降低延迟。模型还支持将复杂推理和工具调用交由后端文本模型处理,并支持原生语音识别转写和回复文本,具备字母数字理解、关键词偏置及轮次检测能力。

在应用场景上,GPT-Live-1支持电话场景,可用于预订餐厅、客户服务等全双工语音智能体。开发者可以将其与Codex等工具连接,也可以通过OpenAI Presence开发能够查询企业系统、执行获批操作并在必要时转交人工的语音工作。

开发者可以通过系统提示词调整模型的语气、语速和对话风格,也可以配置后端模型、工具及智能体框架。

早期评估数据表现亮眼:语言学习平台Speak使用GPT-Live-1后,学习者思考停顿期间的误打断次数较此前基于轮次的系统减少近80%;某医疗服务平台联合创始人兼首席技术官Tony Stoyanov表示,其团队代码量减少了80%,删除约2.3万行代码。

OpenAI公布的评测结果显示,GPT-Live-1在Full Duplex Bench测试中比GPT-Realtime-2.1高出30个百分点;在搭配GPT-6 Astra中等推理强度时,Tau3端到端语音智能体任务测试排名第一。

价格方面,GPT-Live-1前端语音层为每分钟0.05美元,按每小时60分钟计算,单纯前端语音层费用约为3美元(约合20.2元人民币),后端模型和智能体工具的费用另行计算。

此外,OpenAI还扩大了实时语音选项,新增Quartz、Ripple、Vesper、Willow、Stone、Gleam、Meridian、Bossa、Tempo、Beacon、Delta和Cinder等声音,并计划在未来数月继续增加语音和语言支持。

 

如果您喜欢本站,点击这儿不花一分钱捐赠本站

这些信息可能会帮助到你: 下载帮助 | 报毒说明 | 进站必看

修改版本安卓软件,加群提示为修改者自留,非本站信息,注意鉴别

(0)
上一篇 4小时前
下一篇 4小时前

相关推荐

发表回复

评论问题之前,点击我,能帮你解决大部分问题

您的电子邮箱地址不会被公开。 必填项已用*标注