9月11日消息,OpenAI今日宣布将GPT-Live-1引入API,开发者可据此打造支持实时语音交互的应用和业务流程。该模型支持全双工对话,能够同时听取和输出语音,并在对话过程中处理打断、停顿及背景噪声。

据介绍,GPT-Live-1将语音理解与语音输出整合在同一模型中,减少了传统“语音转文字—大语言模型—文字转语音”的多次衔接,从而降低延迟。模型还支持将复杂推理和工具调用交由后端文本模型处理,并支持原生语音识别转写和回复文本,具备字母数字理解、关键词偏置及轮次检测能力。
在应用场景上,GPT-Live-1支持电话场景,可用于预订餐厅、客户服务等全双工语音智能体。开发者可以将其与Codex等工具连接,也可以通过OpenAI Presence开发能够查询企业系统、执行获批操作并在必要时转交人工的语音工作。
开发者可以通过系统提示词调整模型的语气、语速和对话风格,也可以配置后端模型、工具及智能体框架。
早期评估数据表现亮眼:语言学习平台Speak使用GPT-Live-1后,学习者思考停顿期间的误打断次数较此前基于轮次的系统减少近80%;某医疗服务平台联合创始人兼首席技术官Tony Stoyanov表示,其团队代码量减少了80%,删除约2.3万行代码。
OpenAI公布的评测结果显示,GPT-Live-1在Full Duplex Bench测试中比GPT-Realtime-2.1高出30个百分点;在搭配GPT-6 Astra中等推理强度时,Tau3端到端语音智能体任务测试排名第一。
价格方面,GPT-Live-1前端语音层为每分钟0.05美元,按每小时60分钟计算,单纯前端语音层费用约为3美元(约合20.2元人民币),后端模型和智能体工具的费用另行计算。
此外,OpenAI还扩大了实时语音选项,新增Quartz、Ripple、Vesper、Willow、Stone、Gleam、Meridian、Bossa、Tempo、Beacon、Delta和Cinder等声音,并计划在未来数月继续增加语音和语言支持。

微信扫一扫
支付宝扫一扫 