9月16日消息,当地时间9月15日,谷歌宣布推出Gemini 3.8 Live和Gemini 3.8 Live Extended Thinking。谷歌称这是其迄今最先进的实时对话模型,在智能和并行推理方面有重大升级,让AI对话更直观智能。
两款新品定位不同:Gemini 3.8 Live面向规模部署与成本优化,兼顾对话智能、流畅交流和视觉理解;Gemini 3.8 Live Extended Thinking则面向高复杂度任务,具备更强的智能和多步推理能力。

基准测试方面,Gemini 3.8 Live Extended Thinking在多项评测中取得领先成绩:拿下Artificial Analysis语音对语音质量指数总排名第一(82.6%),在τ-Voice智能体任务完成率达68.6%,在Sierra的τ-Voice-banking基准测试达35.1%;推理能力方面,在Big Bench Audio得分97.7%,同时保持有竞争力的定价。Gemini 3.8 Live则在Speech Agent Arena排名第二,获得用户高认可度且具备出色成本效益,适合大规模部署。两款模型在ServiceNow EVA-Bench语音智能体基准测试中成功平衡准确性与对话质量,推高了复杂工作流的帕累托前沿。
功能特性上,Gemini 3.8 Live可近实时处理视觉输入,在对话中自动检测并切换97种支持的语言,还能在后台执行工具与API调用,同时保持对话流畅不中断。Gemini 3.8 Live Extended Thinking可实现推理与发言同步进行,在不中断对话流畅度的前提下提升复杂工作流智能水平:通过“让我确认一下…”这类早期语言提示自然回应用户,还可实时讲解多步后台任务的处理进度。
开发者可通过Gemini Live API,在声网、Fishjam、LiveKit、Pipecat、Vercel、Vision Agents等平台构建部署高性能语音驱动界面;谷歌还与Salesforce、Genspark、Lumeris等企业合作推进生态建设。此外,谷歌所有AI生成音频均嵌入SynthID隐形水印,可检测AI生成内容,帮助防止虚假信息传播。
目前两款模型均已开始推送。Gemini 3.8 Live:开发者可在Gemini API和Google AI Studio使用,企业用户可在Gemini Enterprise抢先体验(即将登陆Gemini Enterprise for Customer Experience),全用户可在Search Live体验。Gemini 3.8 Live Extended Thinking:开发者可在Gemini API和Google AI Studio使用,企业用户可在Gemini Enterprise抢先体验(即将登陆Gemini Enterprise for Customer Experience及Google Workspace企业客户),普通用户可在Gemini Live体验,Google AI Pro和Ultra订阅者可在Workspace的Docs使用,所有Google AI订阅者可在Gmail和Keep体验。

微信扫一扫
支付宝扫一扫 