9月15日,谷歌正式推出Gemini 3.8 Live和Gemini 3.8 Live Extended Thinking两款实时语音对话模型。这是谷歌迄今最强的语音对话模型,核心变化只有一句话:AI终于能一边深度思考、一边不间断和你说话了。
过去的语音助手有个致命短板。模型一思考,对话就沉默,用户对着空气干等三到五秒。体验割裂,任务越复杂越明显。这次谷歌用”边推理边发声”的架构解决它。模型在后台跑多步推理,嘴上不停,用”让我查一下”这类过渡语自然衔接,再通过实时进度播报把结果讲给你听。
跑分说话:三项关键基准登顶
先看硬指标。Gemini 3.8 Live Extended Thinking在Artificial Analysis的Speech to Speech质量指数上拿下82.6分,排全球第一。智能体任务完成率方面,τ-Voice基准68.6%,Sierra的τ-Voice-banking基准35.1%,均处领先位置。Big Bench Audio推理测试得分97.7%。
标准版Gemini 3.8 Live走性价比路线,在Speech Agent Arena用户偏好榜排第二。谷歌明确把它定位为规模化产品:成本更低、延迟更稳,适合高并发的商业场景。
ServiceNow的EVA-Bench评测给出了另一个视角。在准确率和对话质量的平衡曲线上,这两款模型直接把Pareto前沿往前推了一截。翻译成人话:同等准确率下,它的对话更自然;同等自然度下,它答得更准。
三个能力值得开发者关注
实时视觉理解。 模型可以近实时处理摄像头画面。演示视频里,它看着棋盘下国际象棋,边看边解说推理过程。企业场景更实用:新员工入职引导、设备巡检指导、远程维修支持,摄像头加语音就能跑通。
97种语言中途切换。 对话进行到一半自动检测并切换语言,不用手动设置。跨国客服、多语言会议场景直接受益。
后台执行工具调用。 这是最像智能体的一项。你说”帮我订下周三的会议室并通知团队”,模型先口头确认,然后在后台调API完成任务,对话全程不中断。多步预订、异步函数调用都能编排。
生态铺货:从API到Workspace全覆盖
谷歌这次铺货很全面。开发者可以直接在Gemini API和Google AI Studio调用,Live API文档同步更新。Agora、LiveKit、Pipecat、LangChain、Vercel等七个实时媒体平台第一时间完成集成,开发者不用自己搭流媒体基础设施。
Salesforce、Genspark、Lumeris等企业客户已经接入,重点测试方向是客服语音智能体。
普通用户这边,Search Live已经上线实时故障排查:手机对着出问题的家电或汽车,边拍边问。Workspace的Docs Live、Gmail Live、Keep Live向订阅用户开放。AI Pro和Ultra订阅者在Docs里可用完整版Extended Thinking。
安全方面,所有合成音频都带SynthID不可感知水印,可被检测溯源。
对行业的三重冲击
呼叫中心成本模型重写。 35.1%的银行场景任务完成率已经接近可商用水位。对照业内此前的实测数据,AI语音客服单通电话成本能压到人工的十分之一以下。Sierra这类基准被谷歌直接点名,说明它就是冲着客服自动化来的。
语音交互从”命令式”转向”协作式”。 边思考边说话加后台任务执行,意味着语音智能体第一次具备了”职场同事”的沟通礼仪:接话、确认、汇报进度、不让你干等。
实时多模态成为基础能力。 视觉理解进入实时轨道后,”看图说话”升级为”看世界办事”。谷歌在博客里给出的方向叫”操作世界”级别的智能体,MHS架构的讨论也在升温。
对开发者,建议现在就在AI Studio里试Extended Thinking的语音编排能力,尤其是后台工具调用。这个能力的生产化门槛已经降到平台集成的程度,谁先把业务流程搬上去,谁就先吃到红利。
苏公网安备32010502011527号
发表回复