据IT之家9月16日报道,当地时间9月15日,谷歌正式发布Gemini 3.8 Live与Gemini 3.8 Live Extended Thinking两款模型。谷歌表示,这是其目前最先进的实时对话模型,在智能水平与并行推理能力上实现了重大提升,旨在让AI对话更加直观和智能。
这两款新产品分别是面向大规模部署与成本优化的 Gemini 3.8 Live,以及针对高复杂度任务、强化多步推理能力的 Gemini 3.8 Live Extended Thinking。
Gemini 3.8 Live 强调对话智能、流畅交互和视觉理解,注重规模化部署与成本效率。而Gemini 3.8 Live Extended Thinking 则专注于高复杂度任务,具备更强的智能水平和多步推理能力。
Gemini 3.8 Live Extended Thinking 在多项基准测试中表现优异,在Artificial Analysis语音对语音质量指数总排名中位居第一(得分为82.6%),在τ-Voice智能体任务中完成率达68.6%,在Sierra的τ-Voice-banking基准测试中得分为35.1%;推理方面,其在Big Bench Audio上获得97.7%的分数,同时仍保持了具有竞争力的定价。
Gemini 3.8 Live 则获得了用户的高度认可,在Speech Agent Arena中排名第二,并具备出色的成本效益,适合大规模部署。两款模型在ServiceNow EVA-Bench语音智能体基准测试中,成功在准确性与对话质量之间取得平衡,推动了复杂工作流的帕累托前沿。
Gemini 3.8 Live 能够近实时地处理视觉输入,在对话中自动检测并切换97种支持的语言,同时可在后台执行工具与API调用,且保持对话流畅不中断。
针对需要深度推理的任务,Gemini 3.8 Live Extended Thinking 实现了推理与发言同步进行,在不打断对话流畅度的前提下提升复杂工作流的智能水平。它通过“让我确认一下…”这类早期语言提示进行自然回应,并能实时讲解多步后台任务的处理进度。
开发者可以通过Gemini Live API,在声网、Fishjam、LiveKit、Pipecat、Vercel、Vision Agents等平台上轻松构建并部署高性能语音驱动界面。此外,谷歌还与Salesforce、Genspark、Lumeris等企业展开合作,共同推动生态系统建设。
谷歌为所有AI生成的音频添加了SynthID隐形水印,该水印直接嵌入音频输出,可用于检测AI生成内容,帮助防止虚假信息传播。
目前,Gemini 3.8 Live 已开始推送:开发者可在Gemini API和Google AI Studio中使用;企业用户可在Gemini Enterprise中抢先体验,即将登陆Gemini Enterprise for Customer Experience;所有用户可在Search Live中体验。
Gemini 3.8 Live Extended Thinking 也已开启推送:开发者可在Gemini API和Google AI Studio中使用;企业用户可在Gemini Enterprise中抢先体验,即将登陆Gemini Enterprise for Customer Experience及Google Workspace企业客户;普通用户可在Gemini Live中体验,Google AI Pro和Ultra订阅者可在Google Workspace的Docs中使用,所有Google AI订阅者可在Gmail和Keep中体验。