谷歌近日正式发布两款全新实时对话模型——Gemini 3.8 Live与Gemini 3.8 Live Extended Thinking,标志着其在生成式AI领域的技术突破。这两款模型分别针对不同应用场景优化,在智能交互、多语言处理及复杂任务推理能力上实现显著提升,为开发者与企业用户提供更高效的工具支持。
Gemini 3.8 Live主打规模化部署与成本效益,支持近实时视觉输入处理,可在对话中自动识别并切换97种语言,同时保持后台工具调用与API交互的流畅性。该模型在Speech Agent Arena基准测试中位列第二,凭借其出色的性价比成为大规模语音交互场景的理想选择。开发者可通过Gemini Live API在声网、LiveKit等平台快速构建语音驱动界面,企业用户则可在Gemini Enterprise及即将上线的Customer Experience版本中优先体验。
面向高复杂度任务场景的Gemini 3.8 Live Extended Thinking则展现了更强的推理能力。该模型在Artificial Analysis语音质量指数中以82.6%的得分登顶,在τ-Voice智能体任务完成率达68.6%,Big Bench Audio推理测试中更取得97.7%的优异成绩。其独特的多步推理同步技术允许模型在保持对话连贯性的同时,通过"让我确认一下..."等自然语言提示实时反馈后台任务进度,显著提升复杂工作流的处理效率。
技术架构方面,两款模型均采用动态注意力机制与并行推理引擎,在ServiceNow EVA-Bench测试中成功突破准确性与对话质量的平衡瓶颈,推动语音智能体性能进入新阶段。谷歌特别强调,所有AI生成音频均嵌入SynthID隐形水印技术,通过音频信号层面的数字标记实现内容溯源,有效防范虚假信息传播风险。
在生态合作层面,谷歌已与Salesforce、Genspark等企业建立战略伙伴关系,共同推进模型在医疗、金融等垂直领域的应用。开发者社区将获得Google AI Studio的完整工具链支持,企业客户则可通过Gemini Enterprise套件获取定制化解决方案。普通用户现已可通过Search Live体验基础功能,Google AI Pro/Ultra订阅者更可在Workspace套件的Docs、Gmail等应用中解锁高级语音交互特性。
目前两款模型均已启动全球推送。Gemini 3.8 Live开放渠道包括Gemini API、Google AI Studio及企业版平台;Extended Thinking版本除上述渠道外,还将通过Google Workspace向企业客户开放,并逐步覆盖Gmail、Keep等生产力工具。这种分层部署策略既满足开发者对技术前沿的探索需求,也兼顾了企业用户对稳定性的严格要求。