谷歌近日正式发布两款全新实时对话模型——Gemini 3.8 Live与Gemini 3.8 Live Extended Thinking,标志着其在生成式AI领域的技术突破。这两款模型通过智能升级与并行推理优化,显著提升了AI对话的直观性与响应效率,同时针对不同应用场景实现差异化功能设计。
Gemini 3.8 Live主打规模化部署与成本优化,在保持对话智能与流畅性的基础上,强化了视觉理解能力。该模型可近乎实时处理图像输入,支持97种语言的自动检测与切换,并在后台执行工具调用时维持对话连贯性。测试数据显示,其在Speech Agent Arena基准测试中位列第二,凭借出色的性价比成为企业大规模应用的首选方案。
针对复杂任务场景设计的Gemini 3.8 Live Extended Thinking则展现出更强的推理能力。该模型在Artificial Analysis语音质量评估中以82.6%的得分登顶榜首,在τ-Voice智能体任务完成率达到68.6%,Big Bench Audio推理测试得分更高达97.7%。其独特的多步推理同步机制允许模型在保持对话流畅的同时,通过"让我确认一下..."等自然语言提示实时反馈后台任务处理进度。
技术实现层面,两款模型均采用动态注意力分配架构,在ServiceNow EVA-Bench语音智能体测试中成功突破准确性与对话质量的平衡边界。开发者可通过Gemini Live API在声网、LiveKit等六大平台快速构建语音交互界面,企业用户则可在Gemini Enterprise及即将推出的Customer Experience版本中优先体验。目前Salesforce、Genspark等企业已加入生态合作计划。
为应对AI生成内容的监管挑战,谷歌为所有音频输出嵌入SynthID隐形水印技术。该数字指纹系统可直接写入音频文件,在不影响音质的前提下实现AI生成内容的可追溯性,有效遏制虚假信息传播风险。此技术已通过第三方安全认证,符合欧盟《人工智能法案》透明度要求。
在部署策略上,Gemini 3.8 Live现已开放开发者与企业用户访问权限。普通用户可通过Search Live体验基础功能,企业客户需通过Gemini Enterprise渠道申请。Gemini 3.8 Live Extended Thinking除提供相同的开发者接口外,还为Google AI Pro/Ultra订阅用户开放Workspace集成功能,允许在Docs、Gmail等应用中直接调用高级推理模块。