OpenAI 近日宣布对 ChatGPT 桌面应用进行重大升级,引入语音交互功能 ChatGPT Voice,用户现在可以通过语音指令直接与 AI 智能体对话,并控制其在电脑上完成多样化任务。这一更新基于该公司本月早些时候发布的全新语音模型系列 ChatGPT-Live,标志着人机交互方式向更自然的方向迈进。
据介绍,ChatGPT Voice 不仅支持常规对话,还能深度整合 ChatGPT Work 和 Codex 功能。在 macOS 系统中,借助 Appshots 技术,用户可授权 AI 访问屏幕内容,包括图片替代文本等非结构化信息,从而提升任务处理的精准度。例如,开发者可通过语音指令让 AI 创建代码线程、提交代码合并请求,甚至定位程序漏洞根源,相关操作在官方演示视频中已得到验证。
与初期手机版侧重流畅对话体验不同,此次桌面版强化了执行复杂任务的能力。用户可下达包含多步骤的指令链,AI 在需要用户确认或补充信息时会自动暂停并等待反馈,形成闭环交互流程。iOS 用户可通过远程访问功能,在 Codex 环境中调用语音交互模块,实现跨设备协作。
竞争领域同样出现新动态。Anthropic 同步更新了 Claude 的语音模式,该功能可调用 Opus、Sonnet 和 Haiku 三种模型,支持在 Gmail、Slack 等主流应用中完成邮件撰写、日程安排等操作。其技术路径与 OpenAI 形成差异化竞争,双方均在探索语音交互与生产力工具的结合边界。
行业观察人士指出,语音控制功能的普及将重塑 AI 工具的使用场景。从代码编写到日常办公,语音指令的引入不仅降低了技术门槛,更通过自然交互方式拓展了 AI 的应用边界。随着底层模型持续优化,未来或出现更多支持多模态交互的智能体,推动人机协作进入新阶段。
