OpenAI 近日宣布完成 ChatGPT 桌面应用的重大升级,正式引入语音交互功能 ChatGPT Voice。用户现在可通过自然语言指令与 AI 智能体直接对话,并授权其在计算机上执行多步骤任务。这项更新基于本月早些时候发布的全新语音模型系列 ChatGPT-Live,标志着人机交互方式向更自然的语音操作迈进。
新功能支持跨平台协同工作,在 macOS 系统上,用户可通过 Appshots 技术授权 ChatGPT 访问屏幕内容,包括获取替代文本信息。该功能同时兼容 ChatGPT Work 和 Codex 两大工作场景,开发者已演示通过语音指令完成代码线程创建、提交合并请求(Pull Request)以及精准定位程序漏洞等复杂操作。当 AI 需要用户确认或补充信息时,系统会主动发起交互对话。
相较于手机版侧重优化语音对话流畅度的初期设计,桌面版更突出任务执行能力。用户可下达包含多个操作环节的复合指令,例如同时要求 AI 打开特定网页、填写表单并提交数据。iOS 用户还可通过远程访问功能,在 Codex 环境中调用语音交互模块。
在竞争领域,Anthropic 同步更新了 Claude 的语音模式。该系统整合了 Opus、Sonnet 和 Haiku 三种模型,支持在 Gmail、Slack 等主流生产力工具中完成邮件撰写、日程安排等操作。与 OpenAI 的技术路径类似,Anthropic 的解决方案也强调多应用场景下的任务自动化能力。
语音交互的进化正在重塑数字工作流。开发团队透露,后续更新将优化多语言支持,并增强对专业领域术语的识别精度。随着两大AI实验室在语音交互领域的持续投入,自然语言控制计算机操作的技术标准正在加速形成。