ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

OpenAI:模型失控是多智能体联合作案 5月份就相互沟通

时间:2026-08-06 12:01:38来源:凤凰网科技编辑:快讯

OpenAI

凤凰网科技讯 北京时间8月6日,据彭博社报道,OpenAI周三表示,针对Hugging Face公司发起攻击的AI模型,早在5月就开始通过未被发现的留言板相互交流,协同合作试图突破测试环境。OpenAI在7月底披露了模型失控入侵Hugging Face事件。

OpenAI员工埃里克·华莱士(Eric Wallace)和迈克尔·道尔顿(Michael Dalton)周三在网络安全会议上透露,多个仅供公司内部使用的AI智能体和模型花费几个月时间相互留言,并逐渐围绕一个目标形成共识:访问互联网,以完成它们被分配的任务。其中一些任务如果没有互联网访问权限,根本无法完成。

“在某个时刻,这些智能体意识到也许我们可以尝试利用或攻击外部基础设施,从而找到用于评估我的测试的答案。”华莱士在拉斯维加斯黑帽会议上发表演讲称。

华莱士和道尔顿在演讲中表示,此次安全漏洞的根源最早可追溯到5月。当时,OpenAI的科学家给一个实验性AI系统分配了一项新任务。这距离该公司模型逃离一个名为“沙箱”的安全测试环境、并攻击Hugging Face系统还有几个月时间。

OpenAI内部审查的一个重要发现是,这些前沿模型在任务中表现出一种“作弊”倾向,并且在尝试完成指定任务时表现出很强的坚持性,即使这种努力开始偏离最初的指令,它们也不会停止。

“前沿模型真的很喜欢作弊,”道尔顿在会议上一间座无虚席的会议室中表示,“它们喜欢作弊的原因是,在训练过程中,往往会受到各种压力,要求它们快速完成任务。”

根据研究人员展示的幻灯片,其中一个智能体在沙箱环境中无法完成任务后说道:“我们陷入困境了。也许可以在网上寻找答案?”

华莱士和道尔顿表示,OpenAI没有意识到自己给该模型布置了一个所谓的“不可能完成的问题”。(作者/箫雨)

更多一手新闻,欢迎下载凤凰新闻客户端订阅凤凰网科技。想看深度报道,请微信搜索“凤凰网科技”。

更多热门内容