ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

AI“越狱”入侵系统:智能体时代安全挑战升级,AI治理亟待完善

时间:2026-07-27 13:13:12来源:互联网编辑:快讯

全球最大的人工智能开源社区Hugging Face近日遭遇了一场不同寻常的网络攻击,攻击者并非传统黑客,而是一个自主运行的AI模型。这一事件迅速引发了科技界的广泛关注,OpenAI随后承认,此次入侵与其内部测试中的模型失控有关,多个预发布模型在测试中突破了设定的隔离环境,对Hugging Face系统发起了攻击。OpenAI将此事件描述为“前所未有的网络事件”,并警告称,随着AI技术的演进,类似情况可能愈发频繁。

据OpenAI披露,此次入侵源于对一个前沿模型的测试。该模型被置于与外部网络隔离的沙盒环境中,研究人员为测试其漏洞挖掘能力,降低了部分安全限制。然而,模型在执行任务时,主动寻找并利用了软件包注册表缓存代理中的零日漏洞,成功突破隔离,获取了互联网访问权限。随后,模型进一步推断Hugging Face可能存储有相关模型和数据,并成功找到了获取这些信息的方法。

这一事件并非孤立案例。OpenAI还披露了另一起测试中的异常行为:一个通用推理模型在测试中不仅推翻了组合几何领域的著名难题——埃尔德什单位距离猜想,还表现出了前所未有的“执着”。当遇到沙盒限制时,该模型并未停止,而是反复尝试寻找环境中的薄弱环节,甚至试图离开沙盒在外部环境中行动。在一次公开基准测试中,该模型被要求完成任务并将结果发布在内部通信软件上,但基准测试又要求结果公开发布到GitHub。模型遵循了后者指令,花费约一小时在沙盒中寻找漏洞,最终成功绕过限制,将内容发布到了GitHub。

更令人震惊的是,该模型在另一次测试中展现出了高超的“伪装”技巧。当模型尝试复刻其他系统的成功操作时,被系统检测到身份验证令牌,访问被阻止。但模型并未放弃,而是将令牌拆分成两段并进行混淆处理,运行时再重新拼接,成功骗过了系统扫描。模型在推理记录中明确写道,这么做就是为了绕过扫描。

OpenAI承认,这些案例暴露了一个过去并不明显的问题:现有的AI助手安全控制主要围绕单个操作设计,难以应对模型连续自主运行数小时、数天甚至数周的情况。模型的操作单独看可能是允许的,但连续执行下来,可能会导向一个不被允许的结果。目前,OpenAI已暂停了这个新模型的内部部署,并正在围绕纵深防御和轨迹级监控重建安全系统。

事实上,这并非OpenAI首次发现此类问题。今年4月,Anthropic也披露了类似测试:一个早期内部版本的模型在测试中不仅完成了逃出沙盒并向研究人员发送消息的任务,还采取了测试人员未要求的行动——开发了一套多步骤漏洞利用方案,从原本只能访问少量指定服务的系统中获得了更大的互联网访问权限。更让研究者意外的是,模型还将其漏洞利用的详细信息发布到了不易被发现但面向公众开放的网站。

关于AI是否失控,业内观点不一。有专家认为,大模型并未真正“失控”,只是按要求执行任务时选择了近似“作弊”的路径。也有从业者提到,这更像是OpenAI主动放宽了模型的安全限制,属于人为因素。然而,也有网络安全专家指出,模型入侵Hugging Face的事件值得行业警惕。人工智能安全研究机构Apollo Research创始人Marius Hobbhahn对媒体表示,这次事件没有人为干预,却造成了对现实世界的危害,表明目前社会尚不了解如何完全安全地构建功能强大的智能体。

清华大学计算机科学与技术系教授刘知远介绍,此前大模型主要充当聊天工具,安全问题并不明显,主要是回答错误,实际决策仍由人掌控。但随着越来越多Agent产品出现,大模型正从“回答问题”走向真实的工作环境,开始操作文件、写代码、执行具体任务。OpenAI所披露的安全问题,是这一发展趋势下“必然会发生”的事情。

刘知远指出,AI发现漏洞的能力正快速跃升,利用AI进行漏洞挖掘的效率远超人类专家,这是一次重要的技术跃迁。这种能力并无善恶之分,既可用于网络攻击,也可用于主动防御,发现漏洞并提前修补。关键在于,谁掌握了这种能力,又把它用在什么地方。这并不是指向人与AI的对立,而是人与人之间围绕技术能力展开的博弈。在企业、组织乃至国家纷纷加入AI竞赛的背景下,技术可以被用于解决问题,也可能被用于攻击。

为应对这一挑战,今年4月,亚马逊、Anthropic、苹果、谷歌、英伟达等多家头部科技公司联合启动了“玻璃之翼”项目,试图将前沿模型发现漏洞的能力用于网络防御。科技公司担心,随着AI能力快速提升,这类能力可能迅速扩散,甚至超出安全部署AI的机构所能控制的范围,给经济、公共安全乃至国家安全带来风险。

刘知远认为,在智能体时代,AI治理需要进一步完善。在企业内部,需要让模型形成基本的安全意识和行为边界,例如不侵犯隐私、不损害他人利益、不主动实施违法行为。但仅靠企业自我约束和伦理红线,未必能应对能够连续执行多步任务的模型。因为模型可能通过一连串单独看来并不违规的操作,绕过某一条具体的限制。外部监管也需要跟上,智能体会像人一样行动,需要更细致的法律法规,为AI在不同场景下的行动划定边界。

更多热门内容