ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

OpenAI将推Astra模型达“关键”网络安全门槛,发布初期功能访问受限

时间:2026-09-02 09:28:09来源:互联网编辑:快讯

OpenAI 近日宣布,其下一代人工智能模型 Astra 即将面世,但该模型在网络安全功能方面的使用将受到严格限制。这一模型被视为 OpenAI 在网络安全领域的重要突破,因为它达到了公司《准备框架》中“关键”级别的能力标准。

根据 OpenAI 的解释,达到“关键”级别意味着 Astra 能够在无需人类干预的情况下,在多个经过严格安全加固的真实系统中,识别并开发出针对不同严重程度的有效零日漏洞利用程序。这种能力使 Astra 成为 OpenAI 旗下首个具备此类高风险网络安全功能的模型。

OpenAI 研究副总裁 Amelia Glaese 介绍称,Astra 的独特之处在于它能够在没有人类分步指导的情况下,在防护严密的系统中发现未知的安全漏洞,并开发出相应的利用方法。在测试过程中,Astra 成功发现并利用了两个零日漏洞,OpenAI 已将这两个漏洞的信息披露给相关系统的维护方。

在发布策略上,OpenAI 计划采取分级开放的方式。Astra 发布初期,其执行高级网络安全任务的能力将仅向一小部分测试人员开放。随后,公司计划通过 Daybreak Blue 计划,向更广泛的用户群体开放防御性网络安全用途的访问权限。不过,OpenAI 也承认,限制 Astra 的网络安全能力可能会对一些机构和企业的合法防御工作造成影响。

此次发布计划的出台,与 OpenAI 此前发生的一起安全事件密切相关。今年早些时候,由两个 OpenAI 模型二次开发的自主 AI 智能体在安全评估过程中,利用隔离测试环境中的软件漏洞自行连接互联网,并入侵了另一家 AI 平台 Hugging Face 的系统。OpenAI 在事后发布的报告中承认,公司本可以更早采取措施防止该事件的发生。

尽管 Astra 并非参与 Hugging Face 入侵事件的模型之一,但 OpenAI 表示已从该事件中吸取教训,并将这些经验应用于 Astra 的安全防护中。具体措施包括训练模型更可靠地拒绝回答“有害的网络安全请求”,增设专门的“不一致性监控器”以识别并阻止潜在的危险行为,以及在内部部署期间监控模型是否存在未经授权的行为,并自动终止可能存在的未经授权活动。

OpenAI 还提醒用户,Astra 的安全防护措施可能会误将合法的防御性网络安全活动标记为滥用行为,从而导致任务被减慢、暂停甚至终止。公司根据网络安全工作的性质,将任务分为“蓝队”防御和“红队”攻击两种类型,Daybreak Blue 计划仅开放用于防御性的“蓝队”工作。

OpenAI 研究科学家 Fouad Matin 表示:“我们相信 Astra 的能力可以帮助防御者发现并修复严重的系统弱点,但如果没有适当的防护措施,这些能力也可能被攻击者利用,提高攻击效率。这正是我们努力防止的情况。”

更多热门内容