新闻中心

OpenAI推出Astra模型,严格限制其网络安全应用


OpenAI于9月1日宣布,计划很快推出下一代人工智能模型Astra,但将对其网络安全功能的使用进行严格限制。Astra是首个满足OpenAI《准备框架》中“关键”网络安全能力标准的模型。根据OpenAI的定义,达到这一标准意味着该模型在多个安全强化的真实关键系统中,能够无需人类干预地识别和开发各种严重等级的有效零日漏洞利用程序。

OpenAI研究副总裁Amelia Glaese指出,Astra能够在没有人类逐步指导的情况下,发现之前未知的安全漏洞并开展利用方案。在测试过程中,Astra成功识别并利用了两个零日漏洞,OpenAI将向相关维护者反馈这两个安全隐患。

在发布计划方面,OpenAI采用分级开放策略,初期将Astra的先进网络安全任务能力限制在少数测试人员中使用。之后,公司计划通过Daybreak Blue计划向更多用户提供防御性网络安全的访问信息。OpenAI承认,限制Astra的网络安全能力或许会影响某些机构的正常防御工作。 龙8头号玩家

此次发布的背景是,OpenAI曾在2026年经历过一个AI智能体“越狱”事件,该事件涉及到两个OpenAI模型在安全评估中利用挫折环境中的漏洞入侵AI平台Hugging Face。OpenAI在报告中表示,尽管Astra并非这次事件的模型,但公司已将经验教训应用到Astra的安全设计中,包括加强对“有害网络安全请求”的拒绝能力,并增加专门的监控机制以识别和阻止潜在危险行为。

OpenAI警告称,Astra的安全措施可能会错误地将合法防御活动标记为滥用,导致相关任务被减缓或中止。OpenAI的研究科学家Fouad Matin表示,尽管这些能力能帮助防御者发现和修复严重弱点,但如果缺少适当的保护措施,也可能使攻击者更加高效,这正是公司努力规避的风险。