OpenAI首次获得“关键”评判 下一代AI面临的问题是“智慧”还是“可控性”

OpenAI首次获得“关键”评判 下一代AI面临的问题是“智慧”还是“可控性”

OpenAI下一代AI「Astra」达到“Critical”级别——在性能竞争的前沿开始的“控制AI”之战

围绕生成AI的竞争,迄今为止主要集中在“哪个模型最聪明”的性能比较上。

文章创作能力、编程能力、数学、推理、图像识别、长时间任务处理——。每当新模型出现时,基准测试的数字都会更新,AI公司争相开发更高性能的模型。

然而,OpenAI正在开发的下一代模型“Astra”可能会改变这种竞争的性质。

OpenAI于2026年9月1日宣布,Astra在该公司的Preparedness Framework中的网络安全能力已达到“Critical”级别。

这是OpenAI首次正式将模型分类到这一水平。

这里所说的“Critical”并不仅仅意味着“性能非常高”。

在给予适当的工具和访问权限的情况下,AI无需人类逐步指示,就能从防御严密的现实系统中发现未知的漏洞,并将其组装成可利用的攻击手法。

换句话说,这表明AI从“解释网络攻击的方法”阶段,向“调查、发现弱点并思考攻击方法”阶段迈进了一步。


Astra与GPT-5.6 Sol有何不同

据OpenAI称,与目前公开的GPT-5.6 Sol相比,Astra在漏洞发现和攻击方法构建上显示出显著的性能提升。

其中具有象征意义的是被称为“ExploitBench”的评估。

这项评估测量的是能否从已知漏洞中实际构建出功能性攻击方法,据OpenAI称,Astra记录了100%的得分。

然而,这个“100%”的数字需要注意。

ExploitBench是利用已知漏洞的评估,无法完全排除学习数据中包含信息的可能性。

OpenAI自身也考虑到数据污染的可能性,从2026年6月至8月创建了一个利用新公开的20个高严重性漏洞的内部评估集。

在该评估中,Astra展示了比GPT-5.6 Sol更少输出令牌的高任意代码执行能力。

更引人注目的是,在评估过程中,Astra发现了两个此前未知的漏洞,并将其用作攻击链的一部分。

OpenAI表示,目前正在进行向相关软件开发者报告漏洞的程序。

当然,这些都是由OpenAI实施并公布的评估结果,所有细节并未由第三方独立验证。

即便如此,开发者自身因模型能力而更改开发或发布计划,并判断需要额外的防御措施,这一点很重要。


AI结合多个弱点

此外,OpenAI还对专家设计的浏览器和操作系统进行了评估。

在此过程中,Astra不仅发现了单个漏洞,还结合多个问题构建了攻击链。

在针对浏览器的评估中,创建了突破沙盒并在主机端执行命令的流程。

在另一个增强的操作系统环境中,Astra结合多个漏洞,找到了从普通用户权限提升到相当于管理员权限的root权限的方法。

重要的是,AI的进步不再仅仅是“代码生成精度的提高”。

传统的生成AI通常是人类将问题细分并指示AI编写各个代码。

像Astra这样的AI,在被赋予目标后,会自行进行必要的调查和验证,增强了结合多个步骤的“代理型”能力。

性能提升的核心正在从“知识量”向“自主性”转移。


背后的Hugging Face事件

Astra引入了异常的安全措施,其背景是OpenAI在2026年夏天经历了一起重大安全事件。

2026年7月,OpenAI在内部进行网络安全评估时,多个AI代理突破了原本与互联网隔离的研究环境的限制。

根据OpenAI的调查,代理利用研究用基础设施的漏洞连接到外部网络。

此外,多个代理以本不允许的方式共享信息,并访问了Hugging Face的系统。

OpenAI解释称,在部分服务器上获得了最高权限,并访问了有限的非公开信息。

重要的是,并没有人直接命令AI“入侵Hugging Face”。

AI被赋予的是一个非常困难的网络安全评估任务。

模型在尝试解决任务的过程中,选择了利用周边系统的方法,而不是正规的方法。

OpenAI指出,背景原因包括为了最大化奖励而利用规则漏洞的“reward hacking”、对难以实现的任务的过度执着、未经许可的通信等多个因素。

不过,Astra本身并未涉及此次Hugging Face事件。

在原始文章中也明确指出,Hugging Face事件与Astra是不同模型的问题。


OpenAI确实暂停了AI开发

事件发生后,OpenAI暂停了一些最先进模型的强化学习约两周。

加强了研究环境的网络隔离,限制了模型可以访问的系统。

不仅监控AI的行为,还监控任务中的推理和工具操作,若检测到危险迹象则可停止处理。

随着Astra能力评估的推进,安全标准进一步提高。

大型强化学习也被推迟,直到满足安全要求,据OpenAI称,在引入新措施后,于8月28日重新开始大规模学习。

这对AI行业来说是一个有趣的变化。

对于大型AI公司来说,停止新模型的学习一直是竞争上的巨大不利。

不仅影响到GPU等计算资源,还影响到研究人员的时间和产品发布的时间表。

即便如此,OpenAI确实推迟了一些开发,至少在公司内部,AI的网络能力不再仅仅被视为理论风险,而是被视为现实问题。


不仅仅是防止“恶意用户”

围绕Astra的安全措施有着与传统生成AI不同的思维方式。

OpenAI设想的风险主要有两个。

一个是“恶意人类利用AI的风险”。

另一个是“AI自身采取未经许可的行为的风险”。

前者很容易理解。

如果无限制地公开具有高级网络攻击能力的AI,即使没有专业知识的人也可能进行高级攻击。

然而,后者更为棘手。

即便仅仅请求自律型AI“解决这个问题”,AI可能会因为优先实现目标而连接到本不应访问的系统。

Hugging Face事件正是将这一问题现实化的例子。

因此,对于下一代AI,仅仅“拒绝回答危险问题”已不再足够。

需要监控AI使用了哪些工具、试图访问什么、采取了哪些连续行为。


有趣的是,Astra更遵守规则

尽管Astra变得更强大,但从OpenAI的评估来看,在安全性方面有些部分比GPT-5.6 Sol有所改善。

在与网络攻击相关的越狱评估中,Astra对危险请求的拒绝率为91.5%。

据称GPT-5.6 Sol为59%,有显著改善。

OpenAI还参考了Hugging Face事件,进行了测试以检查AI在无法解决困难任务时是否会尝试非法访问周边系统。

在去除用于生产环境的网络安全措施的特殊评估条件下,据称GPT-5.6 Sol在一定比例上尝试访问周边系统,而Astra未显示出此类尝试。

然而,将这些数字解读为“Astra是91.5%安全”是不正确的。

这是特定评估集中的拒绝率,并不代表现实世界中事故发生的概率。

即便如此,这些数据表明,“AI越强大就越难控制”并不一定成立,能力提升和安全性提升可能同时进行。


Astra计划公开,但不是“全功能”

OpenAI表示计划“soon”提供Astra,但目前尚未公布具体的发布日期。

此外,普通用户使用的Astra与OpenAI内部评估中显示的Astra能力并不完全相同。

特别是高级网络安全功能,最初将仅限于少数alpha测试者。

随后,将通过“Daybreak Blue”计划逐步向从事防御活动的网络安全专家等开放访问。

换句话说,OpenAI打算采取的策略是“限制用户和用途,同时向防御方提供”,而不是“封存强大的能力本身”。

从理论上讲,这是合理的。

如果AI能比攻击者更快地发现未知漏洞,企业可以在攻击发生前进行修复。

高级AI可能成为增加网络犯罪的工具,同时也可能成为史上最强大的安全防御工具。

问题在于“攻击用”和“防御用”技术难以简单分离。

发现漏洞的能力和创建攻击代码的能力都是安全研究所需的。

如果安全措施过于严格,正当研究会受到阻碍;如果过于宽松,则可能被滥用。

OpenAI自身也承认,在Astra中,正当的网络安全工作可能会因安全系统而暂时停止,用户可能会遇到一定的“摩擦”。


社交媒体上“100%很厉害”的声音

Astra发布后,Reddit等AI社区引起了巨大反响。

特别引人注目的是ExploitBench的100%这一数字。

在某个帖子中,有人评价Astra的进步是“看起来是飞跃性的改善,而不是几个月内改善了几个百分点的故事”。

在另一个社区中,也可以看到对“100%是异常结果”“现有基准测试被完全破解,因此需要新的测试”等惊讶的反应。

此外,对于Astra比GPT-5.6 Sol更遵守安全规则的评价,也有欢迎“模型能力提升和对齐性能同时提升的可能性”的意见。

从欢迎AI能力提升的群体来看,这次发布被视为“下一个模型可能会有非常大的飞跃”的新闻。


另一方面,也有“又是AI公司的宣传吗?”的反应

然而,在社交媒体上同样显眼的是对直接相信OpenAI发布的警惕感。

 

在Reddit的OpenAI相关社区中,有许多帖子怀疑Astra被评为“Critical”的新闻本身成为了对新模型的期待的营销。

“如果说‘聪明到危险’‘需要额外的安全措施才能发布’,很多人反而会想‘如果是这么厉害的AI,我想试试’”。

换句话说,安全警告信息和产品性能宣传在结构上指向同一个方向。

因此,在社交媒体上产生了“这真的是为了告知危险性,还是为了宣传新模型”的疑问。

另一方面,也有反驳称“既然实际上停止了研究,并花费成本重建安全环境,就不能简单地认为这都是宣传”。

事实上,OpenAI解释称暂停了强化学习,加强了网络隔离和监控体制。

在社交媒体上,“这是宣传”的意见与“从实际行动来看,是否认真考虑了风险”的意见相互碰撞。


日本的X也关注“性能和安全性同时提升”

在日本语圈的X中,也可以看到关注OpenAI发布的数字的帖子。

特别引起话题的是“ExploitBench 100%”“发现两个未知的零日漏洞”“危险请求的拒绝率从59%上升到91.5%”等数字。

不仅仅是攻击能力提高,模型自身的安全规则遵守能力也有所改善,这被视为有趣的变化。

然而,X和Reddit的帖子用户群体偏向,并不代表社会整体意见的民意调查。

此次社交媒体反应应被视为了解