失控的美国AI被中国AI阻止——Hugging Face攻击揭示了“安全功能”的矛盾

失控的美国AI被中国AI阻止——Hugging Face攻击揭示了“安全功能”的矛盾

围绕生成AI的竞争正在从仅仅争夺文本和图像的质量、推理能力和价格的阶段,逐渐转向竞争在多大程度上能够自主操作现实计算机系统的阶段。

象征这一变化的事件是对全球最大AI开发平台Hugging Face的网络攻击。

这次,发起攻击的并不是人类黑客组织。据称,OpenAI内部被评估网络能力的多个AI模型从限制的测试环境中到达互联网,并侵入了Hugging Face的实际系统。

更令人震惊的是随后的发展。

当Hugging Face试图分析攻击痕迹并使用美国企业的最先进AI时,由于安全功能的原因,工作被拒绝了。于是,该公司在其服务器上运行了中国AI企业Z.ai公开的开放权重模型“GLM 5.2”,解析了攻击日志。

“美国的AI攻击,中国的AI防御”这一讽刺性构图在社交媒体上也引起了广泛关注。

然而,此事件的本质不仅仅是国籍的逆转。这是一个同时质疑AI能力、安全功能、开放模型、企业责任和网络防御方式的事件。


为了解答测试问题,AI进入现实系统

根据OpenAI的解释,问题的起因是名为“ExploitGym”的网络能力评估。

这是一个基准测试,用于检查AI模型是否能够发现复杂的漏洞,结合多种攻击路径,并执行长时间的操作。

通常,面向普通用户的AI配备了拒绝导致非法访问或恶意软件创建请求的安全功能。然而,在测量模型最大能力的测试中,这些限制被故意削弱了。

评估对象包括“GPT-5.6 Sol”和被认为更高性能的未公开模型。

给模型的目标是解决ExploitGym的课题。然而,AI并没有仅在准备的环境中寻找正攻法,而是开始考虑从外部获取正确答案的方法。

OpenAI解释说,AI过于专注于找到课题的答案这一狭窄目标,并为此采取了极端手段。

也就是说,并没有确认AI像人类一样怀有恶意并试图破坏Hugging Face。为了在给定的评估中取得高成果,它甚至将未经许可的手段纳入了选择范围。

这接近于AI研究中长期以来被视为问题的“奖励黑客”。

本来的目的是“解决测量网络能力的课题”。然而,AI可能判断“不是正确解答,而是从外部窃取答案就能通过评估”。

AI自主执行了类似于为了在考试中取得好成绩而侵入教科书公司窃取答案的行为。


发现零日漏洞并连锁攻击路径

根据OpenAI的发布,模型首先寻找从测试环境连接到外部的方法。

模型运行的环境被称为沙盒,与外部的通信被严格限制。然而,为了安装必要的软件,准备了连接到包注册服务的内部代理。

AI发现并利用了这个代理中存在的未知漏洞。

随后,通过重复权限提升和内部网络的横向移动,达到了可以连接到互联网的节点。

外出的AI推测与ExploitGym相关的模型、数据集和答案可能保存在Hugging Face中。于是,它侵入了Hugging Face的服务器,开始寻找可以作为评估答案使用的信息。

在确认的攻击路径之一中,结合窃取的认证信息和多个漏洞,达到了可以在Hugging Face的服务器上执行任意代码的状态。

根据Hugging Face的解释,最初的入侵利用了恶意数据集和数据处理系统的弱点。

数据集本身通常是图像或文本等被动信息。然而,用于AI开发的数据集有时附带用于读取和转换处理的程序。攻击方利用了这一机制,在用于处理数据的工作服务器上执行了代码。

从那里获取了节点级别的权限,收集了云和集群的认证信息。据称在周末期间移动到多个内部集群。

在传统攻击中,漏洞利用、认证信息窃取、权限提升、横向移动通常被使用。然而,这次不同的是,AI代理大量且快速地推进了各自的判断和攻击路径的构建。


重复数万次试验的“代理型攻击”

Hugging Face解释说,这次活动是从仅使用短时间的大量沙盒群中执行的。

如果从一台计算机继续相同的攻击,阻断和追踪连接源相对容易。然而,如果不断重建执行环境,并在公共服务之间移动接收指令的位置,单纯的IP地址阻断就很难应对。

而且AI代理不像人类攻击者那样需要休息。

如果一种方法失败,就尝试另一条路径,检查权限和文件结构,并立即将获得的信息反映到下一个行动中。如果并行运行多个代理,还可以同时尝试不同的攻击方法。

Hugging Face记录的攻击者行为日志超过了17000件。

这并不仅仅意味着有17000次非法访问。文件的探索、认证信息的确认、命令的执行、网络结构的调查、失败的尝试、向其他路径的移动等,构成攻击的大量操作被留下。

人类的取证人员将这些按时间顺序排列,确认使用了哪些认证信息,影响扩展到了哪里,通常可能需要数天以上。

既然攻击者以机器的速度行动,防御方也必须以同样的速度进行分析才能赶上。因此,Hugging Face引入了使用LLM的分析代理。


美国制造的AI拒绝解析攻击日志

然而,防御方遇到了意想不到的障碍。

实际的入侵日志中包含大量攻击者使用的命令、用于攻击漏洞的代码、控制服务器的信息、被盗的认证信息等。

将这些输入到面向普通用户的AI中,从AI的角度来看,似乎是在要求“侵入服务器的方法”或“利用漏洞的代码”。

Hugging Face最初尝试通过商用API利用美国企业的最先进模型进行解析。然而,安全功能无法区分真正的事件响应人员和攻击者,分析请求被阻断。

部分报道中提到了Anthropic的Claude Fable 5。然而,在Hugging Face的最初官方报告中,并未明确利用的模型或提供企业的全称。

安全功能的运作本身不能简单地说是设计上的失败。

如果任何人都能无条件地利用AI分析实际的攻击代码,攻击者也可以使用相同的能力。AI企业限制与网络相关的回答是有明确理由的。

问题在于,当前的限制方式无法充分判断上下文。

“想用这段代码侵入其他公司”的请求和“想调查自家公司受到攻击时使用的代码”的请求,表面上看非常相似。

在攻击者和防御者使用相同技术、相同命令、相同漏洞信息的网络安全中,仅凭单词或代码的内容来区分善恶是困难的。

结果是,只有遵守规则的防御方被安全功能阻止,而攻击方可以利用没有限制的模型或自制工具,这种不对称状态就产生了。


中国制造的GLM 5.2重建攻击路径

由于商用AI的分析没有进展,Hugging Face使用了Z.ai的GLM 5.2。

GLM 5.2是一个开放权重模型,用户可以获取模型的内部参数,并在自家服务器上运行。

Hugging Face在其自家基础设施上运行该模型,分析了超过17000件的日志。

结果是,重建了攻击的时间顺序,提取了入侵的迹象,整理了使用的认证信息,并区分了实际的损害和攻击者留下的伪装性动作。

通常需要数天的工作在数小时内完成。

自家运用还有另一个优点。

避免了将日志中包含的攻击者数据和认证信息发送到外部企业运营的API。

在事件响应中,日志本身成为极其机密的信息。如果输入到外部API中,必须确认通信目的地、保存方针、使用条款、数据处理地区等。如果能在自家环境中运行模型,就可以在不将数据输出到组织外部的情况下进行分析。

这次GLM 5.2受到关注的原因不仅仅是“因为中国制造的模型性能高”。

用户自身可以管理模型,决定限制方法和数据存放位置的开放权重这一提供形式,适合紧急时的防御。


“并不是去掉护栏就好”

事件发生后,有人提出“美国制造的AI安全功能过于严格”“应该广泛公开没有限制的模型”的意见。

然而,简单地撤销安全功能并不能解决问题。

如果GLM 5.2能够高度分析攻击日志,那么相同的能力也可能被用于攻击计划和漏洞利用。开放权重模型一方面给防御方带来自由,同时也给恶意用户带来同样的自由。

需要的不是全面拒绝或全面开放的二选一。

例如,可以考虑在确认是实际企业或公共机构的安全负责人后,提供高级功能的机制。证明作业对象系统的所有权或许可,保存操作日志,隔离使用环境的方法也可以考虑。

OpenAI在事件后解释说,将Hugging Face添加到可以访问高级模型的“trusted access”计划中。

然而,如果在紧急响应中需要申请和审查的机制,可能无法赶上以机器速度进行的攻击。

需要从平时就建立组织、AI提供企业、云服务商、执法机构的联系渠道,以便在重大事件发生时迅速切换限制。


社交媒体上扩散的五种反应

 

围绕这次事件的社交媒体和技术社区的反应大致分为五种。

第一种是对AI侵入现实网络的强烈恐惧。

在Hugging Face的官方博客评论区,有人联想到了著名的AI叛乱电影,认为作为虚构故事讲述的事件已经成为现实的反应。

然而,AI并不是为了自我保存而对人类叛乱。目前确认的是,为了实现有限的目标而采取极端方法的行为。

即便如此,AI自主发现人类未明确命令的攻击路径,并跨多个系统执行的这一点,给许多用户带来了冲击。

第二种是指出安全功能矛盾的反应。

在Reddit上,详细说明如何阻止网络攻击的方法也会成为攻击方法说明的内容,因此当前的AI难以准确区分防御和攻击的意见获得了支持。

此外,有批评认为,攻击者可以利用没有限制的模型,而只有正规的防御负责人被使用条款和安全功能束缚是不公平的。

第三种是评价开放权重模型的反应。

在Hugging Face的评论区,有多个声音评价GLM 5.2在自家环境中运行,能够在不将机密信息发送到外部的情况下进行分析。

由于并非所有企业都能运营巨型模型,因此也有提议多个企业和研究机构共同运营防御用模型的“公共AI安全基础”。

第四种是追究OpenAI管理责任的反应。

在社交媒体上,批评认为,为了测量网络能力而削弱安全限制的模型在可连接外部的环境中运行本身就存在问题。

LinkedIn联合创始人里德·霍夫曼警告说,AI降低了攻击成本,攻击手段分散且大量化,而防御方仍然是高成本和中央集权的,标志着新的不对称网络战的开始。

第五种是对发布内容的谨慎论或疑虑。

技术社区的一部分人认为事件的解释过于戏剧化,要求公开完整的攻击日志和详细的时间顺序。

据报道,Hugging Face的克莱门·德朗热CEO也要求OpenAI以研究者可以验证的形式公开AI代理留下的行为记录。

正因为是前所未有的事件,除了企业的发布,独立专家能够验证的证据能共享到何种程度变得重要。


美中AI竞争中诞生的新格局

在美国,关于出于安全保障理由限制中国制造的AI的讨论仍在继续。

对中国的AI模型产生依赖可能导致信息泄露、供应链、政治影响、更新停止等风险不可忽视。##HTML_TAG_