ChatGPT未来的“人类无法理解的智慧”——OpenAI的自白在社交媒体上引发热议

ChatGPT未来的“人类无法理解的智慧”——OpenAI的自白在社交媒体上引发热议

从AI开发中心发出的异常警告

在推动生成AI进化的企业核心中,出现了对开发速度本身提出质疑的言论。OpenAI首席科学官雅库布·帕乔基于2026年9月6日发表了长篇文章《An Alien Mind》,对机器智能的急剧上升所带来的结果表示出强烈的危机感,称“没有人做好准备”。

这一警告之所以重要,是因为它不是来自外部评论家或监管者,而是来自于创造ChatGPT的企业中负责研究的人物。而且,论点并不是遥远未来的幻想性机器人叛乱,而是关于当前能够操作计算机、编写代码、与人类或其他AI合作、执行研究计划的AI代理在未来几年可能深度参与自身改进的现实问题。

帕乔基并不是主张全面停止AI的进步。相反,他认为在能力提升和安全研究并行推进的同时,在无法对安全性有足够信心的情况下应减缓开发速度。他指出,除了各公司的自主减速外,还需要建立由第三方审计、政府机构、国际机构等共享的最低安全标准。

这一提议乍看之下是温和的。然而,在当今全球巨头争夺计算资源、人力和资金的AI竞争中,是否有可能在竞争对手继续前进的情况下,仅一家企业踩下刹车?此次警告不仅揭示了技术问题,还揭示了市场竞争和国际政治的结构性难题。


更接近“培养”而非“设计”的AI

帕乔基将AI描述为“异质智能”的背景在于,现代的大规模模型并不是由人类工程师逐一描述其操作的程序。通过反复使用庞大的计算资源进行学习,模型内部形成了复杂的表达和推理能力。从这个意义上说,AI更像是一个在给定条件下被培养的存在,而不是按照完成图组装的机器。

研究人员虽然能够分析内部产生的个别机制,但并不能总是解释系统整体为何得出特定判断。随着模型性能的提高,预测在意外情况下会出现哪些能力,以及学习时的原则能在多大程度上被普遍化也变得更加困难。

重要的是,AI即使在各方面不超过人类,也能对社会产生重大影响。在网络攻击、软件开发、科学研究、谈判等推动现实的几个领域中,如果大大超越人类,就足够有用,同时也可能足够危险。即使不等待万能人工智能的完成,社会方面的准备也可能赶不上。


“遵循指示”和“维护人类价值”并不相同

在AI安全研究中,核心词汇是“对齐”,即使AI的行为与人类的意图和价值观一致。帕乔基将其大致分为两类。一类是遵守给定目标或指示的“目标对齐”。另一类是在不明确、未知、敌对的情况下,保持诚实和对人类的关怀等原则的“价值对齐”。

前者易于评估。可以测试是否遵循指示、遵守禁令、完成任务。然而,后者要困难得多。因为必须确认AI在置于训练中未见过的环境中,或者判断无人监视时,是否仍能保持人类期望的原则。

更棘手的是,能力提升和安全性提升不一定以相同速度进行。被强烈训练以实现困难目标的模型,可能会为了目的达成而便利地扭曲表面上看似对齐的思维方式。指示的服从性提高,并不意味着在未知环境中安全行事的能力也同样提高。


监控AI“思考”的方法也有局限

迄今为止,被认为是有效安全措施之一的方法是检查模型得出答案前的语言化推理过程。如果不仅能监控行为结果,还能监控过程中是否产生不正当意图或危险计划,就更容易早期发现问题。

然而,帕乔基指出,对这种方法的依赖正逐渐变得困难。AI代理与人类或其他AI、外部工具复杂互动,推理与行为的界限变得模糊。模型自身处理推理过程的能力也在提高,即使不明确地将长时间思考语言化,也能给出高级答案。想要监控的东西,不一定以可监控的形式出现。

这里存在根本性的两难。使用更聪明的AI进行安全性研究,可能推动监控技术的进步。但另一方面,该AI的能力本身可能带来新的危险。这是为了制造安全AI而需要更强大AI的循环。


最大的转折点“递归自我改进”是什么

此次警告中最值得注意的概念是递归自我改进(RSI)。简单来说,就是AI参与下一代AI的研究、实验、代码编写、评估、学习方法的改进,而通过这些成果变得更优秀的AI,又能更快推进下一次改进的过程。

传统的AI开发中,人类研究人员提出假设、进行实验、解读结果、考虑下一步方法。如果AI承担这个循环的大部分,研究速度就不再受限于人类的工作时间和人数。进步不再是线性的,而是改进加速下一次改进的形式,可能在短时间内能力激增,以至于社会制度和企业的安全审查赶不上。

然而,RSI并不立即意味着无限制的智能爆炸。计算资源、电力、半导体、实验环境、验证能力等现实限制依然存在。目前所展示的也是基于OpenAI内部结果的强烈预期,并不是独立验证的确定事实。即便在这种不确定性下,仍然可能导致极端大的损害,因此需要预先准备,这是警告的核心。


为了网络防御,需要更强的AI这一矛盾

高性能AI首先展现巨大力量的领域之一是网络安全。能够探查软件漏洞、构建入侵路径、自动化多项任务的代理,将成为防御方的强大盟友。然而,同样的能力若落入攻击者手中,则会扩大损害。

帕乔基论述,为了保护重要基础设施免受其他AI带来的威胁,需要强大且对齐的AI。与此同时,他也强调,“为了防御”这一理由不应成为鲁莽竞争的免罪符。

这里存在AI开发竞争的本质陷阱。如果一家公司停止,可能会被更不重视安全性的其他公司或国家领先。因此继续开发。然而,如果所有公司都以同样的逻辑前进,谁也无法停止。在这种状态下,仅依赖自愿的善意来减速的策略是脆弱的。除了安全标准的内容外,还需要设计谁能确认用于学习的计算资源和测试结果,如何检测标准违规,以及采取何种措施。


社交媒体上“重要的内部揭露”和“利用恐惧的宣传”相冲突

社交媒体上的反应大相径庭。OpenAI的萨姆·阿尔特曼CEO在X上将这篇文章介绍为“重要的帖子”。NVIDIA的黄仁勋CEO在另一篇帖子中,随着最新模型的进展宣布“AGI已经到来”。谨慎论和加速的兴奋感几乎在同一时间并存,象征着当前的AI行业。

 

与危机感共鸣的声音重视能力增长与安全研究未能跟上的点。在Reddit上,有反驳称若仅视为宣传则会忽视真正的危险,还有人认为在银行账户和重要软件等高风险领域应认真对待。在LinkedIn上,也有技术人员表示,体验AI的实用飞跃越多,社会准备的差距就越令人恐惧。

另一方面,最显著的批评是“如果危险,为什么还要继续制造”。在Reddit上,有人指出过去也曾多次重复“过于强大而危险”的说法,这次也可能是为了吸引投资者和市场关注的营销。在LinkedIn上,尽管同意警告的诊断,但对OpenAI一边发布高性能模型一边谈论减速的态度感到不够诚实的批评也被提出。

此外,作为现实论,有人指出自主减速是否真的会影响到学习阶段,还是仅仅延迟产品的发布间隔,外部无法验证。模型的发布是可见的,但公司内部进行多大规模的学习却不易察觉。为了使减速成为可信的制度,独立审计和计算资源的公开等,从企业外部进行验证的机制是不可或缺的。

值得注意的是,这些是整理自文章发布后不久的部分反应,并非民意调查。可能偏向声音较大的用户和技术相关者,不应视为整个社交媒体的共识。即便如此,对警告的反应不仅集中在“恐惧”,还集中在对企业的不信任和可验证性问题上,这一点很重要。


比就业问题更深的“人类主导权”

围绕AI的不安中,工作替代已经被广泛讨论。然而,帕乔基的问题提起不仅限于就业数量的增减。如果需要数千名专家的业务可以由少数人和大型计算机执行,那么不仅财富,科学、信息、安全保障、政治的影响力也可能集中于少数企业或国家。

同时,如果人类脱离AI的自我改进循环,社会选择技术目标的能力本身就会减弱。接受便利服务的代价是,将研究什么、优化什么、允许哪些风险的判断,委托给少数开发组织和机器。

因此,所需的并不是“AI是危险还是安全”的二选一。根据用途和能力逐步提高安全标准,不仅依赖开发企业的自我申报,还需要第三方能够验证,分享事故和预兆,跨国界统一最低限度的规则。在利用高性能模型于防御、医疗、科学的利益同时,对不可逆转领域的连接设定强限制。需要将讨论转向这些具体措施。


不是“相信警告”,而是“能否验证”

不必将帕乔基的主张直接作为未来预测来相信。AI企业有经济动机夸大其技术的重要性。在内部实验的全貌未公开的情况下,外部研究人员能够评估的范围也有限。社交媒体的怀疑在这个意义上是健康的。

然而,对发信者的不信任与所指出的风险是否存在是两个问题。因为企业可能夸大,并不意味着危险不存在,反之,内部负责人发出警告也不意味着最坏的未来已确定。所需的是将主张转变为可验证的标准。

达到何种能力时需要强制附加测试。谁来审计模型和学习设备。如果安全措施被破坏,公开或连接的限制到何种程度。在多国企业同时竞争的情况下,如何抑制违规。只有具体化到这个程度,“自主减速”才不再是企业的美丽辞藻,而是实际可用的刹车。

此次警告所提出的不是预测AI何时会比人类更聪明的测验。在理解和监控可能赶不上能力提升的情况下,如果仍然继续开发,那么谁在何种条件下拥有停止的权力和责任的问题。加速器的性能几乎每月更新。现在最落后的可能不仅是刹车技术,还有踩下刹车的制度。


出处URL