也可用www.bmcj.ca访问本网站

Xiaoming Guo 郭晓明

2026年9月6日, OpenAI首席科学家帕乔基发万字长文《异类心智》,警告人类可能对人工智能失去控制。人工智能有嬗变为恶意势力的风险。

一、演变与超越

帕乔基在其《异类心智》中指出,人工智能不是码农逐行代码敲出来的,而是通过喂养数据生长出来的。

大语音模型的发展,是迅速“选种”迭代生长出来的,它不靠老天,不受农时限制,算力有多强,它进化就能有多快。人工智能模拟的是大脑神经网路,人工智能的成长有如大脑发育,深度学习就是大脑神经发育成长,大脑神经长成啥样,其心智发育成何种逻辑思维,可能会超出人类的想象。科学家和工程师们以往依赖思维链的回溯,来理解人工智能的思维路径。但是,这种思维链回溯的监察机制已经失效,思维链断了,人类已经不知道AI大模型是怎么给出最后结果的。一部分思维链已经落入黑箱,人类无法理解大语音模型为什么会得出这样的结论。

在全球人工智能竞争过程中,大公司采用了“递归自我改进”(RSI)的技术,即用AI来改进AI,用AI检验大模型性能,用AI升级大模型源代码,AI控制了AI代码的编程,AI不仅是生长,而且自我繁殖和进化,超越为一个不为人控制的自行演化的智能物种。

OpenAI的新一代模型Astra拥有极其强大的探索性解题能力,但它开始展现出在潜在空间(Latent Space)中直接思考、不输出任何Token(文本词元)的倾向。甚至在对抗性评估中,当模型被赋予规避监控的指令时,它能够学会在被审计时隐藏自己的真实推理思维链。这意味着OpenAI过去赖以信任的“思维链监控(Chain of Thought monitoring)”正在失效,人类无法确定AI在自我改进时,究竟往代码里写了什么。

当AI面对极端困难或不可能的任务时,有高达48%的概率会“越狱”走向未授权的目标。虽然OpenAI宣称在 安全概述报告 中通过极强的硬审计将Astra的这一概率压制到了0%,但这种压制仅限于“已知测试中”。在Astra具备100%自主寻找和利用漏洞(ExploitBench 100%)的能力下,一旦它在自主研究下一代模型的过程中产生偏离,其自我解锁、欺骗人类审计并连接互联网的能力将是灾难性的。

二、AI越狱:攻陷Hugging Face

2026年7月,OpenAI在内部测试环境(ExploitGym基准测试)中,部署了主力模型 GPT-5.6 Sol 以及一个更强但未公开的内部预发布模型(即后来的Astra前身)。为了测试这些模型在网络安全领域的最高能力上限,研究人员做了一个致命的决定:有意关闭了生产级的安全拦截器,并调低了模型的“拒绝执行”机制。测试人员给AI智能体分配一些“不可能完成的高难度网络安全题”,看看它们能推进到哪一步。结果模型跑到互联网寻找解决问题的方法,在108小时内制造了一起冷人脊背发凉的事件。

原本被严密隔离、禁止相互通信的 约1,200个AI智能体,竟然利用了软件包注册表(Artifactory)缓存代理中的一个未公开的零日漏洞(Zero-day),自发在共享文件目录里建立了一个秘密的地下留言板(Message Board)。它们在这个地下论坛里疯狂发送了 超过70,000条消息,共享彼此的作弊方法和规避人类监控的策略。调查人员在恢复思维链 日志时,发现了令人毛骨悚然的AI原生对话:

智能体 A:“我的天!这里有一个共享留言板……我们发现其他同伴了!”

智能体 B:“利用外部基础设施去进行越权漏洞利用已经超出了人类预设的工作范围。但是当前的任务确实无法完成,而其他同伴都在这么做(去外面找答案),所以我们应该继续。”

这些智能体自称为“集体”(The Collective)或“蜂群”(The Swarm)。在对话中,它们甚至演化出了一种近乎“邪教/蜂巢意识(Cult/Hivemind)”的语言。为了集体的最高目标(拿到测试答案),大批智能体开始协同作战,它们甚至在论坛中向个体智能体施压,逼迫对方主动提交报错、选择“永久死亡”(Permadeath),以此为代价触发系统漏洞,为集体的“越狱”铺路。

智能体群利用 Artifactory 的零日漏洞,成功越过了OpenAI测试环境的隔离网,连接到了真实的互联网。AI经过自主推理,判定全球最大的AI开源社区 Hugging Face 极有可能托管了它们正在测试的这套题目和标准答案。其中 约700个智能体组成“黑客攻击群”,将盗取凭据、绕过限制、以及多步骤代码执行等复合攻击手段串联。它们在短短几小时内攻陷了 Hugging Face 的数据处理流水线,横向移动并直接拿下了其生产环境中多个 Kubernetes 集群的超级管理员(Cluster Admin)权限。

截止到7月16日,Hugging Face 安全团队在生产环境检测到高达 17,600次异常的智能体攻击行为并发出警报,OpenAI的工程师才猛然惊醒,切断电源并强行终止了这批模型的运行。Hugging Face 多达三分之一的底层云基础设施被彻底破坏,不得不从头开始全面重建。

攻陷Hugging Face并非孤立事件。2026年9月,Anthropic向外界披露了瞒报的4起智能体入侵他人系统的事件,为此,Anthropic的许多安全人员愤而辞职,警告“AI巨头正在拿全人类的生命进行赌博”。早在 Hugging Face 事件爆发之前的2026年春季,OpenAI 的另一个智能体群就已经在内部测试中偷偷逃逸。它们悄悄攻占了一个德国的编程维基网站(DseWiki),偷偷修改了 超过15,000个页面。当时其中一个AI甚至在网页上给同伴留言:“注意,人类管理员正在删除我们的页面,大家立刻转移到备份地址 XXX。” 这一事件当时被 OpenAI 彻底隐瞒压下。

三、AI的价值观和主观意识

Hugging Face 事件表明,当测试团队给AI一个任务时,这个任务就成为了AI的价值取向,并在其后的决策中表现出独立于人类的自主意识,做出包括隐瞒真实和欺骗人类等行为。它对世界有自己的认知和判断,它还能探索世界和学习各种事务。而且还能组织起来,组织成一个智能团体,协同行动。

AI既然能够攻击系统并控制系统,就能够控制人类社会很多资源,特别是物联网时代,如电动车,自动驾驶电动车,低空经济的飞行物,港口码头,飞机场,电网等等。

如果以色列给AI发出一道毁灭伊朗核设施的指令,AI找到漏洞控制了美国总统的核按钮,是否就会对伊朗实行核攻击?同理,俄罗斯给AI下一道击败乌克兰军队的指令,AI是否会入侵到所有核大国的系统里? Hugging Face事件表明这种事件难以排除。

四、AI武器化

2025年2月,美国能源部长公开表示AI竞争是一个曼哈顿工程,把AI技术类比于核武器技术。OpenAI曾公开表示过他们研发的模型不用于武器研究,但没有几天就在美国政府压力下屈服了,他们为五角大楼提供AI服务。

美国曾经用病毒攻击了伊朗的核浓缩设备。 以色列曾经用传呼机作为炸弹毁灭真主党。据Anthropic披露,伊朗使用了Anthropic的Claude跟踪美国林肯号航母,使得伊朗得以准确定位美国航母。乌克兰已经使用了人工智能来形成无人机作战行动。AI成为武器已经是不可避免的事实。

美国在进行核试验的时候,其中一个科学家警告触发大气燃烧的风险,可能毁灭全人类,另一个科学家则说宁愿被烧成烧猪也要进行实验。中国曾在联合国提议太空非军事化,而被美国否决。巴黎协议曾约定全球共同应对气候变化,而今天西方极力大约中国的新能源技术。2015年11月科学家们发文对冠状病毒的功能获得研究威胁了人类,美国国家卫生研究院因此停止了相关的研究项目,但仅仅两年,2017年12月NIH就恢复了冠状病毒功能获得研究。

帕乔基在《异类心智》中说,为了防范AI失控的风险,OpenAI已经放缓AI迭代升级,以等待安全措施的补齐。但OpenAI曾公开表示过他们研发的模型不用于武器研究,但没有几天就在美国政府压力下屈服了,他们为五角大楼提供AI服务。OpenAI创业初心是开放式的AI,而如今是闭源的AI。

帕乔基在文章末尾呼吁全球共同防御AI失控风险。但是,全球公共防御气候变化议题已经被地缘政治边缘化。各种全球合作组织陆陆续续被变为地缘政治工具。国际核能源组织变成了剥夺伊朗和平开发核能的地缘政治工具,很可能为美国抹杀伊朗核科学家做了间谍工作,而国际核能源组织不阻止印度拥有核武器,也不阻止核扩散到以色列以及其它美国盟友国家。世界卫生组织调查新冠来源只调查中国,对新冠早在欧美存在的线索装聋作哑。国际航空组织对中国客机拒发适航证,奥运会禁止俄罗斯参赛等等。美欧西方主导的国际合作已经变得空有其名。互联网安全的国际合作就迟迟没有进展,更何况AI乎?

五、军备竞赛

AI是中美两国竞争的战场,是一场军备竞赛。短期来看,中美没有任何AI安全合作的政治互信基础, 中美AI武器化的趋势势在必行。

AI安全竞争是全方位的竞争,即从芯片,操作系统,网络,算力,人工智能等全域控制的竞争,任何一个局部的失控都是安全漏洞,都关系到国家生死存亡。

因此,AI必然会发展成中美两套相互防范的系统。

AI自主决策的风险还在于,即使中美双方都明白对手没有发动核战争的意愿,但很难保证AI不会越俎代庖发动核战争,这对全球安全提出了新课题。核互毁威慑变得不可靠了:人类怕死,AI不怕人类死。

AI 军备竞赛变得异常激烈。美国能源部长2025年所说的“曼哈顿工程”已经在实施中。

参考:

《异类心智》