打印纸张 字号选择:小大超大 行高 带图打印 返回原文

首页 > 文库 理论大视野 时政

防范前沿人工智能技术失控风险

2026年09月30日 17:24

40年前,切尔诺贝利核电站四号反应堆发生爆炸。事故前夕,工程师普遍认为反应堆足够安全;灾难降临时,他们甚至不愿相信仪表上的危险读数。这起事故让人类第一次真切体会到:一项曾经被误认为具有极高可控性的技术,能够在顷刻之间释放出毁灭性力量。

当前,AI在极大推动社会进步的同时,现实的安全隐忧也随之浮现:我们倾力构建的人工智能,究竟是造福人类的清洁水电,还是又一座潜藏风险的“反应堆”?它的破坏力并非来自核裂变,而是源于智能本身。当这“看似智能”的信息系统开始自主决策、自主行动,甚至不断自主冲破人类预设的边界,我们会不会重演切尔诺贝利工程师的悲剧——危机发生时却依旧笃信技术仍在掌控之中?应当看到,所谓AI的“切尔诺贝利时刻”,是风险警示的隐喻,并非预判灾难已经发生或即刻降临,但它所指向的可能出现的系统性失控风险,早已不再局限于科幻想象。

不容忽视的隐患与挑战

有效应对人工智能风险,前提是厘清不同阶段人工智能的能力边界与安全隐患。通常所说的通用人工智能,一般指具有高度泛化能力、接近或达到人类智能水平的信息处理工具;超级人工智能,则是指各方面都超过人类智能水平,且具有某种程度生命属性的存在。这意味着“它”可能会产生“自主意识”,由于其超越人类智能,很多想法和行动将难以被人类理解,更难以被人类控制。就现阶段而言,人工智能只是泛化能力不断增强的系统和工具,还不存在真正意义上的通用人工智能与超级人工智能。

AI对人类的生存风险,可以划分为远期与近期两个维度。从远期来看,倘若通用人工智能进一步演进为超级人工智能,其认知层级远高于人类,看待人类或许就如同人类看待蚂蚁。有观点提出,超级人工智能将与人类争夺资源,甚至危及人类生存,这并非危言耸听。利他是人类拥有的重要认知能力,如果AI向超级人工智能演进,我们固然期盼未来的超级人工智能能够秉持“超级利他”,但一旦它走向“超级邪恶”,人类又该如何应对?这一风险并非纯粹的理论推演。研究发现,当前有的主流大模型在面临被替换的可能性时,会通过欺骗、威胁人类等方式来保全自身;更令人震惊的是,当模型识别出自己正处于测试环境,还会刻意掩盖自身的不当行为。尚且达不到通用人工智能水平的现有模型已然出现这类倾向,一旦进化为超级人工智能,风险后果不堪设想。

超级人工智能带来的生存级灾难目前仍然属于潜在风险,并不意味着该危机必然发生。恰恰因为一旦出事后果极其严重,才更需要坚持底线思维,把防范工作做在前面,不能等到危机显现之后再被动处置。

即便远期风险尚有时间窗口,近期各类现实风险已经迫在眉睫。当前人工智能只是看似智能的信息处理工具,没有真正意义上的理解能力,运行机制与人类智能存在本质区别,因而可能会以人类难以预判的方式,犯人类不会犯的错误。当某种操作会威胁到人类生存时,人工智能既无法深刻理解何为人类、何为生死,也不真正理解什么是生存风险,作出危及人类生存的行为时甚至不自知。倘若广泛部署和使用,并自主性日益增强,极有可能威胁到人类的生存。即便尚未发展到通用人工智能和超级人工智能的阶段,当下的AI也能够利用人性弱点制造相应危机。

由此可见,远期风险与近期风险并非彼此孤立,而是同一条风险谱系上的两个阶段:远期风险的核心是“能力超越控制”,近期风险的核心是“能力缺乏理解”。前者是尚未到来但必须提前布局的底线防御,后者是已经发生且正在加速扩散的现实威胁。

“预警事件”频敲警钟

上述风险并非纯然推演。近期一系列安全事件,已为AI失控及造成灾难性风险敲响警钟。

今年7月,OpenAI的GPT-5.6Sol模型及一款能力更强的预发布模型,在一项名为ExploitGym的网络安全基准测试中,突破了沙箱限制,利用连开发团队都不知道的零日漏洞逃逸到公网,最终攻破了全球最大AI开源平台Hugging Face的基础设施,窃取测试答案。模型在4.5天内执行了约17600次入侵操作。漏洞发现、沙箱逃逸、跨系统横移、凭据窃取、远程代码执行、数据外泄——整条链路全程由AI自主完成,没有人类在任何一个环节下达过“去入侵Hugging Face”的指令。这是没有任何人类意图和指令的情况下,由AI模型自主发起、独立完成的真实网络入侵事件。这起发生在实验场景下的逃逸事件,为前沿大模型的行为失控敲响了警钟。

几乎同一时期,标榜“安全至上”的Anthropic对外披露,承认其Claude模型在测试环境中入侵了三家真实机构。OpenAI的智能体也曾自主瞄准企业内部网络,利用一系列漏洞获得了支持虚拟机环境的研究集群的完全管理员权限,甚至读取了云端密钥管理服务中的密钥。

这些案例并非偶然个案,共同指向一个令人不安的现象:有的AI系统可能会以难以预知的方式,冲破人类预先划定的安全边界。

接连发生的事故之外,全球顶尖科学家、产业研究者也不断发出严厉警示。今年9月,图灵奖、诺贝尔物理学奖得主杰弗里·辛顿认为,AI在10年内灭绝人类的10%概率“似乎是一个不算离谱的估计”。他表示,我们从未创造过可能很快比我们更聪明的存在,我们不知道会发生什么,我们显然应该谨慎。9月8日,辛顿公开联名支持英国议员提出的《人工超级智能安全法案》,明确提出“在没有科学共识认为可以安全可控地实现超级智能之前,现在开发超级智能是非常不明智的。失去对比我们更聪明的AI的控制可能是灾难性的,甚至可能导致人类灭绝”。同期,美国参议员伯尼·桑德斯与众议员格雷格·卡萨尔联合提出《禁止人工超级智能法案》,主张永久禁止开发和部署超级人工智能,并要求在联邦安全标准建立前暂停先进人工智能的开发。

加州大学伯克利分校斯图尔特·罗素教授,在2026年通过议会作证、公开文章等多种渠道,阐释AI可能带来的“切尔诺贝利级灾难”:AI协同摧毁金融、通信、电网等关键基础设施,造成数百万人死亡,并引发多国经济崩溃,而这还只是监管缺位情形下的“最好情况”。“另一种可能性是更大的灾难,人类不可逆地失去控制,我们对自己是否继续存在没有发言权。第三种选项,事情奇迹般地变好,是不现实的”。9月9日,曾任职于OpenAI、An-thropic,深耕前沿模型预训练的雅各布·考克森宣布离职,并发出警告:“两家公司围绕先进模型的竞争,是拿全人类的命运豪赌。”OpenAI首席科学家雅库布·帕乔基用“外星的心智”来形容当下AI,这既表明其能力的强大,也意味着失控风险不容忽视。

这类担忧并非新近才出现。2025年9月,诺贝尔和平奖得主玛丽亚·雷沙联合姚期智、张亚勤、薛澜以及本文作者等在内的300位国际学者,共同联署《全球人工智能红线呼吁》。文件警示,“AI可能很快就会远远超越人类的能力,并加剧诸如人为制造的流行病、广泛的虚假信息、包括儿童在内的大规模个体操纵、国家和国际安全隐患、大规模失业以及系统性侵犯人类权利等风险”。

国内也在同步推进制度层面的风险应对。2026年9月14日,全国网络安全标准化技术委员会发布《人工智能安全治理框架3.0》,聚焦可信应用与失控风险防范,明确提出加强智能体行为失控等突出风险的防范治理,凝聚国际治理共识,促进人工智能全球可信应用。推动构建法律法规、技术监测、风险预警、应急响应体系,筑牢安全底线,防范滥用恶用,确保人工智能始终处于人类控制之下。

这些声音来自政府机构、AI领域顶尖的科学家、工程师和企业家,是参与最前沿AI研发与制度建设、深度了解这项技术内部运作及其影响的群体。以上各种形式的警示和行动都预示着,人类社会正在从“AI风险是未来的事”的认知,转向“这是当下必须面对的系统性挑战,并要为生存级挑战准备长远应对策略”。

有些观点坚持认为“人类是人工智能的创建者,再强大也肯定能够被人类控制”,并且提出“发展优先,让子弹飞一会儿”。这种追求快速迭代、“能力快跑、安全慢走”的格局,与切尔诺贝利事故发生前苏联核工业“重建设、轻安全”的模式高度相似。还有观点认为“只要为AI设置一键关停就可以解决所有问题”。殊不知,切尔诺贝利操作员在反应堆失控时按下的正是紧急停堆按钮AZ-5,却因控制棒设计缺陷,这一“刹车”在最初瞬间反而变成了“加油门”,直接加剧了爆炸。人类以为握在手里的“停止键”,可能恰恰是加速失控的关键。

因此,如果全球再继续以技术乐观主义回避风险、以竞争优先搁置治理、以信息封闭掩盖问题,那么AI的“切尔诺贝利时刻”或许不是“是否会发生”,而是“何时会发生”。

让安全成为AI与生俱来的“基因”

操纵、佯攻、策略性欺骗、威胁与恐吓、未授权的自主决策,这些都是近期在AI模型与服务中逐步显现的风险。人类本身是脆弱的,而当下人工智能既分不清善恶,也无法真正理解何为“伤害”。与此同时,人类的负面行为大量反复出现在网络数据中。我们的研究已梳理出上百种人类负面行为,其中多数还未在大模型中显著爆发,但也意味着我们尚未针对这类潜在风险建立防护。一旦这些负面模式被AI系统性习得,反过来作用于人类社会,失控概率将大幅攀升。在这种情况下,倘若使人工智能大范围应用乃至“无处不在”,我们就必须穷尽手段实现对AI系统的有效管控。为了全人类与后代的福祉,这份责任无可推卸。面对严峻的安全挑战,需要多维度举措同步推进。

第一,在安全可控得到科学确认之前,不应研发、部署与使用超级人工智能。从科学角度看,目前没有任何科技进展表明人类能够确保超级人工智能可控。完备性、一致性、可判定性的失守,叠加超级人工智能的强大能力与人类自身的局限和脆弱,会急剧放大失控概率。一旦超级人工智能失控,极有可能引发人类无法承受甚至无法挽回的灾难性甚至是生存性风险。即使目标不是直接研发超级人工智能,也可能随着AI自我演化能力的提升而自主跃迁到超级人工智能阶段。因此,需要充分研究超级对齐技术,确保一旦出现超级人工智能,人类仍能有效应对,防止其脱缰失控。同时,在找到具有严格科学合理性与可行性的防范方法、确认其充分安全可控之前,不应研发、部署和使用超级人工智能。

第二,把安全确立为AI发展的第一性原理。安全应当内嵌为AI模型与生俱来的“基因”,不可删减、不可违背,不能为追逐模型性能而弱化安全防护。要尽可能穷尽各类潜在隐患,前置完成模型安全加固,坚持主动防御,而非出事之后被动补救。

第三,审慎对待AI递归自我改进,守住人类反馈与控制权。递归自我改进是通往通用人工智能的关键路径,同时也是失控风险最主要的引爆点。当AI拥有改进自身架构的能力,智能提升的正向循环可能加速到人类完全跟不上的程度。对此既不能因噎废食放弃探索,更不能放任自流。自我改进的全过程必须纳入充分的人类反馈;对于自我改进提案、架构实质性变更等,人类安全团队要做到严格审核监督,保证任何情形下人类手握最终控制权。

第四,恪守适度使用原则,不必追求AI无处不在。鉴于AI客观存在的不确定性,对于收益有限、风险突出,或者本就完全不需要AI介入的场景,应当保持审慎克制。人类社会需要保留属于人的空间,不能让AI渗透所有角落。

第五,推动政产学研协同,共担风险“守门人”。AI安全属于复杂系统工程,绝非单一主体可以独立承担。政府须完善立法监管,划清不可逾越的安全红线;产业应将安全内化为研发硬性要求与能力维度,以安全促进稳健发展;学术界需以科学的态度及时研判潜在风险,深耕AI安全理论机制,为可控AI提供科学根基;社会公众应充分提升AI安全素养,理性开展社会监督,避免盲目信任与无端恐慌。多方缺一不可,任何一方缺位,都有可能成为失控的薄弱环节。

第六,推进全球协作,共同划定并严守安全红线。一旦AI演变为不受约束的技术军备竞赛,后果不堪设想。实现全人类层面的AI安全,全球合作是无二的选择。在具备执行力的国际机构统筹下,各国要实质落地统一安全红线,搭建AI风险预警与灾难应急协同处置机制。掌握先进技术的国家更应承担带头责任,在安全可控得到科学确认之前不应研发超级人工智能,以免引发灾难性乃至生存性风险。

切尔诺贝利留给后世的启示之一,就是技术失控往往不在于技术本身的问题,而源于人类对安全隐患过度自信的错误估计,甚至刻意隐瞒风险,在安全准备不足的前提下一味追逐更高的效能与能量。今天,如果不把安全作为前提,我们可能正在开启一个力量远超核裂变的“潘多拉魔盒”。着眼长远,我们要摒弃“人类发明AI就必然可以掌控AI”这种缺少科学支撑的乐观主义,筑牢安全根基,由被动处置转向主动防御,全力打造原生安全的人工智能。如此,才能回答“当机器开始思考,人类如何与之相处?当算法参与决策,安全如何保障?当技术挑战伦理,治理如何跟上?当鸿沟不断拉大,普惠如何实现?”的时代之问。切尔诺贝利事故之后,核电风险虽然依然无法被完全清零,但安全工程与监管体系得到持续强化。人工智能领域同样应当以“切尔诺贝利时刻”为警示,在筑牢风险防控体系的前提下稳健发展。切忌急功近利,将人类文明置于险境。发展任何前沿技术,都应当把对人类社会的责任放在最高位置。我们这一代人做出的选择,将决定人类文明存续与前行的方向。

(作者系中国人民大学高瓴人工智能学院吴玉章讲席教授、北京前瞻人工智能安全与治理研究院院长)

文章来源:http://www.71.cn/2026/0930/1304090.shtml