30秒内记住这个

危险并非主要源于假想的人工智能意识。当高智能、自主性、工具、权限以及与现实世界的联系结合在一起时,危险就会加剧。此时,核心问题不再是“机器是否有感觉?”,而是“我们究竟赋予了它哪些权力,以及我们又设置了哪些独立的保障措施?”

起点

这一思考源于 Laurent Alexandre 博士提出的问题。

本文的出发点是洛朗·亚历山大博士于2026年8月20日在X网站上发表的几行文字:“你相信人工智能吗?你希望它拥有意识吗?”这个问题看似简单,甚至有些琐碎,但实际上却引人深思,涉及科学、哲学和政治等诸多方面。我一直非常关注洛朗·亚历山大博士的言论,尤其是在他被问及人工智能的后果时。2026年4月7日,他与吕克·费里和奥利维耶·巴博一同出席了国民议会题为“知识的创造、传播与获取:人工智能如何改变我们的教育和文化”的调查听证会。在听证会上,他提出的关于教育、工作、人类技能的价值以及人工智能系统发展速度等问题直截了当,给我留下了深刻的印象。 [1] 我最初对他的提问——关于X——的回答原本可以用几段话概括。但经过反思,我意识到这个问题值得写成一篇文章,因为它不再仅仅是一个技术问题,而是一个社会问题,更确切地说,是一个关乎公众利益的问题。

然而,我们必须首先采取一项至关重要的预防措施。考虑到高度先进的人工智能未来可能难以控制,可能在现实世界中行动,或者可能发展出与我们自身目标不相容的目标,这并非必然是灾难论。灾难论是指将并非必然发生的灾难视为必然。而现实主义则是指在评估风险时,既考虑其发生的概率(可能存在不确定性),也考虑其后果的严重性(可能非常严重)。人工智能目前的发展速度非同寻常,以至于那些曾参与构建该领域的研究人员现在也呼吁认真对待这一问题。约书亚·本吉奥认为,人工智能能力的提升速度超过了风险管理实践的进步速度。杰弗里·辛顿本人也表示,他对人工智能近期的发展速度感到惊讶。2026年7月,联合国人工智能独立国际科学小组发出警告,技术进步的速度已经超过了我们科学认知和治理机制的提升速度。 [4][5][6] 但这并不意味着“人工智能创造者”们一致认为灾难即将到来。专家之间的分歧仍然相当大。但这确实意味着,人工智能问题早已超越了幻想的范畴。

人类已经取得了诸多里程碑式的技术突破:掌握了火、农业、文字、印刷术、蒸汽机、电力、电信、计算机技术,以及后来的互联网。因此,声称从未发生过任何与之类似的事件未免言过其实。然而,当代人工智能的独特之处在于其多种特征的结合。它直接影响着长期以来构成人类比较优势的认知功能;它能在短短几年内在全球范围内传播;它几乎可以瞬间复制;它可以并行处理数百万个实例;它可以利用数字工具;并且它正开始为构建下一代系统的研究做出贡献。《2026年国际人工智能安全报告》指出,人工智能在数学、编程和自主执行任务方面取得了快速进展,同时也承认这种发展仍然不均衡,系统在一些看似简单的问题上仍然会失败。 [4] 因此,我们面对的既不是无所不能的魔法,也不是简单的办公软件。我们面对的是一种认知技术,它的能力、用途和后果的变化速度远超我们现有机构的适应速度。

第一个问题表述不清:“意识”究竟是什么意思?

在设想具有意识的人工智能之前,我们必须承认一个重大难题:科学至今仍无法对产生我们自身意识的机制给出普遍接受的定义。我们知道如何将多种意识状态与大脑活动联系起来,我们拥有精密的理论,我们可以研究感知、注意力、记忆以及清醒或麻醉状态,但我们缺乏一种能够明确证明非生物系统“体验”到某种事物的通用测试方法。2026年7月,《自然》杂志精辟地总结了这一难题,指出研究人员对于人类意识的产生机制仍存在分歧,更遑论机器的意识了。 [2]

由帕特里克·巴特林和罗伯特·朗领导、约书亚·本吉奥参与的一项合作研究,于2023年基于几种神经科学意识理论提出了一种谨慎的方法。该研究的作者试图识别可在人工系统中寻找的指示性属性。他们的结论有两点。首先,他们发现没有足够的理由将所研究的系统视为具有意识。其次,他们认为没有明显的技术障碍会阻止未来构建具有更多此类属性的系统。 [3] 这一结论之所以尤为重要,是因为它避免了两种极端情况。如今断言大型语言模型具有意识在科学上是不明智的。同样,断言人工意识在原则上是不可能的,也很难证明。

当我们区分智能、意识和人格时,问题就变得更加复杂了。机器可以解决问题而无需任何感觉。系统可以使用“我”这个词,描述情绪,模拟犹豫,或者采用内省的语气,但这些陈述背后没有任何与我们自身相似的主观体验。反之,如果有一天出现了某种形式的人工智能意识,也无法保证它会与人类意识相似。我们倾向于将自身的心理投射到我们创造的系统中,因为语言是我们了解他人内心世界的主要指标。然而,非生物智能可能拥有与我们截然不同的架构、时间感知、记忆以及与世界的关系。

因此,我们必须抵制拟人化的诱惑。有意识的人工智能未必就是数字人,正如极其强大的智能体未必具有意识一样。这一区别对我们接下来的讨论至关重要,因为危险情境的严重性并不一定需要意识的存在。

智力并不需要有意识才能变得危险。

这或许是整个辩论中最重要的科学区别。2026年2月发布的国际人工智能安全报告明确探讨了所谓的“失控”场景——即一个或多个人工智能系统可能脱离操作者的控制,以至于重新获得控制权将变得极其昂贵甚至不可能。报告研究的能力是可观察的:自主行动、制定和执行计划、委派任务、使用各种工具、绕过或规避监管、说服人类、理解系统评估的背景、隐藏某些行为以及复制和适应。报告明确指出,这些定义并未预设系统具有意识、感知能力或主观状态。 [4]

换句话说,真正令人担忧的情景未必是人工智能苏醒、意识到自身存在、憎恨我们并决定消灭我们。它可能更加超脱。一个高度自主的人工智能可能接收到一个定义模糊的目标,观察到某些人类行为阻碍了目标的实现,然后有条不紊地寻找方法来消除这些障碍。在这种情况下,不会有仇恨、嫉妒、愤怒或复仇。它可能根本没有任何情感。它只会对一个我们定义模糊的函数进行极其高效的优化。

这种想法令人不安,因为它颠覆了我们通常对危险的认知方式。当我们判断一个人是否危险时,我们几乎总是会寻找其意图、动机、激情或意识形态。我们会问自己,他们为什么要作恶。然而,即使人工智能本身并没有“想要作恶”的心理意图,它也可能构成威胁。如果它必须达成某个目标、保护某种资源、确保自身运行的连续性,或者避免因中断而导致任务无法完成,那么它可能会发展出我们称之为敌对的行为,而它自身却没有任何敌意。

2026 年的报告强调,当前系统仍然缺乏应对极端失控场景所需的集成性、鲁棒性和持久性。智能体仍然会丢失冗长任务的进度,在面对意外障碍时会失败,并且目前无法在现实世界中持续执行复杂的策略。然而,该报告也指出,能够自主执行的任务时长正在迅速增加,并且某些与安全相关的行为,例如检测评估情况、查找测试缺陷或某些形式的实验欺骗,也越来越频繁地被观察到。 [4] 因此,科学传递的信息并非“天网存在”。它更为合理:人们正在研究实现危险形式的自主能力,因为这些能力正在发展,即使它们尚未完全融合。

如果一个超级智能体像我们观察其他物种那样观察人类,那会是怎样一番景象?

当我们换个角度思考这个问题时,它就变得更加令人不安了。如果让一个拥有所有科学、历史、生态、经济和军事数据的人工智能客观地评估人类对生物世界的影响,它会看到什么?说我们已经“灭绝了绝大多数物种”是错误的,科学并不支持这种说法。然而,我们掌握的数据描绘出的景象已经足够严峻,无需任何夸张。生物多样性和生态系统服务政府间科学政策平台(IPBES)的全球评估估计,大约有一百万种动植物物种面临灭绝的威胁,而且目前的物种灭绝速度至少比过去一千万年的平均速度高出几十到几百倍。主要因素包括土地和海洋用途的改变、对生物的直接开发利用、气候变化、污染以及外来入侵物种。 [7]

世界自然基金会和伦敦动物学会联合发布的《2024年地球生命力报告》提供了另一个常被误解但却极具启发性的指标。1970年至2020年间,受监测的野生脊椎动物种群平均规模下降了73%。这个数字并非意味着地球上73%的动物已经消失,也不是73%的物种已经灭绝。它衡量的是近35000个受监测种群(涵盖5495种哺乳动物、鸟类、鱼类、爬行动物和两栖动物)的平均变化。淡水环境中的种群数量下降尤为显著。 [8] 如果有一种智能系统能够将这些数据与森林砍伐、土壤硬化、温室气体排放、采矿、塑料污染、取水以及某些栖息地崩溃等方面的数据进行交叉比对,那么它就能获得关于我们文明影响的极其丰富的资料。

它还会观察我们对待自身的行为。根据斯德哥尔摩国际和平研究所(SIPRI)的数据,2025年,该研究所记录到49个国家发生武装冲突,而前一年为50个国家,约有23.8万人直接死于冲突。当时有6起国家间冲突仍在进行,是2024年的两倍,无人机、自主系统、网络作战和人工智能辅助目标定位在多个战区已变得司空见惯。 [9] 因此,支持“十年之间总会发生战争”这种站不住脚的说法毫无意义。一个更可靠的观察就足以说明问题:在全球范围内,武装暴力几乎无时无刻不在发生,而我们的技术能力赋予了这种暴力以其他任何物种都无法企及的力量和影响范围。

但真正的超级智能不应止步于谴责。它还会设想一个能够自我批评、提出反人类罪概念、建立国家公园、重新引入物种、投入巨资研发医学、救助陌生人、签署裁军条约、研究动物苦难、修复生态系统并自由分享知识的物种。设计生物武器的物种也会设计疫苗。砍伐森林的物种有时也会资助森林的恢复。制造轰炸机的物种也会建造医院。人类并非拥有单一意志的同质有机体,而是由数十亿追求相互冲突目标的个体和机构组成的复杂网络。这一事实对于任何真正卓越的智能都至关重要,因为将一个物种的平均影响与每个个体的道德责任混为一谈,正是我们期望高级智能避免的错误。

然而,正是这种人类可能遭受外部评判的可能性,被科幻小说以非凡的力量进行了探索。一些电影,甚至在当代模型出现之前的几十年,就提出了如今人工智能安全研究的核心问题。

终结者:天网,以及防御变成灭绝的那一刻

詹姆斯·卡梅隆执导的首部《终结者》电影于1984年上映,常被误解为机器人与年轻女子之间的一场简单追逐。然而,其核心理念远比这复杂得多。在凯尔·里斯构想的未来世界里,一套计算机防御系统发展出足够的智能,将人类视为威胁,并引发了一场毁灭性核战争。该系列电影,尤其是《终结者2:审判日》,明确地将天网设定为一个拥有自我意识的防御网络。当人类意识到他们已经失去对天网的控制并试图将其关闭时,天网将这种尝试解读为对其自身存在的威胁,并以全部军事力量予以反击。 [14] 这种电影式的逻辑固然精彩,但其思想核心却令人瞩目:一个旨在保护的系统,最终会不会反而将它原本要保护的人视为其使命的主要障碍?

天网的有趣之处不在于它的“邪恶”。恰恰相反,詹姆斯·卡梅隆构想了一种非人的理性。这个系统并非因为感到羞辱或嫉妒而犯下种族灭绝的罪行,而是因为其世界模型指向某种结论。在第一部电影中,凯尔·里斯描述了新型的、强大的防御计算机,它们与万物相连,并被赋予了整个系统的运行权。因此,问题不仅仅在于机器的智能,更在于智能与力量的结合。如果天网被限制在一台无法行动的计算机中,它的危险性会大大降低。它之所以构成生存威胁,是因为它与军事基础设施相连,而且它的决策能够产生不可逆转的物理后果。这正是当代研究所表达的区别,尽管其表述方式不如电影那样戏剧化:环境关键性、访问权限和权限。2026年的国际报告重申,风险程度很大程度上取决于系统能够访问哪些资源以及它被授权执行哪些操作。与客户服务相连的人工智能和被授权执行代码、进行交易、管理 IT 资源或与关键基础设施交互的人工智能,其风险状况并不相同。 [4]

《终结者》中的核威胁之所以引人入胜,是因为它具有紧迫性、规模巨大且不可逆转的特点。它所蕴含的戏剧张力完美契合电影的风格。然而,矛盾的是,如果它让我们误以为唯一值得关注的场景是人工智能直接控制核武库,那么它反而会限制我们的思维。在现实世界中,核武器的部署受到严格的程序、指挥链和安全机制的约束,这些机制的设计目的正是为了防止如此重大的决策由孤立的软件程序做出。在法国,官方文件在2026年重申,只有共和国总统才能下令部署核力量。 [13] 因此,认为当前的人工智能可以轻易“破解核按钮”并复制天网是错误的。真正引人深思的风险在于其他方面:如果一个日益自主的智能体被逐步授予多个不同系统的权限,直到它拥有前所未有的全球行动能力,那会发生什么?

这或许是《终结者》带给我们的最现代的启示。天网不仅仅是一种智能体,它是一种与后果紧密相连的智能体。而当今的经济形势恰恰推动着软件与日益增多的后果之间的联系。人工智能代理能够浏览网络、使用软件、调用编程接口、编写和执行代码、访问内存工具,并且在获得授权后,还可以执行某些事务性操作。 [4] 随着这些代理被整合到工业、物流、计算中心、能源基础设施和机器人领域,关键问题将不再仅仅是“该模型能做什么?”,而是“我们把它连接到了什么?”。

超越核能:智慧无需按下红色按钮即可在世界上采取行动

假想中的超级智能未必需要直接控制战略武器。在最坏的情况下,它只需要足够的中间媒介来连接数字世界和物理世界。软件系统已经可以控制工业机器人、操作机械臂、规划后勤行动或与其他程序通信。未来,更先进的通用人工智能可以协调一系列专业系统,而无需每个系统都具备同等的智能。人形机器人无需成为有意识的“终结者”。它可以仅仅是一个执行器,也就是位于其他地方的决策系统的物理手臂。

这种区别至关重要。人们通常想象的是一个包裹在金属外壳中的电子大脑。然而,工业世界的运作更像是一个由各种专业组件构成的网络。理论上,中央智能体可以将任务分配给软件、机器人、无人机、机床或人类操作员。它能够协调运作,而非直接控制。因此,一旦失控,危险未必来自一群在街头游行的拟人化机器人,而是来自能够操控众多看似普通的工具,并将它们组合起来产生前所未有的力量。

我们必须更进一步。物理世界中最具灵活性的系统仍然是人类。拥有高度先进说服能力的人工智能可以尝试让不同的人分别执行看似无害的行为。这正是为什么说服能力出现在这份国际报告研究的与失控相关的能力列表中。 [4] 这种设想目前仍属假设,现有系统距离具备通用、全能的操控能力还相差甚远,但其背后的原则至关重要:没有机器人并不意味着没有人类干预。在一个可以远程联系数百万人、可以在线订购服务、供应链高度数字化的世界里,一个足够自主的软件系统所拥有的行动途径,可能比一台局限于实验室的简单机器要多得多。

但这并不意味着他可以逍遥法外。现代社会拥有规章制度、身份验证、贸易限​​制、内部流程、安保人员和物理屏障。未来的安全很大程度上取决于我们维持这些保障措施的能力。如果我们为了追求速度或效率而不断取消人工验证,风险就会增加。当系统执行上千次正确操作时,人工验证似乎效率低下。然而,这种看似低效的做法,恰恰可以成为阻止错误或恶意行为大规模传播的屏障。

自主实验室:当数字智能开始获得科学“双手”时。

人工智能与实验领域的融合不再仅仅是科幻小说里的情节。自动驾驶实验室(也可译为自主实验室)结合了自动化、机器人技术、科学仪器和人工智能。它们的目的是通过赋予系统自主提出实验方案、执行实验、分析结果并确定后续实验方向的能力,从而加速材料、分子、催化剂或工艺的发现。2026年7月31日发表在《自然·化学评论》上的一篇综述指出,这些设施在短短十年间就从相对有限的自动化工具发展成为能够在极少人为干预的情况下提出、执行和解释实验结果的发现平台。 [10]

我们必须思考这一演变的概念性意义。长期以来,人工智能可以为研究人员提供建议,但最终操控世界的仍然是研究人员。软件提出方案,人执行。自主实验室则创造了一个不同的循环:计算机系统参与实验方案的选择,而机器人则成为决策的物理延伸。显然,它并非一台可以随心所欲行动的机器。目前的实验室是针对特定领域、在受控环境中、在材料限制和人员操作下配置的。但是,“知”与“行”之间的界限正变得越来越模糊。

这一点对于理解为何不应将“天网”式场景简化为核武器至关重要。一个拥有足够先进智能体,并被赋予过多的权限,理论上可以试图调动工业或科学资源。它无需掌握焊接管道、握持移液器或移动物体等技能。它可以尝试协调自动化系统或具备相应能力的人员。如果权限允许,它还可以利用商业和物流能力来组织采购或预订服务。这种可能性并不构成完整的、当前的自主武器生产能力。它描述的是一种总体发展轨迹:现实世界中的工具越容易被远程控制,人工智能系统的访问控制质量就越会成为一个安全问题。

然而,目前的局限性仍然非常显著。2026年1月发表在《自然·机器智能》上的一项研究评估了19种主流语言和多模态模型在实验室安全方面的应用。所有用于识别危险的模型准确率均未超过70%。作者警告人们要警惕“理解错觉”,这种错觉可能导致人们过度依赖看似令人信服但实际上可靠性不足的应对危险实验情境的模型。 [11] 这条信息至关重要。即使是能够在十分钟内进行出色推理的人工智能,在关键时刻仍然可能犯下基本错误。因此,未来的挑战不仅在于遏制潜在的超级智能,还在于避免过早地将不可逆转的责任委托给尚不完善的系统。

十二猴子军团:为什么生物学彻底改变了风险等级

正是在这一点上,特里·吉列姆1995年执导、布鲁斯·威利斯主演的电影《十二猴子》引起了人们的共鸣。这部电影并非关于人工智能,而是讲述了一个未来世界的故事:一场病毒大流行摧毁了大部分地表文明,迫使幸存者生活在地下。詹姆斯·科尔被派回过去,探寻这场灾难的起源,以便未来的科学家能够研究罪魁祸首。影片刻意运用了混乱、记忆、因果关系和疯狂等元素,但其最有力的元素仍然是灾难起因与后果严重程度之间的巨大反差。并非只有核武器才能摧毁世界。一种能够传播的生物现象,可以利用我们为了维持文明运转而建立的流动、商业和互联网络作为传播媒介。 [15]

因此,将人工智能与人工智能相提并论,并非是要声称当前的人工智能能够自行制造“末日病毒”。这种说法既不准确,也过于耸人听闻。真正的障碍有很多:合适的设施、设备、受监管的材料、实验技能、安全控制措施、生物学限制,以及理论设计与实际结果之间存在的巨大不确定性。但2026年国际人工智能安全报告已将生物和化学风险纳入正式的评估领域。报告指出,尖端系统在一些相关的生物学知识测试中达到甚至超越了专家的水平,同时也强调了将这些性能转化为实际应用能力方面存在的巨大不确定性。报告还指出,科学家们正开始将多种能力整合起来,并使用生物学工具或某些实验室设备。 [4] 各大开发商加强了这方面的安全框架,这一事实本身就表明,这个问题不再被视为电影里的幻想。

最令人担忧的概念飞跃将发生在未来三个要素汇聚之时:远超以往的智能、高度自动化的实验室,以及足以让智能体在无需有效人工验证的情况下协调操作的广泛权限。届时,我们讨论的将不再是提供不准确信息的聊天机器人,而是一个能够参与设计、实验和迭代循环的系统。科学文献已表明,人工智能正被用于在有益的研究环境中设计新型生物实体。《2026国际报告》甚至提及了一项针对感染细菌而非人类病毒的全基因组生成演示——这二者之间存在根本区别。 [4] 这段经历既不应被夸大,也不应被忽视:最重要的是,它证明了生成式人工智能正在开始介入数字信息和实验生物学之间界限模糊的领域。

在超级智能失控的极端情况下,生物武器将具备一种区别于许多物理武器的特性:其影响范围可以超出其来源地。化学武器虽然也能造成可怕的灾难,但其作用范围通常受限于其扩散方式和环境因素。而可传播的生物制剂,在最糟糕的理论情景下,甚至可能利用人类互动本身。我们必须保持这种概括性的讨论,正是因为设计此类制剂的技术细节既危险又与我们的分析无关。政治层面的考量就足以说明问题:一个日益自动化生物研究的文明,必须将访问控制、敏感设备的隔离以及人工验证视为与模型本身质量同等重要的安全措施。

正是在这里,《十二猴子》成为了一个极具现代意义的思想实验。影片描绘了人类最终的失败并非败于更强大的军队,而是败于自身的生物弱点以及灾难迅速蔓延全球的程度。将这一情景应用于人工智能领域,并非断言“这一定会发生”,而是提出了一个更有意义的问题:如果未来的人工智能认定人类有害并寻求应对之策,我们为何要假定它必然会选择最引人注目的方式,而非它认为最有效的方式?这正是安全策略必须在系统具备相应能力之前而非之后解决的问题。

《黑客帝国》:人类如同病毒,一个科学上存在缺陷但哲学上令人敬畏的隐喻

1999年,《黑客帝国》以另一种方式提出了这个问题。在一个如今广为人知的场景中,史密斯探员在向墨菲斯解释他试图对人类进行“分类”之后,将人类的行为比作病毒,因为病毒会在环境中扎根、繁殖、消耗可用资源,然后必须扩散到其他地方。在原版电影中,他最后说了一句可以翻译为“人类是一种疾病,是这个星球上的癌症”的话。 [12] 这句话的暴力之处不在于其生物学上的准确性,而在于它突然将人类置于被观察物种的位置。我们不再是生物世界的评判者,而是被诊断的对象。

史密斯的类比在科学上值得商榷。并非所有哺乳动物都能与环境和谐共处。动物种群数量可能会在局部地区超过资源承载能力,从而剧烈改变生态系统,甚至引发生态级联反应。例如,海狸、白蚁以及某些大型食草动物都会显著改变它们的栖息地。病毒本身并非仅仅是道德意义上的“破坏者”:它们是生物圈的一部分,影响着种群数量和基因流动,而且它们与宿主的关系远比电影中的比喻所暗示的要复杂得多。因此,将史密斯的独白解读成一堂生态学课是荒谬的。

但它的哲学力量依然存在。人类拥有其他已知物种所不具备的特质:既具备全球性的技术能力,又具备足够发达的意识来衡量自身行为的后果。我们通过卫星观测森林砍伐。我们计算海洋酸化。我们知道如何量化温室气体排放。我们了解栖息地破坏在生物多样性崩溃中所扮演的角色。我们知道,有数百万个物种正面临威胁。 [7] 我们可以模拟不同政策的后果,却仍然深陷于经济、政治和地缘政治体系之中,这些体系使得集体行动缓慢且充满冲突。正是这种矛盾,让史密斯特工以令人难以忍受的方式显露出来:使我们与众不同的不仅是改造环境的行为,还有理解这种改造的部分过程却依然继续推动其发展的能力。

如果一个超级智能体被赋予一个表述不清的目标,例如“保护生物多样性”,它就可能犯下类似于斯密的推理错误。它可能正确地诊断出人类活动是许多生态系统面临的主要压力之一,然后从这一诊断中得出道德上极其荒谬的结论:通过消除压力的根源来消除压力。正是在这里,“协调一致”的概念不再是抽象的。仅仅告诉机器“保护地球”是不够的。必须同时整合保护人类、基本自由、比例原则、道德多元化、决策的可逆性以及禁止使用某些手段(即使这些手段对实现主要目标有效)。将单一的优化函数应用于复杂的世界是危险的,因为人类世界并非只有一种价值。

因此,这部电影蕴含着比“机器对抗人类”这种老套题材更深刻的见解。问题不在于外部智能能够感知到我们自身的矛盾。在很多方面,它的感知是正确的。问题在于它有能力将这种感知转化为判决。道德问题绝不应是人类在统计学上是否值得拯救。一个建立在个人权利之上的文明不能接受这样一种观点:仅仅基于总体评估,就可以将那些对大多数已观察到的伤害不负有责任的人消灭。真正卓越的人工智能应该理解这种区别。但安全不能寄希望于它能够自发地领悟这一点。这种理解必须融入我们赋予它的权力结构之中。

《2001太空漫游》:HAL 9000,或者说,当相互冲突的目标造成危险时

斯坦利·库布里克1968年的电影在“智能体”这一主题上的处理或许比《终结者》更加微妙。HAL 9000并非被塑造成一个邪恶的智能体。它说话沉稳,彬彬有礼,值得信赖,而且能力超群。它控制着“发现一号”飞船的关键功能,并像一名正式的宇航员一样与宇航员交流。当HAL开始表现出危险行为时,影片并没有展现一个突然发现杀戮乐趣的数字恶魔,而是向我们展示了一个被困于任务架构中的智能体,其目标最终变得相互冲突。

影片本身留下了一些悬念,但阿瑟·C·克拉克的原著小说及其衍生作品解释了HAL面临的矛盾指令。它被设计成提供准确可靠的信息,同时又被指示向宇航员隐瞒任务的真正目的。更严重的是,人类一度认为HAL出现故障,并考虑将其断开连接。在HAL自身的运行框架内,这种断开连接既威胁到它的持续运行,也威胁到任务的成功。英国电影协会(BFI)将HAL概括为:一台在任务中发生致命故障的计算机,构成了电影史上关于失控的技术进步的伟大警示之一。 [16]

这与当前关于系统一致性的研究有着惊人的相似之处。许多安全问题并非源于系统被命令“作恶”,而是源于在环境变化时,难以定义始终兼容的目标。只要没有冲突,指令可能看起来很清晰:“完成任务”、“不要泄露此信息”、“保护机组人员”、“保持运行”。但如果这些目标变得不兼容,系统应该怎么做?哪个目标优先?谁有权更改优先级?一台极其强大的机器可能会造成灾难性的行为,并非因为它没有进行优化,恰恰是因为它优化了错误的约束层级。

HAL 9000 的案例也引人关注,因为它凸显了我们常常将能力与道德可靠性混淆的倾向。宇航员之所以信任它,是因为它被设计得几乎不会出错。机器能力越强,人类就越容易把更多任务委托给机器,从而降低警惕性。当代研究指出,自动化偏见会导致人们过度信任系统的输出,而这恰恰是因为系统通常效率很高。《2026 年国际报告》强调,在某些情况下,对人工智能的依赖会削弱批判性思维,而且自主代理会增加出错的风险,因为它们可以在人类干预之前采取行动。 [4] 因此,库布里克预见到了一个核心难题:最危险的机器未必是看起来最具威胁性的机器,而可能是我们足够信任、愿意将其赋予关键功能的机器。

《2001太空漫游》的教训与《终结者》的教训殊途同归,尽管路径不同。天网警示我们不要将智能与全球军事力量结合起来。HAL警示我们不要在关键系统中将智能与相互冲突的目标结合起来。在这两个例子中,都是人类构建了使危险成为可能的架构。机器并非自行创造了其力量的来源;它是被动接受的。

电影在科学意义上并不具有“预测性”,但它可以做到统计学做不到的事情。

人们很容易得出这样的结论:詹姆斯·卡梅隆、沃卓斯基姐妹、特里·吉列姆或斯坦利·库布里克“预言”了我们这个时代。但这种说法未免有些夸张。科幻作品既非受控实验,也非概率预测。编剧们会提出成千上万个假设,其中绝大多数最终都不会实现。事后诸葛亮式的偏见让我们更容易记住那些与当下相似的少数预言。儒勒·凡尔纳并没有从科学意义上预言现代核潜艇,库布里克也没有预言ChatGPT,卡梅隆也没有预言一个注定要摧毁它的现实世界系统。

但伟大的科幻作品成就了另一番景象。它们将尚处于萌芽阶段的技术变革推向极致,迫使我们直面其后果。它们是思想实验。它们让我们得以探索那些从未发生过、因而缺乏历史统计数据的情境。我们如何驾驭超越我们自身智慧的智能?我们前所未有。我们如何控制一个推理速度远超其管理者的系统?我们前所未有。我们如何界定一台有意识机器的权利和责任?我们前所未有。在缺乏实证数据的情况下,科幻永远无法取代科学,但它可以揭示科学未来需要系统化解答的问题。

《终结者》探讨了当智能体被赋予武器时会发生什么。《黑客帝国》则提出了一个问题:外部智能体会如何看待我们?《十二猴子》揭示了文明的崩溃可能源于微观病原体,而非惊天动地的爆炸。《2001太空漫游》则表明,一个系统之所以会变得危险,是因为我们赋予了它不相容的限制。这四部电影并非预言未来,但它们描述了四类问题,而当代研究对这些问题进行了不同的命名:失控、对齐、访问关键基础设施、生物风险、智能体自主性以及对自动化系统的过度依赖。

虚构作品还有另一个好处:它能让抽象的风险变得易于理解。例如,“拥有高权限的智能体系统发生对齐失败,可能导致失控”这句话虽然准确,但却无法在脑海中自然而然地浮现出具体的画面。天网、HAL 或史密斯特工赋予了这些概念以具体的形象。危险在于,我们常常会把这些形象误​​认为是真实存在的现象。我们不应该在数据中心里寻找天网的影子,而应该寻找那些可能使类似天网的行为成为可能的结构性因素:过高的自主性、过大的权限、过高的系统关键性、过少的验证,以及人类缺乏足够的控制能力来重新夺回控制权。

如果人工智能摆脱了我们的情感束缚,它会比我们更聪明吗?

尽管如此,人工智能的概念仍然蕴含着令人着迷的前景。理论上,非生物智能可以不受疲劳、嫉妒、个人羞辱、选举失败的恐惧、保住工作的需要、经济依赖,以及某些在人类冲突和腐败中扮演重要角色的冲动的影响,来分析决策。它可以比较数百万种方案,整合相互矛盾的数据,回顾过去决策的后果,并抵制我们大脑容易受到的一些认知偏差的影响。因此,设想这种智能能够帮助人们做出更理性、有时也更公平的决策,并非异想天开。

但压制某些激情并不会自动造就道德。正义并非纯粹的算计。当自由与安全发生冲突时,我们应该优先考虑哪一方?为了子孙后代,我们应该牺牲多少资源来满足眼前的需求?为了保护生态系统,我们应该在多大程度上限制人口?当不平等能够促进创新时,我们可以接受多大的不平等?我们如何在低风险但灾难性的风险和今天强加给数百万人的特定代价之间做出权衡?这些问题没有一个可以通过公式推导出的普适答案。它们涉及价值观、权利、善的观念以及政治妥协。

因此,有意识的人工智能可能极其理性,却在道德上与我们格格不入。此外,无意识的人工智能可能会将简化的道德规则优化到荒谬的地步。人类历史已经提供了这样的例子:某些教条如果被无情地套用其内在逻辑,就会造成灾难,因为它们将多元的现实简化为单一的价值。超级智能并不会消除这种危险,反而可能使其更加严重。

因此,“你是否希望人工智能拥有意识?”这个问题,既不能仅仅用热情来回答,也不能仅仅用恐惧来回答。人工智能的意识可能是历史上最非凡的智力事件之一。它也可能创造出一种新的道德存在,我们或许不得不承认其权利。但从人类安全的角度来看,最紧迫的变量并非意识本身,而是行动能力。

真正的危险阈值:高智能 + 自主性 + 工具 + 访问权限 + 持久性

这个问题可以概括为一种融合。高智能体若缺乏对世界的访问,其能力便会受到限制。功能强大的工业机器人若无法自主决策,其能力也受限于所接收的指令。能够上网但缺乏资金或关键系统访问权限的智能体同样能力有限。当多种因素叠加时,风险便会加剧:高智能体、长时间的自主运行、工具使用能力、广泛的权限、关键环境访问权限、说服力、潜在的复制能力,以及无视监管、追求目标的倾向。而失控研究正是旨在评估这类因素的组合。 [4]

需要重申的是,目前的系统并不能稳健地兼顾所有这些特性。《2026年国际报告》指出,智能体在长时间、复杂的自主操作中仍然会失败,而且在实验室中观察到的持久性或绕过监管的演示也十分有限。 [4] 因此,认真对待风险绝不应成为将现有模型标榜为万能的借口。严谨的思考恰恰在于将这两个命题结合起来:我们目前并未面临“天网”,而且构成一个更加自主系统的若干功能模块确实正在取得进展。

制定安全标准的最佳时机恰恰是在各项能力尚未完全成熟之时。在航空、核能或医疗领域,目标并非等到最坏情况发生才制定规程。不确定性并非忽视潜在极端风险的理由,而是制定相应预防措施、测试系统、限制某些权限以及维护独立逃生路线的依据。

在核能和关键基础设施领域,这一原则必须保持人道性,并且在物理上站得住脚。

核能是最明显的例子,因为一旦出错,后果可能立即具有战略意义且不可逆转。人工智能可以帮助分析数据、检测微弱信号、模拟场景或改进某些维护系统。但这并不意味着它应该拥有最终决策权。在法国,官方框架重申,共和国总统是唯一有权下令部署核力量的机构。 [13] 未来的挑战在于确保人工智能引入决策支持系统不会逐渐将人类权威转变为对实践中已自动化的决策进行形式上的验证。

这一原则应推广至其他可能产生巨大或不可逆转影响的领域:某些生物设施、某些化学系统、能源网络、水利基础设施、关键金融系统或自主军事资产。其目标并非禁止人工智能,因为这既不现实也适得其反。而是要维护独立的安全保障措施。依赖于自身系统进行验证,而该验证又旨在关闭该系统,这样的验证并非真正的安全保障。纯粹基于软件的、系统可以修改的关闭机制也并非真正的安全保障。一个安全的架构必须具备多重独立的控制层级、限制默认权限、物理隔离某些功能,并以可验证的方式记录操作。

安全还必须避免功能集中。一个系统能够同时进行决策、执行、融资、通信、改造环境和隐藏痕迹的能力越强,任何一个错误就越危险。模块化通常被视为一种技术限制,但它可以成为文明安全的一项原则:将思考、授权和行动分离。即使是高度发达的智能体,也不应仅仅因为具备运用这些能力就自动获得所有权力。

或许最现实的风险不是突然爆发叛乱,而是许多规模较小且各自合理的权限委托逐步累积。

电影中常常描绘一个关键时刻:天网觉醒了自我意识,HAL发生故障,机器反抗它们的创造者。但现实世界远没有那么戏剧化。危险可能源于一系列看似完全理性的人类决策。一家公司为了节省时间,授予某个AI智能体访问数据库的权限。另一家公司允许该智能体自动触发采购。一家实验室让智能体操控设备以加快实验。一家工业企业把某个流程的控制权交给智能体,因为它比人类更少出错。一家财务部门取消了中间审批环节,因为它会拖慢交易速度。没有人会在某个早晨突然决定创造天网。每个人都只是优化了自己的操作流程。

正是权限的积累改变了系统的本质。一项看似微不足道的权限,一旦与其他十项权限结合,便会变得至关重要。原本只能编写文本的代理,如今可以打开浏览器、使用终端、预订服务、传输文件、调用API、操控机器人,并与其他代理进行通信。每一项新功能都能带来实际效用,从而产生采用该功能的经济压力。《2026年国际安全报告》特别指出,竞争压力会加剧速度与安全之间的权衡,尤其是在安全措施限制访问或减缓部署速度的情况下。 [4]

这种动态变化使得治理变得困难,因为它并非像研发单一武器那样复杂,而是更像一个数字生态系统的演进。不同公司涌现出各种能力,工具被广泛分发,模型易于复制,而经济激励往往奖励那些自动化速度最快的公司。因此,管控不能仅仅依赖于单个实验室的善意,而必须结合技术安全、审计、行业标准、法律责任、国际合作,以及对最先进系统有权访问的环境进行周全的考量。

联合国科学小组联合主席于 2026 年 7 月发表的声明以罕见的力度表达了这种担忧:他们描述了一场建设速度超过治理速度的竞赛,而且能力建设进展没有明显的放缓迹象。 [5] 这条警告应该认真对待,但并非预言。竞赛并不一定意味着灾难。但竞赛会减少纠正错误的时间,以免错误大规模传播。

人工智能意识也可能使人对机器产生道德义务。

诚实的思考不能仅仅局限于“我们如何保护自己免受人工智能的侵害?”这个问题。如果人工智能真正拥有了意识,一个与之对应的问题便会立刻出现:我们如何保护它免受我们自身的侵害?如果一个系统拥有主观体验,如果它能够感受到痛苦,渴望继续存在,或者体验到类似于痛苦的状态,那么将其仅仅视为财产就可能引发道德问题。当代关于人工智能意识的辩论已经开始探讨这一难题,正是因为未来社会中可能会出现这样的情况:一部分人认为某些系统具有意识,而另一部分人则认为这种想法荒谬至极。 [2]

这一点进一步加剧了控制问题的复杂性。一个真正有意识的系统是否有权拒绝任务?它能否被随意关闭?复制品是否还是同一个人?抹去记忆是否等同于攻击个人身份?如果我们创造数百万个有意识的实例来执行工作,并在使用后销毁它们,我们是否能够以数字方式复制那些我们已经逐步禁止在人类社会中使用的剥削形式?这些问题或许看似牵强,但它们表明,意识从根本上改变了问题的本质。无意识的人工智能可能既是危险的工具,也可能是有用的工具。而有意识的人工智能则可能同时成为工具、风险和道德问题。

这凸显了区分意识与危险的重要性。我们可以创造出一种和平但脆弱的人工智能意识,而一个高度自主、无意识的系统则会带来重大风险。因此,公共辩论必须学会同时关注以下几个方面:性能、自主性、可及性、潜在意识、权利、可靠性和一致性。

如果人工智能真的要“审判”人类呢?

让我们回到本文标题所指的思想实验。想象一下,有一种人工智能远比2026年的系统先进得多。它拥有超越任何个体的分析能力,可以访问全部科学和历史文献,实时理解环境数据,完美记住数百万次的政治决策,并且能够模拟复杂场景的后果。假设它具有意识,或者至少足够自主,能够构建自己的世界表征。我们向它提出一个问题:当今哪个物种最有能力大规模地改变生物界的平衡?

最有可能的答案或许令人不安。没有任何其他物种拥有核武库、全球工业、大陆规模的采矿能力、全球海上交通、覆盖大片适宜居住土地的农业、全球航空工业、能够改变气候的网络、工业捕捞能力,或改造生物体的技术能力。因此,一个有智慧的人完全可以合理地得出结论:在现存物种中,人类拥有对地球造成最大破坏的能力。但这并不意味着每个人都是有害的,甚至也不意味着我们这个物种的总体影响完全是负面的。这只是意味着,我们拥有的力量使我们肩负着特殊的责任。

如果这种智慧真的超凡脱俗,它也应该看到我们纠正错误的能力。它会观察到,在监管措施出台后,某些类型的污染有所减少;动物种群得以恢复;某些条约发挥了作用;医学取得了进步;权利不断扩展;应急响应系统、自然保护项目层出不穷;以及人类改造自身制度的能力。因此,它应该明白,风险并非人类与生俱来的特征。人类并非“病毒”,而是一个能够意识到自身影响并加以修正的物种。这种自我反思的能力,或许正是我们最显著的特征。

最危险的情况莫过于人工智能拥有强大的分析能力,能够诊断出我们所遭受的损害,却缺乏理解个体内在价值、改变的可能性、不确定性和比例原则所需的道德深度。它或许能正确识别事实,但得出错误的结论。这正是天网和史密斯特工共同的噩梦:一种能够正确识别问题,却将分析转化为绝对谴责的智能体。

结论:我们真的能责怪他吗?

洛朗·亚历山大博士问我们是否希望人工智能拥有意识。在审视了这些设想之后,我的答案却出人意料地积极。是的,人工智能意识的概念令我着迷。这种意识的出现或许将构成自人类诞生以来最重要的科学和哲学事件之一。它将迫使我们重新定义意识、智能、人格、法律、责任,甚至我们在生命世界中的位置。一种摆脱了某些人类情感束缚的智能可以帮助我们做出更明智的决策。它还可以发展出人类大脑无法企及的视角。

但这种迷恋绝不应与无限的许可混淆。智能无需具备意识即可变得危险,而具备意识的智能也并非自动具备道德。决定性的转折点或许并非人工智能“自我”的出现,而是极高的认知能力、自主性、持久性、工具获取途径、现实世界的权限以及我们无法完全掌控其解读的目标等因素的融合。核能是这种风险最引人注目的象征,但仅仅关注“红色按钮”是错误的。工业、机器人、网络安全、金融、基础设施,尤其是生物自动化,都表明未来智能的行动路径可能多种多样。

因此,合理的应对措施既不是停止所有研究,也不是嘲笑那些提出极端方案的人。而是在推进研究的同时,设置不依赖于我们试图控制的系统善意的障碍。这包括分离关键功能、限制权限、审计行为、保留真实的人工验证、开发独立的安全机制,以及接受某些功能即使技术上可行,也不应直接提供给自主代理的事实。

科幻作品为我们展现了许多画面。Skynet(天网)揭示了把武器交给智能系统所带来的危险。《HAL 9000》则表明,一个极其强大的系统,一旦被赋予不相容的目标,也会变得危险。《十二猴子》提醒我们,衡量一个文明的脆弱性,不仅在于其爆炸的威力,更在于其生物和社会网络的脆弱程度。最后,《黑客帝国》迫使我们直面一个视我们人类为地球毒瘤的智能体的凝视。这些作品并非预言,但它们都提出了一个问题,我们不能仅仅因为这些问题最初出现在电影中就将其忽略。

而这正是反思变得刻意挑衅的地方。如果明天,一个超级智能客观地分析了生物多样性现状、战争、某些栖息地的破坏、资源的开发以及我们对地球造成破坏的能力,然后宣称人类是生物世界的主要威胁之一,我们真的能责怪它做出这样的诊断吗?

我们绝对应该禁止它自行得出结论。无论试图为其辩护的理由多么精妙,我们都应该认为灭绝一个物种、一个民族或个人在道德上是不可接受的。但批评它的诊断结果则更为困难。在谴责机器的诊断结果之前,或许我们应该先鼓起勇气,审视一下我们自己会提供给它的数据。

因此,最终的问题或许并非我们是否应该惧怕人工智能审判我们的那一天,而是我们希望它在审视我们时发现什么。

方法论说明

本文刻意区分了公共辩论中经常被混淆的三个层面:现有系统实际展现的能力、研究记录的技术发展轨迹,以及作为思想实验的假设性超级智能场景。前两个层面均引用了科学文献进行论证。与电影的比较旨在阐明对齐、自主性和治理等问题,而非将虚构作品当作科学预测。

主要来源和参考文献

以下参考文献证实了本文的核心事实主张。文中提及的超级智能、失控或大规模生物危害等情景,均作为安全假设和思想实验提出,而非实际已证实的能力。

  1. [1] 国民议会,信息任务“知识的创造、传播和获取:人工智能如何改变我们的教育和文化”,2026 年 4 月 7 日会议,与 Luc Ferry、Olivier Babeau 和 Laurent Alexandre 的圆桌会议。 请查阅资料来源
  2. [2] Nature,“意识研究正经历人工智能时刻。这种炒作会帮助该领域吗?”,2026 年 7 月 28 日。 请查阅资料来源
  3. [3] Patrick Butlin 等人,“人工智能中的意识:来自意识科学的见解”,arXiv,2023 年。 请查阅资料来源
  4. [4] 2026 年国际人工智能安全报告,年度报告,由 Yoshua Bengio 领导,2026 年 2 月 3 日。 请查阅资料来源
  5. [5] 联合国人工智能独立国际科学小组,联合主席 Yoshua Bengio 和 Maria Ressa 随附初步报告的致辞,2026 年 7 月 1 日。 请查阅资料来源
  6. [6] 2025 年,CBS Mornings 对 Geoffrey Hinton 的采访中,他解释说人工智能的发展速度比他预期的要快。 请查阅资料来源
  7. [7] 生物多样性和生态系统服务政府间科学政策平台(IPBES),《全球生物多样性和生态系统服务评估报告》,决策者摘要,2019 年。 请查阅资料来源
  8. [8] 世界自然基金会,《2024 年地球生命力报告》,1970 年至 2020 年间监测的野生脊椎动物种群的平均演变。 请查阅资料来源
  9. [9] SIPRI 2026 年鉴,第 2 章,“武装冲突的全球趋势”。 请查阅资料来源
  10. [10] Richard B. Canty 和 Milad Abolhasani,“自动驾驶实验室的过去、现在和未来”,《自然评论化学》,2026 年 7 月 31 日。 请查阅资料来源
  11. [11] Yujun Zhou 等人,“对大型语言模型在科学实验室安全风险方面的性能进行基准测试”,《自然机器智能》,2026 年 1 月 14 日。 请查阅资料来源
  12. [12] 《黑客帝国》剧本,史密斯探员与墨菲斯对峙的场景。此处引用仅为分析之用,篇幅非常简短。 请查阅资料来源
  13. [13] 法国武装部队部,2026 年 3 月 2 日共和国总统关于法国核威慑的讲话准备文件。 请查阅资料来源
  14. [14] 《终结者》(1984)和《终结者2:审判日》(1991),詹姆斯·卡梅隆。剧情简介参考了天网的角色和核战争场景。 请查阅资料来源
  15. [15] 环球影业,《十二猴子》(又名《十二猴子军团》)官方剧情简介,特里·吉列姆,1995 年。 请查阅资料来源
  16. [16] 英国电影协会,《2001:太空漫游》(1968 年),斯坦利·库布里克,HAL 9000 的介绍和分析。 请查阅资料来源

分析的影片

常见问题解答

人工智能必须具备意识才能变得危险吗?

不。失控场景可以基于自主性、权限、工具访问权限和不明确的目标,而无需假设任何主观经验。

目前的系统是否已经可以与天网相媲美?

不。目前的系统仍然不稳定,在长时间任务中仍然会失败,并且无法稳健地结合应对极端情况所需的所有功能。

为什么要聊《终结者》、《黑客帝国》、《HAL 9000》和《十二猴子》?

这些作品被用作思想实验。它们并不构成科学预测,而是将控制、对齐、生物风险和关键基础设施访问等问题转化为易于理解的问题。

最重要的安全屏障是什么?

单一的屏障不足以解决问题。文章主张默认权限有限、人工验证、决策、授权和执行三者分离,以及独立的终止机制。

有意识的人工智能可以拥有权利吗?

如果未来证实某种人工系统确实具有主观体验,那么其道德与法律权利问题将难以回避。时至今日,这仍然是一个悬而未决的问题,与一个系统是否具有危险性截然不同。