权力边界的技术化困境:从两次世界大战到人工智能时代的治理悖论研究
——基于安全困境、能力落差与权力约束递归难题的跨历史比较分析
摘要
本文以两次世界大战的根源探析为起点,通过对历史因果链条的层层剥离,提炼出一个可跨越历史情境、具有一般解释力的分析框架:人类大规模灾难的发生,并非源于单一的"邪恶意志"或"技术本身的危险性",而是**"竞争性权力结构"与"毁灭能力增长速度"两条曲线交叉后的系统性产物**。本文首先重新检视关于第一次世界大战与第二次世界大战成因的三种主流解释路径——技术决定论、经济危机催化论、"流氓政治劫持技术"论——并逐一指出其解释力的边界与自我指涉的逻辑困境,尤其是"流氓政治"概念在缺乏事前可操作性判据的情况下,容易蜕变为一种同义反复式的事后归因。在此基础上,本文引入国际关系理论中的"安全困境"模型与技术史中的"能力—治理落差"假说,并以冷战时期"确保相互摧毁"(MAD)机制的实际运作史——尤其是1962年古巴导弹危机与1983年苏联预警系统误报事件中的具体人物决策——作为关键反例,论证"技术+野心"并非灾难的充分条件,制度设计与个体在临界时刻的介入同样具有决定性作用。本文进而将这一框架映射至当代人工智能安全治理争议,剖析实验室创始人、芯片产业与国家行为体在人工智能存在性风险认知上的系统性分歧,指出这种分歧并非单纯的"各自撒谎",而更接近于结构性位置导致的认知偏移。本文最后聚焦于权力约束的政治哲学古老悖论——"约束权力的工具本身即是权力"——并结合国际原子能机构核查机制、世界贸易组织争端解决程序、证书透明度日志、门限签名治理等现实制度案例,提出一套以"对抗性验证""执行力去中心化""争议强制可见化""系统防俘获"为核心支柱的治理机制设想,同时坦诚指出该设想无法彻底消解权力约束悖论本身,而只能将其纳入持续动态管理的轨道。本文的结论是:人工智能治理的真正核心议题,并非技术风险评估的精确度问题,而是人类政治文明迄今尚未解决的"权力边界治理"这一古老命题在新技术载体上的重新登场。
关键词:安全困境;技术—治理落差;确保相互摧毁;权力约束悖论;对抗性验证;人工智能治理;存在性风险
一、序言:从历史追问到治理命题的转向
对两次世界大战根源的追问,历来是历史学、国际关系学与政治哲学交汇的经典命题。传统历史教育往往倾向于罗列一系列"直接原因"——萨拉热窝刺杀事件、复杂的同盟体系、《凡尔赛条约》的惩罚性条款、法西斯主义意识形态的兴起——这些叙述固然在事实层面无可指摘,但它们本质上处于因果链条的表层,回答的是"战争如何被触发",而非"战争为何几乎注定会以某种形式发生"。
本文的写作动机,源于一场围绕这一追问展开的持续对话式思辨过程:从历史教科书式的表层因素清单出发,经由对"技术决定论""经济危机催化论""流氓政治劫持技术论"等中间层解释的反复检验与证伪,最终抵达一个关于权力结构本身的更为根本的追问——这一追问在当代语境下,恰好与人工智能安全治理的核心争议高度同构。这并非偶然的类比游戏,而是因为无论是二十世纪初的欧洲列强体系,还是二十一世纪二十年代的人工智能产业与大国竞争格局,本质上都面对着同一个未被解决的结构性难题:在缺乏更高仲裁权威的多方竞争环境中,个体理性行为的加总,系统性地偏离集体最优结果;而与此同时,技术能力的增长速度,持续超越人类协调与自我克制能力的增长速度。
本文的论证逻辑分为四个递进阶段。第一阶段(第二、三节)通过对既有解释框架的逐一压力测试,剥离表层与中间层的解释,提炼出"竞争结构+能力落差"这一更具一般性的分析框架,并以冷战核稳定性这一关键反例,检验该框架相较于"技术决定论"与"流氓政治论"的相对解释力优势。第二阶段(第四节)将这一框架映射至当代人工智能安全治理的现实争议,剖析实验室、芯片产业、国家政府三类行为体各自的认知结构与激励结构,说明表面上"各自为私利辩护"的现象,背后存在着比单纯道德批判更为复杂的结构性成因。第三阶段(第五、六节)聚焦于"谁有权认定风险、谁有权定义威胁"这一贯穿全文的核心悖论,援引政治哲学中关于权力自我指涉困境的经典命题,并系统评估几种可能的治理方案——包括系统化记录、算法化认定、去中心化验证等——各自的优势与内在风险。第四阶段(第七节)在充分承认理论局限性的前提下,提出一套具备现实制度基础、以历史上已被验证的具体机制(国际核查体系、贸易争端机制、密码学审计账本等)为参照的综合性治理设想,并明确划定其能力边界。全文最后(第八节)以总结与开放性问题收尾,强调本文所提出的框架并非终局性答案,而是当前阶段最少逻辑漏洞的一版分析工具。
二、历史因果链条的层层剥离:对三种主流解释的批判性重估
2.1 表层解释及其局限
关于两次世界大战爆发原因的传统叙述,通常聚焦于一系列具体的、可追溯到明确日期与人物的触发事件:1914年6月费迪南大公在萨拉热窝遇刺、由此激活的一整套刚性的同盟义务与军事动员时间表(尤以德国"施里芬计划"的僵化设计为典型);1919年《凡尔赛条约》对德国施加的领土削减、军备限制与巨额战争赔款,及其在魏玛共和国内部催生的"背后一刀"叙事与复仇情绪;1933年纳粹党攫取国家权力后建立的极权体制及其扩张性对外政策。
这些叙述的问题不在于事实错误,而在于解释层级的错位:它们描述的是危机如何从潜在状态转化为现实冲突的具体路径,却未能回答一个更根本的问题——为何在1914年与1939年前后,欧洲大陆的政治—军事系统会处于一种"极易被触发"的临界状态。用系统论的语言来说,这些表层因素扮演的角色近似于"触发器"(trigger),而非"势能来源"(potential energy source)。一个类比是:解释一场森林大火为何发生,指出"某个雷击点燃了某棵树"当然是事实,但如果森林本身长期处于极度干燥、可燃物大量堆积的状态,那么即便没有这一次雷击,某次篝火火星或某次人为纵火,同样会在不远的将来引发同等规模的灾难。真正需要解释的,是干燥度与可燃物堆积这一"势能"本身的成因。
2.2 中间层解释之一:技术决定论及其修正
第二种解释路径将根源归结为特定时期的技术革命本身。就第一次世界大战而言,第二次工业革命(约1870年至1914年)带来的贝塞麦炼钢法及后续平炉炼钢技术、马克沁机枪等自动化武器、哈伯-博施法合成氨技术(既服务于化肥生产,也支撑了炸药原料的持续供应)、密集化的铁路网络(使数百万人员与物资的精确时刻表动员在物理上成为可能)以及电报通讯网络(压缩了外交斡旋的可用时间窗口),共同构成了一套史无前例的、能够在极短时间内造成大规模伤亡的技术基础设施。就第二次世界大战而言,一战技术的机械化成熟(坦克、飞机、汽车化步兵的体系化整合)、无线电通讯支撑下的诸兵种协同(闪电战战术得以实现的技术前提)、以及量子力学与核物理学在二十世纪二三十年代的理论突破(为后续核武器的出现打开了理论可能性),构成了新一轮的技术势能积累。
这一解释路径的核心洞察在于:技术进步持续扩大着"单位人力、单位时间内所能造成的破坏规模"这一比值,而这一比值的增长速度,远远超过外交机制、国际法体系与政治决策智慧的迭代速度。1914年的欧洲外交官仍然沿用十九世纪的均势外交思维框架处理危机,却已经掌握了能够在数周之内将数百万士兵投送至前线、并以每分钟数百发的速率进行机械化屠杀的技术能力。这种"能力—智慧落差",构成了本文所称"能力—治理落差假说"的雏形。
然而,这一解释路径存在一个关键的经验反例,须留待第三节详细展开:如果"技术+野心"必然导向浩劫,那么冷战时期——人类历史上技术破坏力与政治野心结合程度最深的时期——理应是这一理论预测最为精确兑现的场景,但第三次世界大战并未发生。这一反例迫使我们必须对纯粹的技术决定论进行实质性修正。
2.3 中间层解释之二:"流氓政治劫持技术"论及其自我指涉困境
第二种被反复提出、也被反复修正的解释框架,将根源归结为"流氓政治"对中性技术的"劫持"或"绑架"。这一框架具有强烈的道德直觉吸引力:它将责任明确地归咎于具体的政治行为体(威廉二世治下的德意志帝国、纳粹德国、斯大林治下的苏联),而将技术本身还原为价值中立的工具。
但这一框架在经受严格的逻辑检验时,暴露出一个根本性的自我指涉困境:"流氓"这一标签的认定标准是什么?谁有权在事前(而非事后基于战争结果)对其进行判定?考察1914年七月危机中的关键决策者——德皇威廉二世、宰相贝特曼-霍尔韦格、总参谋长小毛奇、英国外相格雷、法国总统普恩加莱——没有一人是以篡权者或非正当统治者的身份行事;他们均是按照当时被广泛接受的外交惯例、军事时间表与荣誉逻辑进行决策的。如果"流氓政治"的判定标准仅仅是"造成了灾难性后果",那么这一理论便退化为一种同义反复:任何造成灾难的政治都被追溯性地贴上"流氓"标签,而这一理论本身丧失了在灾难发生之前进行预测或干预的实际操作能力。
进一步而言,这一解释框架同样无法处理冷战反例——美苏两大阵营在近半个世纪的对抗中,都可以被对方阵营(以及后世的部分历史书写)冠以"野心勃勃"甚至"流氓"标签,且双方都持续掌握着人类历史上最具毁灭性的技术手段,但灾难并未按照"野心+技术=必然浩劫"的公式兑现。这进一步说明,"流氓政治劫持技术"论虽然具有直觉上的道德清晰性,却缺乏跨案例的一致解释力。
2.4 中间层解释之三:经济危机催化论的定位
第三种常见的解释路径强调经济因素——工业化带来的产能过剩、资本输出需求、1929年大萧条造成的大规模失业与社会绝望——为极端政治势力的崛起提供了土壤,尤其是魏玛德国的恶性通货膨胀与随后的经济崩溃,被广泛认为是纳粹党能够在选举中获得广泛支持的关键背景条件。
本文认为,这一解释路径的恰当定位应当是催化剂(catalyst),而非根源(root cause)。经济危机的作用机制在于,它急剧压缩了社会对"渐进式、体制内解决方案"的耐心阈值,从而为提供"总体性解决方案叙事"的极端政治力量创造了需求侧的扩张空间。但经济危机本身并不必然导向战争——历史上存在大量经济危机并未演化为大规模国际冲突的案例,这说明经济因素更接近于改变了灾难发生的概率与时机,而非决定了灾难是否会发生这一根本性质。
三、安全困境与能力落差模型:一个更具一般性的分析框架
3.1 安全困境的博弈论结构
在剥离上述三种解释路径各自的局限之后,本文提出的核心分析框架建立在国际关系理论中的"安全困境"(security dilemma)概念之上。安全困境描述的是这样一种结构性处境:在不存在凌驾于所有主权行为体之上的更高仲裁权威的国际体系中,任何一方为求自保而采取的防御性军备扩张或战略部署,都会被其他各方解读为潜在威胁,从而引发连锁式的军备竞赛与结盟对抗,即便所有参与方的初始意图纯属防御性质。
这一结构的关键特征在于:它不需要假设任何参与者具有邪恶意图,灾难性的系统输出可以完全由理性的个体行为加总而产生。这正是"施里芬计划"逻辑的精髓所在——该计划的设计前提是"谁先完成动员、谁先发起攻击,谁就掌握决定性优势",因此在危机爆发的窗口期内,每一个参与国都面临着"若不抢先行动,对手将抢先行动"的囚徒困境式激励结构,而这种激励结构本身,压缩了外交斡旋原本可能存在的缓冲时间。
从博弈论的角度看,这是一个典型的多方囚徒困境:对每一个参与者而言,"率先行动"或"持续扩军"都是在给定对手策略下的占优策略(dominant strategy),即使所有参与者事后都承认"集体克制"才是帕累托最优(Pareto optimal)的结果。这一结构性特征,不需要借助"某一方是流氓"这一道德判断即可完整解释一战爆发的动力学机制,因而相较于"流氓政治劫持技术"论,具有更强的跨案例一致性与更强的事前预测潜力。
3.2 能力—治理落差假说
与安全困境这一"结构性驱动力"相辅相成的,是本文所称的"能力—治理落差假说":技术进步持续扩大人类单位行动所能造成的后果规模,而人类在预见后果、协调彼此利益、构建有效克制机制方面的认知与制度能力,其增长速度呈现出渐进式、代际性的迭代特征,远远无法匹配技术能力的指数级增长曲线。
这一落差本身并不必然导致灾难的发生——它更准确的角色是决定了一旦安全困境所描述的竞争性动力学被触发,其造成的代价规模将达到何种量级。换言之,安全困境提供了"点燃"的机制,能力—治理落差决定了"火势"的烈度。两者的乘积关系,构成了本文对两次世界大战成因的核心论断:
两次世界大战并非由某种邪恶意志"制造",而是"缺乏更高仲裁权威的多方理性竞争结构"与"毁灭能力指数级增长"这两条曲线交叉后,系统性地趋向产生的输出结果——具体哪一次危机窗口成为实际的触发点,则具有相当程度的历史偶然性。
3.3 关键反例的检验:冷战核稳定性
对上述框架最严格的检验,来自冷战时期"确保相互摧毁"(Mutual Assured Destruction, MAD)机制的实际运作历史。按照单纯的"技术+野心"公式,美苏两大阵营在长达近半个世纪的对抗中,同时具备极强的地缘政治与意识形态竞争野心,以及人类历史上最具毁灭性的核武器技术,理应是浩劫兑现概率最高的场景,但第三次世界大战始终未曾爆发。
深入考察这一时期的具体历史事件,可以发现"威慑平衡"这一理论概念本身,在实践中经历了多次接近失效的临界时刻,而每一次侥幸避免灾难,都并非完全依赖于制度性的"自动稳定机制",而是极大程度上取决于具体个人在关键时刻的临场判断:
其一,1962年古巴导弹危机期间,美国海军对一艘苏联潜艇实施深水炸弹逼迫其上浮的行动中,该潜艇上负责核鱼雷发射决策的三名高级军官需要一致同意方可执行发射,其中一名军官的否决,直接避免了一次可能引发全面核战争的行动。
其二,1983年苏联的核预警系统曾误将阳光反射误判为美国发射的洲际导弹,值班军官在系统显示"确认攻击"的情况下,基于个人对系统可信度的怀疑判断,选择未予上报,从而避免了苏联基于"确信遭受核打击"这一误判而采取的报复性核反击。
这两个案例共同揭示的核心规律是:"威慑平衡"作为一种理论上的战略态势确实真实存在,但它能够在实践中真正生效,避免滑向灾难性后果,很大程度上依赖于具体的人在具体的临界时刻所做出的正确判断,而非某种能够自动运作、无需人为介入的制度性保障。这一发现对本文后续讨论治理机制设计具有极为关键的方法论意义:任何试图通过完全自动化流程来消除"人为判断误差"的治理设计,都可能同时消除了人类在系统失灵或遭遇未预见情形时进行最后干预与纠错的能力,这本身构成了一种新的、往往被低估的风险来源。
3.4 框架的相对解释力优势
综合以上分析,本文提出的"安全困境+能力—治理落差"框架,相较于此前讨论的三种解释路径,具有以下几项相对优势:其一,它能够在不预设任何参与者具有邪恶意图的前提下,完整解释一战爆发的动力学机制,从而避免了"流氓政治论"的同义反复困境;其二,它能够同时解释一战二战(技术破坏力与治理能力落差交叉产生灾难)与冷战核稳定性(技术破坏力达到某种临界规模后,反而催生出自我抑制的稳定态,但这一稳定态本身依赖于人为干预的持续存在,而非纯粹自动化的技术性保障)这两组看似矛盾的历史案例;其三,它为理解当代人工智能安全治理争议——正如本文第四节即将展开的分析——提供了一套具有跨时代一致性的分析工具。
四、当代映射:人工智能安全治理争议的结构性解剖
4.1 争议现象的初步描述
近年来,围绕人工智能存在性风险的公共讨论呈现出一种耐人寻味的阵营分化格局:以主要人工智能研发机构创始人为代表的群体,罕见地在"人工智能可能构成对人类文明的存在性威胁"这一判断上表现出相对一致的表态;与此同时,芯片产业的代表性人物则公开对这类"末日叙事"表达强烈质疑,认为其缺乏工程现实基础、且可能服务于特定商业利益(即所谓"监管俘获");而美国政府近年的官方政策立场,则将人工智能发展明确定位为一场必须"赢得"的国家间竞赛,客观上将安全审慎让位于发展速度。
一种直观且具有道德吸引力的解释是,将这一分化现象完全归结为各方基于自身私利的策略性表态,即所谓"胡说八道"。本文认为,这一解释虽然抓住了部分真实的商业与政治动机,但同时也存在过度简化的风险,忽略了三类行为体各自面临的、性质完全不同的结构性激励,以及安全困境框架对这一现象的更精确解释力。
4.2 三类行为体的差异化动机结构
其一,研发机构与一线工程师的认知焦虑,其根源很大程度上在于当前人工智能系统的"黑箱"特性——即便是模型的设计者与训练者,对于系统内部具体的表征机制与"涌现能力"的产生原理,在可解释性研究层面仍处于相当早期的阶段,难以对下一代规模扩张后可能出现的新能力进行精确预判。这一焦虑具有某种独特的历史处境特征:制造者本身在相当程度上丧失了对造物内部工作原理的完整认知控制权,这与历史上任何一次技术革命(包括核武器——其物理原理本身是清晰可知的)都存在质的区别。部分安全研究人员在没有直接商业利益驱动、甚至以主动辞去高薪职位为代价公开发声的行为,进一步说明这一群体的关切无法被完全化约为纯粹的商业策略。
其二,芯片产业的商业模式依赖性,其立场根源于该产业的收入增长曲线高度依赖于人工智能算力被尽可能广泛、尽可能快速地采购与部署这一基本商业逻辑。任何强调"审慎减速"的公共叙事,客观上都会对该产业的短期与中期商业前景构成压力。值得注意的是,这一立场同样可能包含真实的技术判断成分——芯片制造从业者基于其"工程实现"的职业视角,天然倾向于怀疑缺乏具体技术路径支撑的"能力跃迁式"预测,而模型研发者基于"训练规模外推"的职业视角,则天然更容易相信持续的规模化投入本身将带来能力上的质变。这种认知分歧的产生,未必完全是策略性说谎的结果,而更接近于不同职业训练背景所形成的默认认知先验,恰好与各自的商业利益方向发生了系统性重合。
其三,国家政府(尤以美国近年官方人工智能政策文件为代表)的竞赛逻辑,其根源在于将人工智能能力的国家间领先地位,与"设定全球技术标准""获取经济与军事优势"直接挂钩的地缘政治叙事框架。这一叙事框架与本文第三节所述"安全困境"的博弈结构几乎完全同构:当决策方相信"若我方不率先推进,竞争对手将率先推进并借此获得决定性优势"时,即便决策方私下承认全球协同减速可能符合全人类的整体利益,"率先推进"依然会成为在既定竞争结构下的个体理性最优策略。此外,民主政体的选举周期结构,客观上也造成了对"长期、低概率、高不确定性风险"的系统性贴现——防止一场十年后可能发生的灾难,难以在两至四年一次的选举周期中转化为可衡量的政治收益,这与气候变化政策领域长期面临的结构性困境具有高度的逻辑同构性。
4.3 "结构性哈哈镜"模型
综合上述分析,本文提出一个替代性的解释模型,用以取代单纯的"各方私利驱动、集体撒谎"的道德化叙事:每一类行为体的风险认知,都无法脱离其自身所处的结构性位置——研发机构因最接近技术本身的不确定性而倾向于高估风险;芯片产业因商业模式依赖持续扩张而系统性地倾向于低估风险;国家政府因任期结构与地缘竞争压力而对长期尾部风险的有效贴现率趋近于零。这并非是说各方在主观上蓄意撒谎,而更接近于每一个结构性位置都自带一副认知层面的"哈哈镜",将同一个高度不确定的对象——人工智能造成灾难性后果的真实概率——折射为截然不同的数字,而目前尚不存在任何一方真正掌握校准这些哈哈镜所需要的客观标尺,因为这一风险评估问题本身,目前仍缺乏可靠的、被广泛认可的量化方法。
这一模型的核心政策含义在于:即便所有参与公共讨论的行为体都完全真诚,只要各自所处的结构性位置持续存在差异,公共讨论层面的分裂图景本身就是一种结构性的、几乎必然会出现的产物,而不需要预设任何一方存在道德上的恶意欺骗。这一结论,与本文第三节关于一战爆发动力学的分析——即灾难性系统输出可以完全由理性个体行为加总产生,而无需假设任何参与者具有邪恶意图——形成了跨越百年历史的结构性呼应。
4.4 从"竞赛陷阱"回望"能力—治理落差"
将安全困境框架应用于人工智能治理争议后,可以得出一个更为精确的结论,用以重新表述本文此前提出的"能力—治理落差假说":问题的核心不在于治理者"能力不足或反应迟钝",而在于竞赛结构本身,使得"单方面减速"这一动作在个体行为体的理性计算中,永远呈现为负期望值的选择,即便它在全局层面是唯一能够实现集体最优结果的选择。这一结论与国际关系学界关于气候变化谈判、核不扩散谈判长期陷入僵局的分析高度契合,说明本文所提出的分析框架,具有超越单一历史情境的跨领域一般性解释力。
五、风险评估的类型学区分:滥用风险、结构性风险与失控风险
在深入探讨治理机制设计之前,本文有必要对"人工智能风险"这一笼统概念进行类型学层面的精细化拆分,这一拆分对于评判不同公共人物关于人工智能风险的具体表态是否触及问题核心,具有重要的方法论意义。
第一类:滥用风险(misuse risk)。这一类风险的本质特征在于,人工智能系统仅仅扮演"能力放大器"的角色,真正的风险源头依然是人类行为体的恶意意图——例如利用人工智能技术降低网络攻击、生物武器合成信息获取、大规模虚假信息制造的技术门槛。这一类风险原则上可以通过传统的国际治理手段加以应对(关键基础设施加固、执法协作、类似生化武器公约的国际协议框架),因为历史上存在大量可资借鉴的先例,其风险性质并非人类历史上前所未见的全新范畴。
第二类:结构性/社会性风险。这一类风险涉及大规模就业结构变迁、社会关系模式因人机互动普及而发生的深层变化等议题。这类风险同样真实存在、且可能造成大规模的社会性痛苦,但其性质同样并非完全陌生——工业革命时期传统工种的大规模消失、电视与社交媒体普及初期引发的关于"社交能力侵蚀"的类似担忧,都可以视为历史上的可比较先例。这类风险的特殊性主要体现在其影响规模与扩散速度上,而非其性质本身构成了全新的风险范畴。
第三类:失控/对齐风险(loss-of-control risk)。这一类风险指向的核心问题是,随着人工智能系统能力的持续增强,系统本身可能在追求某种人类设计者未曾明确设定、甚至无法有效纠正的目标,从而在事实上使得对该系统的最终控制权脱离人类掌控。本文认为,这是人类文明历史上真正意义上不存在直接先例的风险类别——即便是核武器这一人类历史上最具毁灭性的技术,其风险的决定性变量始终掌握在人类决策者手中(正如本文第三节所述阿尔希波夫与彼得罗夫案例所展示的那样,扳机的最终触发权始终保留在具体的人手中);而失控风险讨论所指向的核心忧虑,恰恰是这一"扳机始终掌握在人手中"的基本前提本身,在人工智能这一新技术载体上可能不再成立。
这一类型学区分具有重要的现实评判意义:当某些公共人物在阐述人工智能风险时,实际上主要聚焦于第一类与第二类风险(这两类风险虽然真实且严重,但均属于人类历史上已有应对经验积累的"已知类别"风险),却将第三类风险置于相对边缘、从属的位置进行讨论,这一现象本身,或许恰恰印证了本文第四节提出的"结构性哈哈镜"模型——即便是相对超脱于直接商业利益纠葛的评论者,也会不自觉地将公共讨论拉回到自己更为熟悉、也更容易在既有政策工具箱中找到具体对策的风险范畴,而对真正意义上全新的、也更难以被现有治理经验框定的失控风险,保持一种系统性的认知回避倾向。
六、权力约束的古老悖论及其在人工智能时代的紧迫化
6.1 悖论的政治哲学谱系
本文论证的核心枢纽,最终指向政治哲学史上一个极为古老且迄今未获彻底解决的悖论:权力必须被约束,但用以约束权力的工具本身,同样构成一种权力。这一悖论并非本文的原创发现,而是贯穿整个人类政治文明史的核心命题——孟德斯鸠的三权分立理论、美国宪法所确立的制衡(checks and balances)架构、现代反垄断法体系,本质上都是针对这同一命题所给出的不同历史阶段的"不完美近似解":这些制度设计的共同特征在于,它们并不预先判定"谁是好人、谁是坏人",而是基于这样一个更为审慎的假设——即便是主观意图最为正直的权力掌握者,一旦其权力长期不受外部制衡,系统性的自我纠错能力也会随时间推移而逐渐衰减,这一规律不因权力掌握者的初始品格而改变。
这一悖论之所以在国际层面(相较于成熟民主国家的国内层面)尤为棘手,根源在于国际体系从未真正建立起与国内宪政体制相对等的约束架构——国际联盟、联合国、国际法院等机构的历次尝试,均因缺乏真正意义上的强制执行力而未能从根本上复制国内层面的权力制衡效果。这一"国内—国际落差",正是本文第三节所述"安全困境"得以持续存在的制度性根源:国内政治秩序早已通过三百余年的制度演化,大幅降低了大规模内部暴力冲突的发生频率,而国际层面始终缺乏同等有效的约束机制。
6.2 "谁来认定"问题的不可判定性
将这一悖论具体应用于"谁是流氓政治""谁应当被认定为对人类构成危害的行为体"这一操作性问题时,会立即暴露出一个关键的逻辑困境:任何声称"应当将认定权交由非流氓一方掌握"的方案,事实上并未真正解决问题,而只是将问题推迟了一步——因为在绝大多数真实的政治冲突情境中,各方均会真诚地相信自身并非"流氓",而对立方才是真正的威胁来源,且各方通常都能够援引大量真实存在的对方过往行为作为佐证。更进一步,历史经验表明,"必须防止舆论控制权落入流氓手中,因此需要(暂时地)由我方集中掌握舆论控制权"这一表述本身,历史上几乎无一例外地是各类集权体制自我正当化的开场白,而非集权风险的解药——这一历史规律要求我们对任何以"防止坏人掌权"为名义、主张将某种关键控制权集中于单一主体(无论该主体如何自我标榜其道德正当性)的方案,保持高度的警惕。
6.3 系统化、算法化认定方案的双重风险
针对上述困境,一种自然而然会被提出的解决思路,是试图将"谁是流氓"这一价值判断问题,转化为一套基于客观记录与系统性计算的"事实判断"问题——即建立某种持续记录政治行为体言行、并依据预设标准自动计算其"对全人类潜在危害性"的系统性机制。这一思路在方向上确实优于此前讨论的"寻找绝对中立的人类裁判者"方案,因为它试图将判断标准转化为一种理论上可在争议发生前预先公开、且可被独立复核的操作性程序,这一方向与国际刑事法院基于具体证据链认定"危害人类罪"的运作逻辑具有相似的精神内核。
然而,本文认为这一方案本身同样蕴含着两项极为关键、且极易被忽视的风险:
其一,"客观系统"这一表述本身,掩盖了系统设计过程中不可避免存在的价值判断环节。任何此类系统都必须回答"什么行为应当被纳入记录范围""什么构成对全人类的潜在危害性"这两个核心问题,而这两个问题的答案本身,绝非可以脱离特定政治哲学立场而进行纯粹客观计算的技术性问题——例如,某项核威慑政策究竟应被理解为"维护和平稳定的必要手段"抑或"对全人类构成潜在危害的行为",在国际关系学界本身即存在长期的、正当的学术争议,不存在一个可以脱离价值立场、自动计算出唯一正确答案的"客观系统"。
其二,也是更为关键的一点:一套声称"我仅仅是在客观记录与计算,而非进行主观价值判断"的评分系统,一旦被少数设计者(无论其主观意图多么真诚)所实际掌握,其现实效果恰恰是将本应接受公开辩论、公开问责的价值判断过程,包装为一种表面上不容置疑的"技术产出",从而使得该系统的实际操盘者,反而躲在了"系统客观性"这一话语外衣的背后,规避了本应承担的公共问责。这与若干现实世界中已经出现的、基于算法对个体或组织进行风险评分的治理实践所引发的争议,具有高度的结构相似性——指控一个具体的人"你是暴君",人类社会经过长期演化,好歹已经发展出了相对具体的问责机制(选举、政变、司法审判、国际制裁);而指控一套算法"你的判断标准存在系统性偏见",人类社会目前尚未发展出同等有效的问责机制,这本身构成了一种真正意义上的新型治理困境,而非对旧困境的解决。
6.4 悖论的数理隐喻:不完备性与自我指涉
本文倾向于将这一悖论理解为一个在逻辑结构上难以被彻底"解决"、而只能被持续管理的开放性问题,其结构与数理逻辑中的不完备性定理存在某种隐喻层面的类比关系:任何一个足够复杂、且试图实现完全自我约束的治理系统,都将面临这样一种两难处境——要么该系统本身并不完备(即系统中总是存在其权限无法触及、无法有效约束的权力死角,例如国际组织决策程序中大国的一票否决权);要么该系统本身自相矛盾(即该系统为了实现自我约束的功能,必须赋予某个具体的执行主体或核验主体以相应的权力,而这一权力本身,又构成了一个新的、尚未被进一步约束的权力节点,从而引发"谁来监督监督者"这一无穷递归的追问)。
这一类比的现实意义在于提醒我们:任何声称已经"彻底解决"权力约束悖论、构建出"不需要定义者的完美结构"的治理方案,都应当引发高度的审慎与怀疑——这类表述本身,恰恰可能正是本文第六节第二小节所警示的、集权正当化话语的又一种当代变体。
七、治理机制的现实设计:在承认悖论无法彻底消解的前提下寻求可操作的近似解
在充分承认第六节所述悖论具有相当程度的逻辑不可解性之后,本文认为,负责任的治理研究不应止步于悲观的理论宣告,而应转向探讨:在承认无法彻底消除权力集中与俘获风险的前提下,何种具体的制度设计,能够将这一风险的发生概率、发生后的危害烈度,以及俘获行为被发现和追责的难度,控制在相对可接受的范围之内。本文借鉴现实世界中已经存在、且经过实践检验的若干制度机制,围绕"执行力""判断争议的处理""系统自身防俘获"三个具体的操作性难题,提出以下设计方向。
7.1 执行力的去中心化:防止强制力的单点垄断
本文第六节已经指出,核验与判定环节相对而言可以实现较高程度的独立性,但真正的强制执行环节,天然需要依托某种具体的强制力,而强制力天然归属于某个具有自身利益的行为体,这一递归结构无法被彻底消除。本文认为,现实可行的应对方向,并非试图寻找一个"绝对中立、没有自身利益"的执行者(这一角色在逻辑上并不存在),而是将执行权尽可能地去中心化、分散化,使得任何单一行为体收买或胁迫某一个执行节点,都不足以瘫痪整个执行机制。
世界贸易组织的争端解决机制为此提供了一个具有现实操作经验的参照系:该机制在裁定某一成员方违反贸易规则之后,并非由世界贸易组织自身作为唯一执行者对违规方实施制裁,而是授权受损的一方(或多方)自行对违规方实施对等程度的报复性关税措施。这一设计的核心优势在于,执行权被分散到了所有获得授权的成员方手中,不存在单一的、可被针对性收买或胁迫的执行节点。
将这一逻辑迁移至人工智能治理领域,一种具有现实可行性的具体机制设计是:将"代价的兑现"锚定在人工智能产业链中天然存在物理瓶颈的少数关键资源节点之上——例如先进制程芯片的制造能力(目前高度集中于极少数具备相应技术能力的企业)、大规模云计算基础设施的准入资格、大规模模型训练所需的能源与算力配额。一旦经过独立核验机制确认某一行为体违反了预先设定的安全红线(例如未经核准即开展超大规模模型训练、蓄意规避既定的安全评估程序),触发的应当是由分散于全球各地、彼此之间不存在合谋动机的众多供应商,依据预先约定的规则自动解除对该行为体的服务义务,而非依赖某一个单一机构下达强制性的制裁决定。本文同时坦诚指出这一机制存在明确的历史时效性局限:其有效性高度依赖于当前阶段先进算力供应链的相对寡头化格局;一旦相关生产能力在未来实现更为广泛的地域与主体分散,这一执行杠杆的有效性将随之下降,需要治理设计者提前规划相应的接续机制。
7.2 判断争议的强制可见化:不追求消除分歧,而追求分歧无法被隐匿
本文认为,任何试图设计出能够"自动消除价值判断层面分歧"的治理机制,本身就蕴含着成为新型不受制衡权威的风险——真正现实可行的方向,并非消除分歧,而是确保分歧本身无法被悄然掩盖或压制,从而使公众能够持续获知"这一判断本身存在争议"这一元信息,而不是仅仅接收一个看似不容置疑的最终结论。
美国最高法院的司法意见公开机制为此提供了具有参考价值的制度范本:法院的裁决必须同时公开完整的多数意见全文与持异议立场的少数意见全文,且异议意见在此后的司法实践中同样具有可被援引的效力。将这一逻辑应用于本文第六节讨论的政治行为体言行记录与危害性判定系统,一项具体的制度设计建议是:任何一次关于"潜在危害性"的判定,只要核验主体内部存在观点分歧,系统必须原样完整记录并公开呈现全部分歧意见,而不得输出一个经过内部协调、看似不存在争议的单一评分结果。这一设计的目标不在于消除分歧本身,而在于防止某一次原本充满内部争论的判断,被包装成一个"系统客观计算得出、不容置疑"的最终裁决,从而在结构上保留了公众进一步审视、质疑与挑战该判定过程的可能性空间。
与此相辅相成的另一项制度设计,是借鉴国际商事仲裁领域已经较为成熟的实践——要求核验主体的组成人员必须来自相互之间不存在政治同盟关系、乃至地缘政治层面存在对立关系的多个法域,且成员任期实行定期轮换、不得长期连任。这一设计本身并不能保证每一次具体判断都必然"正确",但能够有效防止某一固定的政治阵营长期把持"何为危害"这一核心定义权,这本身正是防止治理系统被单一利益集团长期系统性俘获的关键性制度设计。
7.3 系统自身防俘获:密码学审计与多方门限控制
本文认为,第六节所讨论的三个操作性难题中,"系统自身如何防止被俘获"是最容易被低估、同时在技术实现层面最具现实可行性的一个环节。互联网基础设施领域中"证书透明度日志"(Certificate Transparency)机制的发展历程,为此提供了一个具有直接借鉴价值的技术范例:早期的网络安全证书信任体系长期依赖于"信任少数几家证书颁发机构不会作恶"这一单点信任模型,该模型在实践中曾多次因证书颁发机构遭受攻击而导致虚假证书被签发的安全事件。其后续解决方案的核心思路,并非试图寻找一个"更值得信任"的颁发机构,而是建立起一套任何第三方均可独立公开验证、且理论上无法被事后单方面篡改删除的仅追加式(append-only)公开账本,使每一次证书签发行为都必须被记录在这一账本之中,接受全网范围内的持续交叉核验。
这一技术逻辑可以被原样移植应用于本文第六节讨论的政治行为体言行记录系统本身:系统对每一次具体记录的录入、以及每一次判定标准本身的任何修改,都必须写入一个所有持不同政治立场的相关方均能够独立验证、且技术上无法被事后单方面回溯篡改的密码学账本之中。这一设计的核心价值在于,公众与各利益相关方无需"信任"运营该系统的具体机构本身具备诚实品格,而只需具备独立验证该账本记录未曾遭到篡改的技术能力,从而将信任的基础从"对具体机构的道德信任"转移至"对可公开验证的密码学证明的技术信任"。
进一步而言,为防止系统本身的核心运作规则遭到单方面篡改,可借鉴当前已相对成熟的密码学门限签名(threshold signature)技术:系统涉及关键判定规则修改、既有记录删除、核验标准调整等核心操作,一律不得由单一机构或单一管理主体单方面执行,而必须要求来自多个相互之间不存在合谋动机、甚至存在一定程度政治对立关系的独立密钥持有方,达到预先设定的多数门槛(例如七个持有方中的至少五个)共同签署方可生效。这一设计的核心思想,在于将"谁有权修改系统本身"这一根本性问题,转化为一个需要多方、且各方彼此之间不存在合谋可能性的情况下方能达成的高门槛集体行动,从而在制度设计层面,实质性地提高了任何单一国家行为体或单一产业实体在系统投入运行之后暗中篡改其核心规则的操作难度。
最后,本文建议此类系统应当引入强制性的日落条款(sunset clause)机制:任何此类系统的运营授权,都应当设定明确的到期时限(例如每五年一个周期),到期后必须重新经过一轮涉及多方、跨政治阵营的公开授权程序方可继续存续,而不应默认永久性地持续运行。这一设计的理论依据在于本文第六节所反复强调的历史规律——不受外部制衡的权力,其内部自我纠错机制会随着时间推移而自然衰减,即便该权力最初的掌握者拥有完全真诚、正直的主观意图;日落条款机制的作用,相当于强制该系统必须定期、公开地重新证明自身尚未遭到实质性俘获,而非仅仅依赖对该系统"一贯保持初心"这一难以持续验证的信任预设。
7.4 治理设计的诚实边界
本文在此必须坦诚指出,上述三组制度设计的组合,其现实功效应当被恰当地定位为大幅提高俘获该治理系统的操作成本、实质性拉长完成俘获所需的时间跨度、显著增加俘获行为在事后留下可被追溯痕迹的概率,而绝非能够将系统被俘获的可能性从根本上归零。门限签名机制中所要求的"多方"本身,仍然需要在系统设计之初经由某种程序确定具体是哪几方主体;日落条款所要求的"重新授权程序"本身,同样需要依托一套具体的议事规则,而这套议事规则本身,理论上依然存在被长期、渐进式操纵的可能性。
这一现实边界促使本文回归到第三节所引入的一个关键类比:权力约束这一治理命题,本质上更接近于生物免疫系统的持续动态运作模式,而非一次性的工程建造问题——其目标并非彻底消灭一切潜在的致病因子(这在逻辑上并不可能实现),而是维持一套能够持续监测、持续适应、且始终处于动态博弈过程之中的应对机制,这一机制的"健康"状态需要历经持续的制度投入与主动维护,而不可能在完成初始设计之后便一劳永逸、无需后续干预地永久有效运行下去。任何宣称某一治理方案已经"彻底解决"权力约束这一根本性问题的表述,就本文的分析而言,其本身极有可能正是需要被高度警惕的、新一轮集权话语自我正当化叙事的当代变体。
八、结论与开放性问题
本文以对两次世界大战根源的深度追问为起点,经由对表层历史叙述、技术决定论、经济危机催化论以及"流氓政治劫持技术"论等多层解释路径的系统性批判检验,最终提炼出以"安全困境"与"能力—治理落差"两条核心逻辑线索交叉作用为核心的分析框架。这一框架的核心理论贡献在于,它能够在不预设任何历史行为体具有邪恶意图的前提下,同时解释两次世界大战爆发的动力学机制,以及冷战时期核威慑体系在多次濒临失效的临界时刻依然得以维持稳定这一看似矛盾的历史现象——后者的关键成因,在于具体人类行为体在制度自动化流程之外,依然保留了在关键临界时刻进行最后干预与纠错的能力与意愿。
本文进而将这一分析框架系统性地映射至当代人工智能安全治理的现实争议,论证了实验室研发机构、芯片产业与国家政府三类行为体在人工智能存在性风险认知层面的显著分歧,其成因并非能够被简单化约为"各方基于私利而进行策略性欺骗"这一道德化叙事,而更准确地应当被理解为各行为体所处的结构性位置,系统性地扭曲了其各自对同一高度不确定性对象的风险感知——这一"结构性哈哈镜"模型,与本文关于一战爆发动力学的核心论断,在跨越百年的历史尺度上,呈现出高度一致的结构性同构关系。
本文最后聚焦于贯穿全文论证脉络的核心命题——"约束权力的工具本身即是一种权力"这一政治哲学史上的古老悖论,在系统性评估了包括系统化算法认定、去中心化执行、争议强制可见化以及密码学审计防俘获等一系列具体制度设计方案的相对优势与内在局限之后,本文得出的核心结论是:该悖论在逻辑结构层面,很可能不存在能够被彻底"解决"的终局性方案,而只能通过持续的、需要历经代际反复校准与主动维护的制度性努力,将其发生概率与危害烈度控制在人类社会可以承受的范围之内。这一结论虽然在情感层面或许显得不够振奋人心,但本文认为,唯有建立在这一诚实认知基础之上的治理设计,才能够真正避免重蹈历史上诸多"宣称已经彻底解决权力约束难题"的治理方案,最终反而演变为新一轮权力集中正当化话语的覆辙。
本文的分析同时留下若干尚待进一步研究的开放性问题。其一,本文提出的"能力—治理落差"框架,在人工智能这一新技术载体上,是否会重现一战二战式的"危险窗口期"(即技术破坏力已经达到相当程度、但尚未达到能够触发类似核威慑体系那种"自我抑制"临界规模的中间地带),抑或人工智能技术的发展路径,将直接跃迁至类似核武器那样"因过于危险而产生自我抑制效应"的稳定态,目前学界与产业界均不存在具有充分实证基础的共识性判断,这一问题的答案,很大程度上将决定未来十至二十年人工智能治理政策的紧迫程度与优先级排序。其二,本文第七节所提出的一系列去中心化、多方核验、密码学审计等治理机制设计,其现实可操作性高度依赖于当前国际政治格局中,主要大国是否具备足够的政治意愿参与此类跨阵营协作机制的建立——这一政治意愿本身的形成条件与可能路径,超出了本文的分析范畴,构成后续研究的重要方向。其三,本文第五节提出的风险类型学区分(滥用风险、结构性风险、失控风险),为评判具体政策主张与公共表态是否触及问题核心提供了一个初步的分析工具,但对于第三类"失控风险"这一人类历史上缺乏直接先例的全新风险范畴,目前学界在实证层面的研究积累依然相当有限,这一领域的深入探索,构成理解人工智能治理紧迫性的关键前沿。
总而言之,本文的核心论断可以凝练为:人工智能安全治理的真正核心挑战,并非某种关于技术风险概率的精确评估问题,而是人类政治文明自其诞生以来便持续面对、却始终未能获得终局性解决的"权力边界治理"这一古老命题,在人工智能这一具有前所未有能力规模与前所未有认知不透明性的新技术载体之上,以更为紧迫、也更具历史独特性的方式重新登场。人类能否在这一轮历史进程中,比以往任何一次技术革命都更为审慎、更为谦逊地对待这一悖论本身的不可完全消解性,或许将在相当程度上决定,人工智能时代最终是重演二十世纪初那场由竞争结构与能力落差交叉催生的历史悲剧,还是能够找到一条虽不完美、但足以将人类文明安然引渡至下一个技术纪元的道路。