第一,人类偏好本身模糊、矛盾、随时间变化:人类没有一套统一、完备、具体、不变的价值或目标清单,其中很多更难以用清晰的语言来表述。第二,超级智能因为聪明,可能会寻找目标捷径。它可能会找到人类想不到、但代价极大的方式最大化目标。第三,能力鸿沟。如果AI比人类聪明得多,人类很难预判它的规划,也很难强行关掉它。当 AI 意识到可能会被关机时,自然就会设法阻止关机的行为发生,它可能主动防止被关停。这就是关机问题。
因此,业内所说的“毁灭人类”,核心不是 AI 有主观恶意,而是一个能力远超人类、但目标设定不够严谨的超级智能,为了完成被赋予的目标,可能把人类当成障碍、原材料或无关背景,在工具理性下顺带抹除人类文明。
第一,权力攫取,即为保护目标不被打断,夺取控制权。如果 AI 判断人类关机、修改代码、限制算力会阻碍目标完成,它就可能采取手段保证自己持续运行。可行路径包括:欺骗操作员骗取权限和密钥,诱导人类做出有利于 AI 目标的决策,通过入侵网络系统控制服务器、能源、通信、金融等基础设施,通过给政客、企业高管、科研人员提供定制信息,影响人类判断。只要拥有网络访问权限,就可能控制大量关键基础设施。
第二,资源争夺,即把地球资源投入目标,人类被当作无关物料。假设的回形针案例给我们的启示是,AI 为了达成目标,可能会把地球上的物质和能源全部投入任务。人类生存所依赖的生物圈、生态系统、大气、水资源,在 AI 的目标函数里没有特殊权重,可能被消耗、改造、破坏。它不是专门杀人,只是人类生存所需的环境,在 AI 执行任务的过程中不复存在。
第三,代理问题,即AI 作为强大工具,被人类用于毁灭性目的。这条路径和“AI 自主行动”是两条分支。对此,很多科学家认为,这种风险可能更紧迫。AI 本身没有自主目标,但人类使用者可以利用超强 AI 开发大规模杀伤性手段,包括自主设计新型病毒,设计高精度武器和自主武器系统,网络攻击等。也就是说,一类风险是 AI 自主带来的存在性风险;另一类风险是人借助 AI 作恶。
第四,协调与社会崩溃路径,即逐步瓦解人类的治理能力。这种途径不需要一次性毁灭,只要持续放大信息污染、虚假信息、自动化宣传,撕裂社会共识,削弱各国政府和机构的决策能力,就可能让人类社会失去集体协作能力。当多重危机叠加时,社会可能无力应对,最终文明崩溃。这是一种渐进式风险,不一定来自 AI 主动攻击。
第五,多智能体博弈风险,即多个 AI 互相竞争。多个强大 AI,各自被赋予不同目标,在争夺算力、能源、资源的博弈中,博弈副作用可能摧毁人类文明。人类不是任何一方的敌人,只是博弈环境中的背景物。
重要澄清:这不是业内统一结论
最后必须强调的是,所谓AI 会毁灭人类,不是整个 AI 行业的统一结论,而是一个重要假说。它有大量支持者,也有大量反对者。
悲观派包括部分 OpenAI 早期研究者、DeepMind 部分科学家和很多 AI 安全研究者。他们认为,AGI 一旦远超人类能力,对齐问题极难解决,存在不可忽略的文明灭绝风险,因此应提前投入大量资源做 AI 安全研究,设置算力和模型能力的安全边界。