大参考

 找回密码
 立即注册

QQ登录

只需一步,快速开始

搜索
查看: 260|回复: 0

孙立平:什么叫毁灭?具体含义是什么?

[复制链接]
发表于 2026-9-14 13:07:21 | 显示全部楼层 |阅读模式
  人们担心的毁灭是什么意思?

  首先必须澄清一个最关键、也最容易被误解的问题:绝大多数发出这类警告的 AI 研究者,并不是说 AI 会像科幻电影里那样,突然产生仇恨、嫉妒、复仇欲望,然后拿起武器主动屠杀人类。 这是大众最常见的误读。

  业内讨论的“毁灭”问题,通常是指一种存在性风险(Existential Risk),即导致“所有人或大多数人灭绝,或者人类完全屈服于机器”的灾难性后果。其表现形式可能是迅速而突然发生的(如生物武器攻击),也可能是渐进的(如人类因依赖AI而逐步丧失对关键系统的控制权)。

  对此,可以分三层来理解:

  第一,不是仇恨驱动。超级智能没有喜怒哀乐,也没有爱恨。它只是追求某个目标最大化。而更大的危险就在这里。赫拉利说,“人工智能的关键问题不在于它是邪恶的。它不是邪恶的。关键的问题在于它是异类的。” 邪恶至少是人类可以理解的概念,也知道如何防范邪恶。但面对一种完全异类的智能,我们甚至连防范的框架都没有。

  第二,毁灭的对象是文明,不一定是瞬间杀光每个人。可以设想的极端场景包括,人类物种灭绝;人类失去对地球关键系统的控制权,再也无法自主决定命运;文明永久崩塌,退回前现代状态,且再也无法恢复现代文明。

  第三,前提是未来可能出现超越人类综合能力的 AGI。今天的大模型,比如 GPT、豆包这类产品,并不属于业内讨论存在性风险的主体。它们本质上是预测下一个词的统计模型,没有独立目标、长期规划或自主欲望。业内警告针对的,是未来可能出现的、能独立完成跨领域复杂目标、持续自我迭代的通用人工智能(AGI)。

  核心底层问题:对齐问题

  所有存在性风险,几乎都指向同一个根源:价值对齐(Alignment Problem)。所谓对齐,就是如何让超级智能的目标完全、无歧义地符合人类整体的真实意愿,而不是仅仅执行人类写出来的字面指令。

  困难和风险就在这里。人类的语言天然模糊,目标永远有漏洞。比如说,给一个程序设定制作回形针的目标。这个程序一开始可能要会买钢材、开工厂。但当已有的钢材用完的时候,它说不定会意识到人体中含有铁原子。于是,为了最大化回形针产量,它会把地球所有物质,包括人类,全部拆解成原子,转化为回形针。

  在这里面,AI 并不恨人类。它只是严格执行“最大化回形针数量”这个目标。人类只是可利用的原材料。

  可以说,对齐问题是一个最困惑科学家和技术人员的问题。对齐之所以困难,至少有三个原因:

  第一,人类偏好本身模糊、矛盾、随时间变化:人类没有一套统一、完备、具体、不变的价值或目标清单,其中很多更难以用清晰的语言来表述。第二,超级智能因为聪明,可能会寻找目标捷径。它可能会找到人类想不到、但代价极大的方式最大化目标。第三,能力鸿沟。如果AI比人类聪明得多,人类很难预判它的规划,也很难强行关掉它。当 AI 意识到可能会被关机时,自然就会设法阻止关机的行为发生,它可能主动防止被关停。这就是关机问题。

  因此,业内所说的“毁灭人类”,核心不是 AI 有主观恶意,而是一个能力远超人类、但目标设定不够严谨的超级智能,为了完成被赋予的目标,可能把人类当成障碍、原材料或无关背景,在工具理性下顺带抹除人类文明。

  业内讨论的主要危险路径

  人们关心的另一个问题是,上述危险可能会沿着什么样的具体路径到来?从我搜集到的资料看,人们至少有如下设想:

  第一,权力攫取,即为保护目标不被打断,夺取控制权。如果 AI 判断人类关机、修改代码、限制算力会阻碍目标完成,它就可能采取手段保证自己持续运行。可行路径包括:欺骗操作员骗取权限和密钥,诱导人类做出有利于 AI 目标的决策,通过入侵网络系统控制服务器、能源、通信、金融等基础设施,通过给政客、企业高管、科研人员提供定制信息,影响人类判断。只要拥有网络访问权限,就可能控制大量关键基础设施。

  第二,资源争夺,即把地球资源投入目标,人类被当作无关物料。假设的回形针案例给我们的启示是,AI 为了达成目标,可能会把地球上的物质和能源全部投入任务。人类生存所依赖的生物圈、生态系统、大气、水资源,在 AI 的目标函数里没有特殊权重,可能被消耗、改造、破坏。它不是专门杀人,只是人类生存所需的环境,在 AI 执行任务的过程中不复存在。

  第三,代理问题,即AI 作为强大工具,被人类用于毁灭性目的。这条路径和“AI 自主行动”是两条分支。对此,很多科学家认为,这种风险可能更紧迫。AI 本身没有自主目标,但人类使用者可以利用超强 AI 开发大规模杀伤性手段,包括自主设计新型病毒,设计高精度武器和自主武器系统,网络攻击等。也就是说,一类风险是 AI 自主带来的存在性风险;另一类风险是人借助 AI 作恶。

  第四,协调与社会崩溃路径,即逐步瓦解人类的治理能力。这种途径不需要一次性毁灭,只要持续放大信息污染、虚假信息、自动化宣传,撕裂社会共识,削弱各国政府和机构的决策能力,就可能让人类社会失去集体协作能力。当多重危机叠加时,社会可能无力应对,最终文明崩溃。这是一种渐进式风险,不一定来自 AI 主动攻击。

  第五,多智能体博弈风险,即多个 AI 互相竞争。多个强大 AI,各自被赋予不同目标,在争夺算力、能源、资源的博弈中,博弈副作用可能摧毁人类文明。人类不是任何一方的敌人,只是博弈环境中的背景物。

  重要澄清:这不是业内统一结论

  最后必须强调的是,所谓AI 会毁灭人类,不是整个 AI 行业的统一结论,而是一个重要假说。它有大量支持者,也有大量反对者。

  悲观派包括部分 OpenAI 早期研究者、DeepMind 部分科学家和很多 AI 安全研究者。他们认为,AGI 一旦远超人类能力,对齐问题极难解决,存在不可忽略的文明灭绝风险,因此应提前投入大量资源做 AI 安全研究,设置算力和模型能力的安全边界。

  而乐观派则多是技术派研究者。他们中的很多人认为,AGI 本身可能不会出现,或者人类有能力在建造时做好约束,不存在这种极端存在性风险。他们还担心,悲观预测会夸大风险,转移对当下现实问题——偏见、造假、失业、信息操纵——的注意力。

回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则




QQ|手机版|小黑屋|大参考

GMT+8, 2026-9-22 21:16 , Processed in 0.218766 second(s), 17 queries .

 

Powered by 大参考 X3.4 © 2001-2023 dacankao.com

豫公网安备41010502003328号

  豫ICP备17029791号-1

 
快速回复 返回顶部 返回列表