大参考

 找回密码
 立即注册

QQ登录

只需一步,快速开始

搜索
查看: 826|回复: 0

戍天九思:算法换算力:华为廖恒大赞梁文锋与DeepSeek“系...

[复制链接]
发表于 3 天前 | 显示全部楼层 |阅读模式
  2026年7月25日,华为Fellow、半导体首席科学家廖恒罕见公开露面,接受了长达近5小时的深度专访。这位14岁考入清华、主导昇腾芯片从低谷逆袭的核心奠基人,首次对外系统阐述了半导体产业链的“18层宝塔”理论,并对DeepSeek创始人梁文锋给予了极高评价。

  华为人从不轻易对外发声。廖恒作为昇腾芯片的核心奠基人,其公开评价本身就是强烈的产业信号。而仅仅两个月前,华为董事、半导体业务部总裁何庭波刚刚发布“韬定律”——以“时间缩微”替代“几何缩微”,证明硬件能力可以不依赖制程微缩而持续提升。从何庭波在芯片制造端回答“硬件怎么造”,到廖恒在系统应用端回答“硬件怎么用”,华为在60天内完成了“后摩尔时代”从制造到应用的理论闭环。正是站在这一基座上,廖恒看到了梁文锋的价值——DeepSeek的稀疏架构与后训练,正是从算法层向下穿透宝塔各层级的系统级实践。

  与此同时,DeepSeek-V4-Flash正式版API于7月31日上线公测。模型架构、参数规模与预览版完全一致,仅通过新一轮后训练便实现了Agent能力的跨越式跃升。廖恒的赞誉与V4-Flash的惊艳表现并非巧合——两者共同指向同一个产业命题:在单芯片硬件红利逼近天花板之际,唯有“系统级突围”才能打开算力增长的新空间。

  一、18层宝塔:算力瓶颈的结构性困境

  廖恒将半导体产业链比作一座18层宝塔——从最底层的矿石、材料、设备、制造工艺,到中层的芯片架构、编译器、编程语言,再到顶层的模型算法和应用服务。产业链整体上限由最短的短板层级决定,各层级相互约束、深度联动。

  这座宝塔揭示了一个残酷的现实:硬件底层的迭代以“年”为单位。第4层的芯片架构改动一次,流片周期长达18个月,单次投入高达两到三亿元。而第10到13层的软件栈,迭代速度可以达到小时级。底层改不动,上层可以快跑——这是廖恒给出的基本判断。

  更严峻的是摩尔定律的经济性已基本失效。廖恒指出,自16nm、7nm制程节点起,单位晶体管成本不再持续下降,摩尔定律的经济效益已基本停滞。单纯比拼单芯片性能与制程工艺的时代已经结束。

  华为自身就是这一判断的实践者。英伟达Blackwell架构芯片拥有32倍的CUDA冗余算力,而昇腾芯片的冗余算力仅为8倍。华为没有走攻坚先进制程、堆参数规模追平单卡性能的老路,而是依托全栈软硬件协同与集群组网的系统能力,以系统整体性能弥补单芯片短板。

  二、梁文锋的选择:从算法层向下“穿透”

  正是在这一框架下,廖恒高度评价了梁文锋的战略选择。当行业普遍盲从缩放定律、疯狂堆叠参数时,梁文锋主动选择了难度更高的稀疏激活架构。在廖恒看来,这不是简单的算法微调或局部技术技巧,而是贯穿软硬件的顶层战略选择。“他已经先知先觉地提前去解决一个他预期到的问题。这就是先验者的价值。”

  DeepSeek-V4-Flash正是这一战略的产物。它采用MoE混合专家架构,总参数量2840亿,每次推理仅激活130亿参数。如同一个拥有庞大专业团队的组织,处理具体任务时只调动最合适的一部分专家。130亿的激活参数撬动了2840亿总参数的高性能——这正是“算法换算力”的核心逻辑。

  在注意力机制上,V4-Flash采用了CSA(压缩稀疏注意力)与HCA(强压缩注意力)混合的架构。模型不再是每读一个新词就把全部历史翻一遍,而是先压缩、再筛选,只有必要时才回看全局。这使得在100万词元上下文下,单词元推理计算量仅为V3.2的27%,KV Cache占用仅为V3.2的10%。

  廖恒对此有一个精辟的总结:“也许世界上有10万个AI算法研究者,只有梁文锋一个人深刻认知到,要用更多的复杂性换取更小的算力。”跨层是协同设计的核心——当一个人能跨越这些层,就会像一根线,把很多珍珠串成项链。

  三、后训练:不动骨架,重塑能力

  如果说稀疏架构解决的是“花更少的算力跑任务”,那么,后训练解决的是“用同样的算力完成更难的任务”。

  V4-Flash正式版与预览版的模型结构、参数规模完全一致,底层基座未做改动,仅完成新一轮后训练优化。效果却天差地别:Terminal Bench 2.1从61.8分跃升至82.7分,DeepSWE从7.3分飙升至54.4分。在九项智能体与代码基准上,V4-Flash正式版的表现甚至超越了V4-Pro预览版。AI开发者实测显示,V4-Flash完成相同任务耗时约40秒,而GPT-5.6 Sol+Codex耗时1分47秒。

  成本端的优势更具冲击力:缓存命中场景每百万词元仅0.02元,未命中输入1元,输出2元。对比GPT-5.6 Sol的输入5美元、输出30美元,成本差距达数十倍乃至上百倍。有开发者实测,连续运行近4小时消耗约1亿词元,总花费不到1元人民币。

  四、产业启示:中国AI的“非对称突围”路径

  廖恒与梁文锋的隔空对话,勾勒出中国AI产业一条清晰的“非对称突围”路径。

  在硬件层面,华为以“18层宝塔”的全栈协同弥补单卡劣势,从底层材料到集群组网能力构建系统级护城河;在算法层面,DeepSeek以极致的架构创新压榨每一片晶体管的潜力,用算法效率重新定义算力性价比。两者看似路径不同,实则共享同一底层逻辑:拒绝在对手设定的“单点参数”赛道上正面硬刚,转而以系统级思维重构竞争规则。

  廖恒指出,横向的专业人才并不稀缺,真正稀缺的是能纵向贯通多层、打通软硬件约束的复合型人才。梁文锋及其团队正是这种复合型人才的典范——他们从算法层向下“穿透”,用算法设计适配和驾驭现有硬件,而非等待硬件变强。

  这一逻辑正在产生深远的产业涟漪。在自动驾驶领域,特斯拉仅用144TOPS算力实现FSD(L2)落地,华为仅用400TOPS算力实现乾崑智驾ADS5.0(L3)落地,而国内其它不少车企却在1000+TOPS的算力军备竞赛中不可自拔——DeepSeek的“算法换算力”范式,恰恰为这种“堆算力陷阱”提供了破局思路。

  更深层的意义在于,这场“算法效率革命”正在打破“中国更擅长从1到10的应用创新”的刻板成见。DeepSeek的MLA、NSA、DSA等底层架构创新,以及华为在芯片全栈上的垂直贯通,证明中国工程师完全有能力在“从0到1”的原始创新中占据一席之地。

  总之,从昇腾的“18层宝塔”到DeepSeek的“算法换算力”,中国AI正在证明:真正的技术突围,从来不发生在单点参数的线性追赶中,而发生在系统级思维的范式跃迁里。当廖恒与梁文锋这两条看似平行的创新轨迹交汇,一个属于中国AI的“非对称时代”,或许才刚刚启幕。

回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则




QQ|手机版|小黑屋|大参考

GMT+8, 2026-8-8 06:48 , Processed in 0.421940 second(s), 16 queries .

 

Powered by 大参考 X3.4 © 2001-2023 dacankao.com

豫公网安备41010502003328号

  豫ICP备17029791号-1

 
快速回复 返回顶部 返回列表