DeepSeek,华为,「必须成功」:十六万颗萤火照进荒原

Bitsfull2026/09/22 09:486877

摘要:

必须成功。


2019 年,中国量化圈最贵的一块资产,不在陆家嘴,而在杭州一栋写字楼的机房里。


一千一百张 GPU,幻方真金白银掏了近 2 亿元。机柜排开,占了接近一个篮球场的面积。机房里没有白天黑夜,唯一的背景音是高转速风扇刺耳的呼啸。


管机器的人给这个集群起了个代号,叫「萤火」。


这个名字很轻盈,但它背后的算盘极度现实。在那个大模型还没成为显学的年份里,一千一百张卡日夜不歇,唯一的任务就是在第二天集合竞价前,从海量的 tick 数据里给它的主人算出下一个基点的 alpha。


一台纯粹的印钞机。



同一年,一千多公里外的深圳,华为被列入「实体清单」。全球最顶级的先进制程与半导体 IP,在这一天彻底拉了闸。


两拨人都在为未知的变量买单。


幻方信奉算法。几个浙大年轻人只想抢在市场反应过来前,把巨额电费变成账面上的超额收益;华为手里的自研芯片,则是代价高昂的 plan B,它最好的宿命,原本是一辈子都别被派上用场。


那时候,他们彼此毫无交集。


没人能料到,杭州深夜里为二级市场点燃的那簇算力,几年后会一路向南,最终落进深圳那间老库房的硅片里。


萤火


在很长一段时间里,梁文锋在中国科技界几乎没有面孔。


他生在广东湛江,高考考了全市第一,随后北上浙大学机器视觉。移动互联网最狂热的那几年,同辈的聪明人大多涌去大厂做推荐算法,或者挤进 CV 赛道刷人脸识别。


梁文锋选了一条在当时看来完全不性感的事,教机器炒股。


商业逻辑其实极度枯燥,在撮合交易完成的千分之一秒里,把杂乱无章的高频数据变成账面超额。他和几个浙大同学把这家叫幻方的量化机构,做到了超过 1000 亿元的管理规模。


梁文锋骨子里对人肉判断极度不信任。交易员拼手速,分析师拼人脉,幻方完全倒了过来,他们相信机器,且只相信机器。


2019 年,他们搭了 1100 张卡的「萤火一号」;到了 2021 年,赌注翻了五倍。幻方掏出 10 亿元,一口气扫下上万张英伟达 A100,机房占地整整十个篮球场。这就是后来的「萤火二号」。



当时很多人觉得他疯了。一家量化基金,守着一堆高能耗的铁皮,为什么要沉淀几十亿在毫无由来的 infra 上?


直到 2022 年 10 月,美国商务部一纸禁令,把最顶级的算力通道彻底焊死。梁文锋抢在铁幕彻底合拢之前,把该囤的筹码悄悄买齐了。


他是那种走在时代前面太多的人。


任正非走的是完全不同的路子,他先把东西造出来,扔在暗处,然后静静地等。


这一等,就是整整十五年。


任正非比梁文锋大了整整四十岁。1987 年,这位贵州县城走出来的 43 岁中年人,揣着东拼西凑来的 2.1 万元,在深圳南油的一间逼仄民房里成立了华为。


后来的故事早已人尽皆知,从代理中国香港的交换机起步,到自研通信设备,再到席卷全球的 5G 基站和智能手机。业务版图铺得极大,但有一条暗线,任正非埋得很深,极少放在聚光灯下拆解。


2004 年,华为成立了一家全资子公司,叫海思。


海思成立的目的只有一个,就是造芯片。任正非给这支团队设立的终极指标只有一条,万一哪天外部断供,华为得有兜底的筹码。在那个全球化分工被奉为圭臬的年代,把资金倒进这个看不见底的重工业,在多数人看来极其反常识。


2018 年 12 月 1 日,加拿大警方在温哥华机场,扣下了他的女儿孟晚舟。


从那一刻起,海思这家藏在水下十四年的子公司,被迫以一种极其惨烈的方式浮上水面。它不再是一步看似多余的「闲棋」,而是成了整艘巨轮唯一的救生艇。


2019 年 5 月 16 日,美国商务部实体清单生效。


次日凌晨,海思总裁何庭波在全员信里写,所有沉睡多年的备胎,在这一夜之间全部转正。


三个月后,华为端出「昇腾 910」。


两处光景的反差极其鲜明。萤火被死死锁在杭州的恒温机房里,外界除了账面数字一无所知;而昇腾则被推到聚光灯正中央,接受全行业带着挑剔与审视的注视。


两端的人,都在为一件尚未发生的事情提前支出庞大的现金流。


只是那道闸门,比所有人预想的都要关得更快。


钝刀


最先被切断的是终端。


2020 年 9 月,台积电停掉了晶圆代工,5 纳米的麒麟 9000 成了绝唱。华为手里攥着第一梯队的芯片设计,放眼全球却找不到一家敢接单的代工厂。


真正的暗战落向了机房。


昇腾被推向一线。但在成熟的英伟达 CUDA 生态面前,几乎没有商业客户愿意为一套未经验证的国产体系买单。既然单颗算力在物理极限上追不上英伟达,华为索性换了一套极具工程暴力美学的解法。


单颗不够,就拿几千颗稍微落后的芯片强行连成一片。


这样做的代价是功耗飙升、电表飞转,但华为认这笔账。中国不缺便宜的绿电,也不缺成批能啃硬骨头的工程师。这是一条极度笨拙、极耗资源,但也只有他们耗得起的路径。


而在另一条轨道上,梁文锋迎来了他的大考。


2022 年 10 月出口管制落地,英伟达 A100 与 H100 对华全面禁售,此后流向国内的,只剩下被精准阉割过的特供版 A800 与 H800。



国内大厂和创业团队陷入了前所未有的 FOMO。有人四处寻觅二手卡,有人在东南亚找地下算力池,梁文锋没有参与抢购。他手里的底牌早就备齐了。


但提前囤货只能解决眼前的燃料,更冷酷的现实摆在后面,从今往后,哪怕付出数倍溢价,你也再不可能买到全球同代里最快的那把刀。


当工具本身差了一截,你拿什么去做出不输给对手的东西?


逼一个手艺人,用一把钝刀,去雕刻出与快刀毫无二致的精密花纹。


DeepSeek 后来所做的一切,就是把这种钝刀雕花的工程能力逼到了极限。


2024 年底,他们仅用 2048 张被砍掉互联带宽的英伟达 H800,耗资约 557.6 万美元,训练出了综合性能比肩一线大厂的 DeepSeek-V3。


这个成本账本直接把硅谷打懵了。要达到同等水平,海外头部实验室通常需要动用上万张顶级显卡,烧掉数千万乃至数亿美元。


DeepSeek 赢在一套近乎残酷的工程洁癖,把每一兆算力和显存带宽都榨干。


地缘封锁没有掐死他们,反而倒逼出了这家公司最具壁垒的核心资产。但所有人都清楚,跑在被阉割的英伟达芯片上,刀把终究还攥在加州人手里。


摆在面前的窄门,只剩下一扇。


后来人们给这条路起了一个充满妥协意味的词叫平替。但这哪里是什么性价比的精明选择,分明是被扼住喉咙之后,拼着一口气蹚出来的活路。


勾拳


如果说华为的还手是一场沉闷的阵地战,梁文锋打出的,则是一记不讲道理的勾拳。


2024 年,DeepSeek 先是用极度激进的 token 定价,把整个大模型商业接口的价格打穿,逼得同行连夜修改定价单。


2025 年 1 月 20 日,DeepSeek 毫无预兆地开源了 DeepSeek-R1,一个具备深度推理能力的模型,公开的训练成本只有几百万美元,不过是硅谷头部预算的一个零头。


资本市场迅速完成了定价。七天后,美股周一开盘,英伟达单日市值蒸发近 5900 亿美元,创下美股历史上单一上市公司单日市值的最大跌幅。



更有意思的是 DeepSeek 的资本结构。在大模型赛道疯狂抢夺中东热钱与大厂战略投资的时候,DeepSeek 没拿过外部机构一分钱。幻方在二级市场上靠高频算法一单一分赚出来的现金流,成了梁文锋这场豪赌的粮草。


R1 掀翻纳斯达克的余波还没散尽,华为在昇腾社区同步上线了 R1 和 V3 的全套部署镜像。


跑通了。


「国产芯片根本跑不动前沿模型」的定论,在这一天被捅穿了。


不过据我们了解,DeepSeek 和华为的深度绑定,其实开始得比外界看到的早得多。直到 2025 年初华为才突然发现,DeepSeek 早就背着所有人,悄悄对昇腾的底层环境做了极深度的适配与压力测试。


做硬件的人,甚至不是这间神秘实验室的第一批知情者。


代差依然巨大。昇腾 910C 的单卡浮点算力,大约只有英伟达旗舰 B200 的三分之一。单卡拼不过,华为选择在工程架构上继续硬堆,用数千根高规格光纤,把 384 颗 910C 强行串联成一个庞大的「超节点」,靠网络拓扑结构把总算力勉强拉到了同等水位。



代价显而易见,四倍于英伟达架构的恐怖功耗。


但中国的能源禀赋恰恰包容了这种消耗。内陆的戈壁滩上,风电和光伏足够便宜。


姿态算不上体面,但至少能跑。同一道密不透风的铁幕,终于把两家原本毫无交集的人推到了彼此面前。


梁文锋的模型跑在随时可能被断供的英伟达芯片上;而华为造出了国内最具规模的 AI 芯片,迫切需要一个全球顶级的模型来为这套 infra 的实战战力背书。


两块拼图,在这一刻严丝合缝。


商业世界里最牢靠的结盟,从来不是因为理念相投。


都是被逼出来的。


必须成功


2026 年,DeepSeek 罕见地向外寻找资金。


在此之前,梁文锋从未向资本市场低过头。幻方的现金流即便在行情最寡淡的年份,养活一个数十人的 AI 实验室也绰绰有余。


一个从不差钱的极客突然开口要钱,原因只有一个。他要推的那块石头,体量庞大到了个人口袋无论如何也装不下的程度。


他要做的事情,是联合华为,把下一代旗舰模型彻底平移到纯国产算力底座上。


在总规模高达 74 亿美元的融资盘子里,最大的一张支票来自梁文锋自己的 200 亿元人民币,直接占了总额的近五分之二。


但钱往往是硬工业里最容易解决的变量。


真正的硬骨头在软件栈。把模型从统治了行业近二十年的英伟达 CUDA 生态,连根拔起迁移到华为的 CANN 架构上,无异于推倒整座大厦重建。


这不是常规意义上的搬家。你得用另一套不顺手的工具,在平地里把同一座大厦从地基开始再砌一遍。底层算子要一个一个手写重构,数值精度要在千万次推理里重新对齐,连编译报错时抛出的堆栈提示,都是完全陌生的。


杭州和深圳的工位深夜长明。大批工程师对着充满未知的开发文档,通宵达旦地手动调优算子,直到终端屏幕上一行行刺眼的红字,在凌晨被一个接一个消灭。


大洋彼岸很快有了反应。


2026 年 4 月 15 日,黄仁勋在做客 Dwarkesh Patel 的播客时说,如果 DeepSeek 率先在华为昇腾平台上跑通并发布下一代旗舰,「那对美国而言,将是灾难性的(catastrophic)。」


打了三十多年硬仗、极少在公开语境流露情绪的黄仁勋,破天荒地吐出了灾难两个字。


几万张芯片的订单损失对他来说并不致命。真正让他感到不安的,是规则。


二十年里,全球顶尖模型团队有一条心照不宣的铁律。


最好的算法,必须跑在英伟达的 CUDA 生态上。那是他构筑的最深护城河。


而现在,第一次有第一梯队的 outlier,公开拒绝为这套规则买单。


护城河这种东西,一旦被人在死角凿开一个缺口,水就再也蓄不满了。


梁文锋算过一笔账,如果要训练出达到海外顶尖基准的模型,需要投入约 5 万张英伟达最新旗舰显卡;换成华为昇腾 950 系列,这个数字需要膨胀到整整 20 万张。


四比一的硬件折损率,外加至少两年的代际滞后。


更逼仄的是当下的产能供给。华为当下能腾挪给 DeepSeek 的单批次配额,大约只有 1.6 万张。


拿着这点筹码,在参数规模上根本没有硬碰硬的可能。


但他还是把整个公司的训练底座,全盘押在了华为芯片上。这是 DeepSeek 创办以来最大的一笔 bet。


据 The Information 援引知情人士转述,梁文锋当时只说了一句话:


「必须成功。」


草原


这条路的尽头,在内蒙古的一片草原上。


2026 年 9 月,DeepSeek 被曝出正在内蒙古规划一座超大型数据中心,里面将直接塞进整整 16 万颗华为昇腾芯片。


整个园区的能耗是按 GW 级规划的。这批芯片的核心型号是昇腾 950DT,单颗硬生生封装了 144GB 超大内存,靠极致的芯片内总线,在模型完成推理的同一瞬间,把 token 毫无延迟地分发出去。


这个具体型号,其实早在 2025 年 9 月的华为全联接大会上,就被轮值董事长徐直军投在了大屏幕上。从 950PR、950DT 到更往后的 960 与 970,华为把算力演进节奏定为一年一代。



徐直军在台上逐行勾勒产品蓝图的时候,台下坐着全球合作伙伴;而一年后要用这批卡赌上身家性命的梁文锋,当时并不在世博中心的会场里。


这些芯片,最终会点亮一片草原。


草原上几乎一无所有,除了呼啸的长风和毫无遮拦的烈日。但在这套残酷的算力公式里,廉价的绿电成了最关键的变量。


一个在先进制程上被卡死命脉的经济体,眼下能拿出来的筹码,只剩下风、光,以及一片无边无际、近乎零成本的荒原。


梁文锋太清楚这 16 万颗芯片的重量。当他当着投资人的面说出「必须成功」的时候,他就亲手烧光了所有的退路。



他骄傲了一辈子。不混圈子,不追热点。他当年做大模型,初衷极其纯粹,受够了中文技术圈只能跟在硅谷身后拾人牙慧。


这样一个极度自负的 technical founder,肯把这四个字挑明,本身就已经交了底牌。


骄傲,并别无选择。


从订单落地、产线排期到机房通电点亮,至少要走过一年半的漫长周期。最终能实际交付多少,取决于上游脆弱而逼仄的制造良率。没有人能打包票。


内蒙古的草原深处,长风从极远的地平线呼啸而过。空气干燥透明,深夜抬头能看见整条完整的银河。


16 万颗芯片最终会在西北的风沙里依次点亮。在浩瀚的草原面前,那些微弱的指示灯,依然像几年前杭州深夜机房里一样渺小。


但在漫长的周期里,灯还是要点的。


至于这 16 万点微光最终是连成通明的一片,还是被大风吹散在苍茫的戈壁里。


这个问题,只能交由时间本身来给出答案。


-END-