技术专题:CUDA 护城河被当众宣布"瓦解"——核到哪一步为止
本页目录(9 节)
日期:2026-07-24 类型:技术专题(事实核查 + 变体弹药库) 配套:英伟达、AMD、美光、SK海力士、技术卡·自研ASIC、技术卡·HBM、前篇《CUDA 锁死了什么》、《中国变量对七层的双向 swing》
📖 来源标注:[公司原文]=企业自己发布的材料;[媒体转述]=主流财经/科技媒体与行业研究;[不作数]=内容农场,本篇只用来说明"传言长什么样",不作任何数字依据;[估算]=本篇推算。
一句话结论
梁文锋那句话的准确版本是:"我们买英伟达的卡,但不用它的软件生态。" 不是"不用英伟达"。这两句差一个字,投资含义差一个数量级——前者攻击的是定价权,后者才是出货量,而讲话人自己承认的现实是后者还没发生(V3 训练用的就是英伟达卡)。
但把它当噪音也是错的。库在 2026 年 6 月那篇 CUDA 专题里写下过四条"到什么程度才算护城河松动"的检验信号,这次事件正好打在其中两条上,而且是第一次有具名的、前沿级别的团队公开点名。 本篇的工作是:把混成一团的四个断言拆开、逐条定级、用库自己写下的标尺打分,再算一笔被所有报道跳过的账——产能的天花板。
结论:软件这道墙确实在裂,裂的方式和库 6 月预判的机制一致(编译器抽象层),但多了一个当时没想到的加速器(AI 自己写 kernel)。而"墙裂了"在 2026–27 转不成英伟达的收入损失——卡在物理产能上,不卡在软件上。这两件事必须分开定价。
一、先把话核准:谁、在什么场合、说了什么
出处:腾讯科技刊出的一份闭门投资人交流会记录(约 4 小时,2026 年 7 月下旬),称为"轻度编辑"的实录。DeepSeek 官方没有确认过这份记录,也没有否认。[媒体转述]
这决定了它的证据等级:这是"媒体转述的、一场没有公开录音的闭门会"——比公司公告低两级。按库的排名级断言铁规("最大/唯一/完全替代"这类话,加上讲话人有强烈立场时,必须独立核实才能入库),这份记录里的任何一句都不能直接变成库的结论。本篇下面所有判定,都是拿它去和可独立查证的东西对撞的结果。
被媒体压成一句话的,其实是四个独立断言(中文标题几乎都只留了第一条):
| # | 断言 | 谁说的 | 能不能独立查证 |
|---|---|---|---|
| ① | 英伟达的 CUDA 护城河正在快速瓦解 | 交流会记录 | 判断类,不能查证,只能拆机制 |
| ② | DeepSeek 训练 V3 时"用了英伟达的卡、但基本没用它的生态",靠一个叫 TileLang 的编译器 | 交流会记录 | 部分可查(见第二节) |
| ③ | 华为 950 超节点在性能上可以完全替代英伟达 GB200/GB300 | 交流会记录 | 华为的机器规格可查,"完全替代"不可查 |
| ④ | 单芯片上华为和英伟达的差距是"4 倍 + 2 年" | 同一场交流会 | 与 ③ 出自同一张嘴,方向相反 |
③ 和 ④ 是同一场会里的两句话,几乎所有中文标题只转了 ③。 把它们放回一起,那句"完全替代"的意思其实是:在整机柜层面,用 4 倍数量的芯片加上自研互联,可以顶上——不是单卡打平。这不是抠字眼:4 倍芯片意味着 4 倍的先进制程产能、4 倍的 HBM、4 倍的电和机柜,而这几样正好是中国最缺的(第四节算这笔账)。
二、"不用 CUDA"到底是什么意思——以及 TileLang 是谁的
记录里的原话是:"V3 用了英伟达的芯片,但没有用英伟达的生态。我们写了一个叫 TileLang 的高级编译器。"[媒体转述]
第一件事:这句话本身就承认了硬件还是英伟达的。 前沿模型的预训练仍然跑在英伟达卡上——被绕开的是软件层(算子库、工具链、框架默认路径),不是芯片。对投资人来说,这是两件完全不同的事:
- 绕开软件 → 攻击的是转换成本和定价权(我还买你的卡,但我不再被你锁住,下次谈价我有得选)
- 绕开芯片 → 攻击的是出货量(我不买你的卡了)
目前公开可查的证据只支持第一件。
第二件事:TileLang 不是 DeepSeek 自研的。 查开源仓库(tile-ai/tilelang):它是一个基于 TVM 编译器基础设施的领域专用语言,用 Python 风格写高性能算子,最初由北京大学杨智教授指导的几位开发者做出来,部分工作是在微软亚洲研究院实习期间完成的;后端同时支持英伟达、AMD、苹果 Metal,华为昇腾的后端是 2025 年 9 月才加的,而且放在另一个独立仓库里(通常意味着还在预览阶段,不是生产级)。仓库里确实有 DeepSeek 的 MLA、NSA 算子实现,也确实有标注为 DeepSeek V4 的算子(2026-04-24)。[公司原文=开源仓库自身文档]
怎么读这个出入:最可能的情况是 DeepSeek 深度使用并贡献了这个项目,转述里的"我们写了"是口语化的省略或翻译损耗——我不打算把它读成"撒谎"。但它对判断有实际影响:
如果撬动 CUDA 的关键工具是一个开源、跨后端、任何人都能用的编译器,那这件事的性质就不是"DeepSeek 有秘密武器",而是"这条路对所有人都开着"。 对英伟达来说,后者其实更危险;对"中国靠自研突围"的叙事来说,后者要弱一些。
第三件事:这次多出来一个 6 月那篇没写进去的机制——AI 自己写 kernel。 记录里的论证是:代码生成能力的进步,会让"手写高性能算子"这件事的门槛塌掉。这一条值得单独重视,因为库 6 月把 CUDA 拆成六层时,判定最难攻的是第 4 层:开发者技能和招聘市场(网络效应)——十几年积累的人、教程、踩坑经验,用钱买不来。而"模型能写算子"恰恰是唯一一种能直接稀释人力网络效应的技术。它是不是真成立,见下面的检验信号。
三、拿库自己 6 月写下的尺子来量
前篇《CUDA 锁死了什么》给了四条"到什么程度才算松动"的信号。当时的核心判断是:训练侧极黏、推理侧在松。现在逐条打分:
| 6 月写下的信号 | 现在的证据 | 判定 |
|---|---|---|
| ① 跑在非 CUDA 栈上的推理负载占比上升 | 昇腾承接 DeepSeek 推理已是常态;华为 950 超节点定位推理与训练 | ✅ 在发生 |
| ② Triton/编译器路线在生产环境被采用 | TileLang 被前沿团队用于生产级算子,且跨后端 | ✅ 在发生,且比预期快 |
| ③ 有大厂在非英伟达硬件上大规模训练前沿模型 | 未被证实——见下 | ⚠️ 未成立 |
| ④ AMD ROCm 的库覆盖里程碑 | 本次事件无关 | 未更新 |
第 ③ 条是关键,也是传言最乱的地方。 网上大量文章说"DeepSeek V4 完全在国产芯片上训练、没用一张英伟达卡"——这些几乎全部出自内容农场 [不作数]。能查到的较可靠版本是两条互相矛盾的报道 [媒体转述]:
- 一条说:华为主导的团队宣称用约 1,000 张昇腾 910C 做了 DeepSeek 1.6 万亿参数模型的后训练——注意是后训练(post-training),不是从零预训练;
- 另一条说:DeepSeek 此前在昇腾上多次训练失败,R2 的训练改回英伟达硬件,昇腾负责推理。
再加上讲话人自己说的"V3 用的是英伟达卡"。 三条放在一起,最诚实的结论是:
预训练仍在英伟达上;昇腾目前坐实的是推理,加上后训练这类算力需求小得多的环节。"整条链国产化"目前是叙事,不是可查证的事实。
所以库 6 月的判断没有被推翻,反而被点名验证了——训练侧还黏着,推理侧在松。要更正的是节奏:6 月认为编译器抽象层是"正在成形的替代路径",现在它已经在前沿团队的生产环境里了,且多了 AI 写算子这个加速器。松动比库预期的快,但松动的位置和库预判的一样。
四、被所有报道跳过的那笔账:产能天花板
假设软件这道墙明天就彻底没了。中国能替换掉多少英伟达?这道题的答案不在软件里,在 HBM 里。
可查到的行业研究口径 [媒体转述]:
- 中芯国际的先进制程产能,做昇腾的裸片够一年一百万颗以上——裸片不是瓶颈;
- 国产 HBM(长鑫)2026 年产出约 220 万颗堆栈,只够封装约 25–40 万颗昇腾;
- 华为 2026 年目标产出约 60 万颗 910C,全系列裸片最多约 160 万颗——与 HBM 的上限对不上;
- 华为公布的路线图里,950 系列改用自研 HBM——如果兑现,这道天花板会往上抬,但那是 2027 之后的事。
按讲话人自己给的换算率折一笔账 [估算,口径粗,只用来定量级]:
2026 年国产 AI 加速器封装上限取乐观的 40 万颗 → 按他自己说的4 颗昇腾 ≈ 1 颗 GB300 → 全年折合约 10 万颗 GB300 等效。
对照一个不需要估算的数字:英伟达单季数据中心营收 $75.2B(2027 财年一季度,公司原文,见英伟达卡)。再对照讲话人自己说的:DeepSeek 一年花在芯片上约 200 亿人民币(约 28 亿美元)已经"非常吃力"——那是英伟达一个季度数据中心收入的 3.7%。[估算]
这才是这件事的真实尺度。 而且讲话人自己在同一场会里点破了:剩下的问题是产能,不是生态。
再叠一层:英伟达在中国的生意早就被两头掐——美国这边 H20/H200 的禁、解、加 25% 关税来回摆,中国那边有报道称已要求头部科技公司不得采购英伟达芯片 [媒体转述]。库在 7 月那篇中国专题里已经把英伟达的中国敞口定性为"已经写到接近零的免费期权"。
推论:中国境内的"去 CUDA 化",攻击的是一块英伟达账面上本来就快没有的收入。 它对英伟达 2026–27 的收入表几乎没有直接传导。真正的传导是第二顺位的,而且更慢、更值钱——见下节。
五、真正的传导路径(按七层拆)
| 层 | 谁 | 这件事的方向 | 强度 |
|---|---|---|---|
| 5 芯片 | 英伟达 | 直接收入:几乎为零(中国已写到零)。间接:证明"绕开 CUDA 可行"这件事会外溢到美国买家的谈判桌上 | 慢、但打的是定价权 |
| 5 芯片 | AMD | 最被忽略的受益者:TileLang 这类跨后端编译器,谁的硬件都能接——软件层每被抽象一分,AMD 的接入成本就降一分 | 中 |
| 5 内存 | 美光/SK海力士 | 最反直觉的一条:中国 AI 芯片的真瓶颈是 HBM。若 HBM 对华管制放松,是这两家的隐藏上行;若华为自研 HBM 兑现,是长期利空 | 中,双向 |
| 6 设备 | AMAT/泛林/KLA | 与「设备商:回不去的中国」(编号 L-19)同向——国产替代的棘轮又转了一格 | 弱增量 |
| 4 云 | 中国云 | 不在库的覆盖范围 | — |
| 2 模型 | 开源模型 | DeepSeek 定价"只赚合理利润"、V4 开源——持续压全球模型层的价格,与《效率突跃尾部》同一条主线 | 中 |
最值钱的那条是第一行的后半句:如果"绕开 CUDA"从中国的政治必需品,变成一份公开的、任何人可复制的技术路线图,那么下一次微软、Meta、亚马逊和英伟达谈价时,桌上就多了一个可信的替代方案——哪怕他们最后还是买英伟达。护城河的价值不体现在"有没有人叛逃",体现在"叛逃的威胁可不可信"。这直接指向库对英伟达的判断「英伟达:市场怕过头了」(编号 L-01)押的那个变量:利润率和份额能不能比市场怕的更持久。
六、候选判断(⚠️ 未入账,等你拍板)
按库的规矩,变体观点必须带认错条件才能进记分牌。我不替你决定要不要立这条,先把它写成可以被打分的形状:
候选名字:「CUDA:先塌的是价,不是量」 内容:市场把"CUDA 护城河"当作一个整体在定价,但它正在裂成两半——软件锁定(编译器抽象 + AI 写算子)会明显快于共识地退化,而系统级锁定(NVLink/整机柜/供应链)不会。所以正确的预期不是"英伟达丢份额",而是"英伟达在 2027–28 更难维持 65% 以上的营业利润率,尽管出货量继续增长"——先塌的是价,不是量。 方向:偏空英伟达的利润率,不偏空它的收入(与「英伟达:市场怕过头了」不冲突,那条押的正是利润率的持久性——两条会在同一个数字上分出胜负,这是好事,不是矛盾)。 认错条件(事先写死): ❌ 判我错:① 英伟达数据中心营业利润率在 2027 年内连续四个季度维持 65% 以上;或 ② 到 2027 年底,非英伟达硬件上的前沿级预训练(不是后训练、不是推理)仍未出现任何可独立查证的案例。 ✅ 判我对:数据中心营业利润率连续两季下行,且下行伴随的是竞争性定价(而非产品结构或成本),同时跨后端编译器在美国超大厂的生产环境被公开采用。 粗概率:45%(低信念——关键机制里"AI 写算子能替代多少人力网络效应"完全没有可量化的证据) 到期验证:英伟达 2027 财年各季财报(最近一次:Q2 FY2027)+ 2026 年底重估
第二件要你拍板的事:DeepSeek V4 的"正式版"据传本月底发布、并宣称完成去 CUDA 适配 [媒体转述]。这是一个近在眼前、可以独立查证的裁判点——发布时如果附了技术报告,就能查到预训练到底跑在什么硬件上。要不要把它挂成一个到期验证项?
七、正反两面:最强的反方在哪
反方一(最强):讲话人不是中立的。 他正在完成一笔超过 500 亿人民币的首轮外部融资;他的算力供给受制于出口管制;在中国的舆论环境里,公开唱多国产芯片是低成本、高收益的表态。这三条动机同时指向"把国产替代说得更好听"。 这不代表他说的是假的——代表他的话不能当第一档证据用,尤其是"完全替代"这种排名级断言。
反方二:护城河可能早就搬家了。 库自己的英伟达卡里记着:网络业务同比 +199%、增速全公司最快,护城河"正在从芯片延伸到整机柜系统"。如果真正的锁定已经从 CUDA 迁移到 NVLink 和整柜交付能力,那么"CUDA 松动"打的是一堵正在被搬空的墙。这是本篇结论最大的不确定性来源,也是候选判断只给 45% 的主要原因。
反方三:后训练不是预训练。 目前所有"在国产芯片上训练大模型"的可查证案例,都停在后训练或推理。预训练对互联带宽、稳定性、长时间不出错的容忍度要求高一个数量级——这正是 6 月那篇判定"训练侧极黏"的原因,而这个判定至今没有被推翻。
反方四("市场可能知道什么"): 英伟达现在的前瞻市盈率 ~16 倍 [媒体转述·报价快照],本来就是全库最低之一——市场早就在为"利润率见顶 + ASIC 侵蚀"打折了。也就是说,本篇这个候选判断可能已经被 price 进去了;真正的变体也许在反方向:市场怕的其实比会发生的更多。 这正是「英伟达:市场怕过头了」的内容——两条判断的对撞点是同一个数字:数据中心营业利润率。
八、诚实边界
- 本篇的触发事件是一份未经确认的闭门会记录。 所有由它衍生的表述都标了来源等级;库不会因为这条消息改任何一个承重数字。
- 中国的产能数字(中芯、长鑫、昇腾产量)全部是行业研究口径,政治敏感、几乎不可能有公司原文,误差可能很大,只用来定量级、不用来算估值。
- 本篇最重要的一次自我怀疑:我在第五节说"影响主要在定价权不在出货量"——这个结论依赖"英伟达的中国收入已接近零"这个前提。如果政策再次翻转(这一年已经翻了三次),这个前提立刻失效,整节要重写。
- 内容农场那批"V4 完全国产训练、零英伟达"的文章,本篇一条都没采用为依据——但它们正在塑造舆论,这本身是要盯的东西。
来源:交流会内容=腾讯科技刊出的会议记录及其英文转述(hellochinatech、ChainCatcher),DeepSeek 未确认 [媒体转述];TileLang 技术信息=开源仓库自身文档 [公司原文];华为超节点规格=华为官方新闻 [公司原文];训练硬件的相互矛盾报道=Tom's Hardware、Tom's Hardware(后训练) [媒体转述];产能与 HBM 瓶颈=SemiAnalysis、Tom's Hardware [媒体转述];英伟达财务=公司原文(见英伟达卡);股价=报价快照.md [媒体转述]。