DeepSeek 梁文锋拆解:中美 AI 算力差距有多大?国产芯片何时追上?


DeepSeek 创始人梁文锋在内部交流中罕见地披露了公司的算力现状和未来规划:两万张 H 等效卡、落后美国两年、华为 950 四张顶一张。在英伟达 GPU 被禁运的现实下,中国 AI 公司到底该何去何从?

引言

2026 年,中国 AI 行业面临一个绕不开的尖锐问题:算力。

OpenAI、Anthropic、Google 动辄几十万张 GPU 的训练集群,而国内模型公司能拿到的卡数少得可怜。梁文锋在这次投资者交流会上,罕见地披露了 DeepSeek 的真实算力数据,以及对中美算力差距、国产芯片替代路径的坦率判断。

这些信息,是整个行业第一次如此清楚地看到中国的真实位置。

一、DeepSeek 的家底:两万张 H 等效卡

“我们现在大概是两万张 H 等效算力,其中大部分是最近一两个月刚到。”

这是梁文锋首次明确披露 DeepSeek 的算力规模。两万张 H 等效卡是什么概念?这大约相当于 OpenAI 的几十分之一。

更关键的是,这些卡是刚刚才到位的。在此之前 DeepSeek 的算力还要少得多。也就是说,轰动全球的 DeepSeek V3、R1 等一系列模型,其实是在一个极其有限的算力条件下训练出来的。

梁文锋的态度是:有多少资源就训多大的模型。

“我们训练这么大的模型,并不是因为我觉得这么大的模型就够了,而是我刚好有这么多资源。我是按照我的资源来算的。”

梁文锋透露,融资之后 DeepSeek 的策略非常明确:在合理的价格里,能买多少卡就买多少卡。 他甚至说,”如果半年之内我就把钱花完,那太幸福了,太理想了。”

这不是豪赌,而是理性的算计——一台服务器的成本十个月就能收回,买卡比存银行划算得多。

但现实是残酷的:有钱也买不到。

“实际上要把这么多钱花完非常不容易,买不到那么多卡,很难买。”

二、中美差距:不仅是数量级,还有时间维度

梁文锋用两组数据清晰地描述了差距:

第一,模型规模的差距。

“现在最大的模型,激活参数大概是 800B。国内的话,我们在几十 B 的规模,差一个数量级。”

如果你要训练一个 800B 激活参数的模型,需要大概五万张 NVIDIA GB300,或者二十万张华为 950——而且这还只是训练,没有考虑做研究需要更多。

第二,时间的差距。

“落后美国两年,只用美国二十分之一的算力。”

这里的”两年”是指,华为 950 超节点大概相当于英伟达两年前的产品。英伟达今年 Q3 已经有新一代了,而华为 950 今年 Q3/Q4 才能出货。

但差距不仅体现在硬件上。

梁文锋指出,算力的差距会传导到人才差距——因为算力少,能做的实验机会就少,人才的成长速度就慢。

“人才的差距,本质上也是因为算力的差距。”

这是一个正反馈的恶性循环:算力少 → 实验少 → 人才成长慢 → 追赶更困难。但 DeepSeek 正在尝试用另一种方式打破这个循环——用更高的效率来弥补算力的不足。

三、英伟达的护城河正在瓦解

梁文锋在交流中提出了一个让投资者非常关注的观点:英伟达 CUDA 的护城河正在快速瓦解。

原因有三:

第一,AI 本身在瓦解生态壁垒。 以前要构建一套芯片生态,需要大量人力去写算子、做适配,这是英伟达花了几十年建立的优势。但现在有了 AI,”用 AI 来构建这个生态比以前容易很多了,因为 AI 可以写代码。”

第二,DeepSeek 自研的 TileLang 技术。 这是一种高级语言,用它可以很快地把 CUDA 的整套生态全部重写一遍。梁文锋透露,V3 训练的时候已经用英伟达的卡但没有用英伟达的生态——”我们先写一个高级编译器叫 TileLang,基于 TileLang 的生态来完成其他所有的事情,就已经几乎不依赖英伟达的生态了。”

第三,英伟达的游戏卡和计算卡正在脱钩。 CUDA 原本是从游戏卡演变出来的,它兼容游戏卡。但以前 AI 计算是个小领域,兼容游戏卡是合理的。现在计算卡的市场已经远超游戏卡,两者不再需要耦合。”专用芯片,不管华为还是英伟达自己,以后都是专用芯片。”

这个判断如果成立,意味着华为等国产芯片面临的最大障碍——生态问题——可能在未来一两年内被彻底解决。

四、华为 950:四张顶一张,落后两年

梁文锋对华为 950 超节点的评价相当具体和坦诚:

性能层面:”华为 950 超节点在性能和价格上可以完全平替英伟达的 GB200、GB300。所有 GB300 能做的任务,华为超节点都能做,延时什么的都一样。”

效率层面:”四张华为卡顶一张英伟达的卡。”

时间层面:”落后两年。”华为 950 今年 Q3/Q4 出货,相当于英伟达两年前的 GB200。

价格层面:”价格贵但无所谓,贵百分之一百都无所谓。”因为能买到就是胜利。

但最大的问题不是性能,而是产能。

华为给 DeepSeek 的产能是一万六千张卡。互联网大厂是十几万张,差一个数量级。

“我们买华为 950 的目的,还是希望帮华为把这个生态做好。一万六千张的华为 950,只相当于四千张的 B 系列,不是一个很大的量,意义不是很大。”

五、国产替代的未来:乐观但需要时间

梁文锋对国产芯片的未来总体持乐观态度,但给出了清晰的时间预期。

短期(1 年):”未来一年之内,我们能够看到国产芯片的生态没有问题。之前认为是有问题的,认为是用不起来、不好用,但未来一年之内我们能够扭转这个认知。”

中期(2-3 年):仍将卡在产能瓶颈上。”今年、明年、后年,我觉得可能都还是卡在产能问题上。”

长期(5 年):”我不太相信未来五年之后,我们还卡在产能的问题上。我还是比较乐观的。”

梁文锋认为,现在有”天时地利”的优势——一方面是英伟达买不到,国内被迫自研;另一方面是 AI 技术的进步为生态建设提供了新工具。

“在英伟达卡买不到的情况下,所有人都迫不得已都要去做国产芯片。在这个背景下,国产卡的适配是没有任何障碍的。”

但他也承认一个残酷的现实:四倍加两年——四张华为卡顶一张英伟达卡,加上两年的代差——这就是中国 AI 芯片在可预见的未来里要面对的现实。

六、DeepSeek 的策略:在限制中寻找最优解

面对算力上的巨大劣势,DeepSeek 的选择不是抱怨,而是利用这个劣势来建立自己的竞争优势

“我们跟美国的差距可能是 12 到 18 个月。我们用美国二十分之一的算力把事做出来。未来我们要把时间缩得更短——6 个月、3 个月。这是我们追求的目标。”

这个目标的基础是 DeepSeek 对效率的极致追求:

  • 别人不关心成本时,DeepSeek 把成本优化到极致
  • 别人用一万块卡时,DeepSeek 试着用一千块卡做出同样的事
  • 别人用 CUDA 生态时,DeepSeek 自己写编译器脱离 CUDA

“因为成本越低,我就越能训练更大的模型,我就越能承担起更大的模型。在算力有限的情况下,如果我的计算效率更高,我就能够承担起更大的模型。”

限制不是阻碍,限制是迫使你创新的动力。 这或许是 DeepSeek 给整个中国 AI 行业最宝贵的启示。


原文来源:梁文锋四小时投资者交流会(2026年5月20日)

如果你喜欢这篇文章,谢谢你的赞赏

图3

如有疑问请联系我