DeepSeek V4深度适配昇腾950PR的本质:国产AI跑通了全自主低成本的全新路线

上个月帮一个做企业咨询的朋友改方案,他每天要喂给大模型近百万字的行业报告和客户资料,光GPT的API费用,一个月下来快六千块。 他吐槽说,这钱花的比雇个实习生还贵,换成国内某头部大模型,倒是能省一半钱,但是喂进去的资料超过十万字,AI就开始张冠李戴,把A公司的营收安到B公司头上,根本没法用。 上周凌晨两点他突然给我发消息,甩过来一张内测截图,说DeepSeek刚放的V4测试数据,相同的一百万token输入,处理速度比他之前用的H20集群快了两成,调用成本算下来,连GPT的十分之一都不到。 我第一反应是吹牛逼,找圈里做算力的朋友问,对方只回了一句,四月下旬就发,这次是真把华为那新卡啃透了。

可能很多人不知道,国内大模型这两年,最大的痛点从来都不是算法,也不是数据,是没卡用。 英伟达的H100,别说采购,连正规进关的渠道都没有,有钱都买不到,大家能抢到的,只有英伟达专门给中国市场做的阉割版H20,带宽砍了近六成,互联速度砍了一半,就是不让你做大集群训练,就算这样,去年H20的价格还是被炒到了十万块一张,比原价翻了三倍,还得排队等半年。 去年年中某头部大厂的朋友跟我喝酒,说他们拿了两千张H20,本来想做主力推理集群,结果跑128k上下文的72B模型,单卡每秒只能出十几个token,比H100差了快三倍,算下来每百万token的成本快到十块钱,用户调用贵,他们自己也赚不到钱,就卡在这,上不去下不来。 之前也有很多厂商说自己适配了国产芯片,我测过不少,大部分都是浅适配,就是拿个转换工具把模型转一下,能跑就行,性能折损一半都算好的,好多跑个7B的小模型,出字速度慢的像蜗牛,更别说跑几十上百B的大模型了。 为什么没人做深度适配?因为这活太苦了,太磨人了,还不讨好。 英伟达的CUDA生态做了十几年,所有的模型算子,所有的调度逻辑,都是围绕英伟达的硬件做的,国产芯片的架构和英伟达不一样,你要把大模型的每一层计算,每一个算子,都拆开来,对着国产芯片的硬件单元重新写,还要调集群的调度逻辑,调驱动的细节,稍有不慎,性能就差一大截。 之前某开源模型团队的负责人跟我说,他们把自己的70B模型往某国产芯片上适配,光调核心算子就调了四个月,最后性能才到H100的六成,就这已经算行业标杆了,大部分团队连调都懒得调,反正对外说适配了就行,谁会真的去测性能。

这次DeepSeek干的事,和所有人都不一样。 他们不是等模型做完了再去适配芯片,是从去年昇腾950PR流片回来,就派了核心团队驻场在华为海思,模型架构设计的每一步,都对着昇腾的硬件特性来,甚至有些地方华为还根据他们的需求,改了驱动层的小逻辑,前后磨了快八个月。 这不是单方面的凑活,是双向的适配,你改模型,我改硬件,两边往中间凑,最后出来的效果,才能叫深度适配。 我拿到的内测数据是,跑相同参数的72B模型,开128k上下文,昇腾950PR的单卡推理吞吐量,是H20的1.2倍,延迟还低了15%,如果做万卡级的大集群,线性加速比居然做到了0.92。 这个数是什么概念?英伟达自己的H100,万卡集群的线性加速比也就0.95左右,H20因为互联被阉割了,万卡加速比才0.7出头,差了快三成。 坦率讲,我之前对国产芯片适配大模型的预期,是能达到H20的八成性能就算赢,这次直接反超,是真的打了很多人的脸,包括我自己,我之前还跟人打赌,说至少还要两年才能摸到H20的边,没想到来的这么快。 当然也不是没有短板,训练端的FP8算力,昇腾950PR大概是H100的六成,要是做万亿参数的超大规模模型训练,肯定还是H100更快,但是没关系,整个行业90%的算力消耗,都在推理端,不是训练端。 你平时用大模型聊天,写方案,查资料,这些都是推理,训练只是模型上线前做一次的事,能把推理端的性能提上来,成本打下来,就已经解决了80%的问题。

再说说大家最关心的成本,为什么能做到GPT的十分之一,不是靠吹,是一笔一笔算出来的。 首先是硬件采购成本,现在海外H100的采购价大概是两万五千美金一张,国内根本拿不到,就算走特殊渠道,价格也要翻一倍,H20现在国内的拿货价是十万人民币一张,昇腾950PR的采购价,圈里传的是不到三万人民币一张,也就四千美金出头,是H100的六分之一,H20的三分之一。 然后是运维成本,华为的昇腾集群是整套交付的,从服务器到散热到调度系统都是自己的,不用像用英伟达卡那样,自己凑服务器,自己调调度,运维成本能低差不多三成。 还有电力消耗,昇腾950PR的满载功耗是350W,H20是400W,H100是700W,大集群24小时跑,一年下来电费差的可不是小数目。 最后还有模型本身的优化,DeepSeek V4这次用了动态稀疏架构,推理的时候不用每次都调动全部参数,相同的输出量,计算量比GPT4o少了差不多两成,又省了一笔。 这样加起来算,每百万token的推理成本,GPT4o大概是十美金左右,DeepSeek V4算下来不到一美金,正好是十分之一。 我给那个做教培的朋友算过,他之前想给每个学生配个AI答疑助手,用国内某大模型的API,每个学生每个月的算力成本要三十块,他收学生五十块一个月,去掉运营成本根本赚不到钱,就放弃了,上周我把这个成本数告诉他,他当场就给技术打电话,说下个月就上线,算下来每个学生每个月只要三块钱的成本,怎么算都有的赚。 还有那个做咨询的朋友,之前一个月六千块的API费用,换成DeepSeek V4,一个月只要六百块,省下来的钱够他雇半个实习生了。 这个不是什么小数点后的优化,是数量级的下降,是能把很多之前跑不通的商业模式,直接跑通的那种下降。

很多人说,不就是成本降了点吗,有什么大不了的。 你错了,算力成本就是AI行业的电价,电价降一个数量级,整个行业的玩法都会变。 之前国内的AI应用,为什么大部分都是割韭菜的?就是因为算力成本太高了,你做个AI客服,每个客户咨询一次要花两毛钱,一天十万个咨询就是两万块,比雇人工还贵,谁用得起? 所以很多厂商嘴上说自己用的是72B大模型,背地里给你用7B的小模型,反正普通用户也感受不出来,能省一点是一点。 现在成本降到十分之一,很多之前想都不敢想的应用,就都能做了。 比如给每个外卖骑手配个专属的AI调度助手,帮他规划路线,帮他和客户沟通,一个月收十块钱,之前成本要二十,现在只要两块,就能赚钱。 比如给每个写代码的程序员配个AI助手,不限次数调用,一个月收五十九块,之前用GPT的话成本要一百,现在只要十块,就能打价格战。 甚至你想做个专门给广场舞大妈写主持词的AI工具,一个月收九块九,只要有一万个用户,都能赚钱,因为成本太低了。 之前AI的红利,都被英伟达和OpenAI赚走了,普通创业者根本玩不起,你想做个AI应用,光算力成本就能压死你,现在这个门槛被打下来了,小团队甚至个人,都能进场玩。 我身边已经有几个做垂直应用的朋友,开始把业务往国产算力集群上迁了,之前每个月十几万的算力成本,现在只要几万块,省下来的钱都拿去做运营,做产品,竞争力一下就上来了。 还有更重要的一点,我们终于有了一套完全自主的,不用看任何人脸色的AI基础设施了,从芯片,到算力集群,到大模型,全都是自己的,不用再怕被人卡脖子,不用再被人溢价宰割。 之前很多人骂国产芯片是PPT,是骗补贴的,这次是真的拿出来能用的,性能比英伟达的特供卡还好,成本还低,这个是实打实的突破,不是靠嘴吹出来的。 当然也不是没有问题,现在昇腾的生态还是不如英伟达,很多小的模型团队还是习惯用CUDA,普通团队要做深度适配,还是有门槛,这次是DeepSeek这种头部团队啃下了最难的骨头,后面华为肯定会把这套适配方案开放出来,越来越多的大模型厂商会跟上,整个生态会慢慢好起来。

可能很多人会说,我又不做AI创业,也不用大模型干活,这事和我有什么关系。 关系大了。 首先,你以后用AI工具会越来越便宜,甚至免费,性能还会越来越接近GPT,之前你舍不得充GPT的会员,觉得一个月两百块太贵,接下来国内的AI工具,十几块钱一个月就能用到差不多的能力,甚至很多基础功能完全免费。 然后,很多工作的节奏会被彻底改变,之前你写个方案要三天,用AI只要三个小时,之前你整理一万字的会议纪要要半天,用AI只要五分钟,而且成本低到可以随便用,不用心疼钱,你的工作效率会被拉到一个新的高度,当然,如果你不会用,你也会被会用的人拉开差距。 还有,很多之前看起来很稳定的工作,会加速被替代,比如基础的文案,基础的客服,基础的数据录入,之前公司雇一个人一个月要五千,用AI一个月要一千,公司可能还会犹豫,现在用AI只要一百块一个月,那很多基础岗位肯定会被优化掉,当然,同时也会出来很多新的工作,比如调教AI的,做AI应用的,这些机会会越来越多。 我给大家的建议也很简单,不用去追什么热点,也不用去买什么AI课程,就从现在开始,不管你是做什么工作的,都去试着用大模型帮你干活,写邮件,做表格,整理资料,什么都可以,现在成本降下来了,你可以随便用,不用心疼钱,多练,多琢磨,怎么用AI提高你的工作效率,这个是接下来两三年,普通人最重要的竞争力。 如果你是做小生意的,或者想搞点副业,现在可以多想想,你的行业里有什么痛点,是可以用低成本的AI解决的,比如你是开水果店的,能不能用AI帮你写朋友圈文案,帮你做客户回访,比如你是做装修的,能不能用AI帮你出效果图,帮你算材料成本,这些都是很小的点,但是成本够低,就能帮你多赚钱。 如果你是做投资的,或者对科技投资感兴趣,接下来可以多关注一下AI应用层的公司,之前应用层被算力成本卡了好几年,现在成本打下来了,肯定会出来一批爆发式增长的公司,反而不要去碰那些吹自己做通用大模型的,接下来通用大模型的价格战会打的很凶,大部分都会死,应用层才是真正的机会。

我做了快十年的科技观察,之前每次听到国产突破的新闻,总有点心虚,要么是参数注水,要么是只能看不能用,要么就是离普通人太远。 这次不一样,我看到的不是什么世界第一,不是什么惊天动地的技术突破,是一个很实在的,能落到每个人头上的变化,就是以后大家用AI,会更便宜,更好用,不用再翻墙,不用再花大价钱充会员,小创业者做AI应用,不用再被算力成本压死,我们的AI行业,不用再看任何人的脸色。 之前大家总说,中国的AI落后美国两年,这个差距很大一部分是在算力上,不是在算法上,我们的工程师一点都不比美国差,我们的市场比美国大,我们的数据比美国多,之前就是没有足够的便宜的算力,现在这个最大的短板,被补上了一大块。 我不敢说什么超越美国,也不敢说什么很快就能追上GPT,但是我知道,接下来的一两年,国内的AI应用,会像雨后春笋一样冒出来,很多之前你想都不敢想的服务,会出现在你的手机里,你的工作里,你的生活里。 历史的齿轮从来都不会提前打招呼,等你反应过来的时候,它已经滚出去很远了。

以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~

谢谢你看我的文章,下次再见。

← 返回案例列表
分享:
🤖 Try Now →
🤖
🎁