凌晨两点,我盯着MiniMax官方那条推文看了快十分钟。
2290亿参数,推理只激活100亿。
我承认我第一反应是,这数字是不是写错了。2290亿是什么概念,这已经是去年大家围观GPT-4时讨论的那个量级,是大模型俱乐部里的顶配身位。而100亿激活,又是什么概念,这差不多是你家那张3090显卡都能勉强跑起来的尺寸。
一个顶配身材的模型,跑起来的成本却只有十分之一的电费。
这事如果发生在去年,我大概率会觉得是PPT技术。但今年,是MiniMax干的,我得认真聊聊。
先把背景说清楚。MiniMax这家公司,国内做AI的朋友应该都听过,海螺AI、星野、Talkie这些产品都是他们家的。他们家此前的形象,更多是一个C端产品做得很猛的公司,Talkie在海外尤其能打,是国产AI出海少有的能在DAU上跟Character.AI掰手腕的那一个。
但在大模型这件事上,MiniMax以前一直走的是闭源路线,跟智谱、月之暗面、阶跃这几家不太一样。你能用他们的API,能用他们的产品,但模型权重你拿不到。
这次M2.7突然开源,而且是完全开源、可商用,这态度上的转变本身就很有看头。我后面会讲为什么他们要这么干,先把这个模型本身说透。
2290亿参数的稀疏MoE,激活约100亿,这套架构这两年已经是大模型圈的显学了。Mixtral最早把这条路走通,DeepSeek把它推到了一个让全世界瞠目结舌的高度,Qwen也在跟,国外的Llama 4也是这条路。
但同样是MoE,差别可以非常大。
打个比方,传统的稠密模型,就像你雇了一个全才博士,不管你问他什么问题,他都要把自己脑子里所有的知识全过一遍才能回答你。问他1+1,他也得把微积分、量子力学、唐诗宋词全过一遍。这显然很浪费。
MoE的思路是,我给你雇一整个研究院,里面有几百个专家,你问数学,数学专家上,你问历史,历史专家上,你问代码,代码专家上。研究院规模是大,但每次干活的就那几个人,电费水费自然就省下来了。
2290亿是这个研究院的总人数,100亿是每次叫出来干活的专家人数。比例大概是4.4%,这个稀疏度在业内属于比较激进的设计,已经接近DeepSeek V3那种思路了。
激进意味着什么呢,意味着便宜。
我们来算笔账。一个稠密的700亿参数模型,比如Llama 3 70B,推理的时候每次都要把整个700亿参数走一遍,对显存、算力的占用就是按700亿来算的。而M2.7每次只激活100亿,从计算量上看,跑起来比700亿的稠密模型还要轻松不少。
但你拿到的能力,是2290亿参数堆出来的能力。
这就是MoE的魔法。你花100亿的钱,享受着2000多亿的智商。这事如果不是亲眼见到benchmark一个接一个被这种架构刷下来,谁都不会相信。
那M2.7具体跑分怎么样呢,我看了一下他们公布的数据,在主流的几个评测集上,跟一线的开源模型基本都能掰一掰手腕,在代码、数学、长上下文这几个MoE模型相对吃亏的方向,反而表现得很稳。
但我得说一句实话,跑分这事我现在越来越不信。这几年大模型卷下来,所有的榜单都已经被刷得不成样子,谁家发新模型不是SOTA。我现在判断一个模型好不好,更多看两个东西,一个是实际用起来的感觉,一个是社区开发者用脚投票的速度。
M2.7开源的时间还短,社区反馈我还在等,但从我自己跑了几个测试用例的体感来看,至少在中文场景、代码场景上,是过关的。尤其是处理长文档总结这种活,它的速度让我有点惊讶,因为激活参数小,吞吐量就是猛。
聊到这里,可能有人要问了,这跟我有啥关系。我又不训模型,我又不开发AI产品。
关系大了。
我跟你讲三个场景,你就明白这事的分量。
第一个场景,是你正在用的那些AI产品。
你现在用的Kimi、豆包、通义千问、文心一言,你以为它们的成本是均匀的吗,不是。每问一次,每生成一段回答,背后都是真金白银的GPU电费在烧。这也是为什么所有大厂的AI产品都拼命要做免费版引流,但免费版都有各种各样的限制。
成本压不下来,免费就是亏本,付费就贵得没人用。
MoE这种架构往下走,意味着同样的智商水平,运行成本可以降一个数量级。降一个数量级是什么意思呢,意思是以前给你限10次/天免费的服务,可能可以变成不限次免费。以前每月20美元的Pro订阅,可能可以变成5美元甚至免费。
这事DeepSeek已经演示过一次了。DeepSeek把API价格打到那个程度,逼得国内所有大厂跟着降价,Kimi降、文心降、通义降,OpenAI都被迫调整了价格策略。
M2.7这一刀,会让这个降价螺旋继续往下转。受益的是谁,是你。
第二个场景,是中国AI的开源生态。
我跟一些海外做AI的朋友聊天,他们一个共同的感受是,过去一年中文开源模型的迭代速度,把所有人都看傻了。
Llama 3发布的时候,大家觉得Meta把开源大模型的天花板拉高了一截,没想到三个月后DeepSeek V2出来,又拉高了一截。然后Qwen 2.5又拉高了一截。然后DeepSeek V3直接把闭源模型也按在地上摩擦了一遍。然后是R1,然后是各家的视觉模型、代码模型,一个接一个砸出来。
到今天,全球Hugging Face下载量前列的开源模型里,中文厂商的份额已经远远超过了一年前所有人的预期。
MiniMax这次加入开源阵营,是有信号意义的。它意味着国内最后几家还在坚持闭源的头部模型公司,开始动摇了。或者说,他们意识到,闭源在中国市场已经不是一个可持续的商业模式。
为什么不可持续,因为有DeepSeek这种存在。当一个性能不输GPT-4o的模型可以免费下载、免费商用,你闭源还想收钱,凭什么。
凭情怀吗,AI圈没那么多情怀。
第三个场景,是开发者生态。
我有几个做AI应用的朋友,他们最大的痛点是什么呢,是模型成本。
做一个AI客服,做一个AI写作工具,做一个AI教育产品,最终拼的不是模型有多聪明,而是单次调用的成本能压到多低,毛利能拉到多高。这就是为什么国内现在做AI应用的公司,越来越倾向于自己部署开源模型,而不是调用闭源API。
调用闭源API,每一次都是按token计费,你的成本曲线是线性的,用得越多越贵。
自己部署开源模型,前期有一次性的硬件投入,但跑起来之后,边际成本就是电费。用得越多,单位成本越低。
M2.7这种激活100亿的设计,对开发者来说太友好了。一台8卡的H100服务器就能跑起来,甚至更便宜的国产卡都能凑合,对中小公司、独立开发者来说,这就是把2000亿规模的能力打包送到他们家门口。
接下来一段时间,你会看到越来越多用了M2.7的AI产品冒出来。它们的特点会很统一,便宜、快、能力不弱。
聊完了对你的意义,我想再聊一下我对这件事更深一层的判断。
坦率讲,我觉得MiniMax这次开源,不完全是技术信仰,更多是商业上的清醒。
这家公司过去给我的感觉,是一家产品力很强、商业嗅觉很灵的公司。他们做Talkie能在海外打到那个体量,做海螺AI能在国内做到一线,本身就说明团队对市场的判断很准。
那为什么要开源呢,因为他们看明白了一件事,单纯靠卖模型API赚钱这条路,在中国市场基本走死了。
走死的标志就是DeepSeek。
DeepSeek那个价格不是商业定价,是市场屠杀。当一家公司愿意用近乎成本价的方式去服务市场,整个行业的定价权就被打碎了。其他公司要么跟,要么躺平。
MiniMax选了第三条路,开源,把模型当成基础设施,靠产品和服务赚钱。
这条路看似激进,其实是这两年大模型行业被反复验证过的最稳的一条。Meta的Llama走的就是这条路,扎克伯格在内部信里说得很直白,开源不是为了情怀,是为了让Meta在AI基础设施层占据生态位,让OpenAI的护城河失效。
DeepSeek走的也是这条路,开源换生态,生态换影响力,影响力换长期的话语权。
MiniMax这次跟上了。
那闭源还有没有未来呢,有,但越来越窄。
未来还能靠闭源活得很好的,可能只剩两类公司。一类是OpenAI、Anthropic这种,能持续在最前沿做出代际差距的,每隔几个月就甩开源一个身位的。另一类是有强消费品和强场景护城河的,比如苹果、Google,模型本身只是产品的一部分,不靠模型挣钱。
中间的那些,闭源会越来越难。
而开源这条路上,今年我们看到的最有意思的现象是,中国厂商正在变成事实上的主力。
我之前写过一篇文章聊过这个事,今年Hugging Face上最热的几个模型,DeepSeek、Qwen、GLM,全是中国公司的。再加上现在MiniMax,加上后面可能跟进的更多家,中国在开源大模型这件事上,已经不是追赶者了,是引领者。
这事在两年前你跟我说,我是不信的。两年前大家还在讨论中国能不能追上Llama 2,能不能复刻出ChatGPT。
两年后,我们在讨论的是Llama 4为啥这么拉跨,OpenAI为啥这么久没有惊艳的更新。
世界变化得真快。
我想再说一个观察。
这两年我接触了不少AI圈的人,从大厂高管到独立研究者,从投资人到一线工程师,大家有一个相对统一的感受,中国AI的优势其实不在最尖端的突破上,而在工程化能力、性价比、迭代速度、应用落地这几件事上。
最尖端的突破,比如o1这种推理模型的范式创新,比如Sora这种视频生成的工程奇迹,更多还是OpenAI、Anthropic、Google这些公司在做。中国公司的角色更多是看到一个新方向出来后,迅速跟进、迅速优化、迅速做到便宜可用。
这听起来像是吃了夸,但我觉得这是事实,而且这种角色一点都不丢人。
因为AI这场革命,最终要落到人身上,要落到产品上,要落到普通人用得起、用得爽、用得多的地方。能做到这件事的,才是真正决定行业格局的玩家。
OpenAI再厉害,如果它的产品永远是月费200美元,永远只服务美国白领,永远不向开源生态妥协,那它影响的人就是有限的。
而DeepSeek、Qwen、MiniMax这些,把2000亿参数级别的模型,做到一个学生都能调用、一个小公司都能部署、一个普通开发者都能基于它做产品,这种普及力本身就是一种革命。
MoE架构的兴起,本质上就是为这种普及做技术准备。激活参数越小,单位成本越低,门槛越低,能用上的人就越多。
所以你看,M2.7这件事拆开来看,是技术,但合起来看,是一个时代的注脚。
我们正在见证AI从精英玩具变成基础设施的过程。
就像电力刚发明的时候,只能在大城市的少数地段用,慢慢地铺到每家每户。就像互联网刚出来的时候,只有少数大学和实验室能用,慢慢地变成空气一样的存在。
AI这场普及战,前半场拼的是模型有多强,后半场拼的是模型有多便宜、多容易用。
我们正在从前半场过渡到后半场。
聊到这里,回到一开始的问题,这件事对你意味着什么。
如果你是一个AI产品的普通用户,意味着你接下来用到的AI工具,会越来越便宜,越来越快,免费额度会越来越大方。你不需要做什么,你只需要享受这个红利。
如果你是一个开发者,意味着你现在有了一个新的、性能很强、成本很低的开源选项。M2.7的权重已经在Hugging Face上了,你可以下载、可以试、可以基于它做你想做的产品。这个时间窗口很关键,谁先用上、谁先迭代出好产品,谁就能在新一轮AI应用浪潮里抢到位置。
如果你是一个对AI格局感兴趣的观察者,意味着你应该把闭源vs开源这条线,重新认真看一遍。这条线的胜负,可能比中美AI竞争那条线,更深远地决定我们未来十年的技术生态。
如果你是一个普通人,对这些都不感兴趣,那至少你可以知道一件事,今天有一家叫MiniMax的中国公司,把一个全世界顶级水平的大模型,免费送给了全世界。
这件事在五年前是不可想象的。
我一直觉得,AI这场革命最让我感动的地方,不是它有多强,而是它在变成一种公共品。每一个像M2.7这样的开源动作,都是在把这个公共品的池子再注满一些水。
水越满,喝水的人就越多。
普通人喝水的成本,就越接近于零。
最终我们会发现,回头看这几年中国AI的发展,最值得记住的可能不是某个模型跑分多高,不是某个产品DAU多少,而是这场把AI从奢侈品变成自来水的运动里,中国公司贡献了多少水。
DeepSeek贡献了一桶,Qwen贡献了一桶,GLM贡献了一桶,今天MiniMax拎着2290亿参数的水桶过来,咣当一声,又倒了进去。
这桶水的名字,叫M2.7。
我们这些喝水的人,应该记得这些拎水桶的人。
以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~
谢谢你看我的文章,下次再见。
BossAgents