我昨天刷到一条消息,差点把手机扔出去。
Meta开源了Llama 4。4050亿参数。手机能跑。
你听到这个数字,可能跟我第一反应一样:扯淡呢吧?
4050亿参数是什么概念?去年GPT-4的参数规模,坊间传闻是1.8万亿。Llama 3.1的4050亿版本,跑在A100上都要用两台机器。现在Meta说,这玩意儿能在你的手机上跑?
我翻了三遍官方博客,确认没看错。Llama 4分两个版本,Scout和Maverick。Scout是轻量版,专门为单卡和手机端优化。Maverick是旗舰版,性能对标GPT-4o。
关键是,完全开源,可商用。
这意味着什么?意味着你口袋里那台手机,理论上可以离线跑一个比GPT-3.5还强的模型。意味着中国的中小开发者,不用再跪着求API配额了。意味着AI的民主化,从口号变成了可以摸到的现实。
我认识一个做AI应用的朋友,去年因为OpenAI封了中国区API,项目直接流产。他跟我说,卡兹克,你知道吗,那种感觉就像你刚学会游泳,泳池突然被人抽干了。现在Llama 4开源了,他第一件事就是去下载权重文件,准备在自己的MacBook上跑。他说,终于不用再看别人脸色了。
这才是真正的开源精神。不是那种写着开源,结果只放个论文和演示视频的伪开源。Meta这次是真刀真枪地给了你所有东西:权重、代码、训练细节、评估基准。你拿过去就能用,想怎么改就怎么改,商用也没问题。
但问题来了:4050亿参数,怎么塞进手机的?
这里就要讲一个技术细节,我尽量用人话说。
传统的大模型,就像一个全能型选手。你问他数学题,他调用所有脑细胞。你问他怎么写情书,他也调用所有脑细胞。但写情书和做数学题,用的脑细胞其实是不同的区域。传统模型不管三七二十一,每次都把所有参数激活一遍,这叫密集模型。4050亿参数全部激活,算力需求大到离谱,手机根本扛不住。
Llama 4用的是MoE架构,专家混合模型。这个架构的核心思想很简单:不养闲人。
MoE模型里有很多专家,每个专家只擅长某个领域。比如数学专家、编程专家、写作专家、情感咨询专家。当用户提问时,路由器会判断这个问题该找谁,然后只激活相关的几个专家。其他专家继续休眠,不消耗算力。
Llama 4总共有4050亿参数,但每次推理只激活其中的170亿到290亿参数。你算算,激活率只有4%到7%。相当于一个公司有1000个人,但每天真正干活的只有40到70个人。其他人都在摸鱼,但随时待命。
这就是为什么Scout版能跑在手机上。手机芯片算力有限,但只跑170亿参数,还是可以的。170亿参数什么水平?跟GPT-3的1750亿参数比,规模是它的十分之一。但MoE架构的效率更高,实际能力可能比GPT-3还强。
Meta说Scout版在手机端的推理速度能达到每秒50个token,也就是大概每秒40个汉字。读起来不算快,但作为离线助手,已经够用了。你想想,飞机上没网的时候,你可以跟手机里的Llama 4聊天,问它一些知识性的问题,让它帮你写邮件,甚至让它帮你改论文。这些功能现在都是云端模型提供的,一旦断网就抓瞎。Llama 4 Scout直接把模型塞进手机,离线也能用。
隐私问题也解决了。数据不用上传云端,全在本地处理。苹果一直强调的端侧AI,现在Meta用开源的方式先实现了。库克要是看到这消息,估计血压得飙升。
再说Maverick版。
Maverick是旗舰版,同样4050亿参数,但激活的参数更多,推理成本更高,性能也更强。Meta在官方评测中说,Maverick在多项基准测试中超越了GPT-4o和Claude 3.5 Sonnet。当然,这种自夸要打点折扣,但至少说明它的水平已经摸到了第一梯队。
我比较关注的是Maverick在编程和数学方面的表现。Meta专门提到了它在HumanEval和MBPP上的成绩,这两个是测试代码生成能力的基准。Maverick在HumanEval上达到了92.7%的通过率,比GPT-4o的87.3%高不少。对于开发者来说,这意味着一个免费、开源、可本地部署的编程助手,性能还比付费的GPT-4o强。
开发者圈子里已经炸了。有人直接在GitHub上开了issue,说要把Cursor和Copilot的API换成Llama 4。有人开始训练Llama 4的LoRA适配器,准备把它微调成自己的专属助手。还有人已经跑通了Scout版在iPhone上的部署,视频都放出来了,模型在手机上实时回复,延迟大概两秒。
两秒的延迟,在手机端侧推理里,已经算快的了。
但我要说点冷水。
Llama 4的开源,对中国的AI行业来说,既是机遇也是挑战。
机遇很明显。中国的中小企业和个人开发者,终于有了一个可以自由使用的基础模型。不用再担心被卡脖子,不用再担心API涨价,不用再担心数据安全。你可以在Llama 4的基础上做微调,做应用,做产品。门槛从之前的天花板,降到了地板。
挑战呢?Meta这次开源,不只是给技术,更是给生态。Llama 4的许可证允许商用,允许修改,允许再分发。这意味着Meta在构建自己的开发者生态,就像谷歌用Android对抗iOS一样。Llama 4就是AI时代的Android。中国的大模型公司,如果还在走闭源路线,还在靠API收费,可能会被开源生态碾压。
之前国内很多大模型公司,靠的是信息差和资源差赚钱。你手里有卡,别人没有,你就能卖API。现在Meta直接把一个顶级模型免费给你,你凭什么还收钱?
当然,有人会说,Llama 4是英文模型,中文能力不行。确实,Meta的训练数据以英文为主,中文能力肯定不如百度的文心一言和阿里的通义千问。但这是暂时的。Llama 4开源了,中国的开发者可以自己用中文数据微调。用不了几个月,就会有各种中文版的Llama 4出来,中文能力可能比国产模型还强。
这才是开源最可怕的地方。它不是一个人跟你竞争,而是一群人。你永远无法打败一群带着热情和才华的开发者。
我再说一个细节,很多人没注意到。
Llama 4的训练成本。Meta在技术报告里说,训练Llama 4 Maverick用了大约1000万GPU小时。按H100的租赁价格每小时3美元算,训练成本大概是3000万美元。两亿多人民币。这个数字对于Meta来说不算什么,但对于大多数中国AI公司来说,已经是一个天文数字。
但开源之后,这3000万美元的成本,被分摊到了所有使用者身上。你不需要花两亿去训练模型,你只需要花几千块买张显卡,或者直接用手机跑。边际成本几乎为零。
这就是开源的力量。它把巨头的研发投入,变成了公共基础设施。
我最近在做一个项目,需要让AI理解一些特定领域的文档。之前用GPT-4,每次都要上传文档,还担心数据泄露。现在有了Llama 4,我可以在本地部署,数据不出内网,安全又省钱。而且因为MoE架构,推理速度比同等规模的密集模型快很多,用户体验更好。
这种场景会越来越多。企业内部的客服系统、教育领域的个性化辅导、医疗领域的病历分析、法律领域的合同审查,这些场景都需要一个私有化部署的AI,而Llama 4正好满足了需求。以前私有化部署只能用小模型,能力有限。现在有了Llama 4 Scout,能力接近GPT-4,成本却低得多。
我甚至觉得,Llama 4可能会催生一波新的AI创业浪潮。就像2017年BERT开源后,NLP领域爆发了一轮创业潮一样。Llama 4的开源,会让很多以前不敢想的事情变成可能。
比如,一个农民可以用Llama 4做农业知识问答系统,教农民怎么种地。一个老师可以用Llama 4做个性化教学助手,给每个学生定制学习计划。一个医生可以用Llama 4做辅助诊断工具,提高诊断准确率。
这些应用,以前只有大公司能做,因为需要大量的算力和数据。现在,一个人,一台电脑,甚至一部手机,就能做。
这才是AI普惠的真正含义。
但我也要提醒一点:不要神化Llama 4。
虽然它在很多基准测试上表现优异,但实际使用中,它还是有各种问题。比如幻觉问题、长文理解问题、多模态能力偏弱(Llama 4目前只有文本能力,没有图像生成能力)。而且因为MoE架构,它在某些任务上的表现可能不如专门的密集模型。
Meta自己也承认,Llama 4在某些安全方面还有待改进。比如它可能会生成有害内容,或者被诱导做坏事。开源模型的安全性更难控制,因为一旦发布,Meta就无法控制别人怎么用。
所以,如果你要用Llama 4做产品,一定要做好安全过滤和内容审核。不要直接把它暴露给用户,否则可能会出问题。
再说一个趋势。
Llama 4的发布,标志着AI开源和闭源的竞争进入了一个新阶段。以前开源模型总是落后闭源模型一两个版本,现在差距在缩小。Llama 4 Maverick在性能上已经追平甚至超越了GPT-4o,而闭源模型的优势正在消失。
为什么Meta要这么做?扎克伯格的逻辑很清晰:AI的未来是开放的。如果AI被少数几家公司垄断,那对全人类都不是好事。开源可以加速创新,降低门槛,让更多人参与进来。而且,开源不等于不赚钱。Meta可以通过云服务和硬件赚钱,Llama 4开源了,但Meta的云服务可以跑Llama 4,Meta的硬件可以优化Llama 4,这些都可以变现。
这个策略,跟谷歌的Android一模一样。Android开源,但谷歌通过GMS和Play Store赚钱。Llama 4开源,但Meta通过云服务和硬件赚钱。而且,开源模型的使用者越多,Meta的生态就越强大,它的护城河就越深。
中国的大模型公司,如果还在纠结开源还是闭源,可能已经晚了。不是要不要开源的问题,而是怎么在开源生态中找到自己的位置。
最后,说点实在的。
Llama 4的发布,对普通用户来说,意味着什么?
第一,你以后可能不需要再为AI服务付费了。手机上的AI助手、电脑上的编程助手、家里的智能音箱,都可以用Llama 4来驱动。而且因为是本地部署,没有月费,没有按次收费,一次投入,终生使用。
第二,你的数据更安全了。本地部署意味着数据不出设备,隐私保护更好。不用担心你的聊天记录被上传到云端,被用来训练模型。
第三,你可以定制属于你自己的AI。Llama 4开源了,你可以用你自己的数据微调它,让它学会你的说话方式,了解你的喜好,成为真正懂你的助手。这种个性化,是闭源模型做不到的。
第四,你可能会看到更多有趣的AI应用出现。因为门槛降低了,更多开发者会加入进来,创造各种好玩的东西。今年下半年,可能会有很多基于Llama 4的创业项目出现,其中一些可能会改变我们的生活。
当然,这一切都需要时间。Llama 4刚发布,生态还在建设中。模型下载、部署、微调,都需要一些技术能力。但好消息是,社区很活跃,工具链在快速完善。Hugging Face上已经有很多Llama 4的教程和工具,GitHub上也有各种一键部署的脚本。
如果你是个开发者,我建议你现在就去下载Llama 4的权重,试试看。如果你是个普通用户,可以等一段时间,等手机厂商和软件厂商把Llama 4集成到产品里,你就能直接用了。
说实话,我写这篇文章的时候,心情很复杂。一方面,我为技术的进步感到兴奋。一个能跑在手机上的4050亿参数模型,这在两年前是想都不敢想的。另一方面,我也为国内AI行业感到担忧。当Meta这样的巨头在全力推动开源时,我们还在靠API收费过日子,这差距不是一点半点。
但换个角度想,开源对所有人都是公平的。Llama 4是美国的,但代码和权重是世界的。中国的开发者同样可以从中受益。关键是你怎么用它,用它做什么。
我选择写这篇文章,不是为了吹捧Meta,也不是为了唱衰国内。我只是想告诉你,这个世界正在发生一些重要的事情,而你需要知道它,理解它,然后做出自己的判断。
AI的浪潮不会等任何人。要么你学会冲浪,要么你被淹没。
而我,选择冲浪。
以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~
谢谢你看我的文章,下次再见。
BossAgents