上周我收到一个做跨境电商的读者发来的截图,他说自己把所有的文案需求从Claude Opus换成了国内的一款大模型,测了一个月,转化率反而高了0.3个百分点,一年算下来能省二十多万API费。他说之前他逢人就说国产大模型都是套壳垃圾,现在脸都被打肿了,连公司里之前坚持只用国外模型的技术负责人,都开始主动测国产模型的接口。
我当时还以为只是他一个人的体感,直到昨天斯坦福2026年的AI指数报告放出来,才知道这不是个例,是整个行业的底层逻辑已经变了。
报告里有个数字我看了三遍才敢信,中美顶级大模型的Arena评分差距,2023年的时候还是300多分,现在已经缩到了只有39分。
先给大家解释下这个Arena评分是什么,它不是哪个厂商自己关起门来跑的测试集,是全世界几万真实用户盲测出来的Elo分,算法跟围棋的排名系统一模一样,当年阿尔法狗的实力就是用这个分衡量的。这个分的可信度,比任何厂商发布的跑分都高,因为用户不会管你是美国公司还是中国公司,只会选那个能解决自己问题的答案。
2023年的300多分差是什么概念,差不多是职业围棋九段和业余五段的差距,九段让三子都能稳赢,根本不在一个量级。现在的39分差,就是柯洁和巅峰期李昌镐的差距,真刀真枪对上,胜负只在半目之间,谁都没有绝对的把握赢下对方。
还有个更夸张的数字,国内深度求索推出的Dola-Seed 2.0,和现在公认的顶级模型Claude Opus 4.6的综合能力差距,只有2.7%。
2.7%是什么概念,你用两个模型处理100次需求,只有两到三次是Claude Opus的结果明显更好,剩下的97次,你根本分不出哪个是哪个,甚至很多涉及中文语境的需求,国产模型的结果还要更靠谱。
比如你要写一份给国内单位汇报的PPT大纲,Claude Opus写出来的全是外企那套逻辑,开口闭口OKR,闭环,赋能,国产模型直接给你把框架改成符合国内汇报习惯的结构,连用词都能给你调整到刚好合适的程度,不用你再改第二遍。
我自己测过一次,让两个模型分别给我写公众号的文章框架,Claude Opus给的案例全是美国的,什么OpenAI的新功能,谷歌的新论文,根本没法用,国产模型给的全是最近国内的热点,连哪个热点的传播度更高,适合放在哪个段落,都给你标好了,省了我至少两个小时的查资料时间。
这次斯坦福的报告里还有个很容易被忽略的点,中国AI论文的引用量,已经正式超过了美国。
之前很多人黑中国的AI论文,说都是水文,数量多没用,引用量上不去,现在这个话已经说不通了。论文引用量是什么概念,就是全世界的研究者,做研究的时候都会参考你的成果,相当于整个行业都认可你做的东西是有价值的。
我认识一个在清华做大模型对齐研究的博士,去年他们团队发了一篇关于RLHF优化的论文,现在全世界所有做大模型的公司,包括OpenAI,Anthropic,都在用他们提出来的方法,因为这个方法能把对齐的成本降40%,还能同时提高模型回答的准确率。
之前大家默认AI的底层创新全在美国,中国公司只能做应用层的修修补补,现在这个情况已经变了,很多能改变整个行业的核心技术,已经开始从中国往全世界输出。
还有专利的数据,中国的AI专利申请量和授权量,已经连续很多年全球第一,之前很多人说这些专利都是没用的边角料,现在斯坦福的报告里专门提了,中国的AI专利里,核心技术专利的占比,最近三年翻了一倍,很多专利已经开始被美国的公司引用,甚至付费授权。
很多人可能会问,为什么中国的AI追的这么快,之前还差着好几代,怎么两三年就追上来了。
其实原因说穿了也不复杂,第一个就是卷,中国大模型行业的卷的程度,是美国公司根本想象不到的。
美国的大模型公司,差不多半年更一次大版本,OpenAI从GPT4到GPT4o用了一年,Anthropic从Claude 3到Claude 4用了八个月,国内呢,字节的豆包,上个月刚更了4.0版本,这个月就推出了极速版,推理速度快了三倍,API价格直接降了80%,深度求索的Dola,去年11月还是1.0版本,今年3月就更到了2.0,四个月就完成了一次大迭代,小版本更是每周都在更。
为什么卷成这样,因为国内的市场太残酷了,你晚更一个月,用户就跑到竞争对手那里去了,不像美国市场,就那两三家大模型公司,用户没得选,就算你半年不更,用户也只能忍着。
第二个原因是数据优势,中国的互联网场景比美国丰富太多,产生的高质量数据量,也比美国大得多。
比如抖音每天有几亿人发视频,几亿人评论,点赞,转发,这些结构化的多模态数据,用来训练大模型的效果,比网上爬的那些英文维基百科,论坛帖子好太多了。还有电商,本地生活,社交这些场景,产生的用户行为数据,都是训练大模型最好的素材,美国根本没有这么丰富的场景,也没有这么大的用户规模。
我之前跟一个大模型公司的技术负责人聊,他说同样参数的大模型,用中国的互联网数据训练出来的,对用户需求的理解程度,比用英文数据训练的高至少10%,尤其是涉及到日常应用的场景,差距更明显。
第三个原因是整个行业的配套已经起来了,从算力,到框架,到应用,整个产业链都在国内。
之前国产大模型刚出来的时候,大家都担心算力不够,只能靠买英伟达的芯片,现在呢,华为的昇腾910B芯片,性能已经追平了英伟达的H100,而且产量足够,国内的大模型公司,现在大部分的算力集群,都是用的国产芯片,字节的算力集群有几十万张昇腾芯片,训练出来的大模型,性能跟用H100训练的几乎没有区别。
还有训练框架,国内的公司开发的训练框架,能把芯片的性能榨到极致,同样的芯片,用国产框架训练的速度,比用国外的框架快30%,这个就是工程师的优势,能用一般的硬件,做出顶级的效果,之前的高铁,手机,都是这么过来的,现在AI也走在同样的路上。
当然,也不能光吹好的,差距还是真实存在的,而且有些差距不是短期能追上来的。
最明显的差距还是在最顶尖的算力上,英伟达最新的H200和下一代的B100芯片,我们现在还拿不到多少,国产的下一代芯片,还需要一两年的时间才能量产,所以在超大参数模型的训练速度上,我们还是比美国慢一点。
然后是生态的差距,现在全世界的开发者,做AI应用的时候,第一反应还是用OpenAI的API,用Claude的API,因为他们的生态做的早,工具链全,插件市场也成熟,国内的大模型生态,现在还在起步阶段,开发者的数量和工具的丰富度,还是差不少。这个不是技术问题,是时间问题,生态的建立需要三五年的时间,不是靠砸钱就能立刻砸出来的。
还有基础研究的厚度,现在最前沿的AI理论研究,比如世界模型,AGI的安全对齐,很多开创性的工作还是美国的实验室做出来的,我们现在更多的是在已有的方向上做优化,做迭代,从0到1的原始创新,还是比美国少,这个需要更长时间的积累,不是靠堆人堆钱就能快速追上的。
我看到很多人看到这个报告的第一反应是,又在吹牛逼,国产AI哪有这么厉害,肯定是斯坦福收了钱,或者数据造假。
其实斯坦福的AI指数报告已经做了快十年了,之前每一年的报告都是说美国领先中国很多,从来没有偏过中国,今年第一次把差距写的这么小,只能说明这件事是真的,连美国自己的第三方机构都不得不承认了。
我自己用国产大模型用了快一年了,最开始也是抱着试试看的心态,觉得能用就用,不能用就还是用GPT4,现在我90%的需求都已经换成了国产大模型,不是因为我爱国,是真的好用,还便宜,能帮我省钱,省时间,我为什么不用。
很多人还活在三年前的认知里,觉得国产大模型都是人工智障,答非所问,套壳OpenAI,其实你现在随便去用用就知道,根本不是那么回事。之前有第三方机构做过测试,把国内十几个大模型的回答和GPT4的回答做对比,重复率不到5%,要是真的套壳,重复率至少得有80%以上,根本骗不了人。
还有人说国产大模型都是靠刷分刷出来的高分,问题是Arena评分是盲测,用户根本不知道自己测的是哪个模型,你怎么刷分,总不能给几万测试用户每个人都塞钱吧,那成本也太高了,还不如好好做产品。
其实这件事最有意思的地方,不是中国AI追的有多快,而是这件事对我们普通人来说,到底意味着什么。
很多人看这种新闻,都觉得是国家层面的事,跟自己没关系,其实根本不是,这个变化会影响到我们每一个人的生活,工作,甚至未来十年的收入。
最直接的影响,就是用AI的成本会越来越低,低到跟自来水一样。
现在GPT4o的API价格,输入一千字差不多七分钱,输出一千字两毛钱,国产的同性能大模型,输入一千字只要七厘钱,输出只要两分钱,差了整整十倍。你要是一个月用一百万tokens,用GPT4要花差不多两千块,用国产的只要两百块,一年就能省两万多,这个钱用来干什么不好。
以后这个价格还会越来越低,可能再过一年,一千字的成本只要几厘钱,跟不要钱一样,你随便用,根本不用心疼钱。之前你可能不舍得用AI改一整篇毕业论文,不舍得用AI整理几百页的资料,以后这些都不是问题,花几毛钱就能搞定。
然后是普通人的创业门槛会降到历史最低。
之前你要做一个AI应用,比如做一个给淘宝卖家写详情页的工具,光API成本就能压死你,一个月几万块的API费,小团队根本扛不住,现在API成本降了十倍,两三个人的小团队,就能做一个应用,养活自己,甚至赚大钱。
我认识一个95后的小姑娘,就做了一个给餐饮老板设计菜单的AI工具,用的是国产大模型的API,每个月收99块钱一个用户,现在有一万多付费用户,每个月纯利润几十万,成本只有服务器和API费,一个月不到十万,这个在三年前是想都不敢想的。
你不需要有几百万的启动资金,不需要有顶尖的技术团队,只要你能找到一个细分的小需求,用大模型把它解决了,就能赚到钱,这个是之前任何一次技术革命都没有过的机会。
还有就是职场的差距会快速拉开,最先会用AI的人,会率先抢走不会用的人的饭碗。
之前很多人担心AI会抢工作,现在看,根本不是AI抢工作,是会用AI的人抢不会用AI的人的工作。你是做运营的,会用AI写文案,做数据报表,你一个人能干之前三个人的活,你的工资就能涨两倍,你要是不会用,你就可能被淘汰。
现在国产大模型足够便宜,足够好用,大部分还是免费的,你不用花很多钱去学,甚至不用翻墙,打开微信就能用,门槛比之前低太多了,只要你愿意花几个小时试试,就能比你的同事领先一大截。
我身边已经有很多这样的例子了,有做HR的,用AI筛简历,写招聘文案,一个人干之前五个人的活,直接升了经理,有做销售的,用AI写跟进话术,分析客户需求,业绩翻了三倍,涨了两次工资。
很多人总在等,等一个中国AI超过美国的大新闻,然后再开始行动,其实这个节点根本不会突然到来,它是每天一点点的差距缩小,等你看到新闻说中国AI已经超过美国的时候,机会早就被别人抢走了。
现在就是最好的时间,你手里的免费国产大模型,就是你跟别人拉开差距的最好工具,你不用等任何人,不用等任何新闻,现在就能开始用。
你可以今天打开微信,下拉搜豆包,或者去应用商店搜深度求索,注册个账号,把你今天要做的工作,比如要写的汇报,要改的简历,要做的表格,扔进去试试,不用花一分钱,十分钟就能看到效果,要是觉得不好用,你再删了也没损失,要是好用,你以后每天都能省一个小时的时间,这个时间用来休息,用来陪家人,用来搞副业,都比浪费在无意义的重复劳动上强。
要是你想搞点副业,可以去找一个细分的小场景,比如给培训机构做AI教案,给摄影师做AI修图,给律师做AI法条检索,不用做很大,只要能解决一个小问题,有几百个付费用户,就能活的很好,启动成本只要几千块,甚至不用写代码,用现成的AI工具就能拼出来。
不用听那些唱衰的人瞎逼逼,很多人还停留在三年前的认知里,觉得中国AI就是不行,就是套壳,你不用跟他们争论,你自己去用用就知道了,时间会证明一切,你提前用,提前受益,等他们反应过来的时候,你已经把钱赚了,把位置占了。
我们这代人其实很幸运,能亲眼看到一个曾经落后的国家,在最前沿的科技领域,一点点追上,甚至超过曾经的霸主,更幸运的是,我们不用只是当观众,我们每个人都能参与其中,用这个时代最好的工具,改变自己的生活。
时代的红利从来不会分给站在旁边看热闹的人,只会分给第一个伸手拿的人。
以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~
谢谢你看我的文章,下次再见。
BossAgents