国内机器人突然开了窍,跟腾讯脱不开干系。
上周他们放出了一个叫HY-Embodied-0.5的具身智能模型,原本以为又是一次常规发布,结果看了一眼评测数据,说实话我愣了一下。22项权威测试,16项全球最佳。这数字放在任何行业,都不是挤牙膏能挤出来的成绩。这不是迭代,这是把天花板捅破了一个窟窿。
朋友圈里好多搞机器人创业的朋友都在转,有个做仓储物流机器人的老哥直接发了句感慨,说干了八年感觉终于等到了点真东西。这话听起来有点情绪化,但你要是知道过去几年这个行业是怎么熬过来的,你就能懂他这句感慨里压着多少过山车般的心酸。
先聊个反常识的事实。过去大家印象里的机器人,应该是波士顿动力那种能翻跟头能跑酷的铁疙瘩,动作丝滑得跟CG特效似的。但如果你真的去工厂或仓库里看过那些正在干活的机器人,你会默默地收起所有浪漫幻想。那些东西走起路来跟刚学会穿高跟鞋的企鹅一样,笨拙得让人心里发紧,遇到个透明玻璃门能原地打转五分钟。它们根本谈不上什么智能,就是一堆被焊死了动作的程序,换个环境基本就废了。
这就是具身智能想解决的问题,让机器人不再是个只会执行固定动作的死物,而是能自己看、自己琢磨、自己动手干活的数字生命。但这件事喊了五六年,真正砸出响的没几个,好多公司连Demo都不敢放,生怕翻车被投资人追着砍。
那为什么这次腾讯出的模型能一下把评测刷穿,在我看,关键就三个字,一体化。机器人的大脑之前是分裂的,感知归感知,规划归规划,控制归控制。打个比方,这就像你雇了个团队干活,看门的管看门,出主意的管出主意,干活的管干活,他们之间全靠递纸条交流,纸条丢了就得全崩。以前的技术方案就是这个流程,识别一个苹果要用一个模型,规划怎么抓又要一个模型,最后控制机械臂怎么动还得再调一个模型。每个环节之间都有信息损耗,延迟高得吓人,而且每次换场景都得重新调参,工程师得跟着机器人在现场熬几个通宵才能调通一次完整操作。
HY-Embodied-0.5这次直接把感知、决策、执行全部锁在一个模型框架里,端到端输出,中间没有任何信息断层。机器人看见一个杯子,它脑子里直接就能生成抓取的角度和力度,一气呵成,不需要再经过中间那些翻译环节。这件事听起来简单,但业内为了做成这一步憋了整整五年,中间掉进去的团队不计其数,死法五花八门,有的死在数据量太少,有的死在模型结构不对,有的死在训练的时候不稳定直接发散了。所以那16项最佳里,含金量最高的不是那些操控类测试,而是整体泛化性的指标,意思是换个新环境、放个没见过的物体,它依然能懵懵懂懂地应对个大差不差。
这背后的难点,恰恰是那些我们觉得最理所当然的地方。人类婴儿伸手抓一个奶瓶,不需要任何训练,抓几次就会了,哪怕奶瓶是歪着放的也能调整下手掌的角度。但这事对机器人来说,难比登天。视觉系统告诉它奶瓶在哪,这是二维图像,但抓取必须知道三维坐标,还需要估算物体材质是硬的还是软的、表面是光滑还是粗糙。以前所有这些信息必须靠工程师手写代码来预设规则,但现在,这个模型直接从海量数据里学到了这些隐性的物理直觉,不需要再逐条设定规则。
为什么腾讯能做出来,我特意去扒了扒他们这次公开的技术细节。他们的团队比较实在,没有藏着掖着讲玄学,直接说了一个词。
海量数据预训练加强化学习微调。听着没什么稀奇的,ChatGPT当年也是这条路。但问题在于,具身智能的数据,太难搞了。语言模型的数据是全网公开的文本,几十万亿个token随便抓,但机器人的动作数据,没有现成的互联网大礼包可以白嫖。跟真人学动作需要真人戴动捕设备一天到晚演示,效率低到令人发指,而且无法工业化复制。
这就逼出了一条新路。他们造了一套仿真的操作引擎,在虚拟世界里面生成海量的操作任务,让机器人先在仿真环境里疯狂的练,练出肌肉记忆,然后再搬到现实世界的真机上进行小样本的调整。这招其实不算什么保密技巧,AI圈子都这么干,核心差距在于生成的仿真场景够不够丰富,还有虚实迁移的算法够不够稳,这才是拉开身位的关键。很多团队的仿真只能做简单的方块抓取,场景单调得跟像素游戏一样,一到真实世界就满脸写着水土不服。但腾讯这次公布的花活儿明显增加了很多,比如操作软性物体,像毛巾、生肉这种会变形的玩意儿,还有长距离的移动操作复合任务,比如去另一个房间找到一本书再拿回来。
你把这些细节连起来看,就会发现这模型不是一个只能待在实验室里的玩具。它已经具备了初步的跨场景实用性,虽然还远没到成熟期,但至少路线终于跑通了。这就好比内燃机刚被发明的时候,比马车慢,比马车颠,排出来的尾气还难闻得要死,但那个时代的人只要脑子没坏,就该意识到这玩意儿跟马车已经不是同一种生物了。
我们再把视角拉回到更大的棋盘上看,国产具身智能这一仗,为什么必须打,而且必须打赢。过去互联网时代的核心是连接人的信息,移动互联网时代的核心是连接人的服务,但接下来的物理世界人工智能,核心是连接人的物理劳动。如果机器人只能存在于屏幕里,那姓什么都无所谓,但一旦它们要走进车间、仓库、餐厅还有我们每个人的家庭,那这件事就必须掌握在我们自己手里。
美国那边其实早就嗅到了这个味道。OpenAI和Figure合作的东西已经能跟人流畅对话并顺手递个苹果,特斯拉的Optimus更是被马斯克当成了第二增长曲线来反复吹。这些动作背后都锁定了同一个目标,要把通用人形机器人变成下一代计算终端。未来家家户户都会有一个或多个机器人,它们是劳动力,也是智能入口,更是数据采集器。谁把这个入口攥在手里,谁就掌握了下一个二十年最重要的基础设施,这远比手机芯片更关键。
所以在这样一个时间节点上,腾讯这次的技术突破,不仅仅是刷了个榜单那么简单。它给整个行业打了一针极其重要的强心剂,证明了即便在算力受限的情况下,我们依然能靠模型架构和数据策略的优化,在具身智能这个最前沿的赛道上站稳脚跟。这种感觉不太像堆硬件,更像是在比谁更聪明地利用资源,而我们正在用全栈自研的方式跑出一条自己的路。
有很多人喜欢问一个问题,什么时候机器人才能真正走进普通人家里。我身边已经不下十个朋友问过我了,说卡兹克你看这新闻天天吹,我啥时候能买个机器人回家帮我洗衣服做饭叠被子。
说实话,我没办法给一个确定的年份。但HY-Embodied-0.5这个模型的存在,让我敢拍着胸脯说一件事,方向对了。技术迭代就像烧开水,前面九十九度看起来没什么变化,但一旦突破那个临界点,沸腾就是一瞬间的事。而这次模型突破释放的信号,就是水温正在从八十度猛地往临界点上窜的关键阶段。
以前大家都不敢提通用机器人进家庭,因为技术太稀碎,成本高到离谱,而且泛化能力几乎为零,出个门换个地形就歇菜。但这次16项最佳里的很多场景,已经覆盖了家电操作、桌面整理这些跟家庭环境高度重合的任务。虽然目前的完成率离商用还有距离,但已经能看到终点线在哪里了。这已经比模糊不清的幻想阶段强了不知道多少倍。
我还特意关注了他们团队放的几个演示视频,有一个是两个机械臂配合着做东西的场景,左臂负责拿瓶,右臂负责拧盖,配合得非常灵巧。虽然动作速度没有肌肉记忆的流畅感,但那种笨拙里已经透出了一种正在学习的生命感,而不是机械重复的死板感。这种感觉让我觉得特别奇妙。就好比你看着一个刚学走路的孩子,他跌跌撞撞地扑向你,你知道他现在还很弱,但你心里明白,他走起来只是时间问题。
当然,我也不会无脑吹有一说一。现在的具身智能行业,水分依然很大,PPT造机器人的公司一抓一大把,各种争议和乱象层出不穷。过去一年里,好多披着人形机器人外衣的项目被戳穿,有的其实是用真人远程操控冒充自主智能,有的把预编程动作循环当成AI来宣传。我们见过太多泡沫破灭的瞬间,所以在这个领域,说什么都得留几分余地。
这次这个模型目前也主要是在仿真和受控环境下的测试成绩强悍,真实世界的复杂开放场景是不是依然够打,还需要更多第三方机构做更严格的复现和验证。学术榜单跟实际表现往往有差距,所以我的态度很明确,喜闻乐见,但保持冷静。我认可技术路线的突破价值,同时我也不觉得一个模型刷了榜单就意味着人类已经躺上了被机器人伺候的温柔乡。那个世界还早得很。
但如果让我用一个更宏观的视角来概括这次事件的意义,我会说,它意味着国产具身智能从跟跑和陪跑,开始进入同场竞技的新阶段。过去我们在机器人领域的大部分时间都在看别人怎么玩,然后想办法做一个平替或者跟风者。但这次不一样,这个模型身上带着一种强烈的原生气质,在统一模型架构和数据驱动方案上,我们已经有底气跟任何人掰手腕,甚至在某些细分维度上,已经走得更快。
这可能才是这件事对普通人来说最值得留意的信号。它不再是新闻通稿里那种空洞的喜报,而是切切实实地给出了一个可量化、可对比、可继续演进的坐标点,就像在黑暗的隧道里看到了出口处透进来的一缕光。这缕光还没有亮度十足,但我们已经知道该往哪个方向继续挖了。
回到开头我那个做机器人的朋友。他又补了一句让我印象很深的话,说以前投资人总是问他能不能做到某个精度,但从来没人问过他怎么积累数据。现在好了,模型把最难的那块最底层的地基打好了,我们终于可以往上面盖楼了。这大概是这次发布最有分量的一句话,地基意味着所有下游的玩家,那些做养老陪护的、做手术辅助的、做教育互动的,全都获得了一个更强的起点。他们不用再重复造轮子,可以直接站在这个模型肩膀上做自己擅长的事。
这才是大模型时代应该有的生态姿态。一个基础模型开放出来,点燃的是整个产业链的二次生长,这是开源最大的红利,也是技术进步最健康的方式。
未来还会越来越快。下一波浪潮里,我们家里的扫地机器人不用再靠乱撞导航,厨房里的机械臂不用再被固定程序拴住,养老院里的护理机器人能记住老人的吃药时间并把水杯递到位。这些二三十年前只存在于科幻电影里的画面,正在被一行行代码和一次次模拟训练变成触手可及的现实。它们有时候还是会出错,还是会让人哭笑不得,但这些都已经不重要了。
重要的是,门缝被推开了一条缝,有光透了进来。而这束光来自中国团队的手电筒。就凭这点,已经值得我认认真真地去写一篇文章记录一下了。毕竟能亲眼看到机器人开始睁开眼睛、伸出手臂的时代,我们算是赶上了。
BossAgents