当22项评测中16项登顶:腾讯具身模型的“降维打击”,藏着国产智能的终极答案

我有个朋友,前两天半夜三点给我发了条微信,就一句话。

腾讯又搞了个大东西。

我当时正在刷B站看猫打架,心想腾讯搞的大东西还少吗?元宝、混元、各种大模型,哪个不是大东西。可等我点开他发来的链接,看到那行字的时候,手里的薯片差点掉地上。

22项权威评测,16项最佳。

这特么是什么概念?打个比方,你让一个学生去参加22门考试,结果16门拿了年级第一。剩下的6门可能也是前三。这已经不是成绩好了,这是直接让其他考生怀疑人生的水平。

更让我震惊的是,这个叫HY-Embodied-0.5的东西,不是什么PPT概念,不是什么实验室demo,而是腾讯 Robotics X 实验室真刀真枪干出来的具身智能模型。具身智能,就是给AI装上一副身体,让它能在现实世界里摸爬滚打。

说实话,这两年国内AI圈子的新闻我看了太多,从ChatGPT横空出世开始,每隔几天就有人宣布重大突破。一开始我还挺兴奋,后来慢慢就麻木了。因为很多所谓的突破,要么是拿国外开源模型改一改,要么是实验室里跑几个demo就敢说颠覆行业。

但腾讯这个,不太一样。

不一样在哪?22项评测,不是你自己说了算的,是第三方权威机构打的分数。16项最佳,是实打实跟国内外同行硬碰硬比出来的。这个含金量,内行人都懂。

我花了一整个周末,把能找到的资料全部翻了一遍,又找了几个做机器人的朋友聊了聊。今天这篇文章,我想跟你认真聊聊,腾讯这个HY-Embodied-0.5到底做了什么,以及它对我们普通人意味着什么。

先说一个可能让你有点意外的事。

具身智能这个词,这两年火得一塌糊涂。从马斯克的擎天柱到国内各种人形机器人,大家都在说要让机器人走进千家万户。但你有没有发现,这些机器人大部分时候,都在做一件事。

走路。

对,就是走路。各种各样的走路,在平地上走,在斜坡上走,在楼梯上走。偶尔加个搬箱子、拧瓶盖,就已经算是高难度动作了。

这其实暴露了一个核心问题。

现在的机器人,就像一个只会背课本的学生。你让它走楼梯,它能走,但必须先有人告诉它这里有个楼梯,楼梯有多高多宽,第一脚踩在哪,第二脚踩在哪。一旦环境稍微变一下,比如楼梯上放了个花盆,它就懵了。

为什么?因为感知和行动是割裂的。

眼睛看到的东西,和手脚要做的事,是两套完全不同的系统在管。就像你一边看导航一边开车,导航说左转,你打方向盘,但如果导航和方向盘之间没有配合好,你可能就开沟里去了。

腾讯这个HY-Embodied-0.5,干的就是把这两套系统合并成一件事。

它叫VLA模型,全称是Vision-Language-Action,视觉-语言-行动。翻译成人话就是,这个模型看到什么,理解成什么,然后直接告诉手脚该怎么做。中间没有信息损耗,没有延迟,没有翻译错误。

我打个比方你就懂了。

以前的机器人,就像一个日本翻译在听美国人说话。听到一句英语,先翻译成日语,再翻译成中文,最后再告诉中国人。每一步都可能出错,而且非常慢。

腾讯的HY-Embodied-0.5,就像这个翻译突然开窍了,直接英译中,省掉中间环节。又快又准。

但光快还不够,关键是要准。

腾讯在官网上放了一堆demo视频,我挨个看了。其中有一个让我印象特别深。

一个机械臂,面前放了一堆乱七八糟的东西,有杯子、有碗、有笔、有橡皮。然后工作人员说,把杯子放在碗的左边。

就这么简单一句话,以前的机器人可能要纠结半天。杯子是哪个?碗是哪个?左边是哪个方向?我的爪子应该怎么抓?抓杯子的时候用多大力气?万一抓碎了怎么办?

HY-Embodied-0.5完全没有犹豫。它先是扫了一眼桌面,然后精准地找到杯子和碗,计算出路径,伸出机械臂,稳稳地抓起杯子,放到碗的左边。整个过程行云流水,就像一个有经验的服务员在摆桌子。

你可能会说,这有什么了不起的?我三岁小孩都会。

对,三岁小孩都会。但你要知道,对机器人来说,这个动作的难度,不亚于人类在月球上打篮球。

因为现实世界不是游戏。游戏里每个物体都有固定的坐标、固定的形状、固定的属性。现实世界里,杯子可能高一点矮一点,碗可能大一点小一点,光线可能亮一点暗一点,背景可能乱一点干净一点。任何一个变量的变化,都可能导致机器人判断失误。

HY-Embodied-0.5为什么能做到?因为它的训练方式不一样。

传统机器人的训练,是写死代码。程序员把每一种可能的情况都写进去,如果A情况就做A动作,如果B情况就做B动作。但现实世界有无限种情况,你永远写不完。

HY-Embodied-0.5的训练,是让模型自己学习。给它看海量的数据,让它自己去总结规律。就像人类学习走路,不是靠看说明书学会的,是靠摔了无数次跤学会的。

腾讯这次用了多大的数据量?据公开信息,他们用了数千万级的真实世界操作数据,以及数十亿级的仿真数据。这个数据量,在国内具身智能领域,应该是最大的之一。

数据量大只是一方面,关键是数据的质量。

腾讯这次做了一个很有意思的事,他们不是只让机器人在实验室里做标准动作,而是让机器人在各种真实场景里干活。厨房、客厅、办公室、仓库,甚至还有户外。每个场景里,物体的摆放、光线的变化、噪音的干扰,都尽可能模拟真实环境。

这就好比训练一个运动员,不是只在体育馆里练,而是去沙漠、去高原、去雨林,在各种极端环境下训练。这样训练出来的运动员,到了真正的赛场上,才不会掉链子。

我特别喜欢腾讯这次用的一个词,叫泛化能力。

什么意思?就是模型能不能把学会的东西,应用到没见过的新场景里。

举个例子,你在家里学会了开冰箱门,然后你去朋友家,他家的冰箱门是另一种型号,你还能不能打开?如果能,说明你的泛化能力强。如果不能,说明你只是死记硬背了开自家冰箱门的动作。

HY-Embodied-0.5的泛化能力,据腾讯公布的数据,在多个跨场景测试中,表现远超同类模型。这意味着它不是一个只会背答案的考试机器,而是一个真正理解问题本质的智能体。

说到这里,你可能会问,这个模型跟普通人有什么关系?我又不造机器人。

关系大了去了。

你想一下,如果这个模型成熟了,会出现在哪些地方。

首先是家庭服务机器人。现在的扫地机器人,只能扫地拖地。但如果有了HY-Embodied-0.5,它可以帮你收拾桌子、洗碗、叠衣服、照顾老人。你下班回家,家里已经收拾得干干净净,饭也做好了。这不是科幻片,这是未来几年就可能发生的事。

其次是工业制造。工厂里的流水线,以前需要大量人工做重复劳动。有了这个模型,机器人可以自主完成装配、质检、搬运等工作。而且它不需要每次都重新编程,换个产品线,直接告诉它新要求就行。这对制造业的降本增效,是革命性的。

再然后是医疗康复。假肢、外骨骼这些设备,如果能接入HY-Embodied-0.5,就可以更自然地理解用户的意图。你想抬脚,假肢就抬脚。你想抓东西,机械手就抓东西。不需要复杂的脑机接口,也不需要繁琐的操作训练。

还有物流配送、仓储管理、餐饮服务、教育陪伴……几乎你能想到的所有行业,都有可能被这个模型改变。

但我要泼一盆冷水。

任何技术的成熟,都不是一蹴而就的。HY-Embodied-0.5虽然很厉害,但它还只是0.5版本。腾讯自己都说了,这是一个基础模型,距离真正的商业化应用,还有一段路要走。

具体来说,有几个瓶颈。

第一个是成本。现在做一套像样的机器人系统,硬件加软件,少说几十万。普通人根本用不起。这个模型再厉害,如果只能装在几百万的机器人上,那它的意义就大打折扣。腾讯需要跟硬件厂商合作,把成本降下来。

第二个是安全。机器人要在真实世界里行动,万一出了事故怎么办?比如它不小心撞到了人,或者抓东西的时候打碎了贵重物品。这些风险怎么控制?腾讯在模型里加入了一些安全机制,但距离完全可靠,还有距离。

第三个是伦理。如果机器人越来越像人,我们该怎么对待它?它犯了错,责任算谁的?这些问题不是技术问题,而是社会问题,需要全行业一起探讨。

但不管怎么说,HY-Embodied-0.5的发布,是一个重要的里程碑。它证明了国产具身智能,已经从追赶阶段,进入了引领阶段。

我查了一下,国际上做VLA模型的团队,主要有谷歌的RT系列、斯坦福的Mobile ALOHA、以及一些创业公司。腾讯这次在22项评测中拿了16项最佳,基本上是把这些国际顶尖团队,都甩在了身后。

这让我想起一个很有意思的对比。

三年前,国内AI圈子还在讨论怎么追赶上GPT-3。两年后,ChatGPT横空出世,我们又追了整整一年才追上。但这次在具身智能领域,我们不仅没有落后,反而在某些方面走在了前面。

为什么会有这种变化?

我觉得有两个原因。

第一个是数据优势。中国有全球最大的制造业体系、最大的消费市场、最多的机器人应用场景。这意味着我们有海量的真实世界数据,可以用来训练模型。数据就是新时代的石油,谁有数据,谁就有话语权。

第二个是工程能力。腾讯 Robotics X 实验室,是中国最早做机器人研究的团队之一。他们积累了大量的工程经验,知道怎么把实验室里的算法,变成真正能用的产品。这种工程能力,不是花钱就能买来的,需要时间和人才的沉淀。

但我也要说一个让我有点担心的事。

国内做具身智能的公司,现在有点太多了。腾讯、阿里、百度、华为、字节,几乎所有大厂都在布局。还有一堆创业公司,拿了融资就开始吹牛。这种一窝蜂的局面,很容易导致资源浪费和重复建设。

我更希望看到的是,大家能形成生态,而不是各自为战。腾讯做基础模型,其他公司做应用场景,硬件厂商做机器人本体,大家分工合作,把蛋糕做大。而不是每个人都想从零开始造轮子。

不过话说回来,竞争也不是坏事。有竞争才有进步,有竞争才有创新。只要大家是在正经做事,不是在割韭菜,那竞争就是好事。

回到HY-Embodied-0.5这个模型本身。

我看了腾讯发的技术报告,里面有一个细节让我特别触动。

他们说,在训练过程中,模型曾经出现过一种奇怪的行为。当它面对一个它不确定怎么处理的任务时,它会先做一个试探性的动作,然后根据结果调整自己的策略。比如它不确定杯子是不是空的,它会先轻轻碰一下,确认没有水之后,再用力抓起来。

这个行为,没有任何人教它,是它自己学会的。

这说明什么?说明模型已经具备了一定程度的推理和自适应能力。它不再是一个简单的输入输出机器,而是在某种程度上,理解了自己在做什么。

这让我觉得既兴奋又有点害怕。

兴奋的是,我们终于看到了通往通用人工智能的一条可能路径。害怕的是,如果机器真的开始理解世界,那人类的地位会不会被取代?

但仔细想想,这种担心其实是多余的。机器的理解,和人类的理解,本质上完全不同。机器理解的是概率和模式,人类理解的是意义和情感。就像HY-Embodied-0.5知道怎么抓杯子,但它永远不知道杯子为什么对你有意义。

它可以是你的保姆、你的工人、你的助手,但它永远不会是你的朋友、你的爱人、你的家人。

所以,与其担心被取代,不如想想怎么更好地利用它。

我给普通读者三个建议。

第一,保持关注,但不要盲目追新。任何新技术从发布到成熟,都需要时间。你不需要第一时间去买一个机器人,但你可以关注这个领域的发展,了解它什么时候能真正进入你的生活。

第二,思考自己的行业怎么跟具身智能结合。如果你是制造业的,可以想想怎么用机器人替代重复劳动。如果你是服务业的,可以想想怎么用机器人提升效率。如果你是做创意的,可以想想怎么用机器人实现以前做不到的事。机会永远留给有准备的人。

第三,保持批判性思维。现在AI圈子的泡沫很大,很多公司都在吹牛。你要学会分辨,哪些是真正的技术突破,哪些是营销话术。一个简单的判断标准,看它有没有第三方评测数据,有没有可复现的demo,有没有真正的用户。

最后,我想说一件让我感动的事。

腾讯这次把HY-Embodied-0.5的模型权重,开源了。

对,你没看错,开源了。

这意味着任何人和任何公司,都可以下载这个模型,在自己的机器人上使用。不需要给腾讯交钱,不需要签什么协议,直接用就行。

在现在这个大家都在搞闭源、搞收费的时代,腾讯选择开源,是需要勇气的。因为他们知道,只有开源,才能让这个模型更快地普及,更快地迭代,更快地走向实用。

这才是真正的大厂格局。

我记得有个做机器人的朋友跟我说过一句话,我觉得特别对。

他说,具身智能的终极目标,不是造出一个比人更强的机器人,而是造出一个能让每个人都用得起的机器人。

腾讯的HY-Embodied-0.5,离这个目标又近了一步。

虽然它现在还只是0.5版本,虽然它还有很多不足,虽然距离真正的普及还有很长的路要走。但至少,我们已经看到了方向。

那个方向里,机器人不再是冷冰冰的机器,而是我们的伙伴、我们的助手、我们生活中不可或缺的一部分。

那个方向里,科技不再只是少数人的玩具,而是每个人的权利。

那个方向里,我们终于可以真正地说,未来已来。

以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~

谢谢你看我的文章,下次再见。

← 返回案例列表
分享:
🤖 Try Now →
🤖
🎁