
分拣、组装倒茶、调酒、打乒乓球、拿药……这两天,WAIC(世界人工智能大会)展馆中的“铁皮生物”忙着给碳基生物展示新学的技能。相比两年前呆站着或被绳索吊起来的前辈,这一届具身智能机器人有模有样地动起来了。
但逛了展馆,腾讯首席科学家、腾讯Robotics X实验室张正友告诉第一财经等媒体,他发现机器人无论是本体形态还是落地场景,同质化还是比较严重。
“具身智能尚未真正大规模落地,大家都在寻找可以发挥作用的地方,不同机器人厂家找到的场景可能都差不多。”他表示,现在业界对工业场景应用关注很多,除此之外,他还希望有更多企业参与养老行业。
在养老等需要与人交互的场景,一些难题仍待解决。“机器人最难解决的问题在于操作物体或与人物理接触。现在看到大部分落地场景都在工业,除非是玻璃等脆弱物品,很多物体重一点、轻一点,都不需要那么精细地抓取。”张正友告诉记者,但人与机器人的物理接触不能出现任何差错,尤其是在养老场景,类似“搀扶老人把老人骨头捏碎”的情况不可接受,机器人进入家庭要100%保障安全。
张正友说,要把触觉、力觉、视觉大模型做好,触觉、力觉和视觉感知要紧密结合。触觉反馈大概1毫秒,视觉反馈可能是30毫秒,把不同频率的感知信息和大模型结合十分重要。在各种腾讯希望挖掘的具身智能应用场景中,养老场景是难度最大的之一,腾讯的示范性机器人“小六计划”进入真实场景如养老院,以便进一步迭代。

去年腾讯发布了Tairos具身智能开放平台,定位类似具身大脑,本届WAIC则推出Hy-Embodied-VLM-1.0等多款具身智能系列新模型和多个智能体框架,用于完善具身智能机器人的大小脑并连通机器人身体感知。这些更新源于机器人仍存在一些需要被治愈的智能“硬伤”。
张正友称,目前最聪明的人工智能本质上仍是“缸中之脑”,善于逻辑推理、文本生成和知识问答,但缺乏与物理世界直接互动的闭环,未必真正理解物体的位置、空间关系与可操作性,也难以在持续变化的环境中边行动、边接收反馈、边及时调整。而真正的智能需要让语言、视觉、空间认知、身体控制和环境反馈连通起来。
此外,张正友表示,机器人训练所需数据包括网络视频、第一人称视角操作视频、带传感器手套收集的数据、遥操作数据。要让机器人经由训练变得更智能,这四类数据需要打通。
模型也有待继续演进。张正友告诉记者,大语言模型技术栈已经收敛,具身智能技术栈还没有。去年业界兴起VLA(视觉语言动作模型)范式,今年在谈论世界模型,但目前世界模型的实现方式尚未有共识性技术路径,仍需继续探索。
举报 第一财经广告合作,请点击这里此内容为第一财经原创,著作权归第一财经所有。未经第一财经书面授权,不得以任何方式加以使用,包括转载、摘编、复制或建立镜像。第一财经保留追究侵权者法律责任的权利。如需获得授权请联系第一财经版权部:banquan@yicai.com 文章作者
郑栩彤
相关阅读
我们被机器人包围:它们合计估值超千亿了它们不再只是玩具,而是成为生产力的一部分。
29812 昨天 18:33
WAIC前瞻|具身智能“大考”:谁能造出最会干活的机器人参展企业不止于“秀肌肉”,还将展示具身“大脑”的技术进展。
11398 07-16 17:45
苹果会掉、薯片会爆:为什么机器人完不成手头的工作“手”是机器人与真实世界交互的关键部件。
10 14467 06-25 11:30
机器人为什么还不够聪明?具身智能不缺融资、缺数据数据缺口可能高达1亿倍。
8 7926 06-25 09:13
人形机器人实景大集训来了:从“能用”到“好用”,重塑产业生态进一步丰富具身智能应用谱系,带动形成万台级规模落地能力。
15924 06-10 20:09 一财最热 点击关闭配查查提示:文章来自网络,不代表本站观点。