首页 > 科技 > 正文
Qzone
微博
微信

100万小时之后,机器人为什么还喊“饿”?

科技 盖世汽车    2026-09-01 09:53

100万小时,还不够。

觅蜂科技是智元机器人内部孵化的控股子公司,今年2月成立,定位为物理AI数据服务商。

8月31日,智元机器人内部孵化的控股子公司觅蜂科技,宣布MEgo系列第2万套设备正式下线,同时发布百万小时无本体数据集。这批数据覆盖22大类场景、500余种任务类型、超过1万个真实场景和5万余个物体类别。

100万小时之后,机器人为什么还喊“饿”?

图片来源:觅蜂科技

此时,距离觅蜂科技成立不过半年时间,也成为了行业首家对外宣布百万小时级别的无本体数据产能的公司。

但同一天,觅蜂科技董事长兼CEO姚卯青又把行业的下一阶段目标指向了另一个数量级:“通往AGI,物理AI最终需要上千万、上亿小时的数据,今天只是起点。

100万到1亿,意味着100倍。

这个巨大的缺口,很容易让人产生一种熟悉的感觉。

过去几年,大模型行业已经经历过类似的Scaling叙事:更多数据、更大参数、更多算力,然后等待能力在某个节点突然涌现。

现在,这套逻辑似乎正在被搬到机器人身上。

于是,数采工厂越来越多,无本体设备开始量产,真实世界数据被按“小时”计算,百万小时之后又出现千万、亿小时的目标。

但一个更基础的问题反而值得先问:具身智能真的已经知道自己需要1亿小时什么样的数据了吗?

如果这个问题还没有答案,那么“百万小时”究竟意味着机器人距离通用智能更近了一步,还是仅仅意味着人类第一次具备了大规模生产物理世界数据的能力?

两者其实并不是一回事。

 

大模型的Scaling,不能简单复制给机器人

机器人缺数据,这一点并不难理解。

语言模型拥有一个天然优势:人类过去几十年已经把大量知识数字化。

网页、书籍、论坛、代码、图片、视频,本身就是现成的训练材料。

但机器人最终要解决的是物理世界的问题。

怎么拿起一个杯子、怎样折叠衣服、怎样把不同材质的物品放进货架——这些人类习以为常的操作经验,并没有天然存在于互联网上。

100万小时之后,机器人为什么还喊“饿”?

姚卯青表示,目前物理AI的数据规模相比语言模型还小了“四五个数量级”。在他看来,机器人真正的技能来自经验,“只有见过才会,才能再举一反三”。

问题在于:“机器人缺数据”和“机器人需要1亿小时数据”,中间其实还隔着很远。

大模型Scaling成立的一个重要基础,是文本、图像等数据拥有相对成熟的Token化方式,模型架构、训练目标和评测体系也逐渐收敛。

物理世界却复杂得多。

同样是“拿起杯子”,不同机器人可能拥有二指夹爪、五指灵巧手;不同本体的自由度、尺寸、力矩和控制频率都不同。人类完成一次动作产生的数据,也未必能够直接变成机器人的控制信号。

更重要的是,今天的具身智能甚至还没有完全回答一个基础问题:到底什么数据最有用?

是1000个家庭里各做一次叠衣服,还是一个机器人把叠衣服做10万次?

是人的第一视角视频更重要,还是机器人的关节轨迹更重要?

是让模型见过更多任务重要,还是让它把少数任务做得足够可靠更重要?

这些问题目前并没有统一答案。

所以,“1亿小时”至少在今天还不能被理解为类似“训练某个模型至少需要多少Token”的工程结论。

它更多代表的是一种产业判断:如果具身智能最终需要通向开放世界的泛化能力,那么今天的数据规模远远不够。

至于究竟差多少,行业还在摸索。

为什么“无本体”偏偏在这个时候火了?

也正是在这种背景下,无本体数据开始迅速升温。

过去获取机器人数据,一个最直接的办法是让机器人自己干。

操作员通过遥操作控制机器人完成抓取、搬运、整理等任务,机器人看到什么、关节如何运动、末端执行器经过怎样的轨迹,都同步记录下来。

优点是数据天然贴近机器人。

缺点同样突出——生产效率太低。

京东科技集团副总裁何贺在现场回忆,一年前进行物理世界数据采集时,操作员带着机器人工作8小时,最终可能只有1小时有效数据,同时还要承担机器人、电费、人工和场地成本。

100万小时之后,机器人为什么还喊“饿”?

姚卯青则给出了另一个数字:现在几万小时真机数据已经成为一些模型比较普遍的需求,而几万小时真机数据,可能就需要上千台机器人持续采集半年。

这恰恰暴露了一个矛盾。

一边是行业开始相信数据应该Scaling;

另一边是传统数据生产方式根本Scale不起来。

无本体数据,本质上是在解决这个矛盾。

人不再需要遥操作一台真正的机器人,而可以佩戴第一视角、腕部设备,或者拿着夹爪直接完成任务。

觅蜂此次公布的100万小时数据中,50万小时来自裸手采集,35万小时来自腕部采集,15万小时来自Gripper夹爪采集。

100万小时之后,机器人为什么还喊“饿”?

现场食堂里的对比更加直观。

传统遥操作8小时可能得到1小时有效数据,而餐饮、保洁工作人员正常工作时佩戴设备,8小时最多可以产生5—6小时数据。

所以,无本体的出现首先解决的并不是“机器人怎样变聪明”。

而是一个更加现实的问题:怎样把物理世界的数据生产成本降下来。

这是两个完全不同的问题。

能够便宜地生产100万小时数据,并不意味着这些数据一定能够带来与数量成比例的模型能力提升。

这也是看待此次“百万小时”最需要区分的地方。

它首先证明的是数据生产能力,而不是模型能力。

100万小时最大的价值,可能不是“100万”

事实上,即使是觅蜂自己,也没有把所有筹码押在小时数上。

此次公布的100万小时数据同时强调了22大类场景、500余种任务、超过1万个真实场景和5万余个物体类别。

这背后其实暴露出具身智能Scaling与大模型Scaling一个非常不同的问题:物理世界的数据很难只用“小时”衡量。

两个数据集都可以叫100万小时。

一个可能来自大量重复任务,另一个可能覆盖完全不同的环境、物体和操作,两者对于模型的意义显然不同。

同样,一段30分钟的数据里,也可能真正有价值的操作只有几分钟。

所以小时数是最容易理解、最容易传播、也最容易被产业统计的指标,却未必是衡量具身数据价值最准确的尺度。

这也是为什么,今天看到“百万小时”“千万小时”“亿小时”这些数字时,需要保持一点距离。

它们说明供给规模正在迅速扩大,却不能直接等价为机器人能力的提升。

真正需要观察的是另一条曲线:

当数据从10万小时增加到100万小时,模型到底提升了多少?

成功率提高了吗?

没有见过的环境中,泛化能力提高了吗?

换一个机器人本体之后,原来学到的能力还能保留多少?

过去不会做的任务,因为这些数据学会了吗?

如果这些问题没有对应答案,那么数据规模本身很容易变成一个漂亮但缺乏解释力的产业KPI。

至少此次发布会上,觅蜂更多展示的是数据规模、覆盖范围、采集和治理能力;至于百万小时数据能够给某个具体模型带来多少能力增益,现场尚没有给出一组可以与数据规模直接对应的完整结果。

因此,“行业首个百万小时”值得记录,但它还不是一个类似“大模型参数跨过某个节点之后出现能力涌现”的技术证明。

这是需要分清的。

机器人需要的,到底是“见得多”还是“练得多”?

再往前一步,具身智能还有一个比数据量更根本的问题。

人的学习并不是简单复制过去见过的所有动作。

一个人第一次学会打开某种抽屉之后,换一间房、换一个把手、换一个高度,大概率仍然知道“拉开抽屉”这件事情应该怎么做。

机器人追求的最终也是这种能力。

也就是泛化。

从这个意义上说,真实世界大规模数据的价值很好理解:

实验室可以搭一个餐厅,却很难搭出1000个不同的餐厅。

真实世界里的光线、桌面高度、物品位置、人流和干扰每时每刻都在变化。机器人见过的环境越多,理论上越有机会学习到任务背后更加通用的规律。

这也是无本体数据最有吸引力的地方。

它把数据源从有限的机器人实验室扩展到了真实世界。

但这仍然只解决了一半问题。

见得足够多,不等于做得足够好。

人类的身体和机器人不同。

人的操作经验可以告诉模型“杯子应该这样拿”,却不能天然保证某台机器人知道自己的几个关节应该转多少度、夹爪应该施加多少力。

因此,无本体与真机之间并不是简单的替代关系。

姚卯青在群访中也承认,无本体更多用于预训练和通用表征学习,而真正针对具体机器人、具体任务进行后训练和落地时,“肯定绕不开对应本体的真机数据”。

腾讯Robotics X实验室产品生态负责人朱亚娟的说法也很谨慎:无本体的“异构+Gripper”可以“一定程度上”替代过去通过本体遥操作解决的问题,但跨本体迁移中精细动作的对齐,仍然需要真机数据来校准。

这两个限定词其实比“百万小时”更值得关注。

因为它说明,行业现在仍然没有找到一种可以包打天下的数据。

机器人既需要“见得多”,也需要“练得多”。

而这两种需求究竟应该如何组合,目前仍然处于探索阶段。

具身智能的“Scaling Law”,还没有被证明

所以,回到最开始的问题:100万小时,还不够机器人“吃”吗?

答案可能是——至少在今天,这个问题还没有答案。但真正值得注意的是另一件事:行业已经开始用“数据规模化”来回答这个问题——而规模化本身,也可能成为答案的一部分。

姚卯青认为,上亿小时才能预训练出足够好的具身基座模型。

这个判断并非没有逻辑。

如果目标是让机器人进入家庭、商场、工厂、仓库乃至更多开放环境,那么它面对的物体、任务和环境组合几乎无限,现有数据显然远远覆盖不完。

但从100万到1亿之间,并不存在一条已经被验证的Scaling Law。

1000万小时是否会出现能力跃迁?

5000万和1亿有什么本质差异?

模型架构进步之后,数据需求会不会反而下降?

不同数据之间应该按照什么比例组合?

这些问题目前都没有确定答案。

因此,此次百万小时数据更准确的意义,或许不是证明“机器人距离AGI又近了1%”。

AGI不是一个可以简单用数据小时数计算的进度条。

它真正说明的是另一件事情:

物理世界的数据,正在第一次具备被工业化生产的可能。

两万套采集设备、百万小时数据、真实场景采集,以及越来越专业的数据加工链路,共同指向一个新产业正在形成——人类过去没有被记录下来的物理操作经验,开始被系统性地数字化。

至于这些数据最终能在多大程度上推动机器人能力Scaling,仍然需要模型训练和真实部署来回答。

所以,对于今天的具身智能而言,真正值得警惕的不是数据太多,而是过早把“数据规模扩大”和“智能能力提升”画上等号。

百万小时之后,行业当然还会继续追逐千万小时、亿小时。

但下一阶段需要证明的,不应该只是数字还能不能继续变大。

而是机器人是不是真的因此变得更聪明了。

换句话说:数据产能的工业化,与智能能力的涌现,是两件独立的事。 前者正在发生,后者仍待验证。而把两者混为一谈,恰恰是当前具身智能叙事中最需要警惕的部分。

当然,在证明这一点之前,还有一个更加现实的问题。

如果行业真的准备向1亿小时迈进,剩下的9900万小时,到底从哪里来?

这将是这个系列下一篇要讨论的问题。

【以上内容转自“盖世汽车”,不代表本网站观点。 如需转载请取得盖世汽车网许可,如有侵权请联系删除。】

 

延伸阅读:

 

责任编辑: fjq4191

责任编辑: fjq4191
人家也是有底线的啦~
广告
Copyright © 2018 TOM.COM Corporation, All Rights Reserved 新飞网版权所有