Tuesday, 1 September 2026

Aube.

News of progress
Single source

觅蜂科技发布百万小时无本体机器人数据集

Languages for this article
Original · 中文ENFR

Originally written in Chinese. 3 languages available; yours is one click away.

操作员不再必须遥控一台真正的机器人,而是戴上第一视角设备、腕部设备,或直接拿着夹爪完成抓取、搬运和整理。8月31日,智元机器人旗下觅蜂科技宣布,第2万套MEgo系列设备下线,并发布了100万小时无本体数据集。这批数据来自不同人的操作,不绑定某一种机器人本体,意味着那些过去没有被记录的物理经验,开始进入规模化生产。

数据的覆盖面同样被摆上台面:22大类场景、500余种任务类型、超过1万个真实场景和5万余个物体类别。其中,50万小时来自裸手采集,35万小时来自腕部采集,15万小时来自夹爪采集。觅蜂科技今年2月成立,董事长兼首席执行官姚卯青称,通往通用人工智能,物理人工智能最终可能需要上千万、上亿小时数据,但今天只是起点。

这条路首先解决的是“怎么更便宜地获得数据”。京东科技集团副总裁何贺回忆,传统遥操作让操作员工作8小时,最终可能只有1小时有效数据,还要承担机器人、电费、人工和场地成本;正常工作时佩戴设备,8小时最多可以产生5—6小时数据。数据生产效率提高了,训练材料的供给也随之扩大,但一小时数据里究竟有多少真正有价值的动作,仍不能只看时长。

具体来说,百万小时并不等于机器人已经变聪明了同样多。语言模型拥有网页、书籍、代码和视频等现成数字材料,而拿杯子、叠衣服、把不同材质物品放进货架等经验并不会自然出现在互联网上。可是,不同机器人的夹爪、自由度、尺寸、力矩和控制频率各不相同,人完成的动作不能直接变成每台机器人的控制信号;无本体数据主要用于预训练和通用表征,具体机器人落地仍需要真机数据。

对工厂、仓库、商场和未来家庭场景而言,眼下最实际的变化是数据采集不再只能依赖昂贵的单机遥操作。更丰富的环境、物体和任务组合,理论上有机会帮助机器人学习更通用的规律;但觅蜂科技此次展示的主要是数据规模、覆盖范围以及采集和治理能力,尚未公布百万小时数据能让某个具体模型获得多少能力增益。数据产能的工业化已经发生,智能能力是否随之涌现,还要由模型训练和真实部署回答。

Sources — read the originals(Paris time)

第一电动网ZH
0000

Read next

Comments

Loading the thread…

Sign in to leave a comment. Sign in