自变量机器人用虚拟训练场筛选动作,实验仍需真机验证
机器人运动会散场后,真正棘手的不是再跑快一点,而是把桌上的杯子拿稳。自变量机器人团队发布实验室原型自回归世界模型WALL-SS,让机器人在虚拟环境中预演抓取、倒水和整理物品:同一个起始画面换一条动作轨迹,模型要给出相应的抓空、碰撞或成功结果,而不是无论怎么动都把故事改写成成功。
这正对准了机器人进入真实场景后的短板。训练数据若主要来自成功示范,模型容易把“夹爪闭合”和“物体被拿起”简单画上等号,哪怕夹爪与杯子之间还隔着距离,生成画面里的物体也可能像被磁铁吸住一样贴过去。WALL-SS保留抓空、滑落、碰撞、重新抓取、人工接管和失败恢复等数据,让虚拟训练场看到动作的边界,而不只看到理想结局。
它的做法是把动作与画面放在同一条时间线上。机械臂往左还是往右,先改变低清预览中的运动方向;夹爪何时闭合,再影响清晰画面里的接触结果。模型同时用会随时间压缩的记忆保存任务状态:最近几秒保留更多细节,更早的历史只留下物体位置和任务进度。论文测试中,WALL-SS连续推演60秒倒水任务,机械臂逐帧轨迹误差保持在画面对角线的0.5%以下。
虚拟成绩能否指导真机,关键看两边的策略排名是否接近。研究团队把5个不同训练阶段的策略放进WALL-SS和真实机器人,在6项任务、20组匹配初始状态下进行测试,共得到600对闭环结果;其中527对的最终成败一致,虚拟世界选出的较优版本有89%与真机测试中的优劣关系相同。30个任务与策略版本的虚拟、真机成功率相关系数为0.926,但这衡量的是整体趋势,不是单次预测有92.6%的命中率。
具体来说,WALL-SS可以先替机器人研发团队筛掉更差的动作策略,再让少量候选者进入真机测试,减少设备占用、现场复位以及碰撞液体和易碎物品带来的风险。它不是对真实测试的替代品:灵巧手、触觉、力控和关节精度仍决定机器人能否真正拧紧螺丝或插入接口。当前的价值更像一座研发用的练习场、考场和校准台,把真机产生的成功、失败与人工接管数据继续送回模型,帮助下一轮筛选。
Comments
Loading the thread…
Sign in to leave a comment. Sign in