每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

机械臂动作学习新方法:像拨号盘一样调节速度

苹果公开了名为MoMo的机器人操作框架,可控制同一动作快速或谨慎地执行

이미지: METAL LAB 생성

摘要

  • 苹果发布了MoMo,将机器人操作动作的执行方式(速度、力度)作为一个可学习的变量来处理
  • 在6项真实机器人任务实验中,稳定型、动态型、中间型动作在关节速度、加速度、接近角度上表现出明显差异
  • 即使在只以一种方式演示的任务中,应用新的动作模式后依然保持了任务成功率,验证了其泛化能力
발표
애플 머신러닝 리서치, 2026년 7월 논문 공개
저자
Yuhan Hu, Hugues Thomas 등 6명
구조
시공간 행동 토크나이저 + 행동복제 트랜스포머로 이뤄진 2단계 모방학습
실험 대상
실제 로봇 조작 과제 6종
확인된 차이
관절 속도·가속도·엔드이펙터 접근 각도에서 동작 모드별 차이 관측

机器人也需要区分“快点快点”与“慢慢来”

苹果公开了一个名为“MoMo”的框架,能让机械臂在执行相同任务时,根据情况调整动作的速度和力度。论文题为《MoMo: Dial Motion Mode in Robot Manipulation with Spatiotemporal Action Tokenization》,已于今年7月发表在苹果机器学习研究平台上。

MoMo是一个由两个阶段组成的模仿学习框架——即通过观察人类演示视频让机器人学习模仿行为的学习方法。首先,时空动作分词器将机器人的动作转换为同时包含时间与空间信息的令牌(token)。随后,行为克隆Transformer基于这些令牌,结合任务类型以及一个名为“动作模式”的连续条件值作为输入,生成实际的运动。在使用真实机器人进行的6项操作任务实验中,改变这个动作模式值后,机器人生成了稳定型动作、动态型动作以及介于两者之间的中间型动作,人类评估者也能够区分这些差异。在关节速度、加速度以及抓取物体时指尖靠近的角度上,都确认了实际存在的差异。

为什么“如何”移动很重要

迄今为止,机器人操作研究的重点大多集中在“要做什么”上。核心在于能否准确完成诸如“拿起杯子”“打开抽屉”这类任务本身。但人类在做相同动作时,会根据情况有所不同。玻璃杯要缓慢小心地搬运,而结实的塑料桶则可以快速抓起、近乎扔进去般地搬运。这种“执行方式上的差异”在以往的机器人学习中,往往被当作噪声而被忽略。

MoMo正是着眼于这一点。其思路是:如果将动作模式视为与任务本身分离、可独立复用的要素,那么在某一任务中学到的“谨慎”,就可以原封不动地迁移到完全不同的任务上。研究团队表示,即使在只以一种方式演示过的任务中,当机器人接受未经演示的新动作模式请求时,任务成功率也没有明显下降。这被视为机器人能够泛化到从未学习过的“任务-模式组合”的证据。

在机器人学习领域,近来出现了通过大量学习人类演示视频、从而适应各种物体与环境的基础模型(foundation model)路线,且这一趋势正在扩散。Dyna Robotics公开的、基于100万小时人类视频训练的机器人模型也属于这一潮流。而MoMo与这种大规模学习路线有所不同,其特点在于:即便使用较少的数据,也让“动作风格”这一全新维度变得可控。

那么,这意味着什么变化

以往,若想让机器人“再小心一点”,要么需要重新收集专门的演示数据,要么需要手工编写基于规则的控制逻辑。如果MoMo这种方式实现实用化,就可以通过一个学习好的“动作模式拨号盘”,在多种任务中即时调节速度和力度。可以想见的应用场景包括:在物流仓库中,同一机械臂对易碎物品和结实物品采取不同的处理方式;或者在靠近人类工作的协作机器人中,根据情况降低动作速度等。不过,本次研究的验证范围仅限于6项任务和特定的实验室环境,要应用到商用机器人,恐怕还需要进一步的验证。