METAL for iPhone

AI 新闻, 现在用 App 阅读。

下载 METAL, 每天发现最新 AI 报道。

在 App Store 下载

iPhone 应用 · 免费下载

也可在 iPhone 的 App Store 中搜索 METAL AI Magazine。

METAL

Sakana AI发布机器人轨迹生成方法SAIL

由VLM规划机器人轨迹,先在模拟器中测试并修改,再交给机械臂执行。候选轨迹增至45条后,成功率从25%升至73%。

Sakana AI发布机器人轨迹生成方法SAIL

图片:METAL

摘要

  • Sakana AI与东京大学合作发布基于VLM的机器人轨迹生成方法SAIL,该研究将在IROS 2026上发表。
  • 在不改动Gemini Robotics-ER 1.5权重的前提下,SAIL通过MCTS、相似示范检索和逐步反馈修正轨迹,将六项任务的平均成功率从25%提高到73%。
  • LeRobot SO-101实体机械臂在6次试验中成功5次,用搜索收集的120条轨迹训练出的策略将执行时间从644.72秒缩短至72.306秒。

Sakana AI于9月27日(UTC)发布机器人轨迹生成方法SAIL(Scaling In-Context Imitation Learning)。视觉语言模型(VLM)只需看几条成功示范,就能规划机械臂的完整动作,但它不会直接执行第一次给出的答案,而是先在模拟器中运行,再加以修改。公司表示,在六项操作任务中,把候选轨迹预算从1条增加到45条后,找到成功轨迹的平均比例从25%升至73%。这项与东京大学合作的研究将在机器人学会议IROS 2026上发表。

整个研究过程中,模型权重一次也没有改变。SAIL在生成轨迹的策略角色和为结果打分的评估角色上,都直接使用谷歌的Gemini Robotics-ER 1.5。在语言模型领域,推理阶段投入更多算力来生成、审查和修改候选答案的测试时扩展,已成为提高准确率的成熟做法。Sakana AI想知道同样的交换是否也适用于物理动作。公司在博客中提到,GPT-6 Astra仅凭摄像头画面和机器人状态设定动作目标,就在实体机器人上完成了多项操作任务,以此说明基础模型中已经包含可用于机器人控制的知识。

研究的出发点是,单次生成难以信赖。模型的预测会随作为上下文的示范而变化,即使条件相同,每次采样也会有波动。Sakana AI解释说:“动作目标中的一个小误差就可能导致整个任务失败。”如果不经评估就直接执行第一次预测,机器人在动起来之前就没有机会纠正这个误差。

SAIL用蒙特卡洛树搜索(MCTS)解决这个问题。树中的每个节点是一条完整轨迹,每条边是对上一条轨迹的一次修改。系统先用LPIPS距离从存放成功轨迹的档案库中找出与当前场景最相似的示范,放进上下文。生成的轨迹在模拟器中执行,评估用VLM从执行视频中均匀抽取50帧,判断抓取、提起、递交等子任务完成了多少百分比。这些分数被标注到轨迹的各个路径点上,再反馈给策略模型,模型保留得分高的片段,只修改进展停滞的部分。搜索中找到的成功轨迹会加入档案库,在处理其他初始布局时再次使用。

论文第一作者、东京大学研究员Makoto Sato与另外三位作者在论文中写道,这一设计“将重点从静态模仿转向一种动态范式,让机器人能够真正想得更久,从而化解新任务中的模糊之处”。Makoto Sato是在Sakana AI实习期间完成这项研究的,共同作者包括东京大学的Yusuke Iwasawa以及Sakana AI的Yujin Tang和So Kuroki。

算力越多,数字越高。实验在ALOHA操作模拟器中进行,涵盖递香蕉、递笔、把碗放上架子、拉开抽屉、合上笔记本电脑、拔下记号笔笔帽六项任务,每项任务使用20种初始布局。候选预算为6、15、30、45条时,平均成功率分别为55%、65%、71%和73%。拉抽屉从10%升至50%,合笔记本从15%升至70%,拔笔帽从5%升至45%,递香蕉达到95%。放碗任务在6条候选时就已达到100%,之后保持不变。

搜索方式也带来差异。在同样15条的预算下,SAIL的平均成功率为65%,高于不带反馈、一次抽取15条候选的广度优先搜索(51%),也高于对一条轨迹连续修改15次的深度优先搜索(37%)。不过在合笔记本任务上,广度优先搜索以60%超过了SAIL的50%。作者分析认为,夹爪要安全越过屏幕上方的薄边缘,需要细微的位置调整,而随机性更强的广度优先搜索恰好适合这一几何条件。

SAIL 성공률 표. 여섯 과제에서 단일 생성 25%, 너비 우선 51%, 깊이 우선 37%, SAIL 후보 6·15·30·45개에서 평균 55·65·71·73%

放入哪些示范比放入多少更重要。在15条预算下,检索一条相似场景示范的SAIL达到65%,只用固定原始示范为45%,从档案库随机选取为50%。固定示范增至3条也只有49%,随机3条为53%。作者在论文中总结道:“性能对上下文示范的相关性比对其数量更敏感。”在反馈方式比较中,只给轨迹文本、只给执行图像或两者同时给出的结果为45%至48%,只给一个最终分数为49%,都低于在每个路径点标注分数的逐步反馈(65%)。

实体验证使用的是基于开源机器人学习库LeRobot的SO-101机械臂,任务是把蓝色方块放进红色碗里。GroundingDINO利用英特尔RealSense D435i摄像头的彩色和深度信息定位物体,SAM2勾勒轮廓,再以固定在机器人底座上的ArUco标记为基准对齐坐标,在模拟器中重建相同场景。在这个数字孪生中以15条候选预算找到成功轨迹并交给实体机械臂执行,在手动打乱方块和碗位置的6次试验中成功5次。作者将剩下1次失败归因于基于深度图像的姿态估计存在小误差,以及模拟器未能反映的真实接触动力学差异。

速度问题通过蒸馏来解决。MCTS搜索每次试验平均耗时644.72秒。研究团队在模拟中改变物体布局,用SAIL收集了120条成功轨迹,再以行为克隆方式训练ACT(Action Chunking with Transformers)策略。该策略同样在6次实体试验中成功5次,平均执行时间缩短至72.306秒。作者写道:“我们的MCTS框架可以作为自动数据收集引擎,用来训练快速、可部署的机器人策略。”

시뮬레이터 속 SO-101 로봇 팔과 실물 팔이 파란 블록을 집어 빨간 그릇으로 옮기는 과제를 나란히 보여 주는 화면

根据METAL核实的论文原文和项目页面,这项研究于3月9日首次发布在arXiv上,9月19日发布了修订版。轨迹以开环方式执行,运动过程中没有视觉反馈,实体评估也只限于一项任务、6次试验,Sakana AI自己也写明了这些。研究团队表示,下一步计划与用高斯泼溅构建的逼真数字孪生结合,缩小模拟与现实之间的视觉差距。METAL此前曾报道Sakana AI发布无需反向传播的学习方法PC-ALM,也报道过SAIL所依托的Gemini Robotics系列在真实家用机器人Apollo上遇到的问题。

从AI工程师的角度看,SAIL改变了机器人学习的成本结构。过去教会机器人一项新任务,成本主要是数据:由人收集示范,再重新训练策略。SAIL用推理算力填补这个位置,并用实测曲线表明成功率会随算力增加而上升。代价是时间。每次将近11分钟的搜索很难直接用于现场,但用这种方式找到的120条成功轨迹成为72秒策略的训练数据,这个循环更像一座把算力变成数据的工厂。这座工厂的质量最终取决于模拟器与现实有多接近。Sakana AI表示:“关于现有模型借助这类反馈还能做到什么,以及这些改进能在多大程度上延续到实体机器人上,我们认为还有更多值得探索。”这句话指向的也正是这个瓶颈。

评论