METAL LAB

谷歌研究院公布带手势的XR智能体AgentHands

这是一款给AI助理加上手部动作的原型系统,让它不再只靠语言指引,而是直接在现实空间中标出该做的事

摘要

  • 谷歌研究院在X平台上介绍了AgentHands,这是一款为对话式智能体加入手势的LLM驱动XR原型
  • 公开的演示图展示了打印机设置、抽屉尺寸提示、烫手喷嘴警告等8种场景
  • 目标是用手势直接在空间中标出以往只靠语言传达的指示,缩小用户的理解落差
原文视频

不靠语言,靠手来指引的智能体

谷歌研究院通过研究介绍页面公布了一款名为AgentHands的XR(扩展现实)原型系统。大型语言模型(LLM)会配合对话式智能体的语言内容同步生成手部动作,从而在用户眼前的真实空间中直接标出该做什么。

从代表智能体的中心点出发,一条实线箭头以"手势"之名指向代表理解落差的虚线圆圈,再从这个虚线圆圈发出一条虚线箭头,指向由散乱点构成的用户。图示表明,单靠语言留下的空缺正试图被手势以实线方式直接填补,而这一结果目前也只是暂时性地传达给用户。

公开的演示图涵盖了八种场景。在基本待机状态下,系统只展示倾听和说话的动作;而在指引打印机设置面板时,会用手指向该面板;说明该在窗边放置多大抽屉时,则用手比划出尺寸大小。在讲解冷萃咖啡的特点,或是标出音箱圆润的设计细节时,也都配有相应的手势。此外还包括提醒不要饮酒过量、警告喷嘴烫手,以及任务顺利完成后的击掌动作。

为什么需要这个

现在的语音助理通常靠"转动左边的把手"之类的话语来传达指令。问题在于,用户还得自己把这句话对应到现实空间中的具体位置。谷歌研究院将这种落差称为"心理映射缺口(mental mapping gap)",指出语言指令与实际物理空间之间存在理解上的空隙。AgentHands正是试图用手部动作来填补这一空隙的尝试。当智能体的语言内容与同步的手势叠加显示在XR画面上时,用户就不必再经过把语言翻译成空间位置的过程,而是可以直接辨认出眼前的对象。

这种思路也契合了AR眼镜、智能眼镜等可穿戴设备日益普及的趋势。业界一直有声音指出,仅靠文字或语音在指引实体操作时存在局限,多个实验室也在推进将视觉信息与语言绑定传达的多模态"落地(grounding)"研究。可以说,AgentHands是在这一大方向下,选择用手部动作作为具体表达手段的一个案例。

이미지: @GoogleResearch (X)

目前仍是原型,但方向已经清晰

现阶段公布的还只是研究原型,并非商用产品。不过在组装、修理、烹饪等需要动手操作的场景中,这可以看作是检验"智能体同时用语言和动作来指引是否真正管用"的第一步。对于开发XR、AR设备的团队来说,这提供了一个可参考的方向:仅靠语音指引不足的地方,可以用手势之类的视觉信号来补足。

国内也有不少团队在做AR眼镜和空间计算,这种基于手势的指引方式将如何进入实际产品,值得后续持续关注。

评论