视频-动作模型
video-action model
一种在生成视频的同时,还被训练来预测画面中物体或人物接下来会如何运动、执行何种动作的AI模型。
简单来说
视频-动作模型不只是在屏幕上画出看起来很逼真的视频,它还会预测画面中的物体或机器人接下来该如何运动。如果说普通的视频生成AI是一位把一张张漂亮画面连接起来的画家,那么视频-动作模型更像是一位编舞者——他在画画的同时,也在同步规划'这只手接下来该往哪个方向移动'这样的动作方案。
这类模型之所以重要,是因为它对训练机器人、自动驾驶汽车等真正需要移动身体的机器很有帮助。如果预测视频中世界将如何变化的能力,和预测要产生这种变化需要做出何种动作的能力,同时存在于一个模型里,那么机器人就可以仅靠观看视频推断出该做什么动作,而不需要另外一条一条地学习动作数据。
最近,一些同时生成图像、视频、声音的多模态模型,开始在同一个框架内进一步训练动作预测能力。也就是说,不再分别单独生成视频、声音和动作,而是训练一个架构同时理解这三者。
在报道中是这样出现的
文章提到,Black Forest Labs的FLUX 3"在单一架构中同时训练了图像、视频、音频和动作预测"。这里所说的'动作预测'正是视频-动作模型的核心概念。不过需要注意的是,8月4日实际发布的只是文本、图像生成视频的功能,而利用动作预测的机器人协作模型只是通过一篇技术博客单独介绍的。也就是说,视频-动作模型的要素是包含在FLUX 3这个大模型的设计之中的,但目前可以通过API调用的FLUX 3视频功能本身并不具备操控机器人的能力。
