每天早晨,用三行读完全球 AI 动态浏览品牌目录

METAL LAB

FLUX 3视频版正式开放 20秒配音效 但不支持韩语

需审批的早期访问已于8月4日解除。单一接口涵盖三种模式,起价为每秒0.17美元。同一底层模型还在驱动奥迪生产线上的机器人。

Black Forest Labs

Black Forest Labs于8月4日正式开放了FLUX 3视频版。上月23日发布时还是需要提交申请、等待审批的早期访问阶段,如今已可通过自家API和部分合作伙伴直接调用。该模型能从文本或图像生成最长20秒的视频,台词、音效和环境音都在同一生成过程中一并输出。

Black Forest Labs是一家总部设在德国弗赖堡和美国旧金山、规模约70人的AI研究实验室。其创始团队中包括曾开发潜在扩散模型(Latent Diffusion)、Stable Diffusion和FLUX.1的研究人员。此前的FLUX 1和FLUX 2都只能生成图像,此次是该公司首次推出视频模型。

Introducing FLUX 3 — Black Forest Labs官方频道,2026年8月4日发布

7月23日的发布与8月4日的上线是两回事

由于这两个日期在坊间流传中经常被混为一谈,有必要加以区分。7月23日是一次宣布,公布了名为FLUX 3的多模态基础模型的存在。当天公开的是该模型在单一架构下同时学习图像、视频、音频和动作预测的设计思路及初步评测数据,但实际使用仍受限于需审批的早期访问。

8月4日发生变化的是访问权限。公司当天表示:"从文本和图像生成的初始版本已通过BFL API和精选合作伙伴向公众开放。"同一天,官方YouTube频道上线了一段60秒的介绍视频,另有一篇专门介绍机器人协作模型的技术博客及一段3分50秒的视频同步发布。视频编辑功能以及组合图像与视频参考的Omni Reference功能尚未推出,公司目前仍将FLUX 3标注为"预览版(preview)"模型。

三种模式,一行请求即可调用

FLUX 3视频版通过单一接口 api.bfl.ai/v1/flux-3-video 运行。每次请求需指定模式,共有三种:仅凭提示词启动的文本生成视频(t2v)、从图像开始的图像生成视频(i2v),以及延续已有片段的视频续写(v2v)。除模式选择外,其余请求格式在三种模式下相同。

图像生成视频模式没有单独的起始帧字段。传入图像的通道只有一个,即keyframes,若只提供一张图像,该图像即作为起始帧。若提供两张,则分别作为起始帧和结束帧;最多可提供十张,像分镜脚本一样搭建整段片段。若以[秒数, 图像]的配对形式传入,可将每张图像精确固定在指定时间点,例如在0秒和8秒分别插入一帧,中间的运动过程则交由模型自行完成。

视频续写模式则是将已有片段作为start_video传入,再写明接下来要发生的内容。根据公司说明,该模式最多可接收已有视频和音频的4秒内容作为输入,在衔接点之后延续动作、镜头运动、台词和声音。该模式也支持在单次生成中多次切换场景与镜头角度。

其余字段均为可选。画面比例(aspect_ratio)和时长(duration)默认值均为auto,会根据内容自动确定;分辨率(resolution)默认为HD;音频生成(generate_audio)默认开启。调用为异步方式:提交请求后会返回任务ID和轮询地址,需持续查询该地址直至状态变为Ready结果文件的URL为签名地址,任务完成后约2小时即会失效,因此在搭建流水线时务必加入立即下载并转存至自有存储空间的步骤。

草稿模式价格仅为正式渲染的三分之一

公开的价目表按秒计费。文本生成视频和图像生成视频模式下,HD档每秒0.17美元,FHD档每秒0.29美元,时长可指定为5~20秒。视频续写模式价格贵出一倍以上,HD每秒0.43美元,FHD每秒0.54美元,时长上限也更短,仅为15秒。帧率固定为24fps,支持的画面比例包括21:9、2:1、16:9、4:3、1:1、3:4、9:16。

模式输入时长正式渲染草稿模式
文本生成视频提示词5~20秒HD $0.17/秒, FHD $0.29/秒$0.06/秒
图像生成视频提示词 + 1~10张图像5~20秒HD $0.17/秒, FHD $0.29/秒$0.06/秒
视频续写提示词 + 已有片段5~15秒HD $0.43/秒, FHD $0.54/秒$0.12/秒

在成本结构中,关键在于草稿模式。请求中加入draft: true即可以每秒0.06美元的价格快速获得预览结果,返回内容中还会附带一个名为draft_cache的数据包。若对某个预览结果满意,可将该数据包以draft_enhance模式重新提交,系统会以相同种子对同一场景重新渲染出正式画质。公司明确指出,每次新提交的请求都是独立生成,正式渲染结果可能与草稿版本存在差异解读。也就是说,若想原样获得草稿中选中的那个镜头,不能重新提交请求,而必须走draft_enhance路径。以一段10秒的HD片段计算,草稿探索阶段费用为0.6美元,最终确定渲染费用为1.7美元。

做出视频模型,结果机器人动了起来

同日发布的第二篇博客揭示了此次发布的真正意图。在FLUX 3底层模型之上,公司与苏黎世机器人企业mimic合作开发了名为"FLUX-mimic"的视频-动作模型,奥迪已在其生产线上对该模型进行测试和部署。

公司披露的训练构成解释了这种关联为何成立。FLUX 3全部训练算力中有超过95%用于视频预测,音频训练量还不到720p视频token总量的0.5%。要生成逼真的视频,模型必然要学习物体的接触、运动、重量和因果关系,而从这样训练出的世界模型中解码动作,便可实现机器人控制。公司表示,在训练过程中将动作预测加入课程后,按人工评测标准,视频质量一度下降最多10%,但仅用3500步就恢复到原有水平,说明新增模态所带来的成本只是暂时的。

性能数据也相当具体。FLUX-mimic的底层模型在单块NVIDIA RTX 5090上,从输入到世界表征的处理时间不到80毫秒;包含mimic部署堆栈在内的整个机器人系统的反应时间为101毫秒。训练数据包括数千万小时的通用视频,以及数十万小时专门聚焦人类与机器人操作的视频。奥迪生产实验室的Christoph Schneider表示:"我们看到这些机器人完成了以往机器人技术无法实现的复杂柔性物体操作任务。"

FLUX 3 x mimic: The Next Generation of Video-Action Models — Black Forest Labs官方频道,2026年8月4日发布

斯科塞斯6月已加入

围绕此次发布经常被提及的马丁·斯科塞斯顾问加盟消息,实际上是两个月前发生的另一件独立事件。公司于6月2日专门开设页面,宣布斯科塞斯已加入担任顾问,并附上他使用FLUX进行分镜创作的过程视频。据外媒报道,他目前在制作的新片是由莱昂纳多·迪卡普里奥和詹妮弗·劳伦斯主演的《What Happens at Night》。

斯科塞斯本人的说明并非聚焦于生成工具本身,而是聚焦于沟通工具的作用。他表示:"70年来我一直亲手绘制分镜。如何把脑海中的画面传达给演员和团队,一直是个难题。"并补充道:"现在借助这个工具,我可以把自己构想的画面更清晰、更高效地分享给制作设计师、美术指导和摄影指导。"他还提到自己在《雨果》中使用3D技术、在《爱尔兰人》中使用数字减龄技术的经历,并表示:"电影才诞生125年,是一种年轻的媒介,应该对它将如何演变保持开放态度。"公司仅将这一关系描述为"顾问",并未公开股权、报酬、期限或作品承诺等具体信息。

目前仍未实现的部分

首先需要确认的是语言支持。公司明确列出的支持语言包括英语(多种方言)、中文、西班牙语、法语、德语、日语、葡萄牙语、俄语、意大利语、印尼语、土耳其语、印地语、旁遮普语"等"。**该列表中没有韩语。**由于以"等"结尾,尚不能确定是否完全排除韩语,但若项目需要韩语台词和口型同步,不应默认官方已支持并据此制定计划。

分辨率标注也存在不一致之处。YouTube视频简介写的是"原生1080p(2K和4K即将推出)",但官方博客写的是发布时提供HD(720p)和全高清(1080p)两档,其中全高清经过了升频处理;API文档也说明fhd选项会"通过视频升采样器将结果处理为更高分辨率"。在营销文案与技术文档存在出入时,应以后者为准更为稳妥。此外还需注意,初期评测是在720p分辨率下进行的。

评测数据全部为自评结果。公司公布的ELO对比表显示,在文本生成视频方面,FLUX 3以1135分排名第一,其后依次为Gemini Omni Flash(1090分)和MiniMax H3(1082分)。Seedance 2.0为1069分,Kling v3 Pro为1054分,Luma Ray 3.2以620分垫底。图像生成视频方面的排名则密集得多:FLUX 3为1051分,Seedance 2.0为1049分,两者仅差2分,几乎持平,MiniMax H3以1039分紧随其后。该分项中排名最低的是Runway Gen-4.5,为876分。

FLUX 3的文本生成视频与图像生成视频ELO对比图
Black Forest Labs于8月4日公布的自评ELO评测。左侧为文本生成视频,右侧为图像生成视频。

不过需要指出的是,这份对比表是该公司对自家模型进行的评测,目前尚无独立基准测试结果,也未公开服务等级协议(SLA)或吞吐量保证。

至于剩余的路线图,公司已预告将陆续推出图像、视频、音频参考组合生成功能、负责图像生成与编辑的FLUX 3 Image,以及开放权重版本FLUX 3 Dev。**但目前均未公布具体日期。**对于计划在本地自建部署的团队而言,目前仍只能使用纯图像版本的FLUX.2系列。在安全性方面,公司表示已与第三方评测机构Cinder合作,在发布前评估了包括非自愿色情图像(NCII)和儿童性剥削材料(CSAM)在内的风险范围。