
摘要
- Higgsfield发布了一部由真人演员出演、时长110分钟的AI长片《The Curly Hill Boys》,并以推文串形式披露了制作过程
- UFC选手Israel Adesanya、Quinton "Rampage" Jackson,以及主播N3on等人在签署肖像权和声音权合约后出演
- 合约中约定了报酬、使用范围、剧本审批权,并规定原始素材须在拍摄结束30天内删除、且不得用于训练
展开更多
- 制作使用了ByteDance Seed开发的Seedance模型,在Higgsfield平台上运行,并公开了所有提示词和素材
真人演员出演的110分钟AI电影
Higgsfield于当地时间8月10日通过其X账号发布了长片《The Curly Hill Boys》。据悉制作成本约为200万美元,视频生成部分使用了ByteDance Seed开发的Seedance模型,在Higgsfield平台上运行。Higgsfield一方面自研模型Soul和DoP,一方面也同时调用OpenAI、谷歌、ByteDance的模型,这次作品正是选用了其中的Seedance,给真人演员的面孔和声音"换脸配音"。
故事本身是一部犯罪喜剧。三名在伦敦东区默默无名的说唱歌手本想拍一支音乐录影带,却意外偷走了一艘装满现金的船,由此被卷入两个敌对犯罪团伙之间遭到追杀。据Higgsfield官方说法,片长为110分钟,但X上发布的正片视频显示的播放时长为1小时54分51秒。美国内容媒体Bottle Rocket报道称,该片先于8月5日在纽约Glasshouse举行了首映,随后才在线上公开。
出演阵容中包括UFC选手Israel Adesanya(Stylebender)、前UFC冠军Quinton "Rampage" Jackson、主播N3on,以及街球创作者MKIATPIS。剧中角色与真实人物的对应关系在推文串中被明确列出——Oli对应Adesanya,Tobin对应Rampage Jackson,Horace对应N3on。Higgsfield表示,团队通过合同约定的拍照环节将这些人的真实面孔进行了数字化处理,并在首次生成之前就完成了肖像权和声音权的全部签约。


肖像权合约中写明的三件事
AI行业通讯AlphaSignal整理出的合约条款可归纳为三个方面。首先是以书面形式明确报酬、使用范围和剧本审批权;其次是用于制作面孔和声音的原始照片、录音须在拍摄结束后30天内永久删除;第三是禁止Higgsfield保留这些数据、将其用于训练,或转授权给第三方。这套结构基本沿用了美国演员工会(SAG-AFTRA)通过罢工争取到的事先告知与补偿条款。
剧本方面也采用了类似方式。据Bottle Rocket报道,编剧Timothy Flanagan(不同媒体拼写为Flanagan或Planagan)虽非工会成员,却按照美国编剧工会(WGA)的标准获得了报酬,他本人保留了传统电影改编权,只将生成式AI改编权授予了Higgsfield。这部剧本打磨了五年,原稿已入围2026年伦敦独立剧本大赛决赛。此前Higgsfield在制作《Hell Grind》时,曾因完全没有就演员权利进行协商而遭到批评。


用三张图锁定一张脸的角色表
据制作团队披露的方法,每个角色都要制作一份角色表,包含正面全身照、背面全身照,以及3/4角度特写肖像三张图。在全身照中,脸部被直接抹去——因为在远景镜头中脸部本就小而模糊,模型会原样照搬这种模糊,导致失真。团队规定脸部只能取自特写肖像,而这种特写肖像又分别制作了微笑和面无表情两个版本。据解释,如果不这样区分,模型会随意生成牙齿,结果看起来像是别人的嘴。制作完成的素材还要经过压力测试:用不同姿势和光线各生成10次,确认10次都能被认出是同一角色。
针对主角状态变化,每种状态单独建立素材也是一项规则。干净夹克配橙色背包的Cal、被泰晤士河水打湿的Cal、第三幕中眉骨划伤、白T恤染血的Cal,团队没有把这些状态用备注塞进同一份素材,而是拆成了三份独立素材。据说如果混在一句话里描述,血迹会被冲淡,湿衣服也会莫名其妙变干。Higgsfield将这一原则总结为"拆分比争论更省钱"(Splitting is cheaper than arguing)。

声音与时代设定,被钉死在提示词里的东西
声音没有被当作素材处理,而是被写成精确描述语调、节奏、说话方式的条件语句。这句话在人物每次开口说台词时,都会原封不动地粘贴进音频输入框,一字不改。据介绍,哪怕只是稍微改动措辞,都会扩大模型的采样范围,导致声音发生偏移。
公开的画布中记载的主角Cal的声音条件句是这样的:"A 25-year-old English man. Smooth, relaxed mid-range baritone; casual, unscripted, and conversational delivery; South London street accent — dropped h's, glottal t, -ing to -in'; nostalgic and warmly reflective, sharing a personal memory with a natural, steady pace."(一名25岁的英国男性。声音圆润放松,属中音域男中音;语气随意、不像照本宣科、带有对话感;南伦敦街头口音——省略h音、t发喉塞音、-ing读作-in';语调怀旧、带着温暖的回忆感,以自然平稳的节奏讲述个人往事)年龄、音域、说话态度、口音、情绪全部写进了同一句话里,连口音都直接用语音学标记写了出来。
时代设定也被定为硬性规则:2011年之后出现的物品完全不能出现在画面中。据解释,模型本身有把画面往当代场景拉的倾向,一旦留有余地,人群中的路人就可能突然举着iPhone出现在镜头里。

只靠文字拍出来的拍摄规则
在场景处理上,团队没有直接生成正面照片,而是先生成一段镜头缓慢移动、扫过空场地的视频,再让模型以这段画面为基准去绘制房间的其他面。贯穿整部电影的一条铁律是:只使用文字生成视频(text-to-video),不用图片作为起始帧。也就是说,所有场景都仅靠参考素材和文字描述完成。
某个走廊场景中叠加了多条规则。台词被固定为精确的三个词:"Pull it, Oli."(拉住它,Oli)。人物之间的身高差也用具体描述写明,比如"Horace's eye-line at the level of Cal's mouth"(Horace的视线高度与Cal的嘴齐平)。画面外发生的事件被写成"不该出现的内容清单",并明确指示两个人物的反应绝不能同时发生。
同一条提示词里甚至连镜头和色彩都被写了进去。"ONE continuous ~12–14s 200mm (FOV ≈12°) tight CLOSE-UP two-shot"一句话就锁定了镜头长度、焦距和视角;反应出现的时间点也标注了精确到秒的时间码,分别是1.5秒、4.0秒、6.0秒、9.0秒、11.0秒。段落末尾还跟着三句话:"Colour 60:30:10. Nothing modern beyond 2011. British spelling."——色彩配比、时代禁止线,乃至画面中出现的拼写方式,全都塞进了同一张提示词里。
在歌唱场景中,团队没有让模型"唱歌"。而是先把音轨录好,按12秒为单位切分成文件后导入,并在文件上标注"THE TRACK THEY ARE PERFORMING"(这就是他们正在表演的那段音轨)。此前使用的"audio guide, for sync only"(仅用于对齐同步的音频引导)这一说法虽然没错,但据称并未产生有效结果。至于像车内打斗这种两个身体持续贴合的场景,模型无法胜任,团队便请来替身演员实际在车内用iPhone拍摄,再把这段影像作为动作参考导入。

137次迭代与五项原则
制作按场景分批生成,每次只改动一行内容,最终留下了137条生成日志。据称团队记录了每个版本、改动内容以及结果判定,以此追溯问题出在哪个版本。团队还确立了一项原则:如果反复生成10到15次仍不理想,就该拆分或简化场景本身,而不是继续在措辞上打磨。
| 领域 | 核心规则 | 原因 |
|---|---|---|
| 脸部 | 仅从特写肖像提取脸部,微笑与无表情各一张 | 防止远景中脸部失真 |
| 声音 | 条件语句每次一字不改地粘贴使用 | 措辞改动会导致声音偏移 |
| 时代 | 全面禁止出现2011年以后的物品 | 模型倾向于把画面拉向当代场景 |
| 拍摄 | 仅使用文字生成视频,不设起始帧 | 确保镜头间的连续性 |
| 歌唱 | 预先录音后按12秒分段导入文件 | 模型无法直接唱歌 |
| 打斗 | 先拍替身动作,再作为动作参考使用 | 模型无法还原贴身肢体接触 |
团队还公开了支撑整部电影制作的五项原则:先锁定全部素材再开始生成;由于模型没有记忆,每次都要重新完整描述所有内容;一次只改一处;不要把整个房间交给模型,只给出一个角落;如果画面出不来,该简化的是场景本身,而不是措辞。

4周,28人,计算成本100万美元
据AlphaSignal统计,制作耗时4周,共28人参与,其中导演就有9人,参与人员中40%此前没有AI视频制作经验。制作出的素材约1000份,AI生成的场景达100处。200万美元预算中,约一半即100万美元花在了生成成本,也就是计算资源上。
使用的工具也不止一种。乌克兰媒体UA.NEWS报道称,团队用Anthropic Claude撰写提示词,用Seedance 2.5生成视频和音频,并搭配ByteDance Seedream和谷歌Nano Banana进行图像编辑。这也是为什么Higgsfield在推文串开头就提示"先获取CINEDANCE技能,再打开画布"。角色表、场景与道具板全部集中在同一张画布上,团队的规则是:"如果画布上有而分镜表里没有,以画布为准。"

仍然存在的瑕疵
对完成度的评价并不一致。UA.NEWS指出,画面中出现的文字模糊不清、人物之间的互动较弱,这些生成视频特有的瑕疵依然存在。AlphaSignal引用的一位视频编辑也指出,部分片段的帧率跌破每秒30帧,特写镜头中的面孔"显得有点过于完美"。不过同一位编辑也补充说,以普通观众的标准来看,"作为第一次尝试,这已经算是成功了"。
Higgsfield表示,已在自家项目页面上公开了此次制作使用的全部提示词和素材,从角色表结构、口音标记方式到音频插入方法都可以直接拿来使用。团队同时还开设了一套免费课程,旨在帮助传统制作人员转型进入AI制作领域。

编辑视角
8月14日看到Higgsfield用Cinema Studio 4制作的短片《Adilyada》时,那还只是一部短小的科幻喜剧。而这次的《The Curly Hill Boys》则是一部110分钟的长片,并通过合约买来了真实UFC选手和主播的面孔与声音。同一家公司在短短几天内,从短片跃升到长片,从虚构角色跃升到取得真实人物肖像权,可谓完成了一次量级的跃迁。有意思的是,这一走向恰好与Runway在AIF 2026首尔展映会上展示的方向一致。在8月7日我们采访那场活动时,关键也不在于维持角色一致性的技术,而在于决定保留什么、剪掉什么的剪辑判断力——而Higgsfield此次公开的137条迭代日志和五项原则,更像是把这种剪辑判断力文档化的成果。
从实操角度看,这条推文串中最有价值的部分,是把角色表拆成三张图、只从特写中提取脸部的规则,以及声音条件句必须一字不改地复制粘贴的规则。接触过AI视频制作的人都清楚——同一角色在不同镜头中出现细微差异的面孔问题,大多不是出在角色表本身,而是出在从角色表中提取脸部这一环节的设计失误。这个团队采用的"生成10次、10次都能被认出"的验证方式,是任何个人创作者今天就能照搬的检验方法。反过来说,在歌唱、打斗这类模型目前还做不到的领域,团队没有硬靠文字硬推,而是引入实拍作为动作参考,这种判断力同样值得学习——AI视频制作目前的水平高低,往往就体现在"能否察觉模型做不到什么"这一点上。
不过,抛开所有这些技术细节,更值得关注的其实是素材选择本身。用合约买下真实UFC选手和主播的面孔,套用到虚构的犯罪叙事之中,这件事本身就是一个信号:肖像权交易正开始成为电影选角的一个新维度。正因如此,合约中写入30天内删除、禁止用于训练、剧本审批权等条款才显得格外重要——这次公开真正的新意,或许不在提示词本身,而在于这套合约范本。可以预见,未来几周内其他AI视频平台很可能也会跟进类似的"真实名人肖像合约+开源提示词公开"组合——比起内容本身,这种合约结构和提示词工作流,或许才会成为这个行业接下来的标准。

信息来源
- X — 미디어·생성AI — We made the first 110-minute AI feature film with a real cast, The Cully Hill Boys, on Higgsfield for $2,000,000. →
- X — 미디어·생성AI — We made the first 110-minute AI feature film with a real cast, The Cully Hill Boys, on Higgsfield for $2,000,000. →
- X — 미디어·생성AI — We made the first 110-minute AI feature film with a real cast, The Cully Hill Boys, on Higgsfield for $2,000,000. →
- AlphaSignal — Higgsfield Made a $2M AI Film With Licensed Celebrity Likenesses →
- Bottle Rocket Content — Higgsfield's $2M AI Movie Is Free and Open-Sourced →
- UA.NEWS — Higgsfield has released the AI-generated film Cully Hill Boys and prompts for it →





评论